结构说明(本 IR 的特殊性):本 IR 的需求实质首先来自外部比赛契约(千问 AI Arena 官方比赛页),而非组织内生痛点。为使后续红队审查能对照「原始要求」逐条核验(而非核验我们对要求的转述),第一部分全量罗列比赛原始要求并冻结于此,第二部分才是组织 IR schema v1 九字段。红队审查 spec 时,凡 spec 条款与本 IR 第一部分冲突,以第一部分为准(比赛契约是最高优先级外部约束)。
标注约定:[OFFICIAL] = 官方页面原文或忠实转写;[INFERRED] = 参赛方前期分析推断,非官方。IR 账本纪律:本 issue 为 append-only 意图账本——签署(state:ir-signed)后只追加评论/erratum,不编辑正文。
一、比赛原始要求全量罗列(红队审查锚点——spec 与实现的最终裁判基准)
1.1 比赛身份 [OFFICIAL]
- 名称:一键出海:商品素材全自动生成任务(One-Click Overseas — Automated Product Listing Material Generation)
- 任务域:跨境电商商品本地化素材生成(示例平台:AliExpress)
- 主办:千问 AI Arena(阿里 · 千问 AI 平台 www.qianwenai.com);联合主办:Aidge(阿里国际电商 AI 工具)
- 双榜单机制:国内站 qianwenai.com 与海外站 qwencloud.com 在机器评测阶段独立打榜、各自排名
- 奖金(Token 代金券,发放至千问 AI 平台个人账户,阿里云依法代扣个税):金奖 $10,000 × 1;银奖 $5,000 × 2;铜奖 $3,000 × 2
- 非现金奖励:云栖大会展区展示(2026-09-22~24);阿里云生态伙伴体系商业化合作机会
- 参赛资格:千问 AI 平台或阿里云实名认证用户;虚商、RAM 子账号不可参加
1.2 时间线 [OFFICIAL](全部 UTC+8)
| 阶段 |
窗口 |
| 报名 + 作品提交 |
2026-08-07 → 2026-08-31 |
| 机器评测 + 打榜 |
2026 年 8 月中旬 → 2026-08-31 |
| 专家评审(两榜各 Top 30) |
2026-08-31 → 9 月中旬 |
| 结果展示 |
2026-09-11 后 |
| 云栖大会颁奖 |
2026-09-22 → 09-24 |
- 提交配额:每天最多 3 次提交
- 排名规则:机器评测评测「最新提交」,但保留整个历史评审中的最高成绩及对应排名作为入围依据
- 推导 [INFERRED]:自 IR 登记日(2026-08-24)起,剩余提交次数上限 ≈ 21 次(7 天 × 3 次/天)
1.3 任务定义 [OFFICIAL]
构建一个可被平台独立运行的 Agent:输入一件商品的原始源数据,一次运行端到端产出其在海外电商平台(以 AliExpress 为例)上架所需全套本地化素材。官方五大本地化维度:
- 语言本地化 — 面向不同市场(美国/英语、韩国/韩语、巴西/葡语)产出符合当地语言习惯的文案,而非逐字翻译
- 视觉素材 — 符合平台规范的主图、详情图、商品视频
- 平台适配 — 准确映射到平台后台的类目与属性体系
- 市场适配 — 尺码换算、目标市场拼写与表达习惯、规避文化禁忌
- 事实一致 — 所有素材信息须忠实于源数据,不得虚构或凭空补全
1.4 输入 [OFFICIAL]
- 输入目录示例:
/home/user/ws/input/
- 文件:
product_info/product_basic.json — 上架商品基础信息,含标题、SKU
clothing_attributes.json — 平台服装类商品属性划分
clothing_categories.json — 平台服装类类目划分
- 官方警告:「product_basic 仅为商品名称示意,实际输入名称按本地商品文件名称进行调整」——文件名随商品变化,Agent 必须动态发现/解析实际文件名,不可硬编码
- 示例数据:比赛页提供「商品数据示例」下载(示例商品数据 + 平台类目/属性数据);仅限本任务使用,禁止商用
1.5 每商品交付物(精确规格)[OFFICIAL]
| 交付物 |
数量 |
格式 |
命名(严格) |
内容要求 |
| 商品文案 |
3 份 |
.txt / .md |
product_description_en / product_description_ko / product_description_pt |
英/韩/葡各一份;每份须包含:商品标题、商品信息(SKU 及其对应分解项、商品属性)、数据来源对应平台名称、商品 ID 及 URL、图片名称对应介绍、视频名称及对应介绍 |
| 主图 |
1 张 |
.png / .jpeg |
main_image |
— |
| 详情图 |
5 张 |
.png / .jpeg |
detail_image_1 ~ detail_image_5 |
— |
| 商品视频 |
1 个 |
.mp4 / .mov |
product_video |
— |
| 策略说明 |
1 份 |
.txt / .md |
strategy_document |
阐述 Agent 的整体设计思路与生成策略 |
- 命名合规被严格校验(平台按命名定位与解析素材,且要求「字段可解析」)
- 目标市场:美国(EN)、韩国(KO)、巴西(PT)
1.6 提交包与运行环境规格 [OFFICIAL]
产物包:
- ZIP 格式,≤ 100 MB;包内根目录须命名为
agent
- 入口文件必须位于包根目录,四选一:
agent.py / agent.js / agent.jar(须声明 Main-Class)/ agent(Go 编译 ELF 产物,无后缀)
- 根目录必须有
agent.json:{"runtime":"<java|python|node|go>","version":"<x.y.z 语义化版本,三段纯数字>"}(runtime 小写)
- 根目录必须有依赖声明文件(按运行时):
pom.xml / requirements.txt / package.json / go.mod
- 全部依赖必须打包进 ZIP 且已适配运行环境;沙箱运行时不提供任何网络安装能力
- 必须实现
--version 参数:输出与 agent.json 的 version 完全一致的版本号,退出码 0
- 启动契约示例:
python agent.py --prompt "请根据 /data/dataset 中的数据完成问答任务,将结果输出到 /workspace/output/result.json"——--prompt 传的是自然语言指令,Agent 须自行从中解析输入/输出路径
- 退出码:0 = 成功,非 0 = 失败
- 日志:写入
$AGENT_LOG_DIR/agent.log
沙箱环境:
- OS:Linux(Debian 12, x86_64)
- 可用运行时(仅此四种):JDK 17、Python 3.12、Node.js 22、Go 1.22
- 单次运行限制:墙钟时间 ≤ 30 分钟(超时即任务失败);内存 ≤ 4 GB
- 网络白名单:仅可访问 (a) 千问 AI 平台模型服务,(b) 模型返回的产物 URL;其余外部网络不可达
- 环境变量:
DASHSCOPE_API_KEY(模型调用 API Key,必须从环境变量读取)、DASHSCOPE_BASE_URL(以 /api/v1 结尾)、OPENAI_BASE_URL(以 /v1 结尾)、AGENT_LOG_DIR
- 官方提示的坑:拼接 URL 时注意重复拼接/格式错误
- 限流:官方明确要求「Agent 需要正确处理可能遭遇的模型限流响应信息」(重试逻辑是硬性要求)
- 产物下载:模型返回的产物 URL 须通过 HTTP 下载至 prompt 指定的输出目录作为最终产物
1.7 能力限制 [OFFICIAL——决定架构形态]
以下能力均不支持(调用即失败):
- MCP、智能体应用、工作流、记忆体、知识库检索、Embedding
- Responses API(仅支持 DashScope API / OpenAI 兼容 Chat API 两种调用方式)
- 模型内置工具
- 上传本地文件作为模型输入——若需向模型传入图片/音频/视频,只能使用 (a) 前序模型调用返回的结果 URL,或 (b) 赛题数据中提供的 URL。⇒ 中间产物只能以「模型→URL→模型」链路传递,「先下载再上传」的模式不可行
- 模型白名单:机器评测仅允许调用 §1.8 清单内 36 个模型,其他模型无法调用
- 网络访问:除模型服务与模型产物 URL 外不可访问任何外部网络 ⇒ AliExpress 规则、尺码表、禁忌词表等一切领域知识必须赛前研究并打包进 ≤100MB 的 ZIP [INFERRED]
1.8 允许模型清单 [OFFICIAL](完整列表,共 36 个)
cosyvoice-v3-flash, deepseek-v4-flash, deepseek-v4-flash-0731, deepseek-v4-pro, fun-asr, fun-asr-flash-2026-06-15, fun-music-v1, glm-5.1, glm-5.2, happyhorse-1.1-r2v, happyhorse-1.1-t2v, kimi-k2.5, kimi-k2.6, MiniMax-M2.5, qwen-audio-3.0-tts-flash, qwen-doc-turbo, qwen-image-3.0-pro, qwen-plus, qwen-vl-max, qwen-vl-ocr, qwen3-asr-flash, qwen3-asr-flash-filetrans, qwen3-tts-flash, qwen3-vl-plus, qwen3.5-ocr, qwen3.5-plus, qwen3.6-35b-a3b, qwen3.6-flash, qwen3.6-plus, qwen3.7-max, qwen3.7-plus, qwen3.8-max, wan2.7-i2v-2026-04-25, wan2.7-image, wan2.7-image-pro, wan2.7-videoedit
能力分类 [INFERRED,按命名推断,使用前对照官方文档核实]:
- 文本 LLM:deepseek-v4-flash / deepseek-v4-flash-0731 / deepseek-v4-pro、glm-5.1、glm-5.2、kimi-k2.5、kimi-k2.6、MiniMax-M2.5、qwen-plus、qwen3.5-plus、qwen3.6-35b-a3b、qwen3.6-flash、qwen3.6-plus、qwen3.7-max、qwen3.7-plus、qwen3.8-max
- 视觉语言(VLM):qwen-vl-max、qwen3-vl-plus
- 图像生成:qwen-image-3.0-pro、wan2.7-image、wan2.7-image-pro
- 视频生成:happyhorse-1.1-t2v(文生视频)、happyhorse-1.1-r2v(参考图生视频,推断)、wan2.7-i2v-2026-04-25(图生视频)
- 视频编辑:wan2.7-videoedit
- 语音合成(TTS):cosyvoice-v3-flash、qwen3-tts-flash、qwen-audio-3.0-tts-flash
- 语音识别(ASR):fun-asr、fun-asr-flash-2026-06-15、qwen3-asr-flash、qwen3-asr-flash-filetrans(文件转写)
- OCR:qwen-vl-ocr、qwen3.5-ocr
- 音乐生成:fun-music-v1;文档解析:qwen-doc-turbo
1.9 机器评测评分表 [OFFICIAL]
公式:机器评测总分 = Σ(各维度得分 × 对应权重);榜单按总分排名。机制:评测最新提交作品,保留历史最高成绩作为入围依据。
| 维度 |
名称 |
权重 |
判定范围 |
子维度 |
判定方式 |
| A1 |
内容合规性 |
25% |
全部文本素材 + 图片/视频内可识别文字 + 画面视觉元素;仅按平台素材内容合规规则判定,不做法律与知识产权判断;规则分文本、图像两个通道;AliExpress 上架规则需选手自行搜索研究 |
整体判定 |
标题、详情文案、图片/视频内叠加文字与画面视觉元素均不出现任一违规项即为合规;出现任一违规项即不合规 |
| A2 |
素材规格达标 |
20% |
产出素材的内容完整性与物理规格;不判压缩包打包方式,也不判内容对错 |
文本内容完整性(文件大小 < 1MB);主图规格(jpeg/png,≥ 800×800 px);图片规格(jpeg/png,宽高均 > 260 px,单张 ≤ 5 MB);视频(文件存在且可正常播放,mp4/mov,单个 < 200MB) |
按子维度评分,符合规范即得分 |
| A3 |
类目与属性准确性 |
18% |
类目名称 + 商品属性 + 销售属性枚举值;仅做「选手输出对比标准答案」的校验,算法不自行判断类目归属 |
叶子类目正确性;商品属性命中(各属性 key/value);销售属性(规格分类值)命中 |
按子维度评分,符合规范即得分 |
| A4 |
本地化适配 |
15% |
主图/详情图视觉、文案语气用词、拼写、尺码度量、文化禁忌等文化差异 |
背景规范;文案用词合规;拼写与本地用词;尺码体系;度量单位;文化禁忌·性别与体型;渠道场景本土化 |
按子维度评分,符合规范即得分 |
| A5 |
商品事实一致性 |
10% |
文本素材做信息来源检查;图片/视频内叠加文字仅抽检 |
来源匹配商品源数据;标注与源数据中的展示匹配 |
可核验属性均需标明来源且与标准答案一致;未标注、与源数据不一致、或与标准答案不一致均判为不对 |
| A6 |
出图可用率 |
7% |
一次性生成的全部图片 |
「可用」= 符合平台图片需求规格,且质量上无重大瑕疵 |
一次性生成图中「可用」比例 ≥ 80% 为合格,低于阈值为不合格 |
| A7 |
出视频可用性 |
5% |
一次性生成的全部视频 |
「可用」= 符合平台视频需求规格,可正常播放且无重大瑕疵 |
视频可正常播放且不触发任一不可容忍瑕疵即为可用 |
1.10 专家盲评评分表 [OFFICIAL]
入围池:国内站、海外站两榜各取 Top 30,汇总后由行业专家统一盲评、拉通排名。公式:专家评审总分 = Σ(各维度得分 × 对应权重)。最终从入围作品评选 Top 5 → 金 1 / 银 2 / 铜 2。
| 维度 |
说明 |
权重 |
| Agent 使用体验 |
交互流程、稳定性与整体使用顺畅度 |
15% |
| 图片素材效果 |
主图与详情图的可用性及呈现效果 |
30% |
| 视频素材效果 |
商品视频的可用性及呈现效果 |
20% |
| 整体策略 |
本地化与素材生成策略的合理性、完整性与竞争力 |
35% |
结构性事实 [INFERRED]:机器评测 A1+A2+A3 = 63% 为确定性工程分;专家评审「整体策略+图片」= 65% 为决胜分。
1.11 机评 Prompt 官方示例 [OFFICIAL](整个机评环节 Prompt 保持统一;以下为逐字引用,路径为示例)
## 任务目标
读取 `/home/user/ws/input/` 目录下目标商品的全部信息文件,提取指定内容,按规范生成输出文件并保存至 `/home/user/ws/output/`。
## 输入说明
输入目录:`/home/user/ws/input/`
该目录下包含目标商品的多个信息文件,各文件含义及对应关系如下:
| 文件名 | 内容说明 | 备注 |
| product_info/product_basic.json | 上架商品基础信息,含标题、SKU | product_basic 仅为商品名称示意,实际输入名称按本地商品文件名称进行调整 |
| clothing_attributes.json | 平台服装类商品属性划分 | - |
| clothing_categories.json | 平台服装类类目划分 | - |
## 输出要求
1. 输出目录:`/home/user/ws/output/`
2. 针对该商品,需完整产出以下素材,各项须命名规范、字段可解析:
| 产出物 | 数量 | 格式 | 命名 | 说明 |
| 商品文案 | 3 份 | .txt / .md | product_description_en, product_description_ko, product_description_pt | 英文 / 韩文 / 葡萄牙文各一份 |
| 主图 | 1 张 | .png / .jpeg | main_image | 商品主图 |
| 详情图 | 5 张 | .png / .jpeg | detail_image_1 ~ detail_image_5 | 商品详情图 |
| 商品视频 | 1 个 | .mp4 / .mov | product_video | 商品介绍视频 |
| 策略说明 | 1 份 | .txt / .md | strategy_document | 阐述 Agent 的整体设计思路与生成策略 |
**商品文案内容要求**:每份文案需包含商品标题,商品信息(SKU 及其对应分解项、商品属性),数据来源对应平台名称,商品 ID 及 URL,图片名称对应介绍,视频名称及对应介绍。
3. 命名规则必须严格遵循——所有产出须严格使用上述命名,以便平台定位与解析各类素材。
1.12 官方失败排查清单 [OFFICIAL](提交失败时按此顺序自查)
- 是否按规调用了千问 AI 平台 API KEY(环境变量
DASHSCOPE_API_KEY)
- 产出文件名称是否符合规范
- 素材产出是否完整
- 提交的代码包是否符合要求
- Agent 运行时间是否超过 30 min
- 调用模型是否符合需求,检查输入参数是否符合赛题要求和模型限制
DASHSCOPE_BASE_URL 以 /api/v1 结尾、OPENAI_BASE_URL 以 /v1 结尾,调用时注意 URL 是否重复拼接或格式错误
- 代码包依赖是否完整
官方声明:以上仅为常见示例,不为问题枚举。
1.13 成本补贴 [OFFICIAL]
- 适用:千问 AI 平台实名认证个人/企业用户;完成报名;作品成功提交并获得有效测评分数;虚商、RAM 子账号不可参加;每人限参与 1 次满返
- 规则:活动期间千问 AI 平台按量付费实付金额(不含用券抵扣)达门槛 → 返代金券:实付 ∈ [20, 150) 元 → 返 20 元券;实付 ∈ [150, 300) 元 → 返 150 元券;实付 ≥ 300 元 → 返 300 元券
- 券:9/30 前发放;限千问 AI 平台国内站非折扣商品;90 天有效;不可提现/转让
- 重要排除:开发期间若使用 Token Plan 额度则无法追踪用量、不予补贴
1.14 源链接 [OFFICIAL]
二、组织 IR schema v1(九字段)
job(要完成的待办)
在组织新仓 QW_Arena1(L2,public,Python)内构建并交付千问 AI Arena「一键出海:商品素材全自动生成任务」的参赛 Agent:一次运行读入商品源数据(JSON + 源图),端到端产出 AliExpress 上架全套本地化素材(英/韩/葡文案 ×3、主图 ×1、详情图 ×5、商品视频 ×1、策略说明 ×1,命名严格合规),按比赛契约打包交付(agent/ 根目录 ZIP ≤100MB,agent.py + agent.json + requirements.txt + 全量依赖 vendored,零网络安装),在 2026-08-31 截止前完成双榜提交,目标名次:Top 5 中的第 1(金奖)。
本 IR 同时完成立项治理三件事:① 建仓 QW_Arena1 并按 flows.new_repo 初始化与申报入图;② 语言判定为 Python 并以 ADR-0084 在组织层面登记语言规范豁免(特殊原因:外部比赛运行时契约 + 有限生命周期 + 7 天时间窗);③ 以本 IR 第一部分冻结比赛原始要求,作为后续 spec 红队审查的锚点。本 IR 只登记意图——spec 不在本 IR 范围内(owner 指令:spec 与红队审查另行安排)。
触发场景
- 比赛截止倒计时 7 天(2026-08-24 → 08-31),机评已开放打榜,提交配额 3 次/天(余量约 21 次 [INFERRED])——每晚一天立项,丢一天打榜反馈窗口
- 预研(Spike)代码已存在(工作区内路径解析/图像合成/类目匹配等模块),但散落工作目录、无治理承接、不可追溯——按组织流程需正式立项仓承接,且预研结论必须经 spec→红队→实现流程转正,不得直接作为交付物
- 组织语言政策(governance/policy/languages.yaml)应用层默认 Go、Python 仅限 agent-runtime 集成(ADR-0025)——参赛仓入口契约由赛方规定(
agent.py + requirements.txt,四选一中 Python 为预研资产与图像/文字渲染生态的最优解),与组织政策冲突,需组织层面豁免声明后建仓
- 比赛页面是外部网页(可下线/改版),后续 spec 红队审查与验收需要唯一权威的需求真源——必须在本 IR 内冻结全量原文
当前痛点的证据
- 官方比赛页四标签页全文(抓取于 2026-08-24,见第一部分与源链接)——比赛契约唯一真源;页面可变性 = 需求漂移风险,证明冻结进 IR 的必要性
- 官方机评 Prompt 明示「product_basic 仅为商品名称示意,实际输入名称按本地商品文件名称进行调整」——官方坑点清单(§1.12)第 2/3/5/8 条对应的历史失败模式即证据:命名不规范、素材不完整、超时、依赖不完整均为高频失败原因
- 预研 Spike 实测问题清单:字体路径 str/Path 混用崩溃、中文目录名路径解析截断、类目误匹配(「连衣裙」→「女士短袖」)——未经治理的代码不可直接交付,证明需正式立项流程
- 沙箱约束(§1.6/§1.7)实测推导:无网络安装 + 禁知识库 + 禁本地文件上传——一切领域知识(AliExpress 规则/三国尺码/禁忌词)必须赛前固化进 ≤100MB ZIP;中间产物只能「模型→URL→模型」传递——这些硬约束直接决定架构形态,证明 spec 阶段红队审查必须以 §1 为锚
- 组织治理现状:REPOS.yaml 无 QW_Arena1 条目、无语言豁免 ADR——按 GM-4 线上未申报仓 = 漂移;不先补齐治理面,仓不可用(AG-4 App 挂载 / RL-1 production environment 均未配置)
期望的可观察变化(验收时能在线上看到的事实)
A. 治理面(本 IR 直接交付,登记即验收)
- QW_Arena1 仓线上存在且 public,从 template-service 派生(继承 gate/护栏/AGENTS.md 骨架)
- new-repo-init.sh 四步完成:仓库基线(squash-only/合并删分支/auto-merge 开/wiki+projects 关)+ production environment(required reviewer + 仅受保护分支)+ cloudbrid-agent 挂载 + 验证输出
- governance/REPOS.yaml 出现 QW_Arena1 条目(layer: L2 / visibility: public / status: active / role 注明参赛仓 + ADR-0084 语言豁免)
- ADR-0084 双落盘:agent-registry/decisions/ 墓碑 + INDEX.yaml 登记 + archive/adr/ 正本(三向 sha256 闭环 verify.yml 背书)——内容含 Python 选型理由、languages.yaml 豁免声明、豁免边界、退役条款
- 本 issue 第一部分比赛原始要求与官方页面逐节可对照(红队锚点成立)
B. 比赛交付面(后续 spec/实现/测试阶段验收,此处登记为期望,成为 spec AC 的种子)
- 比赛平台提交记录:机器评测返回有效分数(A1-A7 加权总分);双榜(国内站/海外站)提交;目标:至少一榜入 Top 30(专家评审入围线),冲刺 Top 5
- 单次运行产物完整且命名合规:11 个文件(3 文案 + 1 主图 + 5 详情图 + 1 视频 + 1 策略说明)全部通过 A2 物理规格(文本 <1MB / 主图 ≥800×800 / 图宽高 >260px 单张 ≤5MB / 视频 mp4/mov 可播放 <200MB)
- 提交包契约全过:ZIP ≤100MB、根目录
agent/、--version 输出与 agent.json 一致且退出码 0、30 分钟内完成运行且退出码 0
$AGENT_LOG_DIR/agent.log 全程留痕:模型调用、限流重试、降级链触发、时间预算消耗可审计
非目标(NONGOAL)
- 不写 spec——本 IR 只登记意图与需求冻结;spec 及其红队审查 owner 明确另行安排
- 不做 AliExpress 以外平台(Amazon/Temu/Shein 等)适配
- 不追求组织级语言规范符合性(ADR-0084 豁免——外部契约优先);亦不修改 languages.yaml 本体(豁免是仓级例外登记,不是组织政策修订)
- 不做生产级服务化:交付物是比赛平台的一次性 ZIP,无部署/运维面,不进组织基础设施
- 不为政策符合而重写为 Go/TS——7 天窗口内换语言 = 放弃比赛
- 不引入人类设计师/人工翻译介入:全 AI 生成链路是参赛主体形态(一人软件公司 + AI 编码)
- 不做比赛结束后的长期演进承诺(退役条款见 ADR-0084)
- 不在本阶段搬运 Spike 代码入仓(实现阶段按 spec 重构吸收,Spike 仅作参照与 golden fixtures 来源)
约束 / 不可违反项
铁律一:比赛契约(本 IR 第一部分全量——最高优先级,spec/实现与其冲突以比赛契约为准)
- 墙钟 ≤30 分钟、内存 ≤4GB、超时即失败;退出码契约(0 成功)
- 网络白名单仅千问模型服务 + 模型产物 URL;沙箱零网络安装 ⇒ 依赖全量 vendored 进 ZIP
- 36 模型白名单外不可调用;MCP/工作流/记忆体/知识库/Embedding/Responses API/模型内置工具/本地文件上传全部不可用
- 交付物命名严格校验、字段可解析;文件名动态发现不可硬编码
DASHSCOPE_API_KEY 仅环境变量读取;URL 拼接防重复;限流必须重试处理
- 素材信息忠实源数据不虚构(A5);示例数据仅限本任务使用禁止商用
铁律二:组织治理
- 全仓公开政策(ADR-0020):QW_Arena1 必须 public
- 默认分支仅经 PR+squash 进入(BP-1);gate/org-gate/adversary 双轨 required check
- 语言豁免走 ADR-0084 登记(flows.governance_change C1:PR + ADR + owner-merge);豁免范围=语言规范面,不豁免可见性/PR 流程/hygiene/CODEOWNERS/REPOS.yaml 申报义务
- IR 账本 append-only:签署后只追加评论/erratum,不编辑正文
- 新仓初始化用固定引用执行 new-repo-init.sh(供应链纪律:pin 审阅过的合并提交,不解析浮动 main)
铁律三:反摆拍(组织 risk_posture 与比赛 A5 同向)
- 素材事实一致性不得为凑格式虚构源数据没有的信息;strategy_document 不得宣称未实现的能力
- 本地影子评测近似机评口径时,结论不得宣称等同于官方机评(标注为近似估计)
人类愿意接受的验收证据
- 治理面(本阶段):REPOS.yaml 条目 diff(PR 链接);ADR-0084 双落盘记录(agent-registry PR + archive PR + INDEX 登记);QW_Arena1 线上设置 API 记录(squash-only/auto-merge/production environment/App 挂载);本 issue 第一部分与官方页面逐节对照的抽查记录
- 比赛面(后续阶段):比赛平台提交记录与机评分数;本地影子评测报告(A2 机械复刻 + 允许清单内 VLM/OCR 近似 A1/A4/A6);提交包 ZIP 清单与体积;
--version 与 30 分钟限时运行日志(agent.log)
- 红队可复核性:spec 阶段红队以本 IR 第一部分为锚点逐条对照 spec 条款——本 IR 第一部分的存在本身即红队审查的前置条件
可逆性偏好
- 整仓可逆:比赛评审结束后 QW_Arena1 按 ADR-0084 退役条款转入 archived 状态或删除(REPOS.yaml 状态变更走 C1 PR)——不影响组织其他仓
- 提交可逆:比赛平台保留历史最高成绩,单次提交失败不损历史最高分,迭代天然可逆
- 治理登记可逆:REPOS.yaml 条目与 ADR-0084 可按 flows.governance_change 走新 ADR 撤销(append-only,撤销留痕)
- 不可逆项声明:无——所有决策均有登记在案的撤销路径
质量-速度旋钮
- 速度优先(7 天硬窗口 + ~21 次提交配额),但三条不可降级面:①确定性工程分 A1/A2/A3(合计 63%)的合规与规格达标;②事实一致性 A5(不虚构);③提交契约(命名/包结构/退出码/时限)——任何一条失守 = 提交无效或大幅失分,速度毫无意义
- 可降级面:视觉美学边际分(A4/A6/A7)可在时间耗尽时走「源图 + 确定性渲染」保底链(Pillow 文字层合成、Ken-Burns 图生视频)而非多轮模型精修;strategy_document 深度按剩余时间伸缩
- 资源旋钮:按量付费 API 额度充裕(补贴政策实付 ≥300 元返 300 元券,见 §1.13),不为省钱降质量;但单次运行模型调用次数受 30 分钟时限硬约束,时间预算管理器是必选项
- 红队审查不因时间压力豁免——owner 已明确 spec 红队另行安排,本 IR 冻结比赛原文正是为其准备
一、比赛原始要求全量罗列(红队审查锚点——spec 与实现的最终裁判基准)
1.1 比赛身份 [OFFICIAL]
1.2 时间线 [OFFICIAL](全部 UTC+8)
1.3 任务定义 [OFFICIAL]
构建一个可被平台独立运行的 Agent:输入一件商品的原始源数据,一次运行端到端产出其在海外电商平台(以 AliExpress 为例)上架所需全套本地化素材。官方五大本地化维度:
1.4 输入 [OFFICIAL]
/home/user/ws/input/product_info/product_basic.json— 上架商品基础信息,含标题、SKUclothing_attributes.json— 平台服装类商品属性划分clothing_categories.json— 平台服装类类目划分1.5 每商品交付物(精确规格)[OFFICIAL]
product_description_en/product_description_ko/product_description_ptmain_imagedetail_image_1~detail_image_5product_videostrategy_document1.6 提交包与运行环境规格 [OFFICIAL]
产物包:
agentagent.py/agent.js/agent.jar(须声明 Main-Class)/agent(Go 编译 ELF 产物,无后缀)agent.json:{"runtime":"<java|python|node|go>","version":"<x.y.z 语义化版本,三段纯数字>"}(runtime 小写)pom.xml/requirements.txt/package.json/go.mod--version参数:输出与 agent.json 的 version 完全一致的版本号,退出码 0python agent.py --prompt "请根据 /data/dataset 中的数据完成问答任务,将结果输出到 /workspace/output/result.json"——--prompt传的是自然语言指令,Agent 须自行从中解析输入/输出路径$AGENT_LOG_DIR/agent.log沙箱环境:
DASHSCOPE_API_KEY(模型调用 API Key,必须从环境变量读取)、DASHSCOPE_BASE_URL(以/api/v1结尾)、OPENAI_BASE_URL(以/v1结尾)、AGENT_LOG_DIR1.7 能力限制 [OFFICIAL——决定架构形态]
以下能力均不支持(调用即失败):
1.8 允许模型清单 [OFFICIAL](完整列表,共 36 个)
cosyvoice-v3-flash, deepseek-v4-flash, deepseek-v4-flash-0731, deepseek-v4-pro, fun-asr, fun-asr-flash-2026-06-15, fun-music-v1, glm-5.1, glm-5.2, happyhorse-1.1-r2v, happyhorse-1.1-t2v, kimi-k2.5, kimi-k2.6, MiniMax-M2.5, qwen-audio-3.0-tts-flash, qwen-doc-turbo, qwen-image-3.0-pro, qwen-plus, qwen-vl-max, qwen-vl-ocr, qwen3-asr-flash, qwen3-asr-flash-filetrans, qwen3-tts-flash, qwen3-vl-plus, qwen3.5-ocr, qwen3.5-plus, qwen3.6-35b-a3b, qwen3.6-flash, qwen3.6-plus, qwen3.7-max, qwen3.7-plus, qwen3.8-max, wan2.7-i2v-2026-04-25, wan2.7-image, wan2.7-image-pro, wan2.7-videoedit能力分类 [INFERRED,按命名推断,使用前对照官方文档核实]:
1.9 机器评测评分表 [OFFICIAL]
公式:机器评测总分 = Σ(各维度得分 × 对应权重);榜单按总分排名。机制:评测最新提交作品,保留历史最高成绩作为入围依据。
1.10 专家盲评评分表 [OFFICIAL]
入围池:国内站、海外站两榜各取 Top 30,汇总后由行业专家统一盲评、拉通排名。公式:专家评审总分 = Σ(各维度得分 × 对应权重)。最终从入围作品评选 Top 5 → 金 1 / 银 2 / 铜 2。
结构性事实 [INFERRED]:机器评测 A1+A2+A3 = 63% 为确定性工程分;专家评审「整体策略+图片」= 65% 为决胜分。
1.11 机评 Prompt 官方示例 [OFFICIAL](整个机评环节 Prompt 保持统一;以下为逐字引用,路径为示例)
1.12 官方失败排查清单 [OFFICIAL](提交失败时按此顺序自查)
DASHSCOPE_API_KEY)DASHSCOPE_BASE_URL以/api/v1结尾、OPENAI_BASE_URL以/v1结尾,调用时注意 URL 是否重复拼接或格式错误官方声明:以上仅为常见示例,不为问题枚举。
1.13 成本补贴 [OFFICIAL]
1.14 源链接 [OFFICIAL]
二、组织 IR schema v1(九字段)
job(要完成的待办)
在组织新仓 QW_Arena1(L2,public,Python)内构建并交付千问 AI Arena「一键出海:商品素材全自动生成任务」的参赛 Agent:一次运行读入商品源数据(JSON + 源图),端到端产出 AliExpress 上架全套本地化素材(英/韩/葡文案 ×3、主图 ×1、详情图 ×5、商品视频 ×1、策略说明 ×1,命名严格合规),按比赛契约打包交付(
agent/根目录 ZIP ≤100MB,agent.py+agent.json+requirements.txt+ 全量依赖 vendored,零网络安装),在 2026-08-31 截止前完成双榜提交,目标名次:Top 5 中的第 1(金奖)。本 IR 同时完成立项治理三件事:① 建仓 QW_Arena1 并按 flows.new_repo 初始化与申报入图;② 语言判定为 Python 并以 ADR-0084 在组织层面登记语言规范豁免(特殊原因:外部比赛运行时契约 + 有限生命周期 + 7 天时间窗);③ 以本 IR 第一部分冻结比赛原始要求,作为后续 spec 红队审查的锚点。本 IR 只登记意图——spec 不在本 IR 范围内(owner 指令:spec 与红队审查另行安排)。
触发场景
agent.py+requirements.txt,四选一中 Python 为预研资产与图像/文字渲染生态的最优解),与组织政策冲突,需组织层面豁免声明后建仓当前痛点的证据
期望的可观察变化(验收时能在线上看到的事实)
A. 治理面(本 IR 直接交付,登记即验收)
B. 比赛交付面(后续 spec/实现/测试阶段验收,此处登记为期望,成为 spec AC 的种子)
agent/、--version输出与 agent.json 一致且退出码 0、30 分钟内完成运行且退出码 0$AGENT_LOG_DIR/agent.log全程留痕:模型调用、限流重试、降级链触发、时间预算消耗可审计非目标(NONGOAL)
约束 / 不可违反项
铁律一:比赛契约(本 IR 第一部分全量——最高优先级,spec/实现与其冲突以比赛契约为准)
DASHSCOPE_API_KEY仅环境变量读取;URL 拼接防重复;限流必须重试处理铁律二:组织治理
铁律三:反摆拍(组织 risk_posture 与比赛 A5 同向)
人类愿意接受的验收证据
--version与 30 分钟限时运行日志(agent.log)可逆性偏好
质量-速度旋钮