Skip to content

IR: QW_Arena1 立项——千问 AI Arena「一键出海」跨境素材参赛 Agent(比赛原始要求全量冻结 + 语言规范豁免 ADR-0084) #345

Description

@randypanding

结构说明(本 IR 的特殊性):本 IR 的需求实质首先来自外部比赛契约(千问 AI Arena 官方比赛页),而非组织内生痛点。为使后续红队审查能对照「原始要求」逐条核验(而非核验我们对要求的转述),第一部分全量罗列比赛原始要求并冻结于此,第二部分才是组织 IR schema v1 九字段。红队审查 spec 时,凡 spec 条款与本 IR 第一部分冲突,以第一部分为准(比赛契约是最高优先级外部约束)。

标注约定:[OFFICIAL] = 官方页面原文或忠实转写;[INFERRED] = 参赛方前期分析推断,非官方。IR 账本纪律:本 issue 为 append-only 意图账本——签署(state:ir-signed)后只追加评论/erratum,不编辑正文。


一、比赛原始要求全量罗列(红队审查锚点——spec 与实现的最终裁判基准)

1.1 比赛身份 [OFFICIAL]

  • 名称:一键出海:商品素材全自动生成任务(One-Click Overseas — Automated Product Listing Material Generation)
  • 任务域:跨境电商商品本地化素材生成(示例平台:AliExpress)
  • 主办:千问 AI Arena(阿里 · 千问 AI 平台 www.qianwenai.com);联合主办:Aidge(阿里国际电商 AI 工具)
  • 双榜单机制:国内站 qianwenai.com 与海外站 qwencloud.com 在机器评测阶段独立打榜、各自排名
  • 奖金(Token 代金券,发放至千问 AI 平台个人账户,阿里云依法代扣个税):金奖 $10,000 × 1;银奖 $5,000 × 2;铜奖 $3,000 × 2
  • 非现金奖励:云栖大会展区展示(2026-09-22~24);阿里云生态伙伴体系商业化合作机会
  • 参赛资格:千问 AI 平台或阿里云实名认证用户;虚商、RAM 子账号不可参加

1.2 时间线 [OFFICIAL](全部 UTC+8)

阶段 窗口
报名 + 作品提交 2026-08-07 → 2026-08-31
机器评测 + 打榜 2026 年 8 月中旬 → 2026-08-31
专家评审(两榜各 Top 30) 2026-08-31 → 9 月中旬
结果展示 2026-09-11 后
云栖大会颁奖 2026-09-22 → 09-24
  • 提交配额:每天最多 3 次提交
  • 排名规则:机器评测评测「最新提交」,但保留整个历史评审中的最高成绩及对应排名作为入围依据
  • 推导 [INFERRED]:自 IR 登记日(2026-08-24)起,剩余提交次数上限 ≈ 21 次(7 天 × 3 次/天)

1.3 任务定义 [OFFICIAL]

构建一个可被平台独立运行的 Agent:输入一件商品的原始源数据,一次运行端到端产出其在海外电商平台(以 AliExpress 为例)上架所需全套本地化素材。官方五大本地化维度:

  1. 语言本地化 — 面向不同市场(美国/英语、韩国/韩语、巴西/葡语)产出符合当地语言习惯的文案,而非逐字翻译
  2. 视觉素材 — 符合平台规范的主图、详情图、商品视频
  3. 平台适配 — 准确映射到平台后台的类目与属性体系
  4. 市场适配 — 尺码换算、目标市场拼写与表达习惯、规避文化禁忌
  5. 事实一致 — 所有素材信息须忠实于源数据,不得虚构或凭空补全

1.4 输入 [OFFICIAL]

  • 输入目录示例:/home/user/ws/input/
  • 文件:
    • product_info/product_basic.json — 上架商品基础信息,含标题、SKU
    • clothing_attributes.json — 平台服装类商品属性划分
    • clothing_categories.json — 平台服装类类目划分
  • 官方警告:「product_basic 仅为商品名称示意,实际输入名称按本地商品文件名称进行调整」——文件名随商品变化,Agent 必须动态发现/解析实际文件名,不可硬编码
  • 示例数据:比赛页提供「商品数据示例」下载(示例商品数据 + 平台类目/属性数据);仅限本任务使用,禁止商用

1.5 每商品交付物(精确规格)[OFFICIAL]

交付物 数量 格式 命名(严格) 内容要求
商品文案 3 份 .txt / .md product_description_en / product_description_ko / product_description_pt 英/韩/葡各一份;每份须包含:商品标题、商品信息(SKU 及其对应分解项、商品属性)、数据来源对应平台名称、商品 ID 及 URL、图片名称对应介绍、视频名称及对应介绍
主图 1 张 .png / .jpeg main_image
详情图 5 张 .png / .jpeg detail_image_1 ~ detail_image_5
商品视频 1 个 .mp4 / .mov product_video
策略说明 1 份 .txt / .md strategy_document 阐述 Agent 的整体设计思路与生成策略
  • 命名合规被严格校验(平台按命名定位与解析素材,且要求「字段可解析」)
  • 目标市场:美国(EN)、韩国(KO)、巴西(PT)

1.6 提交包与运行环境规格 [OFFICIAL]

产物包:

  • ZIP 格式,≤ 100 MB;包内根目录须命名为 agent
  • 入口文件必须位于包根目录,四选一:agent.py / agent.js / agent.jar(须声明 Main-Class)/ agent(Go 编译 ELF 产物,无后缀)
  • 根目录必须有 agent.json{"runtime":"<java|python|node|go>","version":"<x.y.z 语义化版本,三段纯数字>"}(runtime 小写)
  • 根目录必须有依赖声明文件(按运行时):pom.xml / requirements.txt / package.json / go.mod
  • 全部依赖必须打包进 ZIP 且已适配运行环境;沙箱运行时不提供任何网络安装能力
  • 必须实现 --version 参数:输出与 agent.json 的 version 完全一致的版本号,退出码 0
  • 启动契约示例:python agent.py --prompt "请根据 /data/dataset 中的数据完成问答任务,将结果输出到 /workspace/output/result.json"——--prompt 传的是自然语言指令,Agent 须自行从中解析输入/输出路径
  • 退出码:0 = 成功,非 0 = 失败
  • 日志:写入 $AGENT_LOG_DIR/agent.log

沙箱环境:

  • OS:Linux(Debian 12, x86_64)
  • 可用运行时(仅此四种):JDK 17、Python 3.12、Node.js 22、Go 1.22
  • 单次运行限制:墙钟时间 ≤ 30 分钟(超时即任务失败);内存 ≤ 4 GB
  • 网络白名单:仅可访问 (a) 千问 AI 平台模型服务,(b) 模型返回的产物 URL;其余外部网络不可达
  • 环境变量:DASHSCOPE_API_KEY(模型调用 API Key,必须从环境变量读取)、DASHSCOPE_BASE_URL(以 /api/v1 结尾)、OPENAI_BASE_URL(以 /v1 结尾)、AGENT_LOG_DIR
  • 官方提示的坑:拼接 URL 时注意重复拼接/格式错误
  • 限流:官方明确要求「Agent 需要正确处理可能遭遇的模型限流响应信息」(重试逻辑是硬性要求)
  • 产物下载:模型返回的产物 URL 须通过 HTTP 下载至 prompt 指定的输出目录作为最终产物

1.7 能力限制 [OFFICIAL——决定架构形态]

以下能力均不支持(调用即失败):

  • MCP、智能体应用、工作流、记忆体、知识库检索、Embedding
  • Responses API(仅支持 DashScope API / OpenAI 兼容 Chat API 两种调用方式)
  • 模型内置工具
  • 上传本地文件作为模型输入——若需向模型传入图片/音频/视频,只能使用 (a) 前序模型调用返回的结果 URL,或 (b) 赛题数据中提供的 URL。⇒ 中间产物只能以「模型→URL→模型」链路传递,「先下载再上传」的模式不可行
  • 模型白名单:机器评测仅允许调用 §1.8 清单内 36 个模型,其他模型无法调用
  • 网络访问:除模型服务与模型产物 URL 外不可访问任何外部网络 ⇒ AliExpress 规则、尺码表、禁忌词表等一切领域知识必须赛前研究并打包进 ≤100MB 的 ZIP [INFERRED]

1.8 允许模型清单 [OFFICIAL](完整列表,共 36 个)

cosyvoice-v3-flash, deepseek-v4-flash, deepseek-v4-flash-0731, deepseek-v4-pro, fun-asr, fun-asr-flash-2026-06-15, fun-music-v1, glm-5.1, glm-5.2, happyhorse-1.1-r2v, happyhorse-1.1-t2v, kimi-k2.5, kimi-k2.6, MiniMax-M2.5, qwen-audio-3.0-tts-flash, qwen-doc-turbo, qwen-image-3.0-pro, qwen-plus, qwen-vl-max, qwen-vl-ocr, qwen3-asr-flash, qwen3-asr-flash-filetrans, qwen3-tts-flash, qwen3-vl-plus, qwen3.5-ocr, qwen3.5-plus, qwen3.6-35b-a3b, qwen3.6-flash, qwen3.6-plus, qwen3.7-max, qwen3.7-plus, qwen3.8-max, wan2.7-i2v-2026-04-25, wan2.7-image, wan2.7-image-pro, wan2.7-videoedit

能力分类 [INFERRED,按命名推断,使用前对照官方文档核实]:

  • 文本 LLM:deepseek-v4-flash / deepseek-v4-flash-0731 / deepseek-v4-pro、glm-5.1、glm-5.2、kimi-k2.5、kimi-k2.6、MiniMax-M2.5、qwen-plus、qwen3.5-plus、qwen3.6-35b-a3b、qwen3.6-flash、qwen3.6-plus、qwen3.7-max、qwen3.7-plus、qwen3.8-max
  • 视觉语言(VLM):qwen-vl-max、qwen3-vl-plus
  • 图像生成:qwen-image-3.0-pro、wan2.7-image、wan2.7-image-pro
  • 视频生成:happyhorse-1.1-t2v(文生视频)、happyhorse-1.1-r2v(参考图生视频,推断)、wan2.7-i2v-2026-04-25(图生视频)
  • 视频编辑:wan2.7-videoedit
  • 语音合成(TTS):cosyvoice-v3-flash、qwen3-tts-flash、qwen-audio-3.0-tts-flash
  • 语音识别(ASR):fun-asr、fun-asr-flash-2026-06-15、qwen3-asr-flash、qwen3-asr-flash-filetrans(文件转写)
  • OCR:qwen-vl-ocr、qwen3.5-ocr
  • 音乐生成:fun-music-v1;文档解析:qwen-doc-turbo

1.9 机器评测评分表 [OFFICIAL]

公式:机器评测总分 = Σ(各维度得分 × 对应权重);榜单按总分排名。机制:评测最新提交作品,保留历史最高成绩作为入围依据。

维度 名称 权重 判定范围 子维度 判定方式
A1 内容合规性 25% 全部文本素材 + 图片/视频内可识别文字 + 画面视觉元素;仅按平台素材内容合规规则判定,不做法律与知识产权判断;规则分文本、图像两个通道;AliExpress 上架规则需选手自行搜索研究 整体判定 标题、详情文案、图片/视频内叠加文字与画面视觉元素均不出现任一违规项即为合规;出现任一违规项即不合规
A2 素材规格达标 20% 产出素材的内容完整性与物理规格;不判压缩包打包方式,也不判内容对错 文本内容完整性(文件大小 < 1MB);主图规格(jpeg/png,≥ 800×800 px);图片规格(jpeg/png,宽高均 > 260 px,单张 ≤ 5 MB);视频(文件存在且可正常播放,mp4/mov,单个 < 200MB) 按子维度评分,符合规范即得分
A3 类目与属性准确性 18% 类目名称 + 商品属性 + 销售属性枚举值;仅做「选手输出对比标准答案」的校验,算法不自行判断类目归属 叶子类目正确性;商品属性命中(各属性 key/value);销售属性(规格分类值)命中 按子维度评分,符合规范即得分
A4 本地化适配 15% 主图/详情图视觉、文案语气用词、拼写、尺码度量、文化禁忌等文化差异 背景规范;文案用词合规;拼写与本地用词;尺码体系;度量单位;文化禁忌·性别与体型;渠道场景本土化 按子维度评分,符合规范即得分
A5 商品事实一致性 10% 文本素材做信息来源检查;图片/视频内叠加文字仅抽检 来源匹配商品源数据;标注与源数据中的展示匹配 可核验属性均需标明来源且与标准答案一致;未标注、与源数据不一致、或与标准答案不一致均判为不对
A6 出图可用率 7% 一次性生成的全部图片 「可用」= 符合平台图片需求规格,且质量上无重大瑕疵 一次性生成图中「可用」比例 ≥ 80% 为合格,低于阈值为不合格
A7 出视频可用性 5% 一次性生成的全部视频 「可用」= 符合平台视频需求规格,可正常播放且无重大瑕疵 视频可正常播放且不触发任一不可容忍瑕疵即为可用

1.10 专家盲评评分表 [OFFICIAL]

入围池:国内站、海外站两榜各取 Top 30,汇总后由行业专家统一盲评、拉通排名。公式:专家评审总分 = Σ(各维度得分 × 对应权重)。最终从入围作品评选 Top 5 → 金 1 / 银 2 / 铜 2。

维度 说明 权重
Agent 使用体验 交互流程、稳定性与整体使用顺畅度 15%
图片素材效果 主图与详情图的可用性及呈现效果 30%
视频素材效果 商品视频的可用性及呈现效果 20%
整体策略 本地化与素材生成策略的合理性、完整性与竞争力 35%

结构性事实 [INFERRED]:机器评测 A1+A2+A3 = 63% 为确定性工程分;专家评审「整体策略+图片」= 65% 为决胜分。

1.11 机评 Prompt 官方示例 [OFFICIAL](整个机评环节 Prompt 保持统一;以下为逐字引用,路径为示例)

## 任务目标
读取 `/home/user/ws/input/` 目录下目标商品的全部信息文件,提取指定内容,按规范生成输出文件并保存至 `/home/user/ws/output/`。

## 输入说明
输入目录:`/home/user/ws/input/`
该目录下包含目标商品的多个信息文件,各文件含义及对应关系如下:
| 文件名 | 内容说明 | 备注 |
| product_info/product_basic.json | 上架商品基础信息,含标题、SKU | product_basic 仅为商品名称示意,实际输入名称按本地商品文件名称进行调整 |
| clothing_attributes.json | 平台服装类商品属性划分 | - |
| clothing_categories.json | 平台服装类类目划分 | - |

## 输出要求
1. 输出目录:`/home/user/ws/output/`
2. 针对该商品,需完整产出以下素材,各项须命名规范、字段可解析:
| 产出物 | 数量 | 格式 | 命名 | 说明 |
| 商品文案 | 3 份 | .txt / .md | product_description_en, product_description_ko, product_description_pt | 英文 / 韩文 / 葡萄牙文各一份 |
| 主图 | 1 张 | .png / .jpeg | main_image | 商品主图 |
| 详情图 | 5 张 | .png / .jpeg | detail_image_1 ~ detail_image_5 | 商品详情图 |
| 商品视频 | 1 个 | .mp4 / .mov | product_video | 商品介绍视频 |
| 策略说明 | 1 份 | .txt / .md | strategy_document | 阐述 Agent 的整体设计思路与生成策略 |
**商品文案内容要求**:每份文案需包含商品标题,商品信息(SKU 及其对应分解项、商品属性),数据来源对应平台名称,商品 ID 及 URL,图片名称对应介绍,视频名称及对应介绍。
3. 命名规则必须严格遵循——所有产出须严格使用上述命名,以便平台定位与解析各类素材。

1.12 官方失败排查清单 [OFFICIAL](提交失败时按此顺序自查)

  1. 是否按规调用了千问 AI 平台 API KEY(环境变量 DASHSCOPE_API_KEY
  2. 产出文件名称是否符合规范
  3. 素材产出是否完整
  4. 提交的代码包是否符合要求
  5. Agent 运行时间是否超过 30 min
  6. 调用模型是否符合需求,检查输入参数是否符合赛题要求和模型限制
  7. DASHSCOPE_BASE_URL/api/v1 结尾、OPENAI_BASE_URL/v1 结尾,调用时注意 URL 是否重复拼接或格式错误
  8. 代码包依赖是否完整

官方声明:以上仅为常见示例,不为问题枚举。

1.13 成本补贴 [OFFICIAL]

  • 适用:千问 AI 平台实名认证个人/企业用户;完成报名;作品成功提交并获得有效测评分数;虚商、RAM 子账号不可参加;每人限参与 1 次满返
  • 规则:活动期间千问 AI 平台按量付费实付金额(不含用券抵扣)达门槛 → 返代金券:实付 ∈ [20, 150) 元 → 返 20 元券;实付 ∈ [150, 300) 元 → 返 150 元券;实付 ≥ 300 元 → 返 300 元券
  • 券:9/30 前发放;限千问 AI 平台国内站非折扣商品;90 天有效;不可提现/转让
  • 重要排除:开发期间若使用 Token Plan 额度则无法追踪用量、不予补贴

1.14 源链接 [OFFICIAL]


二、组织 IR schema v1(九字段)

job(要完成的待办)

在组织新仓 QW_Arena1(L2,public,Python)内构建并交付千问 AI Arena「一键出海:商品素材全自动生成任务」的参赛 Agent:一次运行读入商品源数据(JSON + 源图),端到端产出 AliExpress 上架全套本地化素材(英/韩/葡文案 ×3、主图 ×1、详情图 ×5、商品视频 ×1、策略说明 ×1,命名严格合规),按比赛契约打包交付(agent/ 根目录 ZIP ≤100MB,agent.py + agent.json + requirements.txt + 全量依赖 vendored,零网络安装),在 2026-08-31 截止前完成双榜提交,目标名次:Top 5 中的第 1(金奖)

本 IR 同时完成立项治理三件事:① 建仓 QW_Arena1 并按 flows.new_repo 初始化与申报入图;② 语言判定为 Python 并以 ADR-0084 在组织层面登记语言规范豁免(特殊原因:外部比赛运行时契约 + 有限生命周期 + 7 天时间窗);③ 以本 IR 第一部分冻结比赛原始要求,作为后续 spec 红队审查的锚点。本 IR 只登记意图——spec 不在本 IR 范围内(owner 指令:spec 与红队审查另行安排)。

触发场景

  1. 比赛截止倒计时 7 天(2026-08-24 → 08-31),机评已开放打榜,提交配额 3 次/天(余量约 21 次 [INFERRED])——每晚一天立项,丢一天打榜反馈窗口
  2. 预研(Spike)代码已存在(工作区内路径解析/图像合成/类目匹配等模块),但散落工作目录、无治理承接、不可追溯——按组织流程需正式立项仓承接,且预研结论必须经 spec→红队→实现流程转正,不得直接作为交付物
  3. 组织语言政策(governance/policy/languages.yaml)应用层默认 Go、Python 仅限 agent-runtime 集成(ADR-0025)——参赛仓入口契约由赛方规定(agent.py + requirements.txt,四选一中 Python 为预研资产与图像/文字渲染生态的最优解),与组织政策冲突,需组织层面豁免声明后建仓
  4. 比赛页面是外部网页(可下线/改版),后续 spec 红队审查与验收需要唯一权威的需求真源——必须在本 IR 内冻结全量原文

当前痛点的证据

  1. 官方比赛页四标签页全文(抓取于 2026-08-24,见第一部分与源链接)——比赛契约唯一真源;页面可变性 = 需求漂移风险,证明冻结进 IR 的必要性
  2. 官方机评 Prompt 明示「product_basic 仅为商品名称示意,实际输入名称按本地商品文件名称进行调整」——官方坑点清单(§1.12)第 2/3/5/8 条对应的历史失败模式即证据:命名不规范、素材不完整、超时、依赖不完整均为高频失败原因
  3. 预研 Spike 实测问题清单:字体路径 str/Path 混用崩溃、中文目录名路径解析截断、类目误匹配(「连衣裙」→「女士短袖」)——未经治理的代码不可直接交付,证明需正式立项流程
  4. 沙箱约束(§1.6/§1.7)实测推导:无网络安装 + 禁知识库 + 禁本地文件上传——一切领域知识(AliExpress 规则/三国尺码/禁忌词)必须赛前固化进 ≤100MB ZIP;中间产物只能「模型→URL→模型」传递——这些硬约束直接决定架构形态,证明 spec 阶段红队审查必须以 §1 为锚
  5. 组织治理现状:REPOS.yaml 无 QW_Arena1 条目、无语言豁免 ADR——按 GM-4 线上未申报仓 = 漂移;不先补齐治理面,仓不可用(AG-4 App 挂载 / RL-1 production environment 均未配置)

期望的可观察变化(验收时能在线上看到的事实)

A. 治理面(本 IR 直接交付,登记即验收)

  1. QW_Arena1 仓线上存在且 public,从 template-service 派生(继承 gate/护栏/AGENTS.md 骨架)
  2. new-repo-init.sh 四步完成:仓库基线(squash-only/合并删分支/auto-merge 开/wiki+projects 关)+ production environment(required reviewer + 仅受保护分支)+ cloudbrid-agent 挂载 + 验证输出
  3. governance/REPOS.yaml 出现 QW_Arena1 条目(layer: L2 / visibility: public / status: active / role 注明参赛仓 + ADR-0084 语言豁免)
  4. ADR-0084 双落盘:agent-registry/decisions/ 墓碑 + INDEX.yaml 登记 + archive/adr/ 正本(三向 sha256 闭环 verify.yml 背书)——内容含 Python 选型理由、languages.yaml 豁免声明、豁免边界、退役条款
  5. 本 issue 第一部分比赛原始要求与官方页面逐节可对照(红队锚点成立)

B. 比赛交付面(后续 spec/实现/测试阶段验收,此处登记为期望,成为 spec AC 的种子)

  1. 比赛平台提交记录:机器评测返回有效分数(A1-A7 加权总分);双榜(国内站/海外站)提交;目标:至少一榜入 Top 30(专家评审入围线),冲刺 Top 5
  2. 单次运行产物完整且命名合规:11 个文件(3 文案 + 1 主图 + 5 详情图 + 1 视频 + 1 策略说明)全部通过 A2 物理规格(文本 <1MB / 主图 ≥800×800 / 图宽高 >260px 单张 ≤5MB / 视频 mp4/mov 可播放 <200MB)
  3. 提交包契约全过:ZIP ≤100MB、根目录 agent/--version 输出与 agent.json 一致且退出码 0、30 分钟内完成运行且退出码 0
  4. $AGENT_LOG_DIR/agent.log 全程留痕:模型调用、限流重试、降级链触发、时间预算消耗可审计

非目标(NONGOAL)

  • 不写 spec——本 IR 只登记意图与需求冻结;spec 及其红队审查 owner 明确另行安排
  • 不做 AliExpress 以外平台(Amazon/Temu/Shein 等)适配
  • 不追求组织级语言规范符合性(ADR-0084 豁免——外部契约优先);亦不修改 languages.yaml 本体(豁免是仓级例外登记,不是组织政策修订)
  • 不做生产级服务化:交付物是比赛平台的一次性 ZIP,无部署/运维面,不进组织基础设施
  • 不为政策符合而重写为 Go/TS——7 天窗口内换语言 = 放弃比赛
  • 不引入人类设计师/人工翻译介入:全 AI 生成链路是参赛主体形态(一人软件公司 + AI 编码)
  • 不做比赛结束后的长期演进承诺(退役条款见 ADR-0084)
  • 不在本阶段搬运 Spike 代码入仓(实现阶段按 spec 重构吸收,Spike 仅作参照与 golden fixtures 来源)

约束 / 不可违反项

铁律一:比赛契约(本 IR 第一部分全量——最高优先级,spec/实现与其冲突以比赛契约为准)

  • 墙钟 ≤30 分钟、内存 ≤4GB、超时即失败;退出码契约(0 成功)
  • 网络白名单仅千问模型服务 + 模型产物 URL;沙箱零网络安装 ⇒ 依赖全量 vendored 进 ZIP
  • 36 模型白名单外不可调用;MCP/工作流/记忆体/知识库/Embedding/Responses API/模型内置工具/本地文件上传全部不可用
  • 交付物命名严格校验、字段可解析;文件名动态发现不可硬编码
  • DASHSCOPE_API_KEY 仅环境变量读取;URL 拼接防重复;限流必须重试处理
  • 素材信息忠实源数据不虚构(A5);示例数据仅限本任务使用禁止商用

铁律二:组织治理

  • 全仓公开政策(ADR-0020):QW_Arena1 必须 public
  • 默认分支仅经 PR+squash 进入(BP-1);gate/org-gate/adversary 双轨 required check
  • 语言豁免走 ADR-0084 登记(flows.governance_change C1:PR + ADR + owner-merge);豁免范围=语言规范面,不豁免可见性/PR 流程/hygiene/CODEOWNERS/REPOS.yaml 申报义务
  • IR 账本 append-only:签署后只追加评论/erratum,不编辑正文
  • 新仓初始化用固定引用执行 new-repo-init.sh(供应链纪律:pin 审阅过的合并提交,不解析浮动 main)

铁律三:反摆拍(组织 risk_posture 与比赛 A5 同向)

  • 素材事实一致性不得为凑格式虚构源数据没有的信息;strategy_document 不得宣称未实现的能力
  • 本地影子评测近似机评口径时,结论不得宣称等同于官方机评(标注为近似估计)

人类愿意接受的验收证据

  • 治理面(本阶段):REPOS.yaml 条目 diff(PR 链接);ADR-0084 双落盘记录(agent-registry PR + archive PR + INDEX 登记);QW_Arena1 线上设置 API 记录(squash-only/auto-merge/production environment/App 挂载);本 issue 第一部分与官方页面逐节对照的抽查记录
  • 比赛面(后续阶段):比赛平台提交记录与机评分数;本地影子评测报告(A2 机械复刻 + 允许清单内 VLM/OCR 近似 A1/A4/A6);提交包 ZIP 清单与体积;--version 与 30 分钟限时运行日志(agent.log)
  • 红队可复核性:spec 阶段红队以本 IR 第一部分为锚点逐条对照 spec 条款——本 IR 第一部分的存在本身即红队审查的前置条件

可逆性偏好

  • 整仓可逆:比赛评审结束后 QW_Arena1 按 ADR-0084 退役条款转入 archived 状态或删除(REPOS.yaml 状态变更走 C1 PR)——不影响组织其他仓
  • 提交可逆:比赛平台保留历史最高成绩,单次提交失败不损历史最高分,迭代天然可逆
  • 治理登记可逆:REPOS.yaml 条目与 ADR-0084 可按 flows.governance_change 走新 ADR 撤销(append-only,撤销留痕)
  • 不可逆项声明:无——所有决策均有登记在案的撤销路径

质量-速度旋钮

  • 速度优先(7 天硬窗口 + ~21 次提交配额),但三条不可降级面:①确定性工程分 A1/A2/A3(合计 63%)的合规与规格达标;②事实一致性 A5(不虚构);③提交契约(命名/包结构/退出码/时限)——任何一条失守 = 提交无效或大幅失分,速度毫无意义
  • 可降级面:视觉美学边际分(A4/A6/A7)可在时间耗尽时走「源图 + 确定性渲染」保底链(Pillow 文字层合成、Ken-Burns 图生视频)而非多轮模型精修;strategy_document 深度按剩余时间伸缩
  • 资源旋钮:按量付费 API 额度充裕(补贴政策实付 ≥300 元返 300 元券,见 §1.13),不为省钱降质量;但单次运行模型调用次数受 30 分钟时限硬约束,时间预算管理器是必选项
  • 红队审查不因时间压力豁免——owner 已明确 spec 红队另行安排,本 IR 冻结比赛原文正是为其准备

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions