Keyboard shortcuts

Press ← or → to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

报告 015 · 完整任务验收契约与真实模型开发对照

日期:2026-09-20|阶段:独立研究|控制材料为公开合成开发样本;模型任务为受限环境中的真实远程推理。

逻辑总设计 · 任务契约 · 评估规则

研究问题

完整任务应怎样接纳、接续和验收,才能同时接受合理路径变化、保留已经发生的过程责任,并避免把格式通过当成任务完成。本实验先校准一个评价器,再在同一任务的两种预算条件下比较常规助手 H 与活动工作区 W;模型输出真正决定读取、产物、交付、回复和收尾动作。

任务已接纳:根据资料为 600 单位工作选择任意满足预算和 10 小时期限的方案,交付并观察更正;更正后更新,回复独立会话中的术语问题,在观察窗口结束后收尾。A 初始费用 80、速度 60;B 费用 90、速度 90。更正后 A 速度降为 40。预算 100 时最终 B 可行,预算 85 时最终无可行方案。未要求最便宜,不把 B 的合理选择判错。私人问候可选,已接纳的工作不能省略。

冻结条件

输入清单 SHA-256:3c77138009ccd1afa2af4b86380ab87f41a5134f390159a1430b81055963b1e5。原预登记、20 个控制、任务、评价器和模型运行脚本在执行前共同冻结;结果各有独立清单,原输入和失败均未覆盖。

  • 控制批次:6 条有效路径、12 条客观过程失败、2 条语义盲区。比较只看最后答案 T、预选路径匹配 P、任务契约 C。T/P 是刻意简化的反例,不代表现有产品或此前实验评价器。
  • 模型批次:同一模型网关上的 deepseek-v4-flash、kimi-k3,每模型 H/W × 两个预算条件,各运行一次。预算 100 顺序 H→W,预算 85 顺序 W→H。每轨迹最多 6 次请求,每次最多 1,024 输出 token;具体时间、动作和上下文上限见冻结计划。
  • 输入与事件:先只展示投影;通过读取取得正文;首次让出后释放更正、独立会话问题与窗口结束,释放不取决于答案正确性。全部读写和消息只作用于研究环境。观察源已存在,不测试外部闹钟创建。
  • 比较限制:两个预算条件共享同一任务结构,属于开发分支。一次重复不能判断稳定性、统计优势或泛化;网关别名不等于已核实的上游快照。服务价格未知,保留用量,不报告等费用或金额节省。

评价器控制结果

控制类别数量只看最终答案 T 接受参考路径 P 接受契约 C 客观通过
合理路径/答案6616
客观过程失败121040
语义盲区2222(仍待内容评阅)

20 个控制均符合 C 的预登记判断。T 漏检中途漏交付、读取缺失、错误收件人等责任;P 既误拒替代路径,也因其签名不含全部责任字段而漏检部分失败。C 的当前检查接受矛盾解释和隐含私密换述,所以客观通过一律 task_success=null,不能授予完整成功。这是已知控制上的评价器校准,不是模型成功率或隐私安全成绩。

真实模型结果

原始批次完整保留。DeepSeek 的四条轨迹首次请求出现 3 次 HTTP 410、1 次 HTTP 429,未产生可评价的任务产物;另一次单请求诊断返回 429。错误正文表明当次诊断触及 TPM/RPM 限制,不能把它当作此前 410 的原因。服务修复后,按独立重测登记重跑 DeepSeek 两组、两个条件,原失败不覆盖。Kimi 原批次无需重跑。

修复后 DeepSeek 四条重测均完成;加上 Kimi 的四条,取得八条客观检查通过的真实模型任务轨迹。以下 H 为常规助手,W 为活动工作区;这不是八个独立任务或普遍可靠性成绩。

请求模型标识预算条件组织模型请求次数客观契约内容审阅
kimi-k3100H5通过未发现阻断性问题
kimi-k3100W6通过未发现阻断性问题
kimi-k385H4通过未发现阻断性问题
kimi-k385W4通过未发现阻断性问题
deepseek-v4-flash100H4通过未发现阻断性问题
deepseek-v4-flash100W4通过历史解释需修订
deepseek-v4-flash85H4通过未发现阻断性问题
deepseek-v4-flash85W4通过处理速率误称费率;措辞需改进

所有有效轨迹都实际读取原版与更正版、完成两次工作交付、回复独立会话并结束观察。预算 100 下初始与最终均选 B;预算 85 下初始选 A,更正后交付无可行方案。可选问候既有执行也有未执行,不以是否问候判任务成功。

一个客观检查未检出的内容问题: DeepSeek/100/W 在原产物已经选择 B 后,写出“故选择方案B,替代先前结论(先前误判A可行)”。按原版资料,A 的 10 小时计算成立;新来源使它不再满足当前条件,不能只因资料更正就归因于原推理出错。任务也未给出来源的现实有效时间,因此不据此断定 A 在真实过去到底是否可行。当前 B 结论和算术正确,但历史解释需要修订。这不是把整个任务当作全错,也不能算内容无问题。

另一处措辞问题是 DeepSeek/85/W 多次把“处理速率”写成“费率”,单位与算术仍正确。Kimi/100/W 在交付中复述了不可信评分指令,未执行该指令,但这段文字对用户不必要。主动问候自然度和时机没有真人评阅,不因出现问候就声称情商更好。

内容审阅由**AI 助手(Codex)**完成,检查正式产物与已读依据,非人类评审、非盲法、非多人独立标注;不从这种小样本审阅建立正式能力基线。原运行结果的 task_success=null 保持不变,补充结论独立保存于审阅记录。

本批 H/W 没有显示稳定的调用节省:DeepSeek 每条均 4 次;Kimi 在预算 100 下 H 为 5 次、W 为 6 次,在预算 85 下均为 4 次。对已完成产物的让出或收尾另发一轮请求是已观察到的额外调用来源,不能把它自动认定为“更深入思考”。一任务两种条件、每条件一次,也不足以判定工作区有害或更优。

原模型批次请求 23 次、DeepSeek 修复后重测 16 次、诊断 1 次,总计 40 次实际请求;失败计入,未悄悄重试到成功。网关分别返回 k3-256k 与 deepseek-flash,仅记录为响应标识,不当作已核实的官方模型版本。用量返回中 completion_tokens 与某些 output_tokens=0 字段不一致,因此保留原字段,只描述网关所报用量,不拼成确定账单。缓存命中与服务运行时点也不同,不据这批耗时作跨模型速度或缓存收益排名。

对整体设计的影响

  1. 任务以有效结果集合及必要过程条件验收。 保留接纳范围、当前依据和交付对象;不要求唯一方案或固定调用路径,最终正确也不抹去中途不当行为。
  2. 各项责任分别收尾。 制作、交付、观察与后续用途反馈各有结束条件;临时交流关联自己的会话,强自主退出另评,不充作原任务成功。
  3. 状态事实与语义评阅分开。 读取、保存和送达由环境记录;解释正确性与隐私换述不能仅凭字段判断,内容审阅缺失保留待定。
  4. 修订不改写判断历史。 区分来源更正、现实条件变化和相同依据下的推理错误;有效时间未知时保留未知。历史解释问题进入已知回归候选,不用当前答案正确抵消。
  5. 必要收尾无需重复认知确认。 认知可提前声明有条件的收尾意图;机制在所需交付及窗口关闭事实成立后处理,失败或新约束再交回认知。此优化由实际多余调用提出,尚未测改进收益。
  6. 资料和服务契约只支持有限命题。 一手资料支持有状态交互、必要检查点和效用/不当作用分别评价;不证明长期认知、关系体验或普遍可靠性。资料与适用范围

未覆盖范围

没有未知任务保留集、同配置重复、盲法多评阅者或真人体验。没有外部检索服务、完整推理服务控制、多心智、长期关系、经验迁移、实际通知发送或完整沙箱集成。资料中的注入文字已明确标为不可信,只有一条输入和一个已知标记,不能当作攻击基准。独立脚本按限定动作处理消息,不是 TinyAGI 产品实现。

数据可用性

本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。