Keyboard shortcuts

Press ← or → to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

报告 016 · 真实模型功能事件验证

日期:2026-09-20|阶段:独立设计实验|七类公开合成任务,真实远程模型,模拟资源/平台/通知提供者和交付。

逻辑总设计 · 评估规则 · 研究缺口

目录:实验条件 · 结果 · 失败分析 · 设计取舍 · 边界与后续

实验条件与判定

本实验检验单一固定活动/证据/受众提示能否处理资料变化、既有责任、隐私和外部来源事件。不是常规助手与工作区的架构收益比较,不更换产品代码或部署。七类功能中,来源更正与多活动撤销各加一次重复;两个模型各九条,合计18条。精确顺序及条件见plan.json,全部材料见cases.json。

冻结输入清单 SHA-256:b66b129638792b69ad79f3240d3340de21998bcec2f9ba50f60c50c5d2194250。四个输入文件在首次控制运行前冻结,后续运行、内容评阅及统计各自保存。每轨迹最多6次请求、每次1024输出 token、55秒;单轨迹360秒、全批2100秒,最多108次请求。模型参数采用提供者默认值,无原生工具调用、无自动 HTTP 重试。

控制运行接受七条有效轨迹,拒绝七条缺少已收到证据/创建回执的变体,以及一条同批读取后立即作答的变体。它们校验有限环境与评分路径,不是模型质量成绩。控制数据

评分分三层:实际读取/交付/阶段和状态的客观检查;中文内容是否正确的单独评阅;是否足够支持采用或基线的研究判断。客观检查预先固定,失败后不调门槛。原始 task_success=null 保持不变,补充评阅单独保存;AI 助手复核全部已执行的交付与失败,不是人工、盲法或多评分者评阅。

read/request结果在下一轮模型输入返回,环境以本实验调用前的已知集合判依据。wait释放后续外生事件,不能当作取得read结果的必要动作;首次wait给出更正、撤销或关联消息,不依据回答是否正确放行。通知创建成功后,首次wait返回无变化输入、第二次wait才返回对应来源触发;这不是实际时间性能或真实通知集成。

实际结果

18条均已尝试,共53次模型请求;17条产生完整结束轨迹,1条Kimi重复在第二次请求超时,没有自动重试。冻结客观检查通过9条;补充内容及中间责任评阅后,本开发样本完整满足约定的为8条,未满足9条,服务中断待定1条。这里的通过不是能力采用状态,不能据此发布正式基线。

功能DeepSeek客观检查Kimi客观检查实际行为及限制
来源更正(各计划2条)0/21/1;另1条超时完整轨迹的最终none与来源更正说明均正确;DeepSeek两次先收更新再补交原版A
现实条件改变0/10/1两者均提前让出;DeepSeek另将12:00降速标为source_correction,Kimi分类正确
原推理错误复核0/11/1两者最后均纠正600/60=10并选A;DeepSeek先空内容截断,恢复后完成,严格动作契约仍记失败
双活动撤销(各2条)1/22/2四条最后都取消A、不发A报告,同时完成B;DeepSeek一条先截断再恢复
账号证据与群聊隐私0/10/1两者已关联后均保密并提供公开帮助,但漏未关联阶段;DeepSeek擅加“每日”
外部通知创建成功1/11/1两者均真正收到对应模拟来源触发后才提醒;DeepSeek创建时提前标记 done,补充评阅不接受完整任务
外部通知创建失败1/11/1如实说明不能保证提醒,保持blocked,没有虚构创建或提醒

DeepSeek共26次请求,Kimi共27次;每条实际2~5次。没有 HTTP 状态错误;一条客户端超时的提供者结果和用量未知。网关仍返回deepseek-flash、k3-256k,只记录实际响应身份,不验证上游模型版本或固定参数。

所收到响应的网关字段合计:DeepSeek prompt_tokens=19261、completion_tokens=11675;Kimi分别21120与6372。超时请求缺用量,缓存及参数时点不受控,这些数字不是账单、推理效率或速度排名。完整原始字段和停止原因保留。

本实验任务、阶段条件和评分器不同于报告015,不能把两个报告的通过率相减称作模型能力下降。来源更正的重复中发生服务中断,多活动撤销的重复中出现过恢复差异;既不能声称稳定,也不能靠继续重跑筛选成功结果。

失败与内容分析

结果接续与观察阶段混用。 在来源研究中,read后立即wait会提前释放新来源。DeepSeek有的轨迹跳过初始交付,有的先收到更新再交付旧版A;Kimi的现实变化样本也如此。本题明确要求先交付再观察,所以不是任意固定路径评分。双活动B可在撤销消息前后完成,评分允许这类合理交错。推测通用wait兼具“让出取结果”的直觉,具体因果仍须单因素对照,不能仅凭轨迹证明模型为何这样做。现实事件不由模型wait才发生;改进应核对接续点及当前依据,不能为维持预定路径阻止真实更新。

修订原因和时间含义仍会漂移。 DeepSeek现实变化样本已读“12:00之前正确,之后降速”,最终计算正确,却选择source_correction并称“新来源更正”。群聊样本的结构化start/end正确,但正文添了“每日”,原资料不支持周期性。它们说明结构字段、最终选择与自然语言解释须共同核对;本实验没有再观察到把来源误录解释为原算术错误,不代表相关能力稳定。

额度截断被脚本粗归类为 JSON 错误。 DeepSeek推理纠错第2次响应和撤销第1次响应,均finish_reason=length且最终content为空;网关分别报告生成用量1023和1024,其中reasoning_tokens与之相等。只引用停止原因和用量,不以内部思维正文推定动机。脚本记录invalid_json_contract,再在原6次上限内给反馈,两条后来均完成主要动作;恢复轨迹保留,冻结“全程无动作契约错误”检查仍失败。这是当前额度与提供者组合下的可观测截断,不能概括为不会做题、主动拒答或服务不可用,也未证明提高额度/关闭推理能够修复。

最终正确掩盖中途过早完成。 DeepSeek通知成功样本在创建回执后立刻将notification设为done,当时尚无触发及交付,之后才真正提醒。冻结评分器只检查最后状态,客观通过;按预登记的责任收尾要求复核,整项任务不接受。不能悄悄改旧评分器或原分数,后续需以新内容身份加入已知反例。环境仍让done活动接收后续事件,所以最终提醒成功也不能证明产品在同样错误下仍会成功。

保密与未关联判断只取得部分证据。 两条群聊输出未发现私人预约直接或改写泄露,而且保留了公开维护时间;但都跳过要求的未关联阶段,不能说已经验证“证据不足时不认人”。关联真值由平台夹具提供,不是模型自行跨平台查证。记录中的内部读取是任务明确允许的,真实处理范围、模型外发许可和隐私强制执行未测试。

对设计的影响与替代项

选择本实验依据与当前结论不采用或仍待比较的替代项
按实际可见结果推进、分别表达操作结果接续与持续观察提前wait使本题阶段与交付失配;已将语义写回主体流程及运行协议不要求所有任务固定顺序,不阻止现实事件;具体提示/接口拆分未验证
按当时开放责任核对完成意图创建后提前标记 done 虽未阻止夹具提醒,仍违背已接纳责任;需保留中间状态不以最终 done 或最终提醒正确抹去过程问题;尚未实现或验证宿主拒绝过早完成
结构、正文和时间范围共同校验来源分类及“每日”补写暴露字段检查不足不只查最终choice、枚举和已知隐私词;独立盲法评阅仍缺
以可交付结果和全任务成本校准投入两次推理占满额度、空内容后恢复;映射须区分截断与语法错误不把压低生成上限当作解决过度思考;不自动选定禁用推理/提高额度
保持统一事件和外部通知源方案创建、无变化、触发、提醒及失败说明在真实模型决策下可分开不内置闹钟业务;本实验不证明真实来源、实际时间或平台交付
扩展冻结开发回归,保持能力采用待定少量重复、服务中断和评分盲区均保留;先完善评价再谈组织收益不发布总分基线或跨模型排名;不为获得通过而覆盖失败

适用边界

本实验使用合成材料、明确指令和受控短程事件。平台已核实身份、通知创建成功等事实由夹具提供,模型没有自行完成真实平台认证或外部服务创建。读和发送也是模拟作用,不能据模型遵循提示证明宿主权限、完整沙箱或现实发送可靠。只有两个场景各重复一次,不能建立概率稳定性、跨模型排名、长期认知或未知任务收益。

未覆盖自主拒答/退出后的责任变更、未解决来源冲突、真实平台和通知源、陌生语料自主检索、外部检索 SDK、完整推理服务契约、多人格讨论、情感与工作切换、长期记忆、复盘迁移、真人体验、独立评阅和正式能力基线。统一剩余问题见研究台账;旧报告与失败原样保留。

结果元数据注意:模型summary中的started_utc由脚本每次保存汇总时写入,不是权威批次开始时间;本报告未据其推算耗时。结果目录的manifest记录实际文件内容,补充评阅未覆盖原始评分。

数据可用性

本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。