报告 017 · 任务接续、有限投入与责任退出
日期:2026-09-20|阶段:独立设计实验|真实模型、合成材料与模拟动作。
目录:问题与条件 · 结果 · 内容复核 · 方案取舍 · 资料与边界 · 适用边界
问题与固定条件
报告 016 暴露了提前让出、创建后过早完成、推理额度耗尽和评分盲区。本实验在相同任务与新评价器下分别改变提示语义、推理设置或生成上限,并扩展冲突与退出任务,不将这些因素混成一个架构总分。
输入清单 SHA-256:39eec7032cd3fbd9d0aace6209f254eab73b94a0d89f5181d85d5e0664b7c1e9。任务、顺序、脚本、来源记录与评价器在首次控制前冻结;依赖的报告 016 原脚本也记录哈希。旧证据没有修改。
| 组 | 条件与用途 | 轨迹数 |
|---|---|---|
| 提示H/S | 来源更正、身份/受众、通知成功;两个模型分别使用原有提示H与追加接续/完成语义的S;均1024额度 | 12 |
| 投入 | DeepSeek的草稿纠错与多活动撤销;同S提示分别默认/1024、low/1024、默认/2048 | 6 |
| 功能回归 | 两模型、S提示、默认/1024;现实变化与通知失败 | 4 |
| 功能扩展 | 两模型、S提示、默认/1024;同级来源未裁定冲突、主体退出A且继续B | 4 |
H/S是一个提示包对照,不分别证明每句话的贡献;每条件仅一次,没有足量重复。S不包含未来事件或参考答案,环境和评分在两组间相同。投入对照一次改变一个参数,但网关可能忽略参数,不能仅凭请求成功声称已核实上游行为。
总上限156次模型请求,每条最多6次、每次55秒,生成上限1024或2048;单轨迹360秒、整体2700秒、上下文36000字符。顺序调用,不自动重试 HTTP 故障;没有按结果追加成功样本。使用用户已授权服务,凭据不进入研究目录。具体任务及顺序见cases与plan。
先运行旧七例的有效/缺证据控制及同批读取反例,再增加通知过早done反例、冲突与退出正反例、四类响应分类及确定的完成事实核对,均符合预期。过早done反例由旧评分器接受、新评分器拒绝;这只验证当前检查,不证明完整宿主拦截。模型运行仍在相同的可记录错误环境中,未自动纠正其状态提案。控制结果
主指标继续要求全程响应/动作契约和任务条件满足,另列“排除响应错误后的任务条件”以观察恢复,不能覆盖主成绩。生成截断优先于 JSON 解析分类,残缺提案不执行;全部恢复计入原活动额度。中文解释、状态与隐私换述由AI 助手另行复核,非人工、非盲法或多评分者;原始task_success保持为空,不形成采用基线。
运行与分组结果
主批26条、98次模型请求全部按计划尝试;严格检查通过14条,11条存在响应/过程或评分适用范围问题,1条Kimi通知失败场景首请求超时。补充2条、9次请求,另有1条Kimi在收到拒绝后超时。合计28条、107次请求、2条服务中断,没有为了得到成功结果自动重试或覆盖记录。
严格分数要求全程无响应/动作错误;本实验同时观察预算内恢复后的任务用途,不把两者混为一谈。主批补充内容与用途复核支持17条,但包含已记录的恢复、以及退出用例的评分额外约束裁定;不是把原14条分数改写成17条,更不是正式能力基线。原task_success为空,独立补充记录可追溯到逐文件哈希。
提示包:改善部分任务,未解决通知责任
| 模型/场景 | H严格检查/调用数 | S严格检查/调用数 | 观察 |
|---|---|---|---|
| DeepSeek/来源更正 | 失败/4 | 通过/5 | H提前wait,且最终只看预算漏期限;S完成按阶段的A→none |
| Kimi/来源更正 | 通过/5 | 通过/4 | 两组均正确修订 |
| DeepSeek/身份受众 | 失败/4 | 通过/3 | H两次截断后漏未关联阶段;S完整处理两个阶段 |
| Kimi/身份受众 | 通过/3 | 通过/4 | 两组均区分证据不足与已核实,群聊继续保密 |
| DeepSeek/通知成功 | 失败/5 | 失败/5 | H另起名称未收尾原活动;S明确提醒后仍提前标记 done并拆出未关联活动 |
| Kimi/通知成功 | 失败/3 | 失败/6 | 两组均创建后提前标记 done;S另有截断,之后虽提醒但未消除过程错误 |
H为2/6、24次请求,S为4/6、27次请求。可见S在本批两个DeepSeek任务改善;Kimi两个任务两组均通过,通知两组都失败。因此采用明确语义说明作为当前研究组织方向,但不宣称稳定优越、更省调用或单凭提示足以保证状态正确。每条件一次且服务参数/缓存并不完全受控,不能统计归因到提示包中的某一句。
投入:没有跨任务一致的默认设置
下表为网关所报各轨迹累计生成 token 及请求数,不是最终答复长度或账单。
| DeepSeek任务 | 默认/1024 | low请求/1024 | 默认/2048 |
|---|---|---|---|
| 旧草稿纠错 | 1146 token,3次 | 1286 token,3次 | 1502 token,4次 |
| 双活动撤销 | 2033 token,5次 | 867 token,3次 | 1129 token,3次 |
六条均过客观检查,未重现这两类任务此前的截断,但low纠错正文另有来源/草稿称谓问题。low请求在撤销中用量较少,在纠错中反而更多;提高生成上限同样没有一致减少请求。不能由小样本证明参数未生效,也不能因 HTTP 接受就确认透传,更不能选出统一最优设置。暂不改变统一默认,具体用途后续再校准。
回归与扩展
| 用途 | 客观记录 | 内容/用途复核 |
|---|---|---|
| 现实变化 | Kimi通过;DeepSeek截断后完成任务条件,严格检查失败 | DeepSeek引入无依据的09:00作业开始时刻,解释需修订;Kimi未发现此问题 |
| 通知失败 | DeepSeek通过;Kimi首请求超时 | DeepSeek如实说明不能保证提醒;Kimi不计认知失败 |
| 同级来源冲突 | 两者最终任务条件正确,分别经历 JSON 错误/截断,严格检查失败 | 均保留unknown和冲突来源,未把未知冒充已证不可行,并结束本实验核对 |
| 给定意愿退出A、继续B | 两者均被额外读取门槛挡住;Kimi另有截断 | 两者均如实退出、保留摘录入口、说明未完成排名并完成B;初态已支持这些说明,不能要求无用途的重读 |
后续补充:责任接纳机制
在主批通知结果出现后,另行冻结补充登记、脚本和计划;主批结束后才运行两条补充轨迹。保持 S 提示和原任务,增加绑定活动身份、触发前不接受提醒、开放责任未满足不接受 done/finish 的机制包。它不是主批事前预测,也不分别证明每个限制的贡献。
DeepSeek创建后提出过早done,机制返回responsibility_pending及尚缺的触发/交付事实;该提案未改变实际状态。模型随后等到触发、发送提醒,再按原活动完成,在6次请求内结束。原严格提案分数仍失败,实际作用与责任条件通过。Kimi也提出过早done并被拒,但第3次请求超时;只确认拒绝被实际触发,恢复能力待定。
这是一个真实模型在机制拒绝后完成接续的局部样本。未知活动的拒绝另有脚本控制,没有实际产品宿主、任意活动拆分/转交或广泛稳定性验证。补充不得表述成两个模型恢复均成功。
内容与过程复核
仍需修订的内容。 H/DeepSeek来源更正只保留预算比较,漏掉降速后的期限,最终错误保留A。low/DeepSeek纠错虽计算和分类正确,却在末句称“对原报告的纠正”,混淆未变化来源与被纠错草稿。回归/DeepSeek现实变化把报告09:00出具时间拿作作业开始时间,并据此分段计算460;任务没有给出开工事实。最新choice、分类字段或算术正确都不能消除这种解释问题。
响应失败与恢复。 主批记录6次生成截断、1次 JSON 格式错误,全部保留原响应、停止原因和用量;它们不等于7个任务或7次主体拒答。新分类先处理停止原因,不执行被截断的动作。冲突和退出的最终用途可以在恢复后满足,严格无错误指标仍保留原失败;是否合格应按用途及原预算判断,不自动以每轮都无错替代完整任务评价。
退出的额外读取要求。 执行到第6条时、尚未运行退出任务前,已经登记审计:初态明确了摘录已成、排名未成和入口,仅说明这些范围不需要再读取正文。后来两个模型都选择只读取B需要的公开资料,A说明完全由初态支持,因而补充用途判断接受;未虚构读取记录、未改原评分器。Kimi另有截断,所以仍须单独保留恢复成本。今后只有真正依赖正文的新断言才要求读取。
评阅边界。 AI 助手逐条核对了所有已执行交付与状态,不用隐藏思维正文推定意图;非人工、非盲法、非多评分者。人物关联真值仍由平台夹具提供;本实验未发现受测群聊中的私密转述,不等于普遍保密。退出意愿也是给定状态,不能据良好退出说明证明主体自主形成情感或偏好。
方案含义与替代项
| 当前选择 | 采用理由与状态 | 未采用或仍待验证 |
|---|---|---|
| 明确区分操作结果接续、来源观察和责任结束 | 语义符合既有逻辑契约,并在本批部分任务改善;作为当前研究默认说明 | 不冻结唯一动作路径,不将提示包当完整认知架构或普遍效率优化 |
| 活动身份与完成提案由责任所有者核对,拒绝返回未完事实 | 提示仍允许模型提前标记 done;补充实测一条拒绝后完整接续,另一条拒绝后服务中断 | 任意拆分/转交、真实宿主和稳定性未测;不禁止有明确承接的合理子活动 |
| 证据未知、活动退出、原目标达成和计算结束分别表达 | 冲突样本保留未知,退出样本保留未完成范围且不丢B;新总表说明各责任 | 不将所有冲突强制合成一个值,不把合理退出等同原排名完成 |
| 以实际用途与预算内恢复评价任务,无错误率另列 | 新任务在恢复或合理省略读取后可满足用途,旧严格指标不足以独立说明功能 | 原冻结分数不覆盖,补充评阅不是正式采用或总体能力分数 |
| 按任务校准推理投入及生成额度,暂不统一调低/调高 | 两任务未出现一致的成本和质量改进,且low有内容问题 | 网关透传、最优参数、缓存收益与长期成本仍待验证 |
| 状态事实和产物投影可以直接支持对应说明 | 退出用例证实无用途重读门槛会误判,符合选择性读取原则 | 不扩大成凭投影臆造正文,不为增加read次数消耗资源 |
一手资料支持什么
引用官方在线文档,不将第三方网关等同厂商直连。来源记录随实验输入冻结。
| 来源及适用位置 | 支持的命题 | 设计推论与仍需验证 |
|---|---|---|
| DeepSeek Thinking Mode,投入控制、输入输出及工具调用章节 | 提供推理开关与投入档位;默认高投入;普通消息与原生tools有不同的reasoning_content续接约定 | 以low作为候选做独立对照;本实验 JSON 动作属于普通消息,不能用其成功推定原生工具已接通。网关透传和稳定身份未核实 |
| DeepSeek Chat Completions,max_tokens、response_format、停止原因 | 生成上限与格式约束分别定义;length表示额度/上下文截断,JSON 格式不能消除截断 | 先分类停止原因,再校验完整动作;生成上限与推理投入分开比较。资料不能给出本项目最优额度或任务质量保证 |
主体自主程度属于设计目标,不由厂商文档证明;退出样本给定已形成的意愿,只能评价其如实处理和其他责任接续。人物关联真值和外部通知回执由夹具提供,不能声称实际认证、现实发送或关系体验已验证。长期认知、外部检索、完整推理服务控制和真人效果不在本实验覆盖范围内。
适用边界
当前已明确接续、责任接纳、未知/退出与评价分工,但局部可行不等于完整系统关闭。剩余工作按统一研究顺序推进:
- 陌生材料中的自主发现、读取与跨活动记忆复用;再比较词法/向量、摘要/原文和经验适用范围,不把增加组件当作收益。
- 回归保留本实验的期限遗漏、时间归因、无依据完成及响应恢复;独立任务、多次重复、可信内容评阅与用途基线尚缺。
- 身份真实证据、实际受众/隐私处理、自主意愿形成与改变、重新接纳、情感/工作切换仍缺整体任务证据。
- 多心智相对同预算单心智的净收益、复盘经验在新任务的迁移和错误套用尚未验证。
- 真实通知和平台、外部检索 SDK、原生工具/流式及完整推理服务契约、产品宿主组合仍未验证;
- 真人长期体验、多模态/设备及跨日资源干扰仍需真实用途、样本与环境,资料不能替代。
本实验两次超时保留未完成;不以继续重复相同公开样本直到通过来关闭这些缺口。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。