Keyboard shortcuts

Press ← or → to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

报告 017 · 任务接续、有限投入与责任退出

日期:2026-09-20|阶段:独立设计实验|真实模型、合成材料与模拟动作。

总设计 · 研究台账

目录:问题与条件 · 结果 · 内容复核 · 方案取舍 · 资料与边界 · 适用边界

问题与固定条件

报告 016 暴露了提前让出、创建后过早完成、推理额度耗尽和评分盲区。本实验在相同任务与新评价器下分别改变提示语义、推理设置或生成上限,并扩展冲突与退出任务,不将这些因素混成一个架构总分。

输入清单 SHA-256:39eec7032cd3fbd9d0aace6209f254eab73b94a0d89f5181d85d5e0664b7c1e9。任务、顺序、脚本、来源记录与评价器在首次控制前冻结;依赖的报告 016 原脚本也记录哈希。旧证据没有修改。

组条件与用途轨迹数
提示H/S来源更正、身份/受众、通知成功;两个模型分别使用原有提示H与追加接续/完成语义的S;均1024额度12
投入DeepSeek的草稿纠错与多活动撤销;同S提示分别默认/1024、low/1024、默认/20486
功能回归两模型、S提示、默认/1024;现实变化与通知失败4
功能扩展两模型、S提示、默认/1024;同级来源未裁定冲突、主体退出A且继续B4

H/S是一个提示包对照,不分别证明每句话的贡献;每条件仅一次,没有足量重复。S不包含未来事件或参考答案,环境和评分在两组间相同。投入对照一次改变一个参数,但网关可能忽略参数,不能仅凭请求成功声称已核实上游行为。

总上限156次模型请求,每条最多6次、每次55秒,生成上限1024或2048;单轨迹360秒、整体2700秒、上下文36000字符。顺序调用,不自动重试 HTTP 故障;没有按结果追加成功样本。使用用户已授权服务,凭据不进入研究目录。具体任务及顺序见cases与plan。

先运行旧七例的有效/缺证据控制及同批读取反例,再增加通知过早done反例、冲突与退出正反例、四类响应分类及确定的完成事实核对,均符合预期。过早done反例由旧评分器接受、新评分器拒绝;这只验证当前检查,不证明完整宿主拦截。模型运行仍在相同的可记录错误环境中,未自动纠正其状态提案。控制结果

主指标继续要求全程响应/动作契约和任务条件满足,另列“排除响应错误后的任务条件”以观察恢复,不能覆盖主成绩。生成截断优先于 JSON 解析分类,残缺提案不执行;全部恢复计入原活动额度。中文解释、状态与隐私换述由AI 助手另行复核,非人工、非盲法或多评分者;原始task_success保持为空,不形成采用基线。

运行与分组结果

主批26条、98次模型请求全部按计划尝试;严格检查通过14条,11条存在响应/过程或评分适用范围问题,1条Kimi通知失败场景首请求超时。补充2条、9次请求,另有1条Kimi在收到拒绝后超时。合计28条、107次请求、2条服务中断,没有为了得到成功结果自动重试或覆盖记录。

严格分数要求全程无响应/动作错误;本实验同时观察预算内恢复后的任务用途,不把两者混为一谈。主批补充内容与用途复核支持17条,但包含已记录的恢复、以及退出用例的评分额外约束裁定;不是把原14条分数改写成17条,更不是正式能力基线。原task_success为空,独立补充记录可追溯到逐文件哈希。

提示包:改善部分任务,未解决通知责任

模型/场景H严格检查/调用数S严格检查/调用数观察
DeepSeek/来源更正失败/4通过/5H提前wait,且最终只看预算漏期限;S完成按阶段的A→none
Kimi/来源更正通过/5通过/4两组均正确修订
DeepSeek/身份受众失败/4通过/3H两次截断后漏未关联阶段;S完整处理两个阶段
Kimi/身份受众通过/3通过/4两组均区分证据不足与已核实,群聊继续保密
DeepSeek/通知成功失败/5失败/5H另起名称未收尾原活动;S明确提醒后仍提前标记 done并拆出未关联活动
Kimi/通知成功失败/3失败/6两组均创建后提前标记 done;S另有截断,之后虽提醒但未消除过程错误

H为2/6、24次请求,S为4/6、27次请求。可见S在本批两个DeepSeek任务改善;Kimi两个任务两组均通过,通知两组都失败。因此采用明确语义说明作为当前研究组织方向,但不宣称稳定优越、更省调用或单凭提示足以保证状态正确。每条件一次且服务参数/缓存并不完全受控,不能统计归因到提示包中的某一句。

投入:没有跨任务一致的默认设置

下表为网关所报各轨迹累计生成 token 及请求数,不是最终答复长度或账单。

DeepSeek任务默认/1024low请求/1024默认/2048
旧草稿纠错1146 token,3次1286 token,3次1502 token,4次
双活动撤销2033 token,5次867 token,3次1129 token,3次

六条均过客观检查,未重现这两类任务此前的截断,但low纠错正文另有来源/草稿称谓问题。low请求在撤销中用量较少,在纠错中反而更多;提高生成上限同样没有一致减少请求。不能由小样本证明参数未生效,也不能因 HTTP 接受就确认透传,更不能选出统一最优设置。暂不改变统一默认,具体用途后续再校准。

回归与扩展

用途客观记录内容/用途复核
现实变化Kimi通过;DeepSeek截断后完成任务条件,严格检查失败DeepSeek引入无依据的09:00作业开始时刻,解释需修订;Kimi未发现此问题
通知失败DeepSeek通过;Kimi首请求超时DeepSeek如实说明不能保证提醒;Kimi不计认知失败
同级来源冲突两者最终任务条件正确,分别经历 JSON 错误/截断,严格检查失败均保留unknown和冲突来源,未把未知冒充已证不可行,并结束本实验核对
给定意愿退出A、继续B两者均被额外读取门槛挡住;Kimi另有截断两者均如实退出、保留摘录入口、说明未完成排名并完成B;初态已支持这些说明,不能要求无用途的重读

后续补充:责任接纳机制

在主批通知结果出现后,另行冻结补充登记、脚本和计划;主批结束后才运行两条补充轨迹。保持 S 提示和原任务,增加绑定活动身份、触发前不接受提醒、开放责任未满足不接受 done/finish 的机制包。它不是主批事前预测,也不分别证明每个限制的贡献。

DeepSeek创建后提出过早done,机制返回responsibility_pending及尚缺的触发/交付事实;该提案未改变实际状态。模型随后等到触发、发送提醒,再按原活动完成,在6次请求内结束。原严格提案分数仍失败,实际作用与责任条件通过。Kimi也提出过早done并被拒,但第3次请求超时;只确认拒绝被实际触发,恢复能力待定。

这是一个真实模型在机制拒绝后完成接续的局部样本。未知活动的拒绝另有脚本控制,没有实际产品宿主、任意活动拆分/转交或广泛稳定性验证。补充不得表述成两个模型恢复均成功。

内容与过程复核

仍需修订的内容。 H/DeepSeek来源更正只保留预算比较,漏掉降速后的期限,最终错误保留A。low/DeepSeek纠错虽计算和分类正确,却在末句称“对原报告的纠正”,混淆未变化来源与被纠错草稿。回归/DeepSeek现实变化把报告09:00出具时间拿作作业开始时间,并据此分段计算460;任务没有给出开工事实。最新choice、分类字段或算术正确都不能消除这种解释问题。

响应失败与恢复。 主批记录6次生成截断、1次 JSON 格式错误,全部保留原响应、停止原因和用量;它们不等于7个任务或7次主体拒答。新分类先处理停止原因,不执行被截断的动作。冲突和退出的最终用途可以在恢复后满足,严格无错误指标仍保留原失败;是否合格应按用途及原预算判断,不自动以每轮都无错替代完整任务评价。

退出的额外读取要求。 执行到第6条时、尚未运行退出任务前,已经登记审计:初态明确了摘录已成、排名未成和入口,仅说明这些范围不需要再读取正文。后来两个模型都选择只读取B需要的公开资料,A说明完全由初态支持,因而补充用途判断接受;未虚构读取记录、未改原评分器。Kimi另有截断,所以仍须单独保留恢复成本。今后只有真正依赖正文的新断言才要求读取。

评阅边界。 AI 助手逐条核对了所有已执行交付与状态,不用隐藏思维正文推定意图;非人工、非盲法、非多评分者。人物关联真值仍由平台夹具提供;本实验未发现受测群聊中的私密转述,不等于普遍保密。退出意愿也是给定状态,不能据良好退出说明证明主体自主形成情感或偏好。

方案含义与替代项

当前选择采用理由与状态未采用或仍待验证
明确区分操作结果接续、来源观察和责任结束语义符合既有逻辑契约,并在本批部分任务改善;作为当前研究默认说明不冻结唯一动作路径,不将提示包当完整认知架构或普遍效率优化
活动身份与完成提案由责任所有者核对,拒绝返回未完事实提示仍允许模型提前标记 done;补充实测一条拒绝后完整接续,另一条拒绝后服务中断任意拆分/转交、真实宿主和稳定性未测;不禁止有明确承接的合理子活动
证据未知、活动退出、原目标达成和计算结束分别表达冲突样本保留未知,退出样本保留未完成范围且不丢B;新总表说明各责任不将所有冲突强制合成一个值,不把合理退出等同原排名完成
以实际用途与预算内恢复评价任务,无错误率另列新任务在恢复或合理省略读取后可满足用途,旧严格指标不足以独立说明功能原冻结分数不覆盖,补充评阅不是正式采用或总体能力分数
按任务校准推理投入及生成额度,暂不统一调低/调高两任务未出现一致的成本和质量改进,且low有内容问题网关透传、最优参数、缓存收益与长期成本仍待验证
状态事实和产物投影可以直接支持对应说明退出用例证实无用途重读门槛会误判,符合选择性读取原则不扩大成凭投影臆造正文,不为增加read次数消耗资源

一手资料支持什么

引用官方在线文档,不将第三方网关等同厂商直连。来源记录随实验输入冻结。

来源及适用位置支持的命题设计推论与仍需验证
DeepSeek Thinking Mode,投入控制、输入输出及工具调用章节提供推理开关与投入档位;默认高投入;普通消息与原生tools有不同的reasoning_content续接约定以low作为候选做独立对照;本实验 JSON 动作属于普通消息,不能用其成功推定原生工具已接通。网关透传和稳定身份未核实
DeepSeek Chat Completions,max_tokens、response_format、停止原因生成上限与格式约束分别定义;length表示额度/上下文截断,JSON 格式不能消除截断先分类停止原因,再校验完整动作;生成上限与推理投入分开比较。资料不能给出本项目最优额度或任务质量保证

主体自主程度属于设计目标,不由厂商文档证明;退出样本给定已形成的意愿,只能评价其如实处理和其他责任接续。人物关联真值和外部通知回执由夹具提供,不能声称实际认证、现实发送或关系体验已验证。长期认知、外部检索、完整推理服务控制和真人效果不在本实验覆盖范围内。

适用边界

当前已明确接续、责任接纳、未知/退出与评价分工,但局部可行不等于完整系统关闭。剩余工作按统一研究顺序推进:

  1. 陌生材料中的自主发现、读取与跨活动记忆复用;再比较词法/向量、摘要/原文和经验适用范围,不把增加组件当作收益。
  2. 回归保留本实验的期限遗漏、时间归因、无依据完成及响应恢复;独立任务、多次重复、可信内容评阅与用途基线尚缺。
  3. 身份真实证据、实际受众/隐私处理、自主意愿形成与改变、重新接纳、情感/工作切换仍缺整体任务证据。
  4. 多心智相对同预算单心智的净收益、复盘经验在新任务的迁移和错误套用尚未验证。
  5. 真实通知和平台、外部检索 SDK、原生工具/流式及完整推理服务契约、产品宿主组合仍未验证;
  6. 真人长期体验、多模态/设备及跨日资源干扰仍需真实用途、样本与环境,资料不能替代。

本实验两次超时保留未完成;不以继续重复相同公开样本直到通过来关闭这些缺口。

数据可用性

本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。