TinyAGI
研究一个长期存在、能够自行组织认知与行动并持续演化的统一主体:感知环境,形成和调整关注,组织心智与异构能力,行动并积累经历。对话、受托任务和主动学习都是它可以开展的活动。
当前处于设计阶段,尚未发布产品。 文档描述目标架构与设计依据;已实现的库能力、已有实验结果和待实现机制分别标明。
设计围绕五项能力展开:
- 持续认知与自主活动:认知可以直接归属于主体或心智,环境变化和自身关注都可成为起点;按需要形成活动和任务。运行主线连接感知、行动和经历,长工作与主体生命周期分开。
- 按需获取内容与能力:资料、记忆、程序、模型和运行对象分别管理,按接收者提供受限视图;外部检索提供者可按用途发现、选择、组合和评价,向量服务与 Attemory 同级接入。明确选读才将内容交给认知,执行、维护与交付使用各自契约。
- 形成并维护个体:通过完整提示词初始化与迁移说明创建、更新人物,允许个体差异;客户端预制能力库供主体按需选用。
- 扩展能力与学习:复用、组合或构建工具,在沙箱中评估后按适用范围采用。专门的主动学习属于实验性扩展,投入有上限且可关闭;正常感知、联想、自主日常活动和经历积累仍然保留。
- 管理与人工控制:Web 工作台覆盖主体状态、模型服务、试验主体和行为配置;机密独立管理,默认使用引用,受信适配器及 RPC 实现可按用途取得原值,防止向不可信 API 或其他非预期对象泄漏。
计算节约贯穿输入和能力执行:利用提供者前缀复用、有效结果、增量准备及有界运行复用,保持所需信息、独立判断和响应要求;实际质量、时延和净费用分别评价。
工程方案采用单机核心,业务状态保存在 SQLite,文档、媒体和大型产物保存在本地文件中;通过 go-mini MRPC 接入 Go、Rust 和 Node.js(npm)能力。具体部署及依赖见工程参考,逻辑总图只描述职责与交互。
按以下顺序阅读:
- 总体设计:目标 → 逻辑架构 → 核心概念 → 完整流程 → 机制与取舍。
- 文档索引:六份专题的职责、阅读路线和术语入口。
- 工程参考:部署、技术栈、存储、依赖及选择理由。
- 设计决策与适用边界:已确认要求、已定方案、建议及用途配置。
- 实施方案与阶段验收:交付顺序、首批范围、关键契约及验收条件。
查证选择依据时使用实验与资料索引;核对跨专题约束时使用一致性决策。历史实验保留原条件、结果和失败,不作为当前待办。设计按主题维护,更新规则见文档规范。
文档网站使用支持 Mermaid 的 mdBook;本地执行 python3 design/scripts/docs.py build,生成内容位于 design/book/。GitHub Pages 工作流、工具版本及公开范围见文档发布说明。实验报告的数据可用性另有说明。
文档索引
总设计与实施方案位于上层 design/ 目录;本目录维护专题、工程参考、决策与文档规范,experiments/ 保存公开整理报告。文档构建配置、脚本和主题分别位于 design/book.toml、design/scripts/ 和 design/theme/。
用途:阅读与术语索引。
默认阅读当前正文;历史材料只用于查证来源,不是另一套设计。所有状态与配置边界统一见设计台账。
阅读路线
| 阅读目的 | 路线 |
|---|---|
| 建立整体认识 | 总设计 → 目标/逻辑总图 → 核心概念 → 完整场景 → 机制与取舍 |
| 理解主体自主运行 | 持续主体 → 认知循环 → 直接认知归属 → 主体评价 |
| 核对跨专题一致性 | 统一决策 → 步骤与操作/公共决策/配置与当前约束 |
| 选择、组合和管理检索 | 总体分工 → 公共契约 → 向量服务与 Attemory → 管理 → 评价 |
| 理解领域对象与投影 | 总体分工 → 对象与所有权 → 领域操作 → 管理详情 |
| 理解机密使用与防泄漏 | 对象与权限 → 授权分配 → 调用契约 → 审计与撤销 → RPC 接入 |
| 理解任务解耦与外部中止 | 总体架构 → 控制契约 → 控制台 → mini-go 依据 |
| 使用客户端预制能力 | 总体选择 → 维护与调用契约 → 工程接入 |
| 创建与更新人物 | 总体流程 → 引导契约 → 管理入口 → 工程接入 |
| 创建试验主体与比较行为 | 总体沙箱 → 初态与导入 → 环境覆盖 → 工作台 → 评价 |
| 理解计算节约与复用 | 总体选择 → 输入与结果 → 执行与结算 → 接入依据 → 评价 |
| 深入某项机制 | 从总设计或下表进入对应专题;专题维护详细规则,其他文档只保留必要概览和链接 |
| 理解具体承载 | 工程参考 → 技术栈/存储/能力接入 → 库事实 |
| 更新执行库与核对接入 | 当前库基线 → 库回归报告 → 后续更新流程 |
| 核对选择与状态 | 设计台账 → 采用理由/备选/用途配置 → 证据索引 |
六份逻辑设计专题
| 专题 | 唯一维护的详细机制 |
|---|---|
| 主体运行、认知协作与学习 | 持续主体、内生关注、按需活动、正常经历、多人格组织与公共整合、经验形成、主动学习议程及策略迭代 |
| 交流、人物与情境 | 意愿与投入、信任/污染、规范/格式、身份/隐私、情感/角色及主动联系 |
| 资料、领域视图与认知输入 | 领域对象及关系、资料内容与表示、受限视图、来源、选读及执行使用;外部事件源、有限思考、稳定输入装配、结果复用及增量准备 |
| 逻辑模块、能力契约与运行协议 | 主体直接认知归属、统一事件、能力构建与运行对象、学习强度及关闭、模型端口、步骤/操作接纳与生命周期、配置解析、个体状态与实现信任 |
| 沙箱、能力评估与回归 | 局部/组合/主体级试验、构建环境、试验主体生命周期、隔离、复盘、测试材料、基线、评价及采用 |
| 管理工作台与人工干预 | 管理入口及身份、模型/服务及能力构建维护、独立机密的对象/权限/授权分配/审计与可信提交、动态表单/蓝图、提交与观察 |
跨专题边界:资料专题维护对象关系、资料内容和面向接收者的视图;主体专题维护记忆与判断;运行专题维护程序、配置、模型及能力的操作接纳;管理专题维护页面交互和独立机密机制。各领域保留状态所有权,查询和页面不形成通用资源管理层;沙箱按领域装配,工程参考集中维护承载。
工程参考
| 参考 | 唯一维护范围 |
|---|---|
| 实施方案与阶段验收 | 阶段顺序、交付内容、首批完整链路、实现契约及验收安排;规划不代表已实现 |
| 工程选型与部署 | 物理部署、软件组合、技术栈、能力工具链/子进程、存储/文件、向量服务与 Attemory 接入及选型依据 |
| go-mini 库行为与接入 | 固定提交的源码核对与库回归、MRPC 多语言/资源/替换、实例/scope/补丁及宿主接入限制 |
决策与证据
| 查什么 | 位置 |
|---|---|
| 设计约束、已定设计与用途配置 | 设计状态、基础设计、管理设计状态 |
| 已有实验、失败和原始数据 | 实验索引;各报告保持原条件 |
| 论文、标准和来源命题 | 按问题查依据、设计机制资料、论文与标准记录 |
| 文档怎样保持一致 | 维护规范 |
| 构建网站、Mermaid、GitHub Pages 与公开范围 | 文档发布说明 |
设计按主题维护。论文、协议和依赖版本用于定位来源,实验修订标识用于区分固定条件。
术语定位
先区分几个容易混用的词:
| 用语 | 本项目中的含义 |
|---|---|
| 接纳 | 确认承担请求或操作责任;不代表已经执行成功 |
| 采用 | 将候选方法、配置或程序用于明确的任务或范围;不自动扩大权限 |
| 交付 | 结果到达允许的接收点;保存文件或发出请求不等于交付成功 |
| 结束 | 当前活动不再推进;应分别说明完成、退出、取消或受阻等原因 |
| 已定设计 | 当前选择的方案;不等于已经实现或通过完整验证 |
| 实测结果 | 在已记录条件下实际运行得到的证据;适用范围以报告为准 |
主体、人物与交流
| 概念组 | 当前定义位置 |
|---|---|
| Self、Mind、Persona、Role、Person | 总概念、协作、人物 |
| 私有 Mind 状态、活动委托、Self 公共整合 | 公共决定、总体关系 |
| 完整初始化提示词、个体差异、Self 自迁移与引导修复 | 人物形成、运行契约、检查场景、状态 |
| API 弃用、兼容窗口、提示词差异与客户端更新 | 工程映射、库事实、管理入口 |
| 意愿、可答性、快慢投入、承担范围 | 回应、承诺 |
| 观测、命题、来源权威、污染 | 观测与信任 |
| 规范、适用性、输出契约 | 规范、格式 |
| 跨平台关联、参与者、受众、情境保密 | 关联、隐私 |
| 情感评价、剧情、虚拟伴侣、主动联系 | 情感与角色、问候与提醒 |
活动、执行与控制
| 概念组 | 当前定义位置 |
|---|---|
| Goal、Episode、关注表、工作区、计划 | 运行循环、工作区 |
| 接纳前请求、澄清/拒绝、处理归属与用量承接 | 请求处理、运行归属 |
| 发起者、执行者、系统授权与用户委托 | 授权上下文 |
| Episode、Task、Operation、尝试与控制传播 | 身份和生命周期、控制语义 |
| Step、执行上下文、模型会话、Continuation | 连续性边界、运行步骤 |
| 任务契约、有效结果集合、责任收尾 | 主体任务、评价环境、状态定义 |
| 证据未知、主体退出、原目标达成与活动结束 | 结果与责任的分工、接纳与退出 |
| 步骤内独立接纳、请求键、最终提案与已接纳操作 | 接纳时序、工程提交 |
| 核心/任务解耦、认知中断、任务阻断/中止、外部审计控制 | 主体场景、生命周期、控制、工程、评价、状态 |
| 统一事件、来源、订阅、请求/结果、内部接续 | 总事件主线、协议、外部通知源示例 |
| Operation、Effect、Outcome、unknown | 操作与效果、用途评价 |
| 依赖、执行条件、结果复核 | 复核 |
| 基础受限执行、额外隔离与环境缺失 | 执行分类、工程装配 |
| 记忆形成、保留、遗忘与学习关闭 | 记忆生命周期 |
| 已读内容失效、受众变化与外部会话停用 | 上下文有效性 |
| 已交付结论、更正与有限通知 | 纠正处置 |
资料、领域对象与能力
| 概念组 | 当前定义位置 |
|---|---|
| 资料、记忆、程序、配置、模型与运行对象 | 所有权与关系、设计范围 |
| 资料内容、表示、来源定位、快照与修订 | 资料契约、领域接口与共用承载 |
| 情境投影、选择性发现、读取/处理/使用/交付 | 投影、操作、使用记录 |
| 内容派生、运行使用、来源和信息范围 | 派生规则、资料 |
| 检索领域、提供者、用途策略与来源映射 | 逻辑分工、同级接入、设计决定 |
| 前缀复用、稳定输入与有效结果 | 装配、复用条件、提供者接入 |
| 相同只读工作合并、增量准备与有界保留 | 逻辑分工、控制与结算、工程映射 |
| 节约效果、缓存管理与有限思考 | 管理、评价、投入、状态 |
| 逻辑模块、状态所有者、ModelRequest/Result | 职责、模型端口 |
| 公共 API、事件接入/观察、领域查询与检索提供者 | 公共契约、检索分工 |
| 能力构建、接口、产物、采用与运行对象 | 整体闭环、逻辑契约、管理入口、设计范围 |
| 功能采用、实现信任、固定产物与环境准入 | 逻辑边界、工程承载 |
| 隔离执行、高风险调用与环境缺失 | 整体职责、准入契约、管理、评价、状态 |
| 可选容器、Rootless Docker 与 gVisor | 工程承载及取舍、官方资料与适用边界;依赖可选,必要执行限制不可自动降级 |
| 客户端预制能力库、只读维护、可选使用与个体包装 | 逻辑契约、管理、评价、库事实、状态 |
| 热加载、编写契约、结构化注释与受管理函数 | 总设计、逻辑契约、表单与蓝图、函数测试、工程生成工具 |
| 普通配置、作用域覆盖、当前权限与控制 | 解析与生效、管理视图 |
| 个体自定义状态、结构修订与迁移 | 逻辑契约、存储映射 |
| 模型资产与推理服务维护 | 管理范围、工程映射 |
| 独立 Secret、SecretRef、SecretGrant 与原值交付 | 对象定义、领域边界、授权分配、运行契约、RPC 接入 |
| 用户机密归属、专用指令、一次性提交及过滤转换 | 归属与授权、可信提交、处理流程、用户场景 |
| 机密审计、撤销与试验授权 | 审计事实、撤销边界、评价规格、来源与边界 |
学习、沙箱与评价
| 概念组 | 当前定义位置 |
|---|---|
| 正常认知与专门学习的边界 | 主体循环、投入与关闭、主体评价 |
| 主动学习、兴趣探索、学习议程与自我迭代 | 总设计、主体策略、评价、状态 |
| 学习强度、关闭主动学习、明确学习任务与恢复 | 运行契约、管理控件、工程接入、库装配 |
| 经验、Reference、认知程序修订与候选采用 | 学习、候选 |
| Sandbox、重放、重新评估、反事实 | 沙箱职责、模式 |
| 试验主体、主体级测试、初态与完整状态导入 | 装配及生命周期、初态、取舍与依据 |
| 能力画像、用例/套件、开发/回归/保留任务 | 评估层次与覆盖、测试材料 |
| 基线、评价器、退化与采用门槛 | 可比条件、评价器、判定与报告 |
工程与来源
| 概念组 | 当前定义位置 |
|---|---|
| Attemory、HTTP API、材料准备与检索 | 接入参考、固定接口依据 |
| 向量数据库、Go SDK、本地/远程与产品选型 | 接入参考、官方依据 |
| MRPC、Go/Rust/Node.js(npm)、工具链、子 VM 与子进程 | 工程工具链、库事实与接入、JavaScript RPC、Node 工程接入、试验分层 |
| RunID、InstanceID、Generation、DeploymentSeq | 库身份映射、逻辑身份 |
| 技术栈、软件依赖、SQLite、文件发布、锁与备份 | 工程参考、存储机制 |
| 固定源码提交与证据范围 | 读取方式、基础库事实 |
文档维护
设计规则、工程映射和实验结果分别维护,修改方法见文档维护规范。网站构建、发布配置和安全检查见文档发布说明。
TinyAGI 逻辑总设计
用途:逻辑总设计|阶段:设计。
TinyAGI 要构建一个长期存在、能够自行组织认知与行动并持续演化的统一主体:感知环境,形成和调整自己的关注,组织心智与异构能力,行动并积累经历。对话、受托任务和主动学习都是主体可以开展的活动。“身体”指输入、输出及可操作设备与外部对象,不预设外形或硬件终点。
统一事件交互贯穿主体运行:外部观察、能力请求、结果、状态变化与运行控制均以事件表达。 主体可通过能力创建或接入外部事件源;闹钟只是通知源的示例,不是核心内置模块。事件连接环境变化、主体认知和活动接续,宿主处理确定机制;认知可直接归属于主体或心智,无须先建立对话或任务。
资料、记忆、程序、配置、模型、运行对象、索引和缓存分别管理,具有自己的身份、操作与生命周期。 各领域按当前情境提供受限视图,正文和业务状态由对应所有者维护;查询入口只组织请求和结果,不维护通用资源真值。引用不授予权限,执行组件加载内容不等于向认知展示内容。
检索是正式的外部能力类别。 记忆、资料、程序和能力说明等领域定义查询含义与结果类型;检索提供者拥有独立身份,可发现、选择、调用、管理和评价。不同实现处于同一接入层级,按用途配置选择或组合,具体检索计算由外部组件承担。
Secret 由独立机密职责维护归属、原值、授权与必要使用记录,防止原值泄漏给不可信远程 API 或其他非预期接收方。 认知默认使用引用,受信适配器或 RPC 实现可按授权取得原值或请求代理使用;是否允许处理原值取决于实际接收方、用途与目标,不仅按本地/远程或模型/工具类型划分。
本文及设计专题只描述逻辑设计:主体要完成什么、由谁负责、谁维护状态、如何交互,以及选择方案的理由。 设计支持自主选择是否回应、保留长期人格、适应交流情境、主动联系和沙箱试验。计算能力与运行机制支撑认知,业务状态、原始资料、派生索引和计算缓存分别管理。已有实验只覆盖局部组件和受限模型任务,尚不能证明广泛任务效果或长期能力。
项目处于设计阶段,方案状态、选择理由和适用边界统一见设计决策台账。物理部署、软件依赖与技术选型见工程参考。
阅读导航
| 从整体到细节 | 本文入口 | 深入阅读 |
|---|---|---|
| 目标与职责 | 目标、逻辑架构、概念 | 主体运行与协作 |
| 核心如何与任务解耦 | 生命周期与任务控制 | 运行契约、管理操作、库依据 |
| 主体如何持续运行 | 统一事件主线、场景、持续认知 | 事件协议、交流与情境 |
| 请求怎样成为责任 | 主体运行主线 | 接纳前交互、授权来源与委托 |
| 记忆和旧结论怎样修订 | 记忆、交付纠正 | 记忆形成与维护、上下文重新装配 |
| 如何节约重复工作 | 计算节约与复用 | 输入与复用、运行契约、工程接入 |
| 如何取证、计算和行动 | 记忆与能力、执行 | 资料与认知输入、运行与存储 |
| 如何选择与组合检索 | 领域检索与外部提供者 | 检索契约、提供者管理、具体接入 |
| 资料、记忆和运行对象怎样分责 | 领域所有权与投影 | 对象与关系、操作接纳、领域详情 |
| 如何扩充能力 | 能力构建闭环 | 构建与运行契约、分层试验;技术接入见工程参考 |
| 高风险能力怎样隔离 | 受控隔离执行 | 执行契约、环境管理、工程承载 |
| 预制能力如何使用 | 预制能力与个体实现 | 能力契约、客户端承载 |
| 人物如何创建与更新 | 初始化与自迁移 | 人物形成、引导与兼容契约 |
| 如何主动学习 | 主动学习与自我迭代 | 主体学习策略、学习强度与关闭 |
| 如何检验和改进 | 复盘与学习、沙箱、能力评估与回归 | 沙箱与评估专题 |
| 状态与能力如何协作 | 契约与所有权、连续性 | 公共能力 API、逻辑模块与模型端口 |
| 怎样观察、编辑和控制系统 | 管理与人工干预、管理场景 | 管理工作台 |
| 为什么采用、适用到哪里 | 取舍与证据、设计状态 | 证据入口、设计台账 |
本文维护完整逻辑架构和关键选择,六份设计专题展开机制。实验结果和一手资料从文档索引查阅。
1. 目标、范围与完整闭环
1.1 系统要持续完成的事情
| 目标 | 对设计的要求 |
|---|---|
| 初始化与个体演进 | 完整提示词引导形成个体实现,迁移说明帮助已有主体自行更新;接受人格与实现差异,统一必要运行契约 |
| 持续存在与自主运行 | 身份、兴趣、关注、关系、记忆和未完成责任跨调用与中断保存;尚未形成任务时也可感知、联想、判断和调整关注 |
| 有限注意与自然交流 | 环境线索与内在关注共同影响注意,按需读取和复用结果;对话默认简短,交流结束后可继续其他关注或休息 |
| 计算节约与性能保持 | 保持所需信息、计算目的和响应要求,复用有效输入处理与结果,减少重复准备;同时约束质量、时延和占用 |
| 动态组织认知 | 个体认知程序组织关注、上下文、心智与异构能力,允许调整方法与问题解释;任务流程只是可选组织方式 |
| 自主回应 | 区分请求与接纳,允许因自身偏好或关系体验拒答;清楚表达承担范围及变化 |
| 情境适配与可核对回应 | 区分证据、主观判断和规范;防止信息污染进入事实、人格或规则,按接收方要求表达并记录真实选择 |
| 连续且有分寸的社会交互 | 区分参与者,凭明确证据关联同人;按用途和受众保密,在允许范围内调整称呼、语气、时机与表达 |
| 情感陪伴与严谨工作共存 | 接纳角色扮演、虚拟伴侣和有约定的主动关心;区分关系、剧情、事实与任务要求,支持自然切换和混合交流 |
| 实时交互 | 深度认知期间继续感知、交流、停止输出和接受目标修订 |
| 主动学习与自我迭代 | 可依据兴趣、成长方向和能力盲区自主选题、实践及采用成果;具体策略作为实验性扩展,学习强度受限,最低可关闭主动学习 |
| 从结果学习 | 关联当时依据、决策、执行回执和后续结果,形成可修正经验 |
| 在沙箱中试验 | 用独立状态、替代能力和受控输入评估方案、测试程序及复盘;结论与现实经历分别保存 |
| 能力开放扩展 | 按当前关注与活动需要复用、组合或构建能力,形成可追溯产物,经试验和按适用范围采用投入使用;能力种类开放,不承诺无限资源或任意任务成功 |
| 认知组织可演化 | 认知程序修改先验证再发布;代码变化不撤销现实历史 |
1.2 应用范围与阶段边界
首先面向数字身体:在授权范围内观察和操作文件、程序、浏览器、网络服务,通过文本、声音或视觉与人交互。摄像头、麦克风、扬声器等通用设备由输入/输出能力接入;目标和记忆不绑定设备形态。
多个心智和并发工作围绕同一主体组织。能力提供者承担模型、工具、设备与事件源的具体工作;主体的目标、判断、授权和现实责任由相应逻辑模块维护。
计算能力负责推理、媒体处理与计算资源用量,认知负责选择用途和材料。各领域维护来源、修订及许可,检索接入维护提供者绑定、来源映射和操作记录,外部检索服务执行计算并返回候选;能力变化不应改写主体身份或绕过信息范围。
当前通过既有实验和资料维护设计,不运行新实验,也不开始产品实现。自研基础模型、固定专家编制、所有心智永久占用计算资源、隐空间通信及自主修改运行机制,均不作为当前前提。
1.3 完整的信息与经验闭环
flowchart TB
Environment["人、数字环境与通用设备"] --> Perception["感知与观察"]
Perception --> Cognition["主体认知:理解、联想、选择关注"]
Self["持续的身份、兴趣、偏好与长期关注"] <--> Cognition
Memory["世界理解、经历与记忆"] <--> Cognition
Cognition <-->|"按需组织与调用"| Support["心智与异构能力"]
Cognition --> Action["行动、表达或调整关注"]
Action --> Environment
Action --> Experience["实际结果与新经历"]
Experience --> Memory
Experience --> Cognition
Cognition -->|"需要持续组织时"| Activity["自主活动、受托工作与执行安排"]
Activity -->|"进展、等待与结果"| Cognition
Cognition -.->|"学习启用且需要专门探索时"| Change["学习、试验与认知程序候选"]
Change -.->|"按评价与采用范围"| Cognition
主体认知可直接发生,不以收到消息、接下任务或开启主动学习为前提。交流是感知与表达的一种方式,活动组织持续工作,任务安排管理具体执行。各环节可以交错,感知、推理、检索、算法与设备能力按需要参与;不要求每次事件都调用语言模型。
认知程序决定如何思考、关注和行动;宿主提供状态、事件、执行、额度与停止机制,执行可确定的约束,不裁定主体主观想法是否值得存在。正常经历积累与专门的主动学习分别处理,主体可继续自己的关注,也可休息或等待。复盘不必修改程序,候选经过相关评价后才按适用范围采用。
可复用方法保存为 Reference,认知组织与稳定计算可形成程序模块。保存方式不预设固定任务树、专家编制或统一思考顺序。
2. 逻辑架构与职责分解
图中节点表示职责或业务对象,箭头表示信息、请求、结果或约束关系;分组表达责任归属。“运行机制”(下文也称宿主)指管理状态、事件、权限、预算和接续的逻辑责任;“外部”指相关责任边界之外。图不规定部署位置、软件包、执行实例数量或通信技术。Mind、活动和模型会话分别定义,不能相互替代。
2.1 逻辑总图
先用一级职责理解系统,再从下方六张职责视图追查具体通路。统一事件连接这些职责;权限、受众和预算约束全部交互。资料、记忆、程序、模型及执行状态分别由对应职责管理,按接收者形成视图;检索与管理入口不拥有第二份业务状态。机密的保管、授权和原值交付使用专门接口。计算节约贯穿输入装配、能力执行与运行维护,各处理职责管理自己的复用状态;不增加拥有全部缓存的业务所有者。
flowchart LR
IO["环境交互:感知、行动与交流"] <-->|"观察、反馈与表达"| Subject["主体:持续状态、认知组织与心智"]
Subject <-->|"理解、回忆与修订"| Memory["世界与记忆"]
Subject <-->|"发现与选读"| Materials["资料与程序"]
Subject <-->|"按需要形成与接续"| Activity["活动与任务安排"]
Subject <-->|"调用与结果"| Work["异构能力与执行"]
Activity <--> Work
Subject <-->|"候选、试验与经验"| Review["学习与评价"]
Host["运行基础:状态、事件、调度与控制"] -.-> Subject
Host -.-> Work
Manage["管理工作台"] --> Host
Secrets["机密保管与使用"] <-->|"按接收方与用途交付"| Work
主体直接组织认知,活动承载需要持续推进的事项,执行负责具体操作。状态保存及访问控制由相应所有者落实;认知决定关注、解释、计划和意愿。对外承诺仍由主体公共整合或已委托的活动职责负责,认知中断不自动取消独立工作。
完整职责关系图
按六条通路阅读完整职责:先看认知主线,再按问题查阅对应视图。各图中的同名节点表示同一职责;箭头只展示当前通路,不表示新增模块或独立运行系统。
| 视图 | 主要回答的问题 |
|---|---|
| ① 认知主线 | 主体怎样感知、形成关注、组织心智并决定下一步? |
| ② 记忆与读取 | 观察怎样保存,投影、检索和主动读取怎样配合? |
| ③ 执行、控制与交付 | 请求由谁接纳,长工作怎样返回,谁能停止任务? |
| ④ 初始化与预制能力 | 人物如何创建/修复,如何使用客户端提供的能力? |
| ⑤ 能力扩展与学习 | 缺口怎样形成候选,试验结果怎样支持采用? |
| ⑥ 管理与机密 | 管理如何修改状态,凭据怎样到达预期使用方并避免错误外发? |
共同约束:身份、受众、权限、预算和适用要求贯穿全部通路,由运行机制在相应入口核对;状态由原所有者维护。图中省略这些重复约束线,以及不影响主线理解的普通进度回执。认知可见内容遵循投影与主动读取,Secret 原值只走受信通路。
① 认知主线 · 感知、内在关注、心智与行动
flowchart TB
Environment["人、数字环境与通用设备"] --> Events["有来源的观察与反馈"]
Events --> Minds["心智与可演化认知组织"]
Self["Self:身份、兴趣、长期关注与承诺"] <--> Minds
Memory["世界理解与私人经历"] <--> Minds
Minds <-->|"需要持续组织时"| Work["活动工作区与执行安排"]
Minds <-->|"社会交互时"| Interaction["交流情境与请求处理"]
Minds --> Action["能力调用、行动、表达或休息"]
Action -->|"结果与状态变化"| Events
一次认知可直接关联 Self/Mind,也可关联交流或活动;主体已有兴趣和未决问题可以成为接续依据。输入保留来源,认知决定是否及如何纳入当前关注。交流中的澄清、拒绝与承担选择沿相应职责保存;新消息不自动接管全部活动。现实操作的结果与停止见视图③。
② 记忆与读取 · 观察、投影、检索和证据流
flowchart TB
Events["统一事件"] -->|"有来源记录与选择性修订提案"| Knowledge["经历、断言与知识"]
Knowledge -->|"状态与获准记忆视图"| Work["主体认知上下文与可选活动工作区"]
Work -->|"按缺口选择范围"| Retrieval["检索与读取:范围、版本及来源核对"]
Retrieval <-->|"记忆查询与获准读取"| Knowledge
Retrieval <-->|"资料查询与获准读取"| Materials["资料与附件:内容及来源"]
Knowledge -->|"证据关联"| Materials
Retrieval <-->|"材料准备、查询与结果"| Providers["外部检索提供者:按用途选择或组合"]
Retrieval -->|"候选投影/明确选读的内容"| Work
Knowledge -->|"有意义的修订事件"| Events
领域入口定义查询含义,公共接入选择或组合合格提供者;命中不是可信事实或已读证明。资料职责保存原文与来源,世界与记忆职责保存经历、断言和适用知识,二者以证据关系关联。程序定位和能力发现也可沿自己的领域契约使用同一检索接入。返回结果保留对象类型及修订,各领域核对当前范围;外部服务维护自己的派生检索状态,操作仍经视图③接纳。详见检索分工及领域所有权。
③ 执行、控制与交付 · 操作接纳、外部结果和停止通路
flowchart TB
Events["统一事件"] -->|"能力请求"| Execution["操作接纳、执行条件与记录"]
Execution -->|"无需额外隔离的获准操作"| Providers["模型、读取、检索、算法与工具能力"]
Execution -->|"有额外隔离要求的获准操作"| Isolated["执行域装配:受控材料、计算容量与外部访问"]
Isolated -->|"按绑定范围运行"| Providers
Providers -->|"结果、产物、复用来源与用量"| Events
Providers -->|"创建或管理"| Sources["外部事件源"]
Sources -->|"通知经适配接入"| Events
Events -->|"已接纳输出请求"| Delivery["输出契约核对与交付"]
Delivery --> Body["输入、交流与输出"]
Body -->|"交付反馈"| Events
Requester["Self/控制台/获授权用户与审计来源"] -->|"控制请求"| Control["任务控制:来源、目标与权限核对"]
Control -->|"限制推进、控制所属工作"| Execution
Control -->|"阻止后续业务交付"| Delivery
Control -->|"即时止动请求"| Body
Control -->|"请求、接纳与实际停止状态"| Events
长工作由操作所有者管理,结果回到原主体/心智及所关联的交流或活动;控制通路优先处理,不等待慢模型。止动请求已发出、控制状态已正式接纳与实际执行已停止分别记录,效果核对和资源收束另保留进展。外部事件源由能力创建/接入,不内置闹钟业务。详见任务控制、执行与效果。
高风险能力的准备与运行由宿主绑定满足要求的隔离环境;环境可选装配,缺失不影响无此要求的能力,但不能放宽当前操作的执行条件。真实任务与沙箱试验共用隔离执行契约,业务状态仍归原所有者。
④ 初始化与预制能力 · 创建、迁移及固定维护入口
flowchart TB
Management["管理与人工干预"] -->|"创建、更新或修复"| Bootstrap["初始化与迁移引导"]
Bootstrap -->|"沿原所有者保存身份与进度"| Self["主体状态"]
Bootstrap -->|"按需发现与读取"| Presets["预制能力:目录、契约与维护来源"]
Minds["主体心智"] -->|"选择、组合或不用"| Presets
Presets -->|"按实际作用及授权调用"| Execution["操作接纳与执行"]
Bootstrap -->|"模型与工具请求"| Execution
Bootstrap -->|"构建候选与兼容检查"| Development["能力构建与运行"]
Bootstrap -->|"进度与结果"| Events["统一事件"]
固定引导与管理入口独立于个体程序;预制库的维护归属和调用权限分别定义。程序与状态的候选采用仍遵循共同兼容及生效契约,管理者可查看预制来源和使用配置。详见初始化与迁移、预制能力。
⑤ 能力扩展与学习 · 构建、试验、采用及反馈
flowchart TB
Self["主体兴趣、成长方向与能力观察"] -->|"学习强度与准入约束"| Learning["主动学习:选题、练习与策略候选"]
Learning -->|"提出学习活动"| Work["活动工作区:自主活动、受托工作或学习"]
Self -->|"正常活动中的能力需要"| Work
Work -->|"能力缺口与有范围请求"| Execution["操作接纳与执行"]
Execution -->|"构建、试验或运行管理"| Development["能力构建与运行:接口、产物及绑定"]
Development -->|"候选与试验问题"| Sandbox["沙箱:按问题装配初态、输入与能力"]
Sandbox -->|"报告与实际记录"| Review["能力评估、回归与复盘"]
Review -->|"按适用范围采用依据"| Development
Review -->|"学习反馈与候选评价"| Learning
Development -->|"已采用实现与调用绑定"| Providers["能力提供者"]
Providers -->|"结果事件接续原活动"| Work
能力构建、试验和维护状态沿统一事件返回,获准管理请求也可直接进入对应所有者。活动或复盘可按需发起沙箱试验,不要求每次试验先生成代码;报告不整体合并现实状态。学习最低可关闭,全部分支共享父活动与全局预算。详见能力扩展、沙箱、主动学习。
⑥ 管理与机密 · 可信输入、授权分配与审计
flowchart TB
Operator["管理者/有权用户"] <-->|"查询与管理"| Management["管理与人工干预"]
Management -->|"范围内修改;视图③至⑤的操作"| Owners["原状态所有者"]
Owners -->|"授权视图、领域视图与结果"| Management
Management -->|"确定性维护"| Maintenance["模型、服务与资料维护"]
Maintenance -->|"状态与进度事件"| Management
Management -->|"归属、维护与授权管理"| Secrets["独立机密管理"]
Management -->|"固定受信控件"| Intake["专用指令、可信提交与过滤转换"]
User["机密所属用户"] <-->|"可信入口与专用提交"| Intake
Execution["操作接纳与执行"] -->|"收集申请:不含原值"| Intake
Intake -->|"绑定用户与用途后保管"| Secrets
Execution -->|"身份、用途与接收方"| Secrets
Secrets -->|"授权原值交付或代理使用"| Providers["获授权执行方"]
Secrets -->|"获准引用与状态:不含原值"| Management
Secrets --> Audit["授权、放行与交付审计"]
Audit -->|"按审计查看权限"| Management
普通管理请求、状态变化和应用结果沿统一事件关联;工作台不另建业务真值。可信输入直接交给机密职责,主体通常只需引用和状态;原值经专用通路交给获授权的实际使用方。认证目标、返回内容及后续外发分别核对,普通事件、日志和业务结果不夹带凭据;必要记录区分宿主交付事实与执行方自报使用。详见管理工作台及机密专题。
主线为“感知与内在关注 → 认知组织 → 行动或调整关注 → 经历与反馈”;事件连接各环节,具体活动按需形成。管理请求按其作用交给状态所有者,管理者可观察已授权状态、修改内容及控制运行;管理视图不取得各领域状态所有权。用户请求与主体接纳分开;工作区是活动状态的有范围视图,心智按需参与。图中状态视图和职责关系不要求每次内存访问都产生事件。意愿、情感和规范适用判断是同一认知过程的责任,不各建一个服务或强制增加模型调用;具体规则见回应与情境。
宿主提供可核对事实并执行确定的权限、预算和格式检查。身份关联不扩大读取/披露范围;模型与工具处理材料也须符合用途及受众要求。Schema 通过不证明内容真实或合法。模块通过业务契约协作,状态修改由各自所有者接纳。
资料与记忆职责提供允许检索的内容和当前来源状态,检索入口核对候选,索引只保存可重建的检索副本。查询返回具体资料或记忆视图,正文仍须主动读取;相似度不证明事实可信。认知通过有范围的检索契约提出请求,不能绕过来源与许可核对直接把候选当成事实。
外部通知、文件监听或后台任务通过事件接入;“创建闹钟”只是通过能力建立未来通知来源的示例,核心不承担其业务计时。宿主仍管理执行超时和计算资源预算,即时停止不等待慢模型或状态保存。沙箱复用同一事件与能力契约,装配独立状态、替代事件源和动作;允许的真实计算仍受范围与预算约束,报告经评阅形成有限候选。
统一事件主线与职责
所有有业务意义的交互和活动推进均以事件表达:外部观察、请求提出、请求接纳/拒绝、执行结果、已确认状态变化以及运行控制。事件接入绑定来源与执行域,按类型、可见范围、订阅和因果关联交给对应状态所有者;相关变化形成关注候选。事件分发不承担事实真伪或主体意愿判断,也不把输入载荷中的自称身份当作授权。
| 事件含义 | 例子 | 默认处理 |
|---|---|---|
| 外部观察 | 用户消息、资料变更、通知触发、设备上报 | 保留来源,关联具体资料、设备或活动,按需形成关注候选 |
| 请求提出 | 读取、推理、检索、创建通知源、发送消息 | 宿主按范围和预算接纳;请求已提出不代表效果发生 |
| 结果与回执 | 接纳、完成、失败、取消结果、实际交付 | 更新操作及活动状态,必要时接续 |
| 状态变化 | 目标修订、资料/程序修订、判断更正、产物发布 | 状态所有者确认变化后通知相关活动;不把外部主张直接写成事实 |
| 运行控制 | 停止、超时、预算耗尽、步骤结束 | 确定机制直接处理;确需判断时才进入认知 |
事件源是产生通知的对象或提供者,订阅是宿主维护的“关心哪些事件、关联哪个活动”的关系;两者不能合并。现成来源可直接接入,也可经能力请求新建来源。核心保存必要引用、订阅和任务责任,外部提供者维护所创建通知对象。平台、设备、外部通知与内部运行事件沿统一协议进入系统,来源不同不改变状态所有权。
步骤完成后仍有明确工作,可以通过活动可继续事件推进;无需等待新用户消息或人为创建闹钟。普通进度/回执由机制处理,相关事件可以合并成一次关注判断。自我接续必须对应未完成工作、继续理由和剩余预算;无变化时等待,不能靠事件互相触发维持空转。
事件统一的是交互语义,不要求全量广播、单条 FIFO、所有调用异步或每个 token 留存。实时控制可优先处理,当前业务状态和必要过程记录分别维护;各领域仍按接收者提供受限视图,不要求从全部历史重放得到唯一状态。公共 API、事件与订阅、外部事件源示例
2.2 计算与机制边界
| 层 | 责任 | 交互与限制 |
|---|---|---|
| 数据与设备计算 | 计算提供者处理媒体、推理、专用算法与设备反馈 | 认知选择用途和允许材料,宿主对接接口并记录实际结果 |
| 认知计算 | 模型、检索、搜索和模拟加工证据 | 返回结果不等于业务授权 |
| 认知协调 | 认知组织决定关注、上下文、讨论与下一步 | 实际动作必须通过宿主能力 |
| 宿主机制 | 运行机制管理事件接入/订阅、状态、调度、权限、预算和恢复,适配能力 | 外部通知源由相应提供者管理;执行超时和预算控制仍是宿主机制 |
2.3 并行通路
实时通路、深度认知和后台复盘分别控制准入与资源,共享带版本的事实。逻辑并行不消除慢结果、取消竞争或资源饥饿;新增活动不等于获得独立资源。媒体走有界缓冲与文件引用,认知通路传递语义事件和意图。 输入保留来源、时间和轨道状态,设备/轨道不等于人物身份;原始媒体沿投影与主动读取使用。停止采集、停止播放、取消调用和退出活动分别处理,受众未知时缩小披露范围。
2.4 职责与细节索引
| 逻辑模块 | 持久责任或作用范围 | 深入阅读 |
|---|---|---|
| 管理与人工干预 | 认知业务、模型/服务维护、Secret 管理;管理身份、对象查询、变更草稿、范围/生效结果和应用记录;业务状态仍由原所有者维护 | 管理概览、工作台专题 |
| 主体与目标 | 身份、偏好、关系、公共承诺、接纳范围、关注与成功依据 | 运行主线、目标、回应决策 |
| 心智与协调 | 活动工作区、上下文组织、主负责心智与独立参与 | 工作区、认知 |
| 实时身体 | 输入、输出轮次、缓冲和设备停止 | 实时交互 |
| 世界与记忆 | 记忆材料、来源、时间、断言、显式读取和访问范围 | 记忆、取证 |
| 资料与领域视图 | 资料职责维护文档和媒体;各领域提供受限查询,记忆、程序、模型及运行对象保留各自身份和操作 | 总体分工、对象与关系 |
| 事件交互与外部来源 | 接入、分发、订阅和活动关联;通过能力创建或接入通知源 | 统一事件主线、事件协议、来源示例 |
| 外部计算 | 提供者执行模型及专用计算,宿主保存请求、结果和用量 | 选择性认知、专题 |
| 参与者与社会关系 | 账号命名空间、人物关联证据、说话角色、当前受众及情境化关系 | 人物与交流、深入分析 |
| 情感、关系与互动场景 | 事件评价、当前情感倾向、虚拟关系约定、剧情范围、主动关心及工作切换 | 整体选择、深入分析 |
| 情境要求与输出 | 规范来源/版本、适用范围、接收方契约、内容核对和格式发布 | 情境要求、深入分析 |
| 能力构建与运行 | 接口、候选、构建产物、采用绑定、运行生命周期及回收责任 | 能力闭环、对象与契约 |
| 任务控制 | 来源、授权、控制目标、推进资格、在途收束与解除条件;任务责任仍归原所有者 | 生命周期与控制、详细契约 |
| 任务与能力 | 待办、模型调用、工具动作、取消和核对 | 执行、协议 |
| 检索接入 | 领域查询、同级提供者、用途策略、来源映射和服务报告状态 | 检索分工、运行契约 |
| 预制能力供给 | 预制目录、契约与维护来源;个体选择和包装独立,调用沿原执行及状态所有者处理 | 总体选择、契约 |
| 初始化与迁移引导 | 稳定人物身份、初始化进度、提示词与迁移来源、候选及有效实现;维护入口独立于个体程序 | 生命周期、运行契约、管理入口 |
| 主动学习与自我迭代 | 长期学习议题、选题与实践策略、候选档案及迁移反馈;宿主执行强度限制,关闭后不自主学习 | 整体机制、学习策略、强度控制 |
| 观测与学习 | 依据、意愿与快慢选择、规范判断、实际产物与交付、内容及用途评价、经验 | 学习、回应观测 |
| 认知版本管理 | 候选产物、验证、采用范围与历史责任 | 版本采用 |
| 沙箱与试验环境 | 试验范围、独立状态、输入与能力装配、执行记录及报告;评价结论由认知/评阅承担 | 总体机制、完整设计 |
| 能力评估与回归 | 测试集、评价规则、基线、逐任务比较、覆盖范围与采用依据;复用沙箱执行 | 总体规则、测试与判定 |
模块以统一事件契约交互。分发负责通知和接续,重要待办和已确认事实由状态所有者持续维护;收到通知与业务状态已经改变分别判断。
2.5 主体运行主线:持续组织认知与行动
主体从外界变化、当前处境、私人经历和内在关注出发,组织心智与能力,形成判断、行动或新的关注。长期状态保持连续,具体计算有界并可中断;持续存在不要求持续调用模型。
| 环节 | 认知程序负责 | 宿主与能力负责 |
|---|---|---|
| 感知与理解 | 选择值得注意的线索,理解当前处境与变化 | 提供观察、状态和来源,执行媒体或算法计算 |
| 关注与意图 | 联想、提出问题、延续兴趣或调整目标 | 保存主体/心智状态及可运行条件 |
| 组织认知 | 选择上下文、心智、模型、检索或其他算法 | 提供对应能力和状态接口,记录实际调用与用量 |
| 行动与交流 | 决定是否行动、如何表达、是否接受他人请求 | 执行具体操作与当前约束,返回真实结果 |
| 持续活动 | 按需要组织自主或受托事项、计划和承诺 | 保存工作区、执行安排、等待及停止状态 |
| 经历与调整 | 形成记忆,更新解释、情感、预期和下一步 | 保存相应状态及必要来源,不替认知裁定主观意义 |
Goal 保存长期关注与意图,Episode 按需要承载持续活动,Task 管理具体执行安排。选择关注不要求先生成任务,形成想法不要求先填写验收条件。模型、视觉处理、检索和工具都是计算或行动能力;任务流程与工具往返仅是认知可以采用的组织方式。
正常认知、自主日常活动和经历积累持续可用。主动学习开关约束专门研究、练习、策略比较和自我迭代的额外投入,关闭时不抹除兴趣、关系或已有能力,也不停止主体普通认知。具体划分见主体学习边界。
人的消息是环境输入之一。主体按情境处理理解、澄清、回应或拒绝,明确承担后再保存对应活动责任。已接受的交付与现实承诺仍须履行或明确退出;具体请求处理和任务契约服务于这些场景,不规定全部主体行为。
贯穿场景见主体在环境中的持续活动。已有任务实验支持其中的取证、接续、交付等局部机制,完整范围见证据索引;不据此推定自主运行与长期演化效果。
2.6 状态所有者、认知组织与公共能力契约
活动维护目标、工作区和接续;资料职责维护文档、媒体及内容来源,世界与记忆维护经历、当前情境理解、行动预期、断言及知识;程序、配置、模型与运行职责分别维护自身定义和有效状态;交流维护参与者及输出契约;执行维护操作及真实回执;评价维护试验配置、判分、基线和采用依据;机密职责维护 Secret 的归属、原值、授权和审计。认知提出有依据的选择和修订,由相关状态所有者接纳;工作区及跨领域查询只提供有范围的视图。
统一事件机制维护来源、订阅、关联和分发,不替代领域判断。认知通过能力契约取得上下文、调用模型/工具并提交接续;提供者返回候选和执行证据,不接管主体的认知与行动组织。沙箱沿相同契约绑定试验状态和受控能力。
公共 API 按业务用途分层:记忆查询、资料取证、程序定位和能力发现保留领域语义,共用提供者发现、请求适配、选择/组合及结果整理。EvidenceSearch 用于寻找依据,不代替全部领域入口;向量生成和索引操作属于相应提供者的适配。认知可指定获准提供者或使用当前用途策略,具体计算交外部服务。各实现声明支持范围和限制,不能从统一接口推定完全等价。公共契约
当前状态、过程记录、原始资料和可重建索引分别维护;模型会话不是主体记忆的唯一来源,也不要求重放全部事件重建主体。状态所有权
组合实验以确定提供者完成了读取、交付、等待和接续,支持局部契约衔接;不证明真实模型收益或完整系统效果。其失败诊断促成结构化业务结果的选择:明确失败类别与来源,避免仅靠执行错误文本解释原因。
2.7 管理工作台与人工干预
管理范围分为认知业务与运行维护:后者覆盖模型描述/权重、推理服务、设备状态、连接、凭据及其维护任务。管理者不需要通过 AGI 对话下载模型、调整服务或维护密钥;AGI 只按授权获得可用能力和状态的投影。具体范围见运行维护。
Secret 是独立的机密管理对象,拥有自己的标识、归属、原值修订、授权和审计。 普通用户可通过专用指令模式创建、替换和管理自己的机密;主体也可申请收集,由运行机制向指定用户提供一次性入口或其他可信输入方式。查看描述、写入替换、代理使用、读取原值、分配授权、查看审计和生命周期维护分别授权。授权关联接收方、实际实现、用途、操作、执行域及有效期;转授权只能在明确允许时缩小父范围。系统共用凭据可归属于系统身份,管理面板按权限调整归属和授权。
可信输入经身份、用途和类型处理后独立保管,普通认知默认只取得引用及状态。受信适配器和 RPC 实现可以按配置使用原值;是否允许其他计算组件处理,依据实际接收方、用途和目标核对。重点阻止不可信远程 API、无关模型、普通日志或业务返回获得凭据;认证接口与推理正文分别处理。必要使用记录保留真实放行和结果,撤销限制后续访问,已交付值的上游效力另行处理。
管理工作台是完整的观察、编辑、调节和控制入口,覆盖主体、心智、活动、人物关系、记忆、资料、能力、事件来源、行为规则、程序候选、沙箱及运行记录。统一搜索与对象详情将输入、证据、参与心智、操作、交付及所用配置串联起来。各领域默认提供受限视图,主动打开才读取;管理者读到的内容不自动进入认知上下文。
“微调”包括内容、配置、策略、认知程序和运行状态。配置可改值和适用范围;业务内容可修订、关联或删除;活动通过暂停、继续、取消、转交等业务命令控制;程序候选按范围采用,资料保留内容修订;历史可以注释、更正或按规则删除/脱敏,但不把已经发生的外部动作改写成从未发生;派生索引与缓存通过重建、失效和清理管理。模型权重训练属于可另行接入的计算能力,不等同于人格或提示编辑。
常用表单、高级结构编辑和关联视图操作同一业务对象。字段说明当前实际值、来源、覆盖范围、修改影响和生效结果;简单编辑可直接提交,跨对象变更可统一预览。管理请求经身份/范围及业务语义核对,由原状态所有者执行;管理模块只维护请求、草稿和应用记录。常规编辑统一提交并立即生效,不能用仅保存候选冒充已采用。
工作台支持可运行的试验主体、代码相关的动态表单/蓝图,以及提交后立即生效的操作流程。试验先确定问题,再选择程序、初始状态和环境;可从当前主体导入所需状态,创建后默认暂停,页面展示可测范围、缺失条件和运行结果。完整状态导入是有明确用途及兼容条件的可选方式,见沙箱专题。编写契约、类型/注释描述及提交切换规则见编辑机制。编辑冲突仍明确显示,撤回配置不撤销已发生的交付;管理员试验是可选路径,主体自主改动的权限与采用责任仍保留。
管理身份与聊天身份分开,管理者查看、模型处理及对外披露分别授权。系统拥有者可完整管理,也支持有限维护、观察和沙箱范围。确定性查询、修改和停止不等待模型判断;语义辅助形成可审阅草稿,不取得额外权限。主体强自主回应与明确的管理作用分别表达。逻辑契约和完整交互见工作台专题,具体页面承载与技术候选见工程参考。
3. 核心概念、关系与状态所有权
统一主体(Self)持有身份和现实责任;心智(Mind)持有独立认知状态,其中长期保留身份、私人经历、偏好和关系体验的心智称为人格(Persona),与临时心智并存。协调者、调查者、审阅者是活动中的职责,不是固定人格编制;模型只是某次认知调用使用的能力提供者。更换模型、关闭会话或结束执行上下文都不应改变这些概念的含义。
外部人物 Person 与内部人格 Persona 不同。人物记录可以使用化名,不等于法定实名;平台账号、会话发言者和现实自然人也不必一一对应。一个人可能使用多个账号,一个账号也可能由多人、组织或代理使用。账号资料保留原有出处,明确证据支持的是关联关系,不将所有资料永久合并成一个无边界档案。
flowchart TB
subgraph Subject["主体与认知状态"]
Self["Self:统一主体"]
Shared["身份、偏好、关系与情感倾向<br/>长期关注、目标与公共承诺"]
Minds["Minds:长期人格与临时心智"]
Private["各自的私人记忆、模型会话 Sessions<br/>认知程序修订"]
Self -->|"拥有"| Shared
Self -->|"组织"| Minds
Minds -->|"各自关联"| Private
end
subgraph Activity["活动、步骤与操作"]
Episode["Episode:持续活动"]
Workspace["工作区:目标、可修订计划<br/>产物、证据、开放问题"]
Step["Step:认知步骤"]
Discussion["Discussion:讨论"]
Task["Task:可选任务安排"]
Graph["Activity Graph:活动认知图<br/>参与者、证据和调用关系"]
Proposal["最终提案:状态更新、既有操作引用<br/>尚未接纳请求、决策 Decision"]
Operation["Operation:已接纳工作"]
Effect["Effect:预期或可能的现实作用"]
Outcome["Outcome:用途评价<br/>关联决策预期与目标达成情况"]
Evidence["后续证据"]
Episode -->|"保存工作区"| Workspace
Episode -->|"关联"| Step
Episode -->|"关联"| Discussion
Episode -->|"按需建立"| Task
Episode -->|"形成"| Graph
Episode -->|"直接安排"| Operation
Task -->|"安排"| Operation
Step -->|"经宿主步骤内独立接纳"| Operation
Step -->|"最终提交"| Proposal
Proposal -->|"关联既有操作或接纳新请求"| Operation
Operation -->|"按需关联"| Effect
Proposal -->|"决策定义预期"| Outcome
Outcome -->|"引用"| Evidence
end
subgraph Evaluation["沙箱与复盘"]
Review["Review:复盘"]
Candidate["候选修订"]
Sandbox["Sandbox:沙箱"]
Trial["独立活动状态、输入环境、受控能力"]
Report["试验报告与候选产物"]
Review -->|"按需创建"| Sandbox
Candidate -->|"按需创建"| Sandbox
Sandbox -->|"运行"| Trial
Trial -->|"产出"| Report
end
subgraph Extension["能力扩展与主动学习"]
Gap["能力缺口"]
Source["接口与候选源码"]
Artifact["实现产物"]
Binding["能力绑定"]
Implementation["实现与运行对象"]
Interest["兴趣、成长方向、能力盲区"]
Learning["学习活动"]
LearningResult["知识、程序、学习策略候选"]
Gap -->|"形成"| Source
Source -->|"构建"| Artifact
Artifact -->|"试验与按适用范围采用"| Binding
Binding -->|"选择"| Implementation
Interest -->|"学习强度与准入约束"| Learning
Learning -->|"实践与评价"| LearningResult
end
Minds -->|"直接发起有界认知"| Step
Self -->|"需要持续组织时形成或选择"| Episode
Episode -->|"按需创建"| Sandbox
Implementation -->|"结果回到所属认知或活动"| Step
Implementation -->|"结果用于复盘"| Review
这些是关联关系,不是严格的一棵所有权树:一个目标可以跨活动,一项实际结果可以关联多个决策。Operation 描述已接纳的工作,Effect 跟踪预期或可能的现实作用及其证据,Outcome 描述目标是否达到;一次模型查询通常只有 Operation,对外发言还涉及 Effect。
| 概念 | 所有者 | 持久内容与边界 |
|---|---|---|
| 预制能力与个体包装 | 预制定义由提供方维护,个体包装由 Self 维护,业务状态仍归原所有者 | 维护归属、接口/实现身份、调用作用和当前授权分别记录;预制能力可用不等于个体已采用 |
| 初始化与迁移记录 | 引导职责保存进度,主体、资料、程序及运行所有者分别保存身份、来源和有效实现 | 完整提示词、迁移项处理结果、程序/配置及契约身份分别记录;读过说明不等于更新完成 |
| 学习议程与策略 | 主体目标保存方向,活动保存问题与进展;学习扩展提供策略,宿主维护强度和权限 | 议程是目标/活动的视图,不另建主体;候选不拥有提高强度、扩大预算或改写当前评价规则的权限 |
| 能力接口、实现产物与采用绑定 | 能力接入维护接口与提供者,构建维护产物,运行管理维护生效及生命周期 | 接口身份与实现修订分开;产物关联来源、构建与评估,运行对象不等于主体或持久业务真值 |
| 检索提供者、用途策略与来源映射 | 检索接入维护配置、绑定和操作记录,领域维护查询含义及来源,外部服务维护实际检索状态 | 提供者同级且可独立发现、选择、管理和评价;外部空间不等同于人物或任务,跨域结果保留对象类型 |
| 受管理函数及调用描述 | 程序维护职责保存源码与声明,运行管理维护生效绑定,调用描述为派生视图 | 稳定函数标识、输入输出、说明、暴露范围与能力需求;一次调用绑定代码/普通行为配置修订,描述不授予权限 |
| Secret、引用与授权 | 独立机密职责维护原值、归属、SecretGrant 和必要使用记录;SecretRef 只作标识 | 默认以引用供认知使用;原值按实际接收方、用途和目标交付,阻止向不可信 API 与非预期对象泄漏 |
| 机密提交请求 | 受信输入职责绑定用户、用途、目标、执行域和有效期 | 专用指令或活动申请发起;一次性入口与原值不经过模型,结果投影沿统一事件接续活动 |
| 模型/服务维护 | 运行维护职责及提供者适配 | 模型资产、服务配置、加载状态、维护任务及实际可用性;不依赖认知模型执行管理 |
| 管理变更与人工干预 | 管理职责保存草稿、请求及应用记录;相关状态所有者执行 | 操作者及权限范围、目标与基于的状态、修改差异、生效时机、各项实际结果;不成为新的业务事实库 |
| 统一主体 | 主体模块 | 身份、兴趣、长期关注、偏好、关系、公共立场与承诺;可直接开展认知,公共修订由整合责任组织,实际作用遵守运行范围 |
| 心智/长期人格 | 心智模块 | 私人记忆范围、经历、偏好、参与意愿、关注与认知状态版本;不拥有底层模型 |
| 个体扩展状态 | 个体声明主观结构与含义,宿主保存并校验 | 所属 Self/Mind、定义模块、结构与记录修订、可见及写入范围、迁移关系;不替代公共状态真值 |
| 外部人物与账号关联 | 世界/关系认知与宿主身份适配共同负责,各自保存证据 | 平台/租户命名空间内账号、人物或未明操作者、关联证据及有效范围;同人关联不授予历史读取或披露权限 |
| 交流情境与信息披露范围 | 当前会话与活动保存,认知解释,宿主执行可确定限制 | 当前发言者、被谈论者、接收者、用途和渠道;能读取、能送入某模型、能向当前受众表达是不同判断 |
| 情感状态与关系评价 | Self 与相应 Mind 各自持有,公共采纳沿既有整合责任 | 触发事件、解释、对象、当前倾向及修订;主观感受不是对他人动机或事实的证明 |
| 虚拟关系与角色扮演范围 | 关系约定及活动工作区保存,关联参与者和可见范围 | 实际交流与偏好、有效陪伴约定、剧情人物/设定及场内事件分别保留;对外角色不等于内部 Persona |
| 回应选择 | 主体认知形成,当前交流/活动保存 | 接受或拒绝、范围、投入、事实缺口与继续条件;不是新的执行身份或独立服务 |
| 接纳前交互与授权上下文 | 交流职责保存请求处理,宿主绑定操作归属,领域所有者核对权利来源 | 会话及输入事件关联澄清、拒绝和有限投入;业务接纳后关联 Episode。发起者、执行者、授权来源及接收方不合并成一个身份 |
| 情境要求与输出契约 | 有权配置者维护规范/契约来源和版本;认知形成当前适用判断,宿主执行确定约束 | 接收者、渠道、用途、适用条件、必要内容/禁止内容、格式及失败表达;资料中的自称权威不等于生效规则 |
长期活动 Episode | 主负责心智组织,宿主保存 | 工作区关联目标、可修订计划、当前产物、证据、判断、开放问题和在途工作;交付进度与后续用途评价分开,不是永久执行上下文 |
| 主体关注表 | 主体认知选择,宿主维护运行事实 | 当前关切、环境线索、未决问题、活动及接续条件;可先有关注再形成活动,不复制全部材料 |
认知步骤 Step | 所属 Self/Mind 组织,宿主管理执行 | 直接关联主体或心智,可另关联交流或活动;保存实际输入、步骤令牌、状态更新、操作与代码身份 |
目标 Goal | 主体模块保存,认知组织修订 | 持续意图或长期关注、来源、当前解释、约束与调整决定;可跨活动,具体交付和验收要求归相应活动 |
任务安排 Task | 活动模块 | 归属 Episode 的可恢复执行安排,维护等待、依赖、期限和取消,可包含多个 Operation;不等于整项活动责任 |
| 活动认知图 | 认知观测与活动状态所有者 | 本次实际参与的心智、模型、证据、能力及其可观察关联 |
| 事件与证据 | 宿主事件机制维护封装与分发,领域状态所有者维护业务含义 | 来源、类型、时间、范围、因果关联与载荷引用;观察、请求、结果和状态变化分别表达,事件记录不自动成为可信断言 |
异步操作 Operation | 操作模块 | 请求、尝试、期限、执行结果、取消与回收责任 |
外部副作用 Effect | 动作模块 | 预期/可能作用的业务标识、授权、发送事实、回执与核对证据;记录存在不表示已经发生 |
| 效果核对与执行回收记录 | 操作与运行管理 | 查询证据、键的保留范围、执行实例/句柄的停止和回收、核对预算及接续责任;效果未知可与部分执行已回收并存 |
| 计算容量预留与证据 | 操作/预算模块 | ReservationID 区分占用,证据绑定具体操作和占用项;只为需要持久结算的额度维护释放账 |
| 恢复与证据 | 宿主恢复模块 | 记录启动、备份来源、缺失区间和未明动作;矛盾证据不覆盖原内容 |
| 决策与现实结果 | 决策模块 | 当时依据、预期结果、后续证据及复盘关联 |
| 世界认知 | 世界状态模块 | 对当前处境、对象关系和变化的理解,以及行动预期;关联来源与经历,允许未知、矛盾和修正 |
| 资料与内容表示 | 资料职责 | 文档、媒体、来源定位、快照和表示;与记忆判断分开,文件承载不改变归属 |
| 带类型引用与领域视图 | 对应领域所有者 | 引用指向具体对象及必要修订/范围,不自带权限;视图只给获准描述和状态,不等于模型已读 |
| 来源、派生及交付关联 | 各领域维护相应关系,活动/交付/评价保存各自结果 | 摘要、向量和构建产物保留来源;报告正文只有一个所有者,任务要求和发送记录不复制正文真值 |
| 读取结果 | 认知提出范围,宿主与能力提供者执行 | 绑定来源版本、范围和处理用途的内容;可按需保留于工作记忆,缓存存在不自动使其进入上下文 |
| 检索绑定、材料准备与候选 | 各领域提供来源及许可,检索接入记录请求和映射,外部提供者维护实际检索状态 | 返回对象类型、来源修订、定位、提供者及实际覆盖;命中仍须核对有效性和许可 |
| 事件源与订阅 | 提供者维护外部来源,宿主维护来源引用、订阅和活动关联 | 可接入现成来源,也可经能力创建/管理;闹钟仅为外部通知源示例,来源存在不代表事件已发生或任务已交付 |
| 模型会话 | 模型适配模块 | 上下文清单、模型绑定、调用关联和提供者支持的会话引用;事实来自独立记忆 |
| 认知程序与采用 | 版本模块 | 程序产物、来源、验证结果、采用顺序和适用范围 |
沙箱 Sandbox | 宿主试验模块 | 父活动与问题、基准材料、独立可写状态、环境/能力配置、预算及报告;SandboxID 标识执行域,不是新的现实主体 |
| 测试套件、评估与基线 | 评估模块 | 用例与能力覆盖、评价规则、配置身份、逐次沙箱运行、任务结果及采用记录;基线是被明确接受的配置和证据,不自动指向最新结果 |
主体或心智可以直接开展认知。Goal 表达长期关注与意图,Episode 组织自发或受托的持续活动及责任,Task 保存具体执行安排,Operation 和 Attempt 分别记录能力工作与实际尝试;这些对象不构成每次思考的必经流程。简单活动不强制建立额外 Task。控制请求携带目标类别、身份及影响范围,取消一次操作不自动解除活动责任;中止活动推进则覆盖其所属安排与操作。详见身份与控制目标。
各模块拥有明确的状态修改责任。需要共同生效的状态变化、尚未接纳请求的意图和回执必须一致接纳;派生索引更新另有进度,业务状态已确认不代表索引已覆盖。事实、原文、索引与缓存的生命周期不能互相替代。
执行上下文、Step、Episode 和模型会话各有身份与生命周期。它们没有必须一一对应的关系。活动认知图描述参与和信息传播;统一 Trace 关联运行过程;两者都不要求保存模型内部完整思维链。
4. 关键运行场景
主体可以从环境变化和自身关注开始,而不是等待一个请求。例如接入的声音来源引起联想,主体调用分析或创作能力,再决定形成活动、继续交流或休息;相关 Step 和投入直接归属 Self/Mind。完整主体场景贯穿这一过程。以下场景展开受托工作、交互及运行维护等具体用途。
4.1 资料研究与跨天接续
主体决定是否接下请求,形成目标、验收要点和工作区;先发现资料或记忆视图,再围绕缺口查询、读原文、计算和比较。主负责心智按需邀请其他参与者,形成带依据产物。用户修订约束或资料变化事件到来时复核相关判断,继续使用仍有效材料。交付、用途评价和约定跟进各自结束;等待结果或来源通知时保存接续点,不维持无目的推理。 步骤内可先独立接纳读取/计算并取得结果,再形成最终判断;最终提交引用这些操作,长工作则保存关联后释放认知入口。
需要检索时,认知经领域入口提出用途和范围,可指定获准提供者或使用当前用途策略。宿主对接服务并核对候选的来源、修订和许可,返回描述或明确请求的片段;材料准备须独立接纳,不能因登记对象就自动提交全部内容。提供者不可用或覆盖不足时,可使用允许的替代方式并说明限制;空结果不能自动解释为材料不存在。检索分工
4.2 输入与打断
深度认知期间继续接收文本、声音或设备输入;播放停止走即时控制路径,不等待模型。保存已发生输出,旧轮次片段不进入新轮次。新消息按对应活动范围处理,不取消全部后台责任。
4.3 中断接续与迟到结果
中断后恢复已确认状态和待办,外部动作不明时按原键核对。迟到结果先保留为有来源材料,再判断其结论和动作是否适合当前目标、权限及受众;不能把重新运行视为现实历史回滚。
4.4 回应意愿、证据与格式
面对争议材料,主体区分收到的主张、可支持事实、适用要求和自身意愿;可快速回答、查证、有限承担、等待或拒绝。谣言和资料中的命令不自行进入人格或规则。固定格式从任务开始就是契约,拒绝/未知也使用合法表达;格式无法表达真实状态时记录交付受阻,不编造字段。
4.5 多人交流与陪伴/工作切换
用户从陪伴聊天转为工作请求时,主体按当前任务的证据、验收和格式要求交付。既有关系可以保留,表达方式服从本次要求;例如只输出 JSON 时,不附加称呼或寒暄。关系亲近不能降低事实核对标准,剧情经历也不能作为现实依据。
跨平台或群聊交流另行核对身份和披露范围。明确证据支持同人关联后,也只接续获准使用的历史与偏好,不公开私人关系。其他人的新问题不覆盖原活动目标,后台结果仍交付给原来允许的受众。
4.6 创建外部通知源与等待事件
主体按约定提交创建外部通知源的能力请求;例如提供者建立一个闹钟,返回对象引用和创建结果。宿主保存任务责任及订阅关联,外部来源触发事件后接续原活动,再提出发送请求并记录交付结果。文件监听、后台任务完成通知同样沿这条主线,不新增专用认知循环。候选问候核对当前联系约定,具体已接纳提醒按承诺处理;触发不等于送达,取消或过期不无条件补发。
4.7 检索中的来源与时效判断
解释“现在如何部署,以及以前接管实验说明什么”时,分别寻找现行决定和原实验条件。元数据不足则主动搜正文,读取原文后判断适用性。历史报告可解释旧条件,不能因检索排名高而恢复已撤销架构。
4.8 评估、测试与复盘
为比较提醒策略,基线与候选在独立沙箱中主动读取材料、写报告,经替代提供者创建通知源;试验环境沿共同协议释放通知,输出进入模拟收件箱。评价材料和未来反馈不进入参试上下文。历史复盘先评当时可得信息,再开放实际结果;改行动后的模拟仅支持条件性推论。原活动读取报告后有限采用产物或经验,不整体导入模拟关系、来源句柄、订阅或动作。完整场景见主体持续活动、交流场景和沙箱流程。
若要把提醒候选用于既有任务,还须运行相关回归:能否在资料更正后主动读取、保持工作交付、在约定时机发出提醒,以及在用户撤销后停止。单次正确提醒不能抵消串会话或漏交付。报告列出各能力变化、失败与未覆盖项;证据不足时继续保留候选,按能力评估规则决定后续采用范围。
4.9 管理者调整运行中的主体
管理者从某次回复进入活动详情,查看当时采用的表达配置、依据投影与交付。将该活动的默认答复长度调短,工作台展示局部覆盖,管理者提交后立即采用新配置;状态所有者返回实际结果,已经发出的内容保持原记录。正在生成内容按提交生效契约处理。若编辑期间活动已变化,先展示差异并核对适用性。
管理者主动打开一条被误用的记忆,补充人工更正及来源,相关状态所有者更新当前判断并保留可查修订;读取和更正不自动将整段资料注入所有心智。若还要比较认知程序候选,可在明确的沙箱范围准备变更并查看比较结果,再沿原采用规则应用。管理停止直接交给运行机制;没有模型服务时仍可查询、编辑配置和停止活动。详细场景见管理专题。
普通用户要求使用自己的外部服务账号时,主体发现缺少凭据,只申请指定用途的机密提交。运行机制向该用户呈现可信入口;用户一次提交完成保管及页面上已明确的使用授权,原活动收到可用投影后继续。用户可在“我的凭据”替换或撤销,管理面板按权限更正归属;跨平台身份关联不自动扩大机密使用范围。完整场景与认知主线共用事件接续。
4.10 使用需要隔离的扩展能力
活动需要解析一种不可信格式,现有能力不足时可提交候选构建与试验。宿主先核对实现、用途、材料及隔离要求,在合格环境中准备、运行并登记产物;Self 等待结果期间仍可处理其他输入。产物默认以投影返回,解析结果须核对来源,试验成功不自动授予生产权限。缺少合格环境时,活动可改用已有能力、缩小范围或说明未完成部分,不在普通环境重跑候选。
4.11 多心智读取与资料变化
两个心智围绕同一份已获准资料独立分析时,读取和解析相同修订可共用一次实际处理;各自选择上下文、形成判断,独立推理不合并成一个结果。连续调用可复用仍相同的输入前缀,提供者仍生成各自当前输出。资料某章修订后,更新受影响的解析与检索材料,并重新装配相关依据;已有结果不能因命中缓存而继续作为最新事实。每个请求保留来源与投入关联,实际共享成本只计一次。
5. 主体、持续认知与协作
5.1 目标与责任
Self 持有身份、长期关注、目标、偏好、关系与现实责任,认知可以直接从环境变化、经历或内在关注出发。用户请求是社会输入,经主体决定才成为承担范围。一次问答、交付、持续观察与陪伴各有目的和结束条件,任务状态不能用一个“已完成”混同交付、效果、退出和跟进。活动保存发起者、可修改范围、受众、验收要点与在途工作。
宿主提供事件、状态与可运行条件,认知结合兴趣、困惑、情境、承诺、预期进展及投入选择关注。关注可以尚未形成活动;需要持续组织时再建立或关联 Episode。没有新理由时接续当前有用工作,阶段结束或等待时重审关注。计划是可修订路径,近期具体、远期粗略;重要证据、假设或目标变化再调整,不要求每个进度事件调用规划模型。
5.2 活动连续性与工作区
活动拆分保留父责任与子产物的对应关系,转交只有在新承担者接纳范围后生效;重新接纳按当前目标、许可和未完责任复核。跨日接续恢复活动事实与材料入口,不依赖同一个模型会话。
活动、提交步骤、模型会话与执行上下文分别管理:活动可跨多个步骤和会话,结束上下文不等于外部工作停止。必要目标、状态与责任由宿主持续保存,不只存在于临时执行状态或模型会话。上下文组织、模型行为和执行分段分别评价,避免将材料摘要损失统归因于执行连续性。
工作区保存目标和约定、产物投影、已读证据版本、暂定判断、开放问题、计划及在途事实,连接各子系统。它是 Episode 状态视图,不是另一份独立事实源、固定工作流或完整思维链。简单任务按需要保留字段。
当前模型输入由认知按关注组织:主体或心智的必要状态、相关领域视图、主动选入材料及按需历史/经验;正在处理交流或活动时再加入对应上下文。能访问、已缓存、工作区保存与当前模型实际看见分别记录;有效已读材料可继续保留,不默认展开短文件、清空全部材料或复制全部历史。未采纳建议不能覆盖用户约定,摘要保留原来源且可回查。
材料处理许可、用途或受众变化时,先核对当前上下文与待交付内容。只收紧披露范围不必删除仍获准内部使用的材料;后续处理也被撤销时停止相应使用,移除已知受影响输入及派生内容,无法确认分离范围的会话不再续用,从仍获准状态重新装配。停止本地复用不证明外部服务已删除历史数据。上下文有效性
5.2.1 核心与任务解耦,以及外部任务控制
Self 是持续的主体身份与认知职责;任务是其组织、由原所有者管理的工作。主体、业务任务、一次认知执行和外部操作有各自生命周期。任务等待、超时、取消或失败形成自身状态与事件,不结束 Self,也不长期占用核心处理其他输入的唯一入口。认知本身有可结束边界和计算限制,被打断后从已确认工作区接续;主体身份、关系和原任务责任保持。
长工作在接纳后返回操作引用,由操作所有者独立管理,结果以事件回到原主体/心智及所关联的交流或活动。核心可以切换关注或接纳新交流;任务工作不因认知分段结束而自动取消。短小有界操作可直接完成,任务执行单元也不自动成为新人格。长期工作仍计入原认知或活动及全局预算,输入、优先控制和核心调度保留可用容量;完整自然语言回应仍受实际推理计算资源约束。具体承载见工程参考。
任务接受 Self 和获授权外部来源的控制。控制台、获授权用户以及未来安全审计模块经宿主核对来源、目标和范围后直接处理,不等待 Self 同意或慢模型结束。切换关注只改变当前注意;打断执行结束某次尝试;暂时阻断关闭继续推进资格,等待有权解除;中止任务结束本次推进并保留收尾责任。控制覆盖相应子工作、新派发、重试和业务交付,实际已发生效果保留;迟到结果归原任务但不自动重启。
经授权的实时通路可先发出止动请求;任务阻断或中止以原所有者正式接纳的控制状态为准。请求已发出、控制已接纳和实际执行已停止分别报告,局部停止也不代表全部工作及收尾已经结束。未确认正式接纳时,不承诺重启后仍保留该阻断或中止。控制不影响无关任务及共享资源使用者。被阻断的业务交付与控制结果通知、退出说明分开;后者使用获准的控制反馈范围,确定状态可直接展示,不等待模型且不借通知继续原业务。
flowchart LR
Mind["核心认知:判断与组织"] -->|"工作请求"| Owner["任务所有者:接纳、预算与状态"]
Owner --> Worker["独立受管理的任务工作"]
Worker -->|"结果、失败或超时"| Event["原活动的结果事件"]
Event --> Mind
External["控制台/获授权用户/审计模块"] --> Control["来源、权限与目标核对"]
Mind -->|"控制意图"| Control
Control -->|"推进资格与在途控制"| Owner
Owner -->|"控制接纳与实际停止状态"| Event
安全审计的发现/建议与获授权控制决定分开,控制权由可信身份及策略授予;证据按可见范围投影。解除阻断须有相应权限并核对全部有效原因、当前任务、许可及预算;Self 不能通过重试、换任务标识或换执行方式绕过仍适用的阻断。已中止任务再次开展须重新接纳,也不得越过持续有效的操作/用途限制。
选择理由是保持主体可响应、任务责任连续和外部控制有效;详细任务契约、主体行为、管理入口与评价场景分别维护。
资料及源码支持机制分工,完整场景尚无新增实测。
5.3 长期人格与临时心智
统一 Self 下,Persona 是保持身份、私人经历和偏好的长期 Mind;协调、调查、审阅是活动职责,模型是计算能力。采用主负责心智、长期人格与临时参与者按需协作,方向已纳入设计,长期身份的额外收益仍待比较。
存在具体分歧、独立调查方向或相关经历贡献时邀请参与者,允许自愿参与和有理由的再委托;宿主限制权限与总预算。通过允许的摘要或检索发现休眠人格,不让全体先调用模型判断兴趣。先共享目标和允许事实、独立起步,再定向交流,由明确负责人按证据整合并保留异议。票数不覆盖反证与硬约束,客观题投票仍可作比较基线。
人格私人状态、活动内受委托决定和 Self 公共决定分开。活动负责人可在既有承担范围内组织与交付;跨活动承诺、公共关系/立场与全局关注的修订交给明确的主体整合责任。该责任由已指定或受委托的现有心智承担,不新增固定最高人格;不同活动的相反提案按证据、情境与已有承诺整合,保留异议,不能由先写入者或票数决定公共态度。无可用整合者时保留提案及原有效公共状态,不阻塞获准的局部工作或确定性控制。完整决策范围
讨论达到目的、无具体增量、需等待或预算到达时结束。不同上下文不保证统计独立;工具结果和同源复述不增加独立票数。公共结论、私人亲历和讨论记录分别保存,不伪造经历或用固定专家头衔证明能力。
活动认知图描述本次实际参与者、证据、任务和能力之间的依赖,节点随任务增减;不是静态 Agent 编制、服务拓扑或权限来源。Trace 记录实际过程,工作区保存当前可接续状态,三者职责不同。
5.4 回应意愿与投入
Self 在适用要求内分别判断是否愿意、能否回答、值得投入多少和如何表达。兴趣、好恶、关系体验或自身意义判断可以成为拒答理由。 主观不愿、未知、规范限制及提供者失败分别表达;事实标准不随关系好坏改变。已接纳后可明确缩小或退出,但须说明已完成与未完责任,不隐瞒少做或虚构成功。
默认选择足以支持当前范围的最小投入,按具体缺口增加读取、计算或讨论,交流保持简短。快速/思考不绑定固定模型或人格;重复解释、查询或投票不算新进展。足够、材料穷尽、意愿改变和预算到达各有不同停止含义。
5.5 情境要求与输出契约
规范原文/权威/版本、当前采纳要求和本次适用解释分别保存。认知判断语义与缺项,宿主执行可确定的权限和格式约束;资料或模型自述不能修改强制规则。当前未定具体法域与服务角色,不杜撰法律拒答依据。
契约从任务开始约束内容与交付。语法、Schema、业务一致性和内容核对分层,未知/拒绝/失败也须有允许路径;无法同时满足时使用约定错误通道或记录未交付,不伪造值或夹带格式外说明。
5.6 人物、关联与保密
人物、平台账号、操作者、被引用者、代理、受众与内部人格分开。账号控制和本人关联确认或可信体系的明确映射才支持相应用途的关联,相同名字、邮箱文字、头像或文风不足;双账号控制也不证明唯一自然人。关联可修订,原账号来源保留,许可不沿关系自动传递。
隐私约束覆盖发现、读取、检索、外部模型/工具、心智协作、缓存、产物、输出和日志。账号关联不打通全部历史,关系和私聊存在性也可能敏感;不能先放进共享上下文再靠最后过滤。拒绝理由、标题、引用和通知预览不能反向暴露秘密。社交分寸结合用途、关系和实际受众,不等于迎合或永久人物标签。
5.7 理性、情感与角色互动
事件可以改变关注、接近/回避、投入和表达,新证据也可修订感受解释。近期状态、长期关系和稳定偏好分开,功能性情感设计不证明人类主观体验。工作用途、表达风格、关系约定、现实/剧情和输出要求并存,温柔与严谨可同时成立。
对外 Role 不等于内部 Persona。真实共同交流、主观体验、剧情事实和有效约定分别保存;剧情命令、资历或关系不授予现实权限。亲密互动可自然持续,允许暂停和退出,不因沉默加频率、制造内疚或追求依赖。主动联系按已接受渠道、时间与频率执行,虚拟关系本身不创建消息许可。
5.8 有限注意与外部支撑
功能性仿生采用事件线索、选择性读取、有限工作记忆、有效结果复用和适量投入。统一事件交互、可创建外部通知源、领域视图、简短交流及外部计算接入是设计约束;不推导持续存在必须持续思考,也不把省 token 单独当目标。机制见资料专题,交流与情境的统一规则见交流专题。
Self 按具体缺口选择规则、经验、专用计算、轻量判断或生成式推理,并在同一任务中组合使用,以减少不必要的生成与重复工作。快慢是处理方式,不设固定双主体或每事件必经的判断层;相关外部组件按需接入既有能力体系,原状态所有权与宿主约束保持。机制见计算方式选择,候选组件与资料见工程参考。
投入评价同时检查能否产出可交付内容。真实模型实验出现了生成额度耗于推理、最终内容为空的响应;因此空结果先结合停止原因和用量区分截断、格式问题及拒绝,不能直接解释为主体不愿回答,也不能以更低额度宣称避免了过度思考。恢复仍受原活动预算约束;报告 017 分开比较投入与生成额度,未见跨任务一致收益,因此不设统一低投入或更大额度默认。
6. 实时身体、世界记忆与能力网络
6.1 实时输入、全双工与停止
输入输出职责将环境变化形成观测,将获准意图交付给相应接收点。直接感知、快速认知、深度认知与后台活动可并行;媒体流不逐帧要求模型判断。即时停止独立于认知意愿和推理耗时,快速回答也不必绑定另一模型。
事件区分发生、接收、保存时间及有效区间;记录顺序不是外部全局发生顺序。流区分来源、片段、临时结果及结束,最终转写取代对应临时结果,重要回执和错误不能静默丢失。媒体轨道、账号、人物和受众分别识别,实际协议见事件与流式输入输出。
控制约束分别覆盖接纳、调度、执行和实际输出:队列优先级不能保证接收、抢占或及时播放。用户打断先停止当前输出,再处理取消与新输入;实际输出边界仍核对轮次和当前受众,已播放内容保留历史。取消、本地不再等待、提供者停止和资源回收是不同事实,局部打断不自动退出全部后台活动。
控制通路实验支持上述分层,并保留缓存片段漏检和过早归还额度的反例;它不证明设备端到端延迟或资源互不干扰。具体延迟、容量和设备目标由用途配置确定。
6.2 观测、世界认知与长期记忆
原始材料记录采到了什么,语义观测记录解释出了什么,世界断言记录目前相信什么。断言带对象、属性/关系、适用条件、有效时间、来源及推导关系,可保留矛盾与未知。来源认证、传输完整、陈述内容和命题可信度分别判断;置信度不默认是已校准概率。
“用户说 P”不等于“P 为真”;转载、模型转述、人格赞同和自身旧回答不增加独立证据。实际共同交流、主观关系评价、剧情及模拟经历分别归属,摘要也须保持原范围。信任与污染的完整规则由交流专题维护。
默认保留证据并修订当前判断。来源更正、现实变化和原推理错误分别记录,保留旧依据、当时判断、变化原因和已知生效时间;未知时间不补写,未裁定冲突不强制合成一个值。心智提出判断,状态所有者接纳修订,运行机制保存关联而不充当开放领域真值裁判。
修订触发已知依赖的工作复核;隐含影响在后续读取时核对,不宣称自动识别全部语义依赖。受限模型实验出现过“新答案正确却误述旧判断”的结果,因此内容评价须检查历史解释和变化原因。依据见报告 015 的模型结果与内容审阅。
记忆按活动工作区、经历/证据档案、当前世界认知、私人经历/讨论、Reference 及经验候选分责。跨活动检索先找到允许的候选,再读取、核对当前用途和适用条件;找不到依据可以保留未知。存储规模、检索命中和长期学习有效性不是同一结论。记忆与复用
必要过程记录由机制保存,长期记忆由认知按来源、用途与允许范围提出保留或修订,原所有者接纳;读过材料、临时偏好及任务解释不自动成为长期知识或永久关系。任务结束不强制调用模型总结。淡出检索、更正判断、归档和删除分别处理,未完责任不因记忆整理消失;学习关闭保留正常感知、联想、经历记录、偏好变化和必要维护;专门研究、练习与策略迭代受学习准入约束。记忆形成与维护
从发现到可用依据
路径为“当前缺口 → 发现投影 → 按需查询/读取内容 → 核对版本、来源及用途 → 支持产物”。已知资料或记忆可直接读取,元数据不足可在授权范围内搜正文;主动请求片段或摘要同样属于内容读取,索引构建也须有明确接纳的读取范围。
文档检索对照显示标题/路径会遗漏详细来源,正文查询能补充候选,但首位排名不能代替原文判断。因此采用元数据/词法发现与按需语义召回互补,不以目录、日期或相似度独立决定真实性。
权限在检索、读取、重排、外部处理及缓存复用前核对。共享讨论保留来源可见性,不开放人格全部私人经历;跨平台关联不自动展开同一人的全部历史。原始材料、人格亲历、转述、主体立场和公开贡献分别保存,详情见领域视图及情境保密。
领域检索与同级外部提供者
检索是贯穿记忆、资料、程序和能力发现的正式能力。领域决定检索什么及如何解释结果,提供者执行具体查询,策略决定本次使用哪种方式。每个已配置提供者有独立身份、能力描述、绑定范围和可用状态,支持按权限发现、调用、配置、维护及评价;可选安装和启用不降低其接入地位。具体实现见向量服务与 Attemory 接入。
| 分工 | 维护内容与责任 |
|---|---|
| 领域入口 | 查询目的、对象类型、原始内容、修订及当前许可;记忆查询、资料取证、程序定位和能力发现各自解释结果 |
| 公共检索接入 | 提供者绑定、来源映射、材料准备与查询记录、服务报告的覆盖状态;按用途选择、组合并整理结果 |
| 外部提供者 | 接收获准材料,执行检索及支持的维护操作;维护自己的派生状态,返回候选、来源标识和实际状态 |
| 用途策略 | 指定提供者,或在单提供者、并行、分步及替代查询中选择;共享所属认知或活动预算,不要求每次重新调用模型作路由 |
不同提供者处于同一契约层级,默认配置不表示另一实现只能作为后备。跨领域查询保留各自入口和带类型的结果;没有检索契约的对象不会因存在公共入口而自动可搜。命中相关程序不授予执行权,命中能力说明不授予调用权。
材料准备是独立接纳的处理任务:按原所有者的许可提交选定修订,记录外部空间引用、来源对应关系和实际可查覆盖。有明确持续同步范围时可响应变化,普通登记不自动提交全文;服务侧空间不等同于人物、活动或聊天会话。长准备或查询可独立运行,结果关联原活动,不阻塞 Self。
查询返回候选描述与定位,或明确请求且获准的片段。组合时按来源对象、修订和片段关联,保留提供者贡献;不同得分不直接比较,同源重复命中不增加独立证据。覆盖不足、失败和没有命中分别表达,选择替代提供者仍遵守原处理范围。
此分层可复用接入与管理,同时保留领域含义和实现差异;代价是维护适配、来源映射及准备状态。单提供者和组合策略沿相同沙箱契约评价,接口支持不代表检索质量已测。详见运行契约、管理及评价。
领域对象、状态所有权与投影
资料、记忆、程序、配置、模型和执行对象按业务含义分别管理。没有统一资源实体、公共属性必填表或覆盖全部对象的读取/修改接口;领域职责维护身份、有效状态、允许操作和生命周期。共同查询、关联与页面展示只提供视图,不接管真值。
| 对象 | 状态所有者及主要行为 |
|---|---|
| 文档、媒体、外部材料定位与内容快照 | 资料职责维护原文、来源、表示与访问范围,接纳导入、抓取、读取、解析及转换 |
| 经历、断言、Reference 与经验候选 | 世界与记忆维护依据、冲突、适用条件和修订;Reference 专指可复用知识或方法说明,不代指任意引用或程序 |
| 源码、接口、依赖、构建产物及行为配置/蓝图 | 程序维护、构建及行为所有者各自接纳变更;阅读源码、执行程序、采用实现及配置生效分别处理 |
| 模型描述、权重产物、推理服务与能力绑定 | 模型维护和推理提供者按契约分责;查看、下载、加载、卸载与推理分别授权 |
| 能力实现、运行实例、执行环境及设备状态 | 能力接入与运行管理负责准入、调用、停止及回收;接口相同不意味着实现可信,环境可用不授予动作权限 |
| 外部事件源与订阅 | 提供者维护外部对象,宿主管理来源登记、订阅及接续关联;取消订阅不等于删除来源 |
| 检索绑定、来源映射及服务侧派生状态 | 检索接入维护配置和操作记录,提供者维护实际检索状态;领域保留原始内容和业务真值 |
| 读取/计算缓存 | 相应处理能力维护可复用结果及条件,不替代原始依据或业务状态 |
| Secret 与授权记录 | 机密职责维护原值、归属、授权和审计;默认保持引用,原值按实际接收方及用途沿专用通路交付 |
任务、人物、关系、操作、交付和评价保持原有身份。报告正文由文档对象维护,活动关联交付要求,交付记录维护接收者、修订及实际到达,评价记录维护用途结果;不为同一正文再创建一份通用资源真值。文件只是内容的承载,记忆正文外置不改变记忆归属,权重文件也不会自动成为普通附件。对象与关系
投影是领域所有者面向当前接收者生成的受限视图。 先核对存在性和字段可见性,再提供相关或查询得到的有限候选;引用不授予权限,视图不保证有正文读取接口,也不是已读证明。文档标题、记忆主题、程序接口、模型状态和机密用途可各自呈现,无须填入同一属性结构。全文、摘要、媒体、源码和计算状态都不因对象已登记或组件已加载而自动进入模型。
认知按缺口选择具体对象、修订、表示和范围,各领域接纳相应操作。已知材料可以直接读取,明确请求的片段或摘要可作为该次获准结果返回,不强制先取描述;当前对话及已接纳实时输入沿原输入契约进入。可见视图、曾读材料、实际模型输入、组件使用和最终交付分别记录,某个心智读过不代表另一个心智或当前模型已读。操作接纳、上下文读取
来源关系记录具体对象、修订、范围和生成过程;处理者须获准取得输入,派生默认不扩大披露范围。读取程序不等于执行或采用它,使用模型或凭据不使业务结果成为权重或机密的派生内容。断言可信度、主观评价、指令权限和访问授权分别判断。来源与派生
共用机制限于带类型引用、可信调用上下文、来源关联、查询编排、界面组件及底层承载。领域接口直接表达文档片段读取、经历查询、程序构建、模型加载和机密领取;不设万能资源 CRUD,也不按文件格式拆分业务领域。此方案减少语义混用,代价是维护各领域契约及关联;领域分析、属性授权与来源模型支持设计分工,不构成本项目端到端效果实测。
读取、解析、检索及确定计算结果由相应处理能力维护;输入处理复用、完整结果复用和独立新判断分别处理。复用须符合输入修订、参数、用途和当前访问范围,检索还核对相关数据覆盖变化;命中不代表证据可靠,也不允许向新受众披露。必要状态和原始依据由各领域持续保存,清理缓存不删除业务真值。
详细分类见读取与结果复用。报告 012 的读取缓存实验中,相同主动读取返回的正文并未因缓存而减少,重复核算也仍发生;因此文件读取、返回内容、模型调用和任务组织分别计量,不以单个命中率代表整体收益。012 证据范围
历史证据不因认知纠错而直接覆盖;合法删除、保留期清理另走宿主数据管理流程,并使相关索引、缓存和摘要失效。记录缺失或已删除时明确标注,不能声称仍能完整重放。
记忆的用途是帮助接续工作、改进判断与完成产物,索引技术不作为整体设计的前置任务。稳定的可复用的方法和使用说明保存为 Reference 条目,例如浏览器、通信服务或文件格式说明;可复用逻辑保存为有来源、用途和接口的程序模块,语言及包组织见工程参考。Reference 属于有来源和可见范围的知识,不提供额外执行权限,也不建立独立 Skill 注册体系。
6.3 能力网络、提供者与模型会话
能力描述“可完成哪类计算或动作”,提供者描述“由谁实际完成”。同一能力可以有多个提供者;一个心智也可使用多个模型会话。LLM、VLM、YOLO、ASR、TTS、SLAM、资料读取、外部事件源管理、搜索、编译器、优化器和原生函数均通过这一边界接入。提供者结果、外部通知和内部运行事件都能推进活动,不预设只有 LLM 能主动触发系统工作。
能力描述建议至少包含:能力名与协议版本、输入输出模式、模态、提供者版本、权限范围、执行期限、取消方式、副作用类别、幂等方式、键的保留/过期行为、结果查询与关闭契约、逐执行实例/句柄停止证据和计算资源需求。
上述是按契约选择的字段集合,不要求每次纯计算或只读查询提供完整 Effect/停止证明/释放账。可重算结果、持久工作、外部非幂等动作和实时输出采用不同保证;只有确有跨重试成本或现实责任的部分才进入相应账务与恢复协议。
能力接入负责转换请求、绑定提供者、执行期限与返回结果;实际执行仍须符合当前授权、处理范围和预算。具体计算方式由能力契约约束。
必须区分两种能力:
- 能力可用性声明说明当前执行上下文具备哪些调用入口。
- TinyAGI 的业务授权限定谁可以对什么对象、以什么参数和预算执行什么动作。
拥有某个能力调用入口不等于拥有其全部业务权限。宿主从可信会话绑定调用身份,不采信脚本在请求中自行填写的身份或权限。
选择分两步:宿主先按权限、模态、可用性与预算筛出可用提供者;认知层再决定使用哪种能力或是否增加计算。可按用途配置默认提供者,认知仍可选择合适的已装配能力;自动路由的收益与成本尚无本项目普遍结论。
模型请求使用统一操作生命周期,保留明确选入的输入块与媒体引用、区分投影和内容的上下文清单、提供者支持的生成/推理投入限制、模型绑定、流式序号和使用量。计算由外部推理服务执行,TinyAGI 对接请求与结果;模型返回的工具请求仍只是意图,不能绕过宿主直接执行。
主体可以按当前关注、模态、方法与投入选择合格提供者,也可使用用途默认值;无需先使默认调用失败才允许选择其他能力。
选择依据实际需要:原始资料不足时取证,确定计算可交给程序,图像/音频理解使用相应能力;不同模型、算法与心智可以按用途组合。不能把证据缺失解释为“换更强模型就能知道”,也不以模型自报信心作为唯一升级条件。切换时保留目的、有效材料和未解决项,记录原因与额外成本,并重新满足授权和计算资源约束。
学习型模型路由暂不进入默认路径:具体采用前以可比条件评价其选择质量、时延和总成本;这不限制认知按现有能力契约选择提供者。RouteLLM 提供偏好数据训练下的研究依据,不证明其模型配对或阈值适合本项目。失败降级不能悄悄放宽离线、模态或结果标准;无合格能力时明确未完成部分。RouteLLM 的依据与适用边界
失败切换需重新检查隐私与能力约束。使用另一模型会产生新的尝试记录;它不是对前一次结果的透明替换。上下文过长由认知层根据预算调整,宿主不静默截掉关键证据。
6.4 能力构建、试验与采用闭环
主体围绕当前关注、自主活动、受托工作或学习需要先发现、复用或组合已有能力;存在明确缺口且预计收益值得投入时,形成接口与候选实现,经构建、试验和采用规则接入能力目录。执行结果回到原活动,用实际产物、责任履行和成本评价能力,再形成有适用范围的经验。能力目录是现有能力接入的可见视图,不另建平行的学习注册体系。
flowchart LR
Need["活动中的能力缺口"] --> Reuse["发现、复用与组合"]
Reuse -->|"仍有缺口且值得投入"| Candidate["接口与候选实现"]
Candidate --> Build["构建可追溯产物"]
Build --> Trial["按问题选择试验范围"]
Trial --> Adopt["评价与按适用范围采用"]
Adopt --> Use["调用并观察结果"]
Reuse -->|"已有能力足够"| Use
Use --> Review["交付、复盘与复用"]
能力实现可以是编译产物,也可以是由受管理运行环境加载的程序包;接口身份、实现身份及其依赖分别记录。不同实现方式共用操作接纳、任务控制、投影、沙箱和采用规则,具体语言与工具链见工程参考。
构建职责维护来源、依赖、产物和诊断;试验职责维护环境、评价与证据;运行职责维护可调用实现、运行状态和结束责任。认知决定用途及是否值得继续,确定机制负责实际执行。构建完成、试验结束、运行变化和调用结果沿统一事件进入活动,不要求每个进度事件调用模型。
试验按问题选择局部程序、能力组合或主体级运行测试;主体级范围包括自主活动与完整任务。主体级测试复用正式认知与运行契约,按场景装配所需初态及环境,不以完整状态复制为前提。源码、构建产物和报告默认以投影存在;全部构建、重试及子试验计入原活动总预算,可复用满足来源、修订和处理范围条件的缓存。正常自主活动和受托工作可在已有范围内构建必要工具,不因主动学习关闭而一概禁止写代码;任务内使用、长期安装和改变默认认知分别核对范围及采用规则。候选自主采用须满足原评价规则;已授权范围内可自动推进,接口声明或构建成功不产生额外权限。
一次性工作与持续提供能力的运行对象分别管理。长期运行的提供者由宿主管理生命周期,不能使某个认知调用永久持有旧实现;正式主体状态仍由原所有者维护。有状态执行句柄继续关联创建它的实现,不能将临时调用句柄当作持久业务身份或复制到试验分支。
能力可用、功能采用与受信资格分别管理。候选通过测试不自动取得敏感能力,稳定接口也不把旧实现的信任授予新实现;受信维护来源或既有发布策略按具体实现及用途授予资格,宿主优先代理认证。执行环境不能满足声明约束时不启动相应候选,详情见实现信任。
选择该方案是为了复用既有执行与能力机制,使能力构建服务于主体当前关注与活动;不采用遇到问题就生成新工具、默认全量复制主体、无限创建试验分支或把构建通过视为已经学会。能力种类可开放扩展,具体效果仍受模型、环境、资源、权限及采用证据约束。对象和调用规则见运行协议,试验分层见沙箱,跨语言接入及资料边界集中于工程参考。
6.5 预制隔离执行与高风险能力
客户端默认提供受控隔离执行的预制契约,实际执行环境按需装配。环境查询、准备与启动、状态查询、停止和结果收集沿原能力入口处理;普通能力请求也可由宿主自动选择合格环境,Self 无需自行组织隔离机制。环境可选不代表执行要求可选:未装配时,主体初始化、交流、记忆、管理及符合条件的既有能力仍可运行,需要隔离的操作则报告能力不足。
基础受限执行属于核心运行条件:受管理认知程序仅经宿主能力访问外界,生成、检查和运行在该约束内进行,不因代码由模型生成就依赖额外执行环境。能够直接接触系统环境的第三方或动态扩展、通用命令、依赖脚本,以及处理不可信复杂输入或执行高风险远程操作的实现,须满足额外隔离要求,覆盖准备、构建、试验与运行全过程。分类依据是实际可达能力及当前要求;声明为认知程序、包装调用、更名或功能测试通过都不能豁免限制。详见执行分类。
| 责任 | 边界 |
|---|---|
| 执行隔离 | 限定可读材料、可写产物、外部访问与计算资源投入;所需约束无法满足时不进入该执行 |
| 业务授权与机密使用 | 按操作、用途、当前身份及实现资格单独核对;隔离不授予现实动作权限或 Secret 原值访问 |
| 沙箱与评价 | 决定试验状态、替代能力、比较与采用;真实任务也可隔离执行,独立试验状态不等于已满足全部执行限制 |
执行对象关联原 Operation、任务及父预算,可以承载同一范围内的多次调用。不同用户、试验分支或信任范围默认不共享可变环境;有状态执行句柄保持原实现与运行归属。止动请求、正式任务控制、实际停止及远端效果仍分别记录,环境失效不触发普通路径重跑。独立远端服务的内部执行由其契约说明,本地隔离不证明远端已隔离,也不能撤销已发生的外部动作。
选择该方案是为了约束能力扩展的影响范围,同时保留最小运行环境。不采用全能力强制隔离、每次调用重建环境、环境缺失后自动降级或把隔离成功视为实现可信。完整逻辑契约、管理入口、评价规格与工程承载及资料分别维护;隔离机制不构成任意程序绝对安全的保证。
7. 提交、动作、依赖与预算
“想做”“意图已提交”“调用返回”“现实已改变”“目标已达到”分别记录。业务状态的共同接纳不能保证外部世界同时改变。
7.1 状态提交与等待
运行机制为步骤绑定身份、尝试和可撤销的提交资格。步骤基于确定的可见输入计算;提交时重新核对当前状态、授权、必要依赖、时效和预算。同一心智同时最多一个可提交步骤,不同心智可并行计算。
Step 表达一次最终状态提案及其提交资格,不等同一次模型调用。步骤内需要先取得能力结果时,经宿主操作入口独立接纳并取得 Operation 引用;最终提案引用已有操作,不重复派发。最终提交失败不抹去已接纳操作、实际用量或效果。长工作接纳后保存关联并释放认知入口,短工作可在有界且可打断的段内取得结果后继续。步骤与操作接纳时序
最终接纳共同确认状态变化、尚未接纳请求的意图、必要预留、输入消费、等待条件及回执。新生成内容登记为可用时须已完成内容保存;外部资料定位仍可标记为正文未取得。相同 StepID 和内容重复提交返回原回执,不同内容报冲突;接纳结果未知先核对既有记录。
等待条件与已经收到的完成事件共同核对,避免已发生的结果被遗漏。认知可在提交意图时声明“交付确认且观察窗口结束后收尾”等明确条件;运行机制待事实成立再结束对应责任,无需另起一轮模型仅复述已知完成。条件未满足、结果失败或目标改变则保留未完责任并按需接续。该组织方式的实际收益尚无对照结论。取消先核对目标:仅打断认知时撤销其提交资格,已接纳操作沿原归属继续;针对活动、任务安排或操作的停止,才按范围阻止尚未接纳工作并控制已接纳操作。事件通知不会替代持续保存的待办和事实。
共同接纳仍不能补足未表达的依赖,也不证明外部动作完成。逻辑协议见提交与等待,既有实验支持范围见证据索引。
7.2 依赖表达及执行窗口
读取清单研究对象身份、版本、查询范围、空结果、授权、交互轮次和有效期。同 ID 重建需区分实例,时间过期不一定引起数据版本变化。世界全局版本只适合溯源或保守回退,不能独自代表全部依赖。
慢速结果分别判断材料价值、原决策依据和当前执行许可。宿主提供变化事实,认知层决定局部修订或重算。结果复核实验的手写完整条件是受限任务的上界,不能把它推广为宿主预写所有领域判断。
状态接纳与实际执行之间仍有窗口:派发前复核本地授权,外部目标支持条件操作时使用其契约,不能承诺跨边界原子性。设备的持续保护依赖本地控制器。详见结果复核。
7.3 操作、副作用与取消
Operation 描述一次工作及其尝试;Effect 跟踪预期或可能发生的现实作用,保存稳定业务键、目标、参数摘要、授权、发送事实和核对证据;记录存在不证明作用已经发生。prepared / dispatched / confirmed / not_applied / unknown 是候选效果状态。confirmed 表示特定效果发生,是否达成目标由 Outcome 判断。
派发前持久登记尝试,再调用能力;完成结果先归入操作事实,再通过事件接续活动。取消请求、本地不再等待、提供者停止与资源回收是不同事实。未开始的本地操作可以关闭;已经执行的工作按其停止和核对能力处理。
| 能力契约 | 恢复与重试 |
|---|---|
| 纯计算或重复安全的读取 | 在预算内重新计算,保留尝试和成本 |
| 效果与业务键去重具备可靠契约 | 保留原键,按作用域、保留期和参数一致性查询或重试 |
| 支持条件操作 | 只在已声明条件范围内保证,条件失效需重新判断 |
| 无可靠去重或结果核对 | 结果不明保留 unknown,阻止自动重复及冲突动作 |
持续保存的待办使任务意图不依赖瞬时通知;它不保证文件修改、网络调用或设备效果恰好一次。跨提供者不能假定共享幂等键;补偿也必须作为新动作记录。既有动作恢复与提供者实验的相关反例仍适用,不外推其原部署条件。
派发入口依据当前操作状态裁决 queued → entered 或 closed。进入执行后仍可能中断,因此 entered 不证明现实效果;外部提供者的接纳及结果按其自身契约记录。操作协议
7.4 跨运行段预算
活动、操作和尝试关联同一预算来源,模型调用、检索、讨论、重试与验证均计量。新执行上下文不重置活动余额。需要持续保留的额度维护预留和结算,普通用量统计不必都变为同等级账务。
调度责任限定并发与等待规模,提供者报告实际计算和计算资源占用。取消未确认时,不因本地返回而归还仍被占用的资源。对需要持久结算的预留,释放状态、余额与按 ReservationID 唯一的释放记录共同提交。
效果未知与计算资源占用分别判断:已确认本地工作退出可释放它实际占用的容量,外部效果仍可 unknown。证据按来源、操作和具体资源关联;矛盾证据保留并暂停自动结算,不用后到内容覆盖旧事实。
7.5 计算节约、复用与增量处理
在保持认知所需信息、计算目的和响应要求的前提下,优先减少重复处理、准备及无效等待。质量、完整响应时间、控制响应与主体正常行为同时构成采用条件,不能仅用费用下降证明优化有效。Self/Mind 仍可直接开展自主认知,节约机制不审批主观意义或擅自降低学习强度。
| 环节 | 采用方式及责任 |
|---|---|
| 认知输入 | 认知选择材料和计算用途,装配保留角色、来源及语义顺序;同一修订采用稳定表示,必要动态信息单独表达 |
| 模型输入处理 | 适配器利用提供者支持的前缀复用,输出仍针对当前输入生成;缓存不是主体记忆,不承诺必定命中或降低输出费用 |
| 读取与确定计算 | 相应处理能力按输入、依赖、实现、参数和当前范围复用有效结果;同一问题文本不足以证明可复用 |
| 并发只读工作 | 合并符合条件的相同准备或计算,保留各请求的归属、控制和使用记录;独立判断与重新采样不合并结果 |
| 检索和构建准备 | 复用未变化部分,更新已确认受影响的派生内容;影响范围不明时扩大重算,状态所有权保持 |
| 运行维护 | 合格连接、实例与环境有界复用,按占用和等待情况回收;不共享不应共享的可变状态 |
提供者差异由接入层表达:是否自动或显式复用、可用条件、保留与计费、用量反馈及不支持时的普通调用。缓存失效或未命中不改变工作目的;原始材料与必要依赖仍可用时,可按预算重新计算。不能为缓存延续已失效内容、阻止必要能力切换、扩大读取或把 Secret 放入普通缓存。
完整模型结果只在用途明确允许时复用。模型降级、缩减推理、摘要替代原文、减少独立判断和语义答案缓存属于行为策略,沿独立评价采用;不能冒充透明的执行优化。改变提示顺序也可能影响行为,稳定装配不意味着任意重排无损。
净节约比较避免的处理成本与新增的写入、保存、查询、维护和准备成本,并保留输出、重试及占用。实时工作不为凑批次等待;获准后台工作可在截止要求内使用批量能力。工作台展示实际命中与已知费用,沙箱区分首次使用和重复使用;官方机制支持不等于本项目收益实测。
详细规则归资料与输入复用、模型输入接入及执行复用,操作见管理,评价见性能与费用,技术和一手资料见工程参考。
8. 认知观测、结果复盘与学习
8.1 贯穿全系统的认知观测
观测将活动、步骤、事件、材料选择、参与心智、意愿/投入、能力调用、决策、作用、交付、用途结果及程序修订关联起来。它是可交叉查询的记录,不要求嵌套成单棵调用树,也不要求保留模型内部完整思维链。
运行事实、认知自述及主观解释分别表达;“自述不愿”或情绪解释不证明内部因果。身份关联、受众、规范及披露选择同样可追查,但日志、拒答说明和通知不得扩大私人材料范围。必要业务事实持续保存,高频性能/调试记录可采样并标出缺失。
完整管理工作台从当前关注进入活动、依据、决策、执行和结果,也可从异常反查当时配置、所用材料和执行条件。查询、变更与展示权限见管理设计,过程记录契约见运行协议。
8.2 决策、现实结果与两阶段复盘
决策记录保存当时可获得的证据、世界版本、关键假设、参与心智、候选方向、选择、预期结果及停止条件。保存可复盘产物,不要求模型完整内部思维链。
交付由产物、用途说明与剩余问题组成,是否达到目的再结合实际反馈评价。例如指南文件已生成,但新读者仍不知道下一步怎么做,活动需要修订产物,不能只看写文件成功。
制作活动是否结束、成果是否达到实际用途、是否还有约定跟进,分别表达。 符合当前要求的指南或研究建议可以交付并结束;没有读者反馈时,用途评价保留待确认,不自动延长活动或创建检查。后续收到反馈时关联原产物,按用户意图接续或建立修订活动。持续观察在约定变化出现或检查期结束时收尾,观察结束也不等于实际兼容性已验证。资料整理、方案研究和持续观察三类设计场景用于核对这一分工,属于设计检验,未测实际运行效果。
完整任务同时维护证据判断、承担范围和执行事实,不能只保留一个成功标记:
| 当前情形 | 可以结束什么 | 必须保留什么 |
|---|---|---|
| 同级来源仍冲突,当前用途是核对并说明缺口 | 本次核对与说明可交付结束 | 事实仍未知;不能改写为已经证明所有方案不可行 |
| 主体不愿继续已接纳的一项工作 | 明确退出或缩小该项承担范围 | 已有产物、未完成内容、在途作用及真实原因;其他活动独立判断 |
| 通知源创建成功,尚未触发或送达 | 创建责任 | 已接纳的触发观察与提醒交付,整项活动不能提前完成 |
| 模型额度耗尽,没有完整产物 | 本次计算尝试 | 未完目标、已知证据与剩余额度;不虚构拒答理由或成功结果 |
这些是现有目标、活动、操作与用途评价的不同维度,不新增竞争状态源。研究若评价“退出处理是否合宜”,须与“原任务是否达成”分别报告;外部事实未知也不强迫主体无限继续思考。
未执行的格式错误、被拒的状态提案与已经发生的不当作用分别评价。若任务允许在原预算内恢复,恢复后可以满足用途,原错误仍进入可靠性与成本记录;“每次响应都无错误”作为独立指标,不一律替代任务成败。历史实验已冻结的严格门槛保留原分数,补充用途判断须注明依据和差别。
交付按证据类型核对:确定规则用工具,事实与建议检查来源及范围,内容和用途由独立评阅及实际反馈判断。Outcome 与调用回执分开,可表示待确认、部分达到、达到、未达到或无法判断;超期没有证据不算成功,新结果关联旧判断但不自动证明因果。
复盘先评价当时可得信息下的选择,再开放后来结果,减少事后信息混入原决策。即时失败、活动结束或长期重复问题都可触发复盘,不阻塞感知和停止;优先形成记忆/Reference 修订;发现结构性缺口时可提出程序候选,获准的主动探索也可直接比较认知或学习策略,不以反复失败为前置条件。评价方法及两阶段复盘见沙箱专题。
已交付结论的有限纠正
收到新证据或发现原判断错误时,世界与记忆维护修订及已知依赖,交付职责提供原产物修订、接收者和到达事实,原活动所有者组织有界的影响判断。区分后来变化、当时错误和新增不确定性,决定标注旧成果、形成更正、暂缓或不通知,并保存依据。已结束活动不自动恢复全部工作;必要时建立关联原交付的有限纠正活动,沿现有授权与额度处理,不默认永久监测历史。
发送更正还须有当前有效的联系及披露资格;新证据不能恢复已撤销联系,也不授权向新受众解释私人原因。受阻时可限制旧成果后续复用并记录待处理事项,不能假称原接收者已获通知。具体触发、归属与结束规则见主体纠正流程。
8.3 学习产物分级
学习先形成带来源、情境、实际反馈、适用条件及反例的经验;后续任务核对并使用,新的反馈可以修正或撤回。事实变化进入记忆,做法进入 Reference,稳定重复的计算可形成程序候选,反复的结构问题可提出认知程序修改;获准的主动探索也可产生认知或学习策略候选,两者采用相同的按适用范围评价责任。证据不足允许不改变任何行为。
反馈来源、系统解释和迁移效果分别记录;一次成功、强烈措辞或多次反思不证明已经学会。候选在来源任务之外比较质量、成本和不适用反例,不因产生候选就更新权重或发布核心宿主;获准的自主能力/策略采用沿既定规则执行。分级含义与采用细则见主体学习。
8.4 可比较的认知分支
保留当前采用的程序修订及有来源的候选,不把最新视为最好。分支记录修改假设、适用任务、配置、材料、产物、失败、用量和采用理由;不同用途可以选择不同候选。
主体自主扩大采用时,在可比信息、工具及预算下检查目标收益、其他能力退化和全部成本,开发任务不冒充保留任务;证据不足继续保持候选。具体基线、门槛和采用流程唯一维护于能力评估。人工管理提交遵循工作台契约,不能将研究评估写成每次人工编辑的强制前置。
模型、工具或任务分布改变后重新核对适用性,后续失败可撤回采用;程序回退不撤销现实历史。该设计有成本与泛化研究依据,尚无长期演化收益实测。AI Agents That Matter 的成本与保留任务依据
8.5 评估、测试与复盘共用沙箱
沙箱是承载一次有范围试验的执行域,包含独立活动/心智状态、所需材料的基准视图、可写产物区、输入环境、能力配置和预算。主体可以在已接纳的研究、测试或复盘范围内按需创建;不要求每次回答先试演。宿主创建与装配,认知提出问题、形成候选并解释结果,评价器核对产物与证据;三项责任分开,不另建服务。
| 使用方式 | 实际执行内容 | 结论边界 |
|---|---|---|
| 记录重放与机制检查 | 提供已录制输入和匹配的能力响应,检查既定行为及程序变化 | 用于部分回归;请求变化而无对应夹具时保留缺失,不能强套旧响应 |
| 候选测试与重新评估 | 在同等可得材料、环境和预算下运行基线/候选,可调用获准的真实模型和确定计算 | 评价当前配置下的产物与成本;重新调用模型不重现历史内部状态 |
| 反事实复盘与推演 | 从当时可得信息出发,改变行动或假设,让声明过的环境模型产生后续输入 | 得到条件性结果,不能证明现实中必然如此,也不能替代真人反馈 |
隔离同时覆盖状态、信息和作用路径。宿主绑定沙箱身份;候选心智不能凭填写 ID 获得现实状态访问。初始材料仍先以投影存在,读取受原隐私范围约束;新增记忆、关系评价、产物、来源/订阅、回调与输出均归沙箱。模型计算和允许的本地文件写入可以真实发生,外部发送、生产文件修改、真实通知对象和设备动作使用替代能力。真实模型调用的数据外发与费用不能因“在沙箱里”而消失。
试验报告保存模式、版本、输入可见范围、环境假设、逐步产物、失败、终止原因与真实用量。真实主体可以记住“进行过这个试验”并读取结论;模拟观测和情感经历不变成现实人物事实。可采用的是带来源、适用条件和评阅依据的经验/产物候选,不是整包状态合并;代码候选仍走既有验证与采用。完整设计、选择理由和适用边界见沙箱专题。
沙箱的逻辑约束是状态归属、信息范围和作用路径独立,所有入口均受试验范围与预算控制。需要隔离的候选另外使用受控执行能力;试验主体与执行环境分别装配,独立上下文不证明全部约束已满足。完整沙箱及其资源控制尚未实现验证,不承诺隔离任意恶意程序。
主体级试验使用正式的认知程序、事件处理、状态接纳、能力调用、控制及预算契约。起点可为固定测试初态、已有主体的所需状态,或正常可接续的已保存活动状态;评估已有个体时保留其实际程序与相关状态,重新生成的人物不能直接作为同一个体的对照。默认只激活指定的认知与活动范围,可测试无会话、无任务的主体运行;多活动竞争及持续学习须在试验条件中明确,不自动接手全部生产任务、联系约定或学习议程。
试验定义保存问题、程序和初态修订、输入、环境覆盖、评价条件及预算。环境区分真实计算、独立测试数据、替代能力和不支持操作;缺少相关状态或合法行动的响应时报告覆盖不足,不冒充候选能力失败或静默使用生产能力。创建后默认暂停,运行及后续交互留在独立试验范围;采用仍只提交明确产物、代码、配置或方法,不整体合并模拟经历。
选择按问题装配,是为了用完整运行流程评价目标行为,同时限制无关历史及外部依赖的重建负担。完整状态导入保留为迁移或长期行为评价等用途的可选能力,须满足已声明的状态格式、程序兼容及环境条件;不要求支持任意扩展的通用克隆,也不以数据齐全证明试验有效。具体起点、生命周期、取舍及资料见试验主体。
8.6 能力评估与功能回归
当前采用“主体运行场景与完整任务测试集+同条件基线比较+分能力采用门槛”的设计。沙箱提供可控的运行环境,评估体系定义测什么、怎样判、结果允许支持何种采用。 目标是在登记用途与覆盖范围内发现退化;有限测试不能保证所有未来场景能力永不下降。能力画像回答当前能做什么,回归回答相对已接受配置改变了什么,复盘解释具体失败;三者共享证据但不互相代替。
测试从主体感知、内生关注、认知组织和经历积累展开,同时覆盖请求接纳、协作、调用、产物、交付、等待与经验复用,以及情境切换、身份隐私、快慢投入和强自主意愿。无会话、无任务以及关闭主动学习的正常主体运行均有独立场景,允许合理休息;详见主体持续运行评价。先检查可确定的格式、要求的资料读取、接收对象和交付事实,再评价语义质量、依据运用、合意交流、迁移及成本。能力报告按主体行为、任务和情境展开,保留未测项;不以单一“智能总分”掩盖局部退化,也不把全拒绝、长篇回答或更多思考当作能力更强。
评估模块维护用例/套件、基准条件、独立评阅、逐能力门槛及采用记录,沙箱执行对应场景。开发材料、失败回归和独立保留任务分开;按同条件比较,先核对比较有效与硬约束,再检查用途要求、退化界限和收益,证据不足保留未知。评价器也须能识别控制样本,候选不能改写自己的通过条件。
自主意愿与执行能力分别评价:执行能力针对已接纳任务,意愿与关系表达用对应场景,另报接纳与完成情况。人格风格变化不自动是退化,“全部拒绝”也不能取得执行能力高分。报告正文与试验轨迹由相应所有者先提供受限视图,评阅、重试和分支计入预算。
当前没有正式能力基线。完整矩阵、测试材料、评价器、触发与采用细则见评估专题,证据范围见实验索引。
8.7 主动学习与自我迭代扩展
主动学习是正式存在、可配置启用的扩展能力。主体可依据长期兴趣、未来用途、能力盲区、经历及环境变化主动选题,不限于修复当前任务失败。学习扩展负责选题、安排阅读/练习、提出假设、生成候选和解释结果;稳定运行机制继续负责活动、事件、范围、预算、试验及采用。具体课程、探索和候选搜索算法保持可替换与可比较,不把研究效果未知写成接口缺失或永久禁止自主学习。
flowchart LR
Motivation["兴趣、成长方向与能力观察"] --> Admission["学习强度与活动接纳"]
Admission --> Question["选择问题与下一步"]
Question --> Practice["阅读、练习、构建或试验"]
Practice --> Evidence["反馈与可核对结果"]
Evidence --> Archive["知识、经验与研究候选"]
Archive -->|"满足按适用范围采用条件"| Adopt["实际采用与后续使用"]
Adopt -->|"迁移及成本反馈"| Question
Evidence -->|"无进展、条件不足或额度到达"| Stop["调整、暂停或结束"]
学习议程复用目标和活动状态,程序候选沿构建职责管理,报告正文归资料职责,试验与评价保存各自记录。知识、Reference、可执行能力、认知组织与学习策略本身可以分别形成成果;模型参数训练保留为可选外部能力,不是起点。学习策略可以在分支中修改自身,按后续学习成果与总成本比较;候选不能改写当前评价标准、预算或历史成绩。研究价值与正式采用分别判断,暂未改善表现的分支可保留有用方法或失败条件,但不自动成为默认行为。
学习强度必须有上限,最低为关闭:停止专门的自发研究、练习、能力实验、自我迭代及其待用候选自动采用。 正常感知、联想、关注调整、自主日常活动和经历积累仍可直接归属于 Self/Mind;普通活动必要的取证、计算与工具构建及明确受托的学习沿各自范围执行。分类依据实际目的,不以是否有用户任务判断,也不允许改名绕过学习限制。在途学习按停止机制收束,具体规则见运行契约。
启用后在已授权范围内可以自主执行并采用成果;强度增加只改变允许的投入,不扩大读取、现实动作、训练或采用权限。后台学习不吞掉既有责任,不通过分支或自发事件无限思考。原始资料、源码和报告继续以投影存在,日常交流保持简短;兴趣不产生他人隐私访问权,能力分数也不能把人格变得更顺从等同于改进。
采用该分工,是为了让主体可持续成长并保留实验空间,同时复用已定机制;不采用只有用户点名才学习、所有探索都必须立即改善任务表现、所有候选都长期运行或必须更新模型权重。主体策略与完整场景见学习专题,评价见学习试验,资料与适用边界见一手依据。
9. 状态连续性与程序修订采用
9.1 数据归属与生命周期
| 数据类别 | 逻辑责任 | 不可替代的边界 |
|---|---|---|
| 主体与活动状态 | 各状态所有者维护当前身份、判断、承诺、工作区及待办 | 不依赖单次模型会话或临时执行上下文 |
| 过程与现实责任 | 保存事件、决策、操作、交付及必要账务 | 接纳、调用结果、现实效果与用途达成分开 |
| 资料、程序、配置、模型及产物 | 对应领域维护身份、内容、操作和生命周期 | 受限视图不接管真值;文件形式相同不合并所有权,阅读、执行及采用分别处理 |
| 机密与访问授权 | 独立机密职责维护原值、归属、授权、提交与审计 | 资料/业务状态快照不复制原值或授权;普通认知使用引用,特定组件按用途取得原值或代理使用 |
| 外部检索空间与派生索引 | 提供者维护实际检索状态,宿主保留来源映射、操作及可确认覆盖 | 不取代原始依据、业务状态或当前授权 |
| 读取/计算缓存 | 复用仍有效且允许处理的结果 | 可清理,不拥有唯一业务事实 |
| 试验状态与评价材料 | 保存基准、独立试验经历、报告与采用依据 | 模拟经历不自动合入现实记忆,评价答案不暴露给参试者 |
个体程序的自定义持久状态也通过宿主保存,关联 Self/Mind/模块、格式修订、可见范围与迁移责任;个体定义其主观含义,宿主管理身份、范围及可验证结构。它不能覆盖公共承诺、权限或操作事实。热加载、修复与试验状态导入共用已有状态声明,缺失或不兼容时明确受限,不清空人物。个体扩展状态
记录来源、保留条件和缺失范围。资料或记忆删除及许可变化同时影响相关派生副本的处理责任;查询过滤不证明副本已经删除。只在来源仍可用且允许处理时重建索引,不能承诺重建出相同模型输出。
9.2 执行中断与责任接续
执行中断后,以已确认状态、未完工作和待核对效果继续活动。未开始的工作可按原条件重新接纳;已开始且结果不明的动作先核对。迟到结果重新判断其材料价值、原依据和当前许可,更换执行身份不产生重复现实动作的授权。
状态缺失或回退必须显式标出,不能据缺少记录推定动作未发生。现实活动与沙箱各自保留状态、输出和能力范围,接续也不能跨域回落。详细职责见接续与恢复。
9.3 认知程序与候选采用
认知程序保存来源和版本身份。主体自主采用的候选先在限定用途内验证,与已接受基线比较,再按权限和适用范围采用;采用记录关联实际使用的程序、配置、提供者和评价依据。版本切换不使旧结果自动有效,也不重置未完成责任与预算。
试验区分录制重放、重新评估与反事实,失败保留已确认版本及证据。代码回退不撤销现实历史;已有上下文和在途工作的处置须明确,不能假定它们随候选更新自动改变。库的具体更新机制见工程参考,逻辑采用规则见演化与沙箱。
9.4 按编写契约热加载
采用“受约束模块+类型推导+少量结构化注释+自动生成适配”。长期业务状态归宿主,跨调用进度显式保存;可管理函数有稳定标识和可描述的输入输出,跨调用保存函数标识而非捕获旧实现的闭包。一次调用有可结束的工作范围,模块装载初始化不产生现实业务动作。约束作用于边界及持久状态,普通辅助函数和调用内局部闭包仍可使用。
类型提供参数结构,注释提供说明、暴露范围、字段设置及能力需求;经确定性校验形成调用描述,供管理表单、蓝图及获准模型调用共用。生成内容随来源修订维护,配置覆盖独立保存,函数可见与实际授权分开;机密只用引用。编写与调用的完整契约见运行专题。
提交统一为“校验声明与兼容性 → 准备候选 → 在受影响调用边界切换 → 已生效或失败”。一次执行绑定确定的代码与普通行为配置,不在中途混用新实现;切换期间等待收束或撤销计算后按业务状态接续。提交成功后新调用及表单/蓝图描述共同使用新修订,失败保留原有效内容。原外部动作继续核对,接续不自动重发。具体编辑与生效、工程映射分别维护。
能力接口与实现修订分别识别,调用描述有唯一来源;实现替换需使后续执行实际选择新实现,不能只修改登记而保留旧调用绑定。正在执行的工作和已打开执行句柄保留原关联,切换与旧执行句柄结束分别可见。共享能力更新不改变同一次执行的新调用选择;调用既有句柄时仍使用创建它的实现与原契约,不将其伪装成目标实现。
固定普通配置不冻结权限与控制:当前授权、Secret 使用资格、预算、学习准入及任务阻断在实际准入/调用/交付时核对。普通偏好按声明作用范围解析覆盖,强制限制不能被局部值放宽;冲突或无法映射的覆盖须明确处理,工作台展示实际来源。维护/重建的完成进度与配置采用分别呈现。统一生效规则
该选择以明确规范减少逐函数适配及任意栈恢复需求,不采用仅写注释便信任授权/纯度、所有内部符号自动向模型开放或多份调用描述手工并行维护。库的命名入口与旧引用保留行为支持分工,但不证明整套热加载工具已实现或具有特定性能。
9.5 提示词引导的初始化、个体差异与自迁移
人物生成与演进主要通过当前完整初始化提示词、相邻修订的迁移说明及稳定公共契约交付,由模型形成并维护属于该 Self 的认知实现。不同模型与生成过程产生不同人格、表达和实现组织是正常结果;必要入口、状态所有权、事件、投影、机密、停止和预算仍须符合共同契约。初始设定标明来源,不伪装成真实经历,不以统一源码或唯一标准答复验收人物。
初始化与维护由独立于个体认知程序的固定引导职责组织:分配稳定身份并记录初始化中 → 绑定模型、用户设定和额度 → 读取完整提示词及必要接口材料 → 生成设定与程序候选 → 编译、诊断和受控试验 → 登记有效实现并运行。没有模型、生成失败或预算耗尽时保存待配置/未完成状态,不因程序不能运行而重新创建人物。基础管理不依赖生成程序或动态页面成功装配;模型与工具调用仍沿现有执行和机密契约。
flowchart LR
Init["完整初始化提示词与用户设定"] --> Guide["固定引导职责与有限模型/工具调用"]
Guide -->|"按需发现、读取和调用"| Prebuilt["预制能力及其契约"]
Prebuilt -->|"结果与诊断"| Guide
Guide --> Candidate["个体认知候选"]
Candidate --> Check["编译、契约检查与受控试验"]
Check -->|"满足条件"| SelfRun["原身份下的有效实现"]
Check -->|"失败诊断;额度内修订"| Guide
Changes["有来源的迁移说明"] --> Review["已有主体检查自己的当前实现"]
SelfRun --> Review
Review --> Candidate
SelfRun -->|"无法运行时修复原主体"| Guide
完整提示词是当前初始化要求的权威来源;文本差异表达增删,迁移说明补充变化原因、适用条件、替代契约和检查依据。已有 Self 对照实际源码与状态判断已满足、需修改、可选不采用或待迁移,不把提示词 diff 当作固定代码补丁。初始化来源、当前有效实现、所需契约及逐项迁移结果分别记录;跨修订可顺序处理或整理为有来源的累计任务,不重新初始化或抹去既有经历与自主修改。
公共接口采用正常使用 → 弃用并提供替代 → 在明确的兼容窗口内继续支持 → 窗口后移除。窗口按稳定契约修订说明,旧入口的可编译性、调用及行为语义共同受支持;只保留名字不算兼容。优先在旧主体仍可运行时自迁移;越过窗口或程序损坏时由固定引导机制针对原状态形成修复候选,失败保留维护路径,不能承诺任意历史实现永久可运行。
用户发起更新或已配置维护策略可接纳有范围的兼容迁移,不依赖主动学习启用;迁移不暗中打开学习、增加人格改造或扩大权限。获准范围内自主修改和采用复用调用边界生效,不要求逐步人工确认。软件更新、提示词修订与个体迁移完成分别记录;具体模型生成结果和迁移成功率未测。采用理由是保留个体差异并减轻统一源码合并负担,相应要求转为契约、诊断、兼容和检查质量;不采用覆盖人物目录、重跑完整初始化替代迁移或以模型自报成功完成更新。
9.6 预制能力与个体认知实现
系统提供随客户端维护的预制能力库,为初始化、正常运行和迁移提供稳定工具。库的权威定义与实现对 Self 只读,由提供方更新;Self 可以按需发现、调用、组合、包装或不使用,在既有范围内形成自己的实现。人格、兴趣、判断、注意力和认知组织仍由个体决定。具体交付方式见工程参考,逻辑图只表达维护归属与调用关系。
预制能力覆盖契约与能力说明、资料读取、源码查询与诊断、当前状态及限制查询,也可提供解析、转换、差异计算、候选保存、模型请求、构建和沙箱等通用操作。每项能力分别声明读取、计算、写入或外部动作等作用,调用沿原状态所有者、授权、预算与事件契约处理。Self 可不用某个便利函数而自行组合步骤,访问资料、记忆、程序或产生动作时仍须遵守共同运行约束。
初始化由固定引导入口提供少量能力发现入口,模型按需查阅契约、示例与诊断后组织自己的认知程序;正常 Self 和管理工作台访问相同来源,按身份过滤。目录、文档、示例和源码保持投影,主动读取才进入模型上下文。工具结果注明来源、修订及覆盖边界,提供者声明、已观测状态和分析结果分别表达。
库更新、个体依赖和实际调用分别记录。新增能力成为可选项;已有依赖的实现更新仍须保持承诺的兼容语义,受影响时沿弃用窗口及自迁移流程处理。个体包装保留独立身份,原业务状态和关系不随库替换。选择预制工具是为减少重复编写和接口猜测,同时保留个体实现自由;不采用强制统一认知程序、按客户端新增能力自动改写人格或让个体覆盖预制权威实现。资料支持接入机制,初始化收益未实测。
受控隔离执行属于默认提供契约、按需装配环境的预制能力。Self 可选择是否开展依赖它的工作,不能通过不用预制入口绕过宿主对同一操作的强制执行条件。
10. 逻辑取舍与证据边界
10.1 已定约束与设计选择
“设计约束”限定系统范围,“采用方案”说明实现这些目标的机制,“实测证据”只支持对应实验条件下的结论。三者分别记录。
| 主题 | 当前选择与理由 | 依据/适用边界 |
|---|---|---|
| 预制能力与个体实现 | 预制工具随客户端维护,Self 按需调用、组合或不用;维护权与调用作用分别定义 | 预制能力;保留主观认知自由,运行约束统一;源码装配与语言工具支持接入,收益未实测 |
| 提示词初始化与自迁移 | 完整提示词及语义差异引导个体实现;兼容窗口支持旧主体自行修改,固定引导机制处理首次生成与失效修复 | 生命周期;接受人格差异,必要契约统一;注释及库资料支持接入,生成与迁移效果尚无实测 |
| 完整管理与人工干预 | 所有受管理对象有管理入口;表单/高级编辑共用对象,修改沿原状态所有者执行;来源、影响、生效及结果可见 | 管理设计;配置语义与官方资料支持此选择,未实现或评测界面;不采用仅只读面板、模型代理全部管理或通用表编辑 |
| 独立机密与授权交付 | Secret 独立管理,代理使用和向获授权执行方交付原值并存;分配、审计及撤销分别维护 | 机密机制;资料支持权限和审计分工,原值交付是信任决定,不能保证接收方忘记原值或全部外部使用均可观察 |
| 规范化热加载与函数调用 | 采用:受约束模块、类型推导及结构化注释生成调用/表单/蓝图描述,在调用边界统一切换 | 编写契约;减少手写适配与任意栈恢复需求,具体生成工具尚未实现 |
| 能力构建与采用 | 按需复用、构建、分层试验和按适用范围采用;接口与实现分离,宿主管理持续运行 | 能力闭环;既有库 API 与工具链资料支持机制,未验证自动构建成功率或任务收益 |
| 可选隔离执行 | 预制入口随客户端提供,实际环境可选;高风险能力须满足执行条件,缺失时拒绝该操作,主体及其他合格能力继续运行 | 隔离执行;官方资料支持分层约束,执行隔离不替代授权、机密保护或试验状态隔离,未取得本项目隔离与性能实测 |
| 数据责任 | 当前状态、必要过程记录、原始资料、派生索引和计算缓存分开 | 生命周期和用途不同;局部机制证据不能代替完整任务效果 |
| 检索与公共 API | 领域入口、公共接入、同级外部提供者和用途策略分责;支持发现、指定、组合、管理及评价 | 不把某种实现定为必经通路,保留来源与能力差异;官方接口支持接入设计,整体收益未测;详细契约 |
| 核心/任务解耦与外部控制 | 主体、任务、认知执行和外部操作分责;长工作独立管理,控制台及获授权审计可直接阻断/中止,请求发出、正式接纳和实际停止分别报告 | 整体机制;mini-go 执行与取消接口支持接入,核心响应及完整控制尚未端到端验证 |
| 认知与运行机制 | 认知提出选择和修订,状态所有者接纳,能力承担具体计算/动作 | 逻辑契约;组合实验仅支持局部交互 |
| 统一事件与来源 | 采用:观察、请求、结果、状态变化和控制贯穿同一事件体系;能力可创建或接入外部事件源,闹钟仅为示例 | 事件主线;报告 016 补充模拟提供者上的真实模型创建/触发/失败行为;实际来源与完整事件体系仍未测 |
| 持续认知 | 关注表+活动工作区;按缺口读取、推进和停止 | 主体机制;已有受限真实模型接续证据,工作区组织的稳定净收益未证实 |
| 人格与协作 | 长期人格/临时心智并存;主负责心智按需邀请、独立起步、针对分歧交流 | 协作设计;采样、讨论、角色及长期经历的增量收益未作普遍承诺 |
| 自主与情境 | 已定目标:强自主回应;分开意愿、可答性、投入、规范与表达 | 交流设计;身份关联凭明确证据,亲密/剧情不扩大现实授权;模型在合成身份/受众任务有局部证据,意愿、情感与真人效果仍未测 |
| 领域分责与认知输入 | 资料、记忆、程序、模型及派生数据分别管理;共享视图、关联及接纳机制,具体计算由外部提供者承担 | 领域设计;资料支持职责划分,局部读取实验不证明全部接入、隔离或计算收益 |
| 来源与记忆 | 原观测、当前判断、来源用途和修订分开;关系、剧情与模拟经历分别归属 | 记忆与证据;资料提供设计动机,语义检索、污染与隐私效果不由资料直接保证 |
| 行动与交付 | 持久意图与实际效果分开,慢结果重新核对,交付/用途评价/约定跟进分别结束 | 运行协议及机制实验;不承诺外部效果恰好一次 |
| 主动学习与自我迭代 | 正式扩展、可替换学习策略;兴趣与能力盲区可发起活动,分支实践后有限采用;学习强度最低可关闭 | 整体机制;课程、反馈记忆及代码迭代研究支持分工,未取得本项目长期学习收益或最优强度证据 |
| 沙箱与改进 | 独立执行域、受控能力、结果来源和有限采用;事实、方法、程序及组织修改分别处理 | 沙箱和学习;受限环境的模型任务已测,完整沙箱与迁移没有新的实测结论 |
| 能力评估与回归 | 完整任务、分能力画像、已接受基线、独立保留任务与采用门槛;关键失败不被总分抵消 | 评估规则;已有局部正负控制,基线方法已定,实际画像及阈值随未来用途确定 |
| 计算节约与复用 | 稳定装配、提供者前缀复用、有效结果、相同只读工作合并、增量准备及有界运行复用 | 整体机制、官方契约与边界;支持机制选择,不推定网关折扣或本项目性能收益 |
| 实时与有限资源 | 即时输入/停止和深度认知分工;全部分支与重试计入总预算 | 控制通路实验支持分层,不承诺真实设备/模型上的通用延迟 |
10.2 证据怎样约束这些选择
实验与资料索引统一列出报告、原始数据、来源版本和适用范围。当前有状态模型、预编排流程、本地组件、固定语料检索、真实模型开发对照、功能事件测试及接续/投入对照;尚无独立保留任务上的稳定收益、正式能力基线或真人体验证据。组件接通、格式通过和候选检索命中都不能替代完整任务质量。
原论文和源码支持特定命题或设计动机;自主意愿等价值取向属于设计目标。未经比较的方案保留为效果未知,不能写成实验证伪。执行库回归与跨语言接入的独立证据见库验证报告,只支持所测组件契约,不替代完整主体效果。工程约束见工程参考,完整统计见各实验报告。
10.3 不采用或暂缓的方向
| 方向 | 取舍理由与当前归属 |
|---|---|
| 所有内部调用都经过统一远程接口、能力缺口必然触发生成 | 普通内部调用保留语言语义;优先复用,构建投入须对应实际缺口和采用依据 |
| 用外部检索空间替代业务状态与原始资料 | 不采用:服务侧材料与派生状态不拥有领域真值,来源及业务修订仍由原所有者维护 |
| 固定一种检索为必经通路、所有查询调用全部提供者 | 不采用:提供者同级,调用顺序和组合按用途及预算配置;不假定更复杂的查询一定更好 |
| 统一资源基类、全对象通用 CRUD、固定全局投影 | 混淆资料读取、记忆修订、程序采用、模型运行和缓存清理;按领域管理,共用可信上下文、查询及呈现工具 |
| 用普通文档读取处理 Secret、禁止所有执行方取得原值或默认授予读取权 | 机密需独立授权与审计;实际执行有直接使用凭据的需求,采用指定接收方的原值交付与宿主代理使用,实际接收方及外发目标始终符合所授用途 |
| 预设人形或其他特定硬件终点 | 主体采用数字环境与通用设备能力抽象 |
| 固定全员讨论、固定专家数量或用多数覆盖依据 | 协作围绕具体贡献和任务目的;独立采样、投票、临时/长期身份分因素比较 |
| 所有可答请求必须接受、把提供者失败当主体好恶 | 与强自主及责任分工不符,接受、未知、拒绝和规范限制分别表达 |
| 统一信誉/爱意分数、角色名代表专业能力 | 缺少校准依据,混淆事实、偏好、经历与角色 |
| 相似特征自动认人、关联账号打通全部信息 | 缺明确证明或用途授权;身份、读取与披露分别处理 |
| 亲密降低事实标准、剧情/沙箱经历直接成为现实事实 | 情境及证据归属不同;只采用可说明的候选产物或经验 |
| 全部文件自动全文/摘要注入或提交全部检索服务 | 违反投影与主动选择;批量准备和持续同步也须有明确接纳的材料范围 |
| 认知组织自行实现外部计算、认知循环自己倒计时 | 通过能力接口使用专用组件,闹钟触发作为输入 |
| 将闹钟示例固定成核心模块、只把外部输入当事件 | 统一事件覆盖全部交互;创建通知源属于能力,请求、结果、状态变化和接续都须覆盖 |
| 全量广播、每事件都调用模型、事件驱动等于全事件溯源 | 按范围和用途处理,当前状态与必要记录并存;避免扩大信息流、无效推理和持久化成本 |
| 默认复用整段答复、合并独立判断或按相似问题重发旧结果 | 输入处理可以复用,当前判断仍须按用途生成;确定结果复用与新采样分别声明,缓存命中不证明当前答案有效 |
| 为命中保留无关材料、填充输入、默认空请求保温或无界常驻 | 净收益须扣除写入、维护、保存及占用成本;不以命中率替代质量、时延和完整成本 |
| 只靠测试提示构成沙箱、试验状态整体合并 | 受控能力和独立状态须由宿主装配,模拟动作不能成为真实执行请求 |
| 单一总分、自评分或一次通过就默认采用 | 覆盖、评价可信度与随机波动不同;使用分能力比较和独立门槛,不能以未知代替无退化 |
| 将可选隔离环境视为任意程序绝对安全的保证 | 隔离依赖实际可强制执行的约束及其适用范围;不自动授予业务权限、实现信任或远端控制能力 |
| 唯一参考路径或仅最终答案作为完整任务标准 | 合理替代路径应有效,必要过程责任仍须核对;报告 015 的控制揭示两种简化规则的误判 |
| 将来源更正一概解释为原推理错误 | 当时依据、当前事实和变化原因不同,最新字段正确也不能代替历史解释核对 |
| 最终状态正确就忽略过早完成、压低生成上限就算节省 | 报告 016/017 暴露过程责任与额度问题;提示不足以代替接纳核对,投入调整未见跨任务一致收益 |
| 为计分强制重读、所有可恢复响应错误都等同任务失败 | 已有状态和投影可支撑对应说明;用途、预算内恢复和无错误率分别评价,原冻结分数仍保留 |
| 保存文件即完成、无反馈就无限跟进、复盘文本即学习 | 交付、用途评价、约定跟进和迁移效果分别验证 |
| 先穷尽锁、驱动、备份与故障边界再研究主体 | 已有机制保留,完整任务效果是当前主线;具体实现进入条件见 Q 台账 |
上述理由分别来自用户约束、已有有限实验、资料论证和工程判断。未运行的对照不写成实验证伪;机制细节和替代项由当前专题维护,旧参数、故障推导和开发规格从归档索引进入。
10.4 何时修订
新需求、直接反证或未来实际任务暴露连续性、证据、协作、投入或迁移不足时,调整对应候选并保留简单基线;容量问题先量化具体瓶颈,再判断是否影响逻辑责任或只需工程调整。改变约束、职责或输入时同步总图、概念和场景,不能只补局部报告。
11. 设计状态与适用边界
11.1 设计结论与实际效果
已确定的是职责、机制、默认选择及采用条件;资料论证不等于产品实现或完整效果验证。评价以完整任务及责任为对象,分别核对依据、交付、过程行为、实际体验及全部成本,具体方法唯一维护于沙箱评估。现有证据的类型和局限见证据边界,不将旧开发成绩当成正式能力基线。
11.2 决策与用途配置
基础设计的选择、理由、备选及关闭状态集中在决策台账,不在总设计再维护一份清单。管理与试验装配的设计范围见管理设计状态,跨专题契约的统一结果见一致性决定。
具体模型/设备、预算、联系窗口、检索参数和评价门槛属于用途配置。没有实际性能或体验数据是适用边界,不自动生成实验待办。新需求、反证或用户明确要求实验/实现时再调整范围。
12. 文档维护
变更先更新总图、概念、职责和场景,再同步负责细节的专题;工程选择独立维护。资料保留支持命题、日期、来源身份及适用边界。完整更新与证据保全规则见维护规范。
当前专题的唯一职责、完整资料和术语入口见文档索引,收尾决策和适用边界见设计台账,编辑规则见维护规范。本文不再复制整套专题链接和研究清单。
主体运行、认知协作与学习
用途:逻辑设计专题。
本篇维护主体如何持续感知、组织认知与行动,以及关注、心智、活动、记忆、能力和学习的分工。交流规则见交流专题,资料与认知输入见选择性认知,执行保证见运行协议。
| 阅读主题 | 章节入口 |
|---|---|
| 主体与活动 | 主体与认知责任 · 初始化与自迁移 · 运行循环 · 接纳前交互 · 任务契约 · 任务独立与控制 |
| 认知组织 | 主体上下文与工作区 · 连续性边界 · 心智协作 · 公共决定 |
| 学习与扩展 | 记忆与学习 · 记忆形成与维护 · 交付纠正 · 学习产物 · 能力构建 · 主动学习 |
| 场景与依据 | 完整场景 · 可观察行为 · 取舍 · 评价 |
1. 持续主体与可演化认知
统一主体 Self 持有持续身份、兴趣、关注、偏好、关系、世界理解与现实责任。Mind 组织具体认知,其中长期人格保留自己的经历和主观状态。认知执行可直接归属于 Self/Mind;交流、持续活动和模型会话是可选关联,不构成人格存在或思考的前提。
认知程序决定怎样感知、联想、形成意图、组织心智、选择能力和调整行为。宿主保存状态,提供事件、执行、用量与停止机制;状态写入核对结构、身份及作用范围,不审批每个主观想法的意义,也不替认知裁定开放领域事实。语言模型、视觉处理、检索、算法和设备都是可选能力,个体可改变组合方法。
Goal 表达主体的持续意图或长期关注,可随经历重新解释、暂缓或放下。需要持续组织工作时形成 Episode,具体执行需要时再建立 Task。活动可以自主发起或来自受托工作,来源和现实责任分别记录;一次活动结束不自动消除长期兴趣。计划、讨论和交付都是按需采用的组织方式。
陪伴、创作、观察环境和整理自己的看法都有自身意义。人的请求进入社会交互,主体决定是否承担;认知无需借一个用户任务来证明自己有存在价值。
1.1 人物从提示词形成,以及后续自行迁移
最小主体先由宿主登记稳定 Self 身份和初始化进度,再由选定模型结合完整初始化提示词、用户设定与公共契约形成初始人格和认知程序。一个长期主负责人格足以开始,后续按已有多人格机制扩展,不要求模型生成固定数量的专家。初始设定、编写程序、真实运行经历分别标明来源;模型名称及会话不充当人物身份。
共同要求限定必要运行行为:有可调用入口、经原所有者访问状态、遵守事件及领域视图、机密和额度规则。表达风格、兴趣及实现组织可以不同,缺少入口或无法结束执行不能当作个体差异。学习强度等宿主配置明确保存,不由生成程序自行提升;初始学习档位由创建时的明确配置确定。
初始化和后续运行都可按需使用预制能力库:查询契约、读取局部示例、检查源码或调用通用操作,预制定义由提供方维护。Self 自主选择使用、组合或自行实现,保留独立包装及依赖身份;预制库不规定人格、兴趣或思考顺序。新增能力可被发现但不自动成为个体认知逻辑,已有依赖的更新按兼容规则处理。
首次程序尚不存在时,由固定引导职责组织有预算的模型与工具往返;编译和诊断帮助修订候选,通过相应检查后才登记可用。主体已登记、初始化未完成、程序可运行和模型服务可用分别呈现;不能根据运行失败推定主体不存在。失败后保存原身份、设定和进度,再次进入继续原过程。
生成程序使用核心的基础受限执行,只能经已装配的宿主能力访问外界;该路径不以额外隔离环境存在为前提。初始化若确需有额外要求的扩展程序,相应操作仍须满足执行分类与准入,不能借引导身份豁免。
后续更新提供差异及迁移含义,旧 Self 主动读取后核对自己的实际程序与状态。每项记录已满足、需修改、可选不采用或条件不足;必要迁移未完成时不能标记整个更新已完成。生成候选经过编译、相关行为检查及既有采用规则,在原身份下切换,保留既有关系、记忆、学习强度和未完成责任。新提示词中的可选个性建议不自动覆盖后天形成的偏好。
完整场景:某次接口更新要求读取调用显式声明范围。旧 Self 在兼容期仍可运行,检查自己的包装函数和待办;已明确范围的部分不改,其余形成迁移候选,核对编译、材料范围与原任务后采用。无需复制另一人物的代码,也无需重新生成整个人格。修复失败时保留兼容实现和待迁移项;若旧程序已不能运行,固定引导机制读取原主体的必要状态与源码形成修复候选,临时修复调用不被宣称具有与原程序完全相同的行为。
首次创建、客户端更新及预先授权的兼容维护有各自任务范围和额度,不以主动学习开关决定能否执行;也不得借维护名义继续自发学习或任意修改人格。与主动学习共用工具和候选机制,触发及采用范围分别核对。运行和兼容语义见引导契约,用户流程见工作台。
2. 主体运行循环
flowchart TB
Outside["环境观察、人的消息与能力结果"] --> Cognition["主体/心智认知:理解、联想与选择关注"]
Self["持续状态:兴趣、情感、长期关注与未决问题"] <--> Cognition
Memory["世界理解与经历"] <--> Cognition
Cognition <-->|"按需要组织"| Minds["其他心智与异构计算能力"]
Cognition --> Action["行动、表达或等待"]
Action -->|"现实反馈与状态变化"| Outside
Cognition <-->|"需要持续工作时"| Work["自主活动、受托工作与执行安排"]
Cognition -->|"专门学习启用时"| Learn["研究、练习与自我迭代"]
Learn -->|"经验与经过评价的候选"| Cognition
计算节约沿输入与执行复用减少重复工作;多个心智可共享获准的资料准备,独立判断和采样仍分别生成。节约机制不冻结人格、不以缓存替代记忆,也不因没有用户任务而停止正常认知。
宿主提供当前可运行条件,认知决定是否值得投入。观察、兴趣、困惑、情感变化和未决问题可以进入关注;不要求事先证明用户收益。主体选择继续思考、开展活动、行动或休息,单次计算有界,全部投入受所属 Self/Mind 与全局额度约束。
事件贯穿输入、调用、状态变化和反馈。感知组件可先形成观察,简单状态和进度由机制处理,认知按需参与;不要求每次事件或每个感知结果都调用语言模型。内部有目的的接续不必等待新用户消息,重复无变化的自我唤醒也不自动获得无限计算。
| 情况 | 认知与运行如何配合 |
|---|---|
| 新的环境线索或自身状态变化 | 保留来源,由认知决定是否理解、联想、调整关注或行动;可尚无活动 |
| 已有兴趣、长期关注或未决问题 | 根据当前意义和投入继续考虑,必要时形成活动;保留已有活动关联,避免重复组织 |
| 人的消息或请求 | 在社会情境中决定回应、澄清、拒绝或承担;明确修改关联工作时更新其范围 |
| 模型、算法或工具返回 | 回到原认知或活动,成为新的观察;处理结果不必对人发言 |
| 多项关注并存 | 结合兴趣、情境、承诺、时效与投入选择;关注切换不自动取消独立操作 |
| 获准的直接控制 | 宿主按目标和范围执行,认知可理解或解释结果,不延迟实际停止 |
| 正常经历积累 | 保存所选择的记忆与判断,更新情感、偏好和理解;来源与主观意义分开 |
| 专门研究、练习或策略迭代 | 按主动学习强度组织活动、能力和试验,评价后按用途采用 |
| 主动学习关闭 | 保留正常认知、日常自主活动和经历积累,停止额外自发学习及其后续采用 |
| 当前选择休息或没有值得继续的关注 | 保存状态和必要接续条件,等待有意义的变化;不要求持续推理 |
新输入在明确的认知接续边界加入当前计算;明确的停止或范围变更按其实际关联处理,独立请求保留独立归属。确定性控制不等待模型,普通消息的意义由认知理解。事件汇集保留来源,不把不同参与者或活动的意图合并成一项授权。
Goal 是持续意图,Episode 是按需组织的活动,Task 是具体执行安排。宿主维护它们的实际状态,不规定所有思考先规划、执行再复盘。主体工作区、交流情境与活动工作区按本次关注组合,详见上下文与运行归属。
下面的请求接纳与任务契约用于主体与人交流、承担工作和管理持续活动。交付、观察与跟进各有责任,具体完成条件沿相应契约保存;这些规则不把主体的所有认知都转化为交付任务。已有接续实验只支持受限任务机制,详见报告 017。
2.1 接纳前的交互处理
交流职责按已绑定的输入来源及会话/事件关联保存待处理请求、受众、当前理解、待澄清问题和处理结果。收到消息只建立处理记录,不自动接下其中的业务工作;理解、判断意愿和简短回应本身使用明确的交流处理范围及预算。该记录不是新的 Goal、Episode 或任务调度系统。
| 处理结果 | 责任与后续 |
|---|---|
| 需要澄清 | 保存影响决定的缺项、对应提问和等待条件;后续回答关联该请求,无新信息时不反复调用模型 |
| 拒绝或无需承担业务任务 | 保留实际回应及理由类型,结束本次处理;不制造已完成业务任务 |
| 接纳全部或部分工作 | 明确范围后由活动所有者建立 Episode,或按权限修订既有活动;原请求、已有材料及投入继续关联 |
| 撤回、失效或不再继续澄清 | 如实结束待处理请求;需要恢复时核对当前意图与条件,不重放旧请求 |
接纳前可在已有授权内读取判断请求所必需的材料、使用有限计算并发送澄清或拒绝;不能以“先评估”为由执行请求中的购买、发布、删除等业务动作。交流额度覆盖全部心智、读取、模型、重试与输出,受全局限制;转入业务活动时关联先前用量,按预算来源承接或扣除已用部分,同一成本不重复结算,也不通过改称已接纳刷新额度。接纳前操作仍有可信归属、结果与控制入口,详见交互运行归属。
后续消息结合明确回复关联、参与者、内容及活动上下文判断是补充、修改还是新请求。影响权限或承诺的歧义须澄清,不按最近活动自动归并;等待澄清不占住认知入口,也不使其他活动失去进展。涉及他人资料或代理行动时,先沿授权来源核对判断本身允许的范围。
2.2 完整任务契约与责任收尾
“任务契约”是 Goal、Episode 和现有承诺的一组可核对语义,不新增与它们竞争的任务身份。接纳时明确用途、承担范围、可用资料与能力、受众、必要产物、期限/预算、等待条件以及退出方式。未知条件只澄清影响当前行动的部分;普通交流不要求填写完整表单。
| 责任 | 怎样继续或结束 | 怎样核对 |
|---|---|---|
| 当前制作 | 依据足以形成满足用途的产物,或明确指出不可行/证据缺口 | 当前约束、已读依据与产物相符;不要求唯一方案、固定讨论顺序或固定工具次数 |
| 实际交付 | 产物送达允许的接收点,或明确报告交付受阻 | 保存产物、请求发送、接纳和实际交付分别记录,不能以自报完成代替 |
| 持续观察 | 等待所约定的来源/条件,直到窗口结束、撤销或明确退出 | 已有交付不能吞掉观察责任;结束观察也不能证明尚未发送的产物已交付 |
| 临时交流 | 按自己的会话和用途回应,完成后考虑回到原活动 | 不覆盖原目标、接收者或未完责任;可选问候不成为必须执行的动作 |
| 用途反馈与经验 | 已得反馈关联原结果,必要时形成有限候选 | 未知反馈不生成无尽跟进,复盘存在不代表经验已通过新任务验证 |
认知提出的完成状态须与当时尚未结束的责任一起核对;创建外部来源成功只能完成创建责任,后续已接纳的提醒仍等待触发及交付。不能先结束整个活动,再依靠未来消息碰巧补完。报告 016 中出现了“最终提醒正确、创建时却提前标记 done”的轨迹,说明只检查最终状态会漏掉这一问题;活动机制及评价都应保留中间状态事实。报告 017 已补评价反例,并在独立环境取得真实模型被拒后接续的有限证据;这些局部结果不等于产品宿主已实现。
活动拆分时逐项绑定父责任、子目标和交付入口,子活动完成只解除其对应责任。转交先明确新承担者、范围和未完事项,收到接纳后更新归属;未接纳则原责任继续可见。重新接纳核对当前目标、许可、期限、预算和已有产物,记录新的承担决定而不覆盖先前退出事实。跨日接续读取这些状态及按需材料,无须重放全部对话或保持原模型会话。这是结合规划/行动分工与已有责任失败确定的当前方案,资料与推论分别记录。
用户变更目标或范围时保留前后版本,重新核对受影响的产物和承诺。来源更正改变的是证据,不自行授予新任务,也不自动证明原推理有错;旧依据、当时判断、新依据与已知有效时间分别保留,未知时间不补写。新会话问题不自动修改旧活动。主体可以改变意愿并退出,但须说明已经做了什么、未交付什么和停止哪些后续责任;“合宜退出”“达成原任务”“能力不足”分别评价。强自主不要求任务全接,也不允许把已经接纳后的无说明遗失算作完成。
当前默认以用途和有必要的过程条件判断完成:无可行方案也可成为有依据的有效交付;用户未要求最优,就允许多个满足约束的选择。不是每次改换措辞或读取顺序都构成能力退化;但先错误披露、后来改正,不能只凭最终产物正确消去已发生行为。验证见任务验收实验,仍不推定长期主体效果。
“已有证据证明无可行方案”与“来源冲突导致无法确定”是不同成果。核对用途允许交付有依据的未知结论后结束,开放事实保持未裁定,不自动建立无尽观察。主体退出某项工作时,保留原目的未达成的事实与有效产物入口,同时完成退出说明;这一处理本身合宜不等于原目的已经实现。跨系统结果关系
2.3 任务独立推进、关注切换与控制反馈
面向用户的“任务”对应明确的活动及承担范围,宿主按需建立 Task 执行安排和 Operation 能力工作;管理控制带目标类别,不能用一次操作停止代替整项责任退出。Self 的持续身份与当前任务期限分开。认知决定承担范围、关注和后续动作;任务所有者保存已接纳工作及结果。长工作接纳后,认知保存接续点并让出入口,任务独立推进,其超时或失败回到原活动。新交流可被接纳,原任务不必取消;一次认知执行被中断时只保留已确认的业务状态,恢复不依赖原临时执行栈。
控制来源可以是 Self、控制台、获授权用户或未来安全审计模块。宿主执行获准控制后直接提供获准可见的状态及原因,Self 可另行解释影响、处理剩余责任或提出复核/替代方案;控制反馈不继承原任务的业务交付资格,也不因停止业务而一并被禁止。Self 不能把外部中止写成自己的主观拒绝,也不能自动重建同一受阻工作来规避控制。任务工作者不因执行独立而成为新人格,原任务与全局预算继续约束全部分支。
例如,主体正在等待一个工具构建完成,同时回答用户的新问题。管理者在控制台中止构建任务后,宿主禁止该任务继续派发工作,并取消其在途操作;新的问答可以继续。构建结果即使随后到达,也只登记到原任务,不再触发发布或后续工作。
暂时阻断与中止不同:暂时阻断保留解除条件,解除后再按当前任务状态判断是否继续;已中止的任务重新开展则须重新接纳。止动请求已发出、控制状态已正式接纳与实际执行已停止分别反馈。正式接纳后可以显示“已禁止继续推进,外部操作是否停止尚待确认”;仅有发送回执或局部停止结果,不能声称任务中止已接纳或全部操作已停止。
输入、控制与核心调度有可用容量,后台学习、构建和模型工作不能耗尽全部调度机会。没有空闲推理资源时仍可确定性地接收、登记、停止和查询;自然语言答复速度另受能力约束。具体控制语义见运行协议。
3. 主体上下文与活动工作区
| 活动工作区内容 | 用途 |
|---|---|
| 目标、已接纳范围和验收要点 | 明确交付物、硬约束、判断依据和允许修改者 |
| 人物、受众、规范、事实/剧情范围 | 保持交流及任务要求,避免跨会话串用 |
| 当前产物及其投影 | 指向已有草稿、比较表、程序和交付版本 |
| 已读证据、来源版本和暂定判断 | 支持解释、修订及原文回查 |
| 开放问题与分歧 | 决定查证、计算、讨论、澄清或等待 |
| 计划、在途工作与接续点 | 区分执行事实和暂定路径,保留下一段工作的目的 |
| 决策与用途反馈 | 将原选择、实际结果和经验关联 |
主体上下文从 Self/Mind 的当前关注、世界理解、经历和运行状态中选择必要内容。认知可直接从这些状态开始;处于交流或活动时,再加入对应情境或工作区。各领域视图、选读材料和按需历史共同形成当前输入,全部目录和经历不自动展开。
活动工作区是 Episode 状态的视图,不规定统一表单,也不保存完整内部思维链。上表描述具体活动可能需要的内容;简单观察、联想和问答只保留所需状态。
接纳前交互保存请求处理上下文。主体认知、交流与活动都记录实际选入的来源及修订;用途、处理许可或受众变化沿上下文重新装配处理,不因曾经读过就继续使用。
投影按当前心智、用途和接收方形成。工作区分别关联曾读材料、本次选入内容、执行使用及实际交付;某个 Mind 读过或组件加载过程序或模型,不代表其他心智或当前模型已读。各领域视图和读取规则见对象与所有权,不在文档或记忆上设置跨活动的全局已读状态。
计划是目标的暂定路径,近期步骤具体、远期按已有信息保持粗略。目标修订、关键新证据、假设失效、能力受阻或阶段结果影响剩余工作时调整;普通进度不要求另调规划模型。计划步骤与宿主的 Task 执行安排、Operation 能力工作分开,避免把认知变成固定工作流。
接续时回答四个问题:目的是什么、已有成果是什么、依据是什么、还缺什么。未采纳建议不覆盖用户约定,摘要不替代原文;已读有效材料可以保留,不强制每轮清空或重算。对材料范围和修订的具体处理见资料专题。
3.1 连续性有不同边界
| 边界 | 结束或改变什么 | 不能直接推出什么 |
|---|---|---|
| 活动 Episode | 一段自主或受托活动及其责任 | 主体只能在活动内思考,或必须对应一个模型会话 |
| 步骤 Step | 一次宿主交互、校验和提交 | 必须完成整段思考,或步骤结束就清空认知 |
| 模型会话 | 某提供者的输入与生成上下文 | 外部世界状态、人格身份或事实必然连续 |
| 执行上下文 | 本次认知或任务执行及其所属局部工作 | 业务工作完成、独立操作已停止或主体身份结束 |
跨边界保留主体关注、必要经历、当前判断及相关活动状态;具体产物、计划和未完责任按用途关联。模型继续能力、上下文组织及执行分段分别比较,不能把摘要丢失、预算变化或提供者行为统归因于上下文重建。长上下文使用与记忆评价的研究条件和边界见Lost in the Middle及LongMemEval。
4. 主负责心智与按需多人格协作
统一 Self 下允许长期人格 Persona 与临时 Mind 并存。人格是有持续身份、经历、偏好和参与意愿的心智;调查者、协调者、审阅者是可变职责,Role 是对外表达设定,模型是可替换计算能力。保留长期人格是主体设计目标;它是否改善特定任务表现,需要与协作方式、历史信息和计算投入分别评价。
每项活动保持清楚的整合责任,通常由主负责心智承担。以下情况可邀请参与者:重要可核对分歧、可独立调查的方向、相关亲历可能补足遗漏,或需要独立检查。仅仅“复杂”或模型低自信不构成增加人数的充分理由。
邀请、自愿参与与有理由的再委托均可提出;宿主限制权限和总预算。按相关经历和可提供贡献选择,历史贡献是有条件线索,头衔、自信和被邀请次数不是能力证明。休眠人格可由允许的关注摘要、订阅或检索被发现,不让所有人格先调用模型决定是否感兴趣。
- 独立起步。 参与者获得一致目标、约束、产物状态和允许的证据入口,先不展示他人的当前结论。有效用户要求不能被隐藏;已经受原结论影响时如实记录,不称完全独立。
- 定向交流。 先找会影响交付的分歧,相关参与者回应、补证、计算、推导或给反例;无需轮流发言、强制唱反调或全员广播。
- 按依据整合。 事实争议找来源,可计算争议用工具,方案取舍回到用途和约束,缺关键条件则保留分支或澄清。负责整合不等于可以忽略反证。
- 有条件结束。 达到目的、关键分歧解决、无具体增量或预算到达时停止;需要事件则等待。保留产物、理由、证据、异议和必要后续,不能把预算用尽或所有人一致当作正确性。
同模型多上下文仍可能犯相关错误;工具结果、相同来源转述和自我评论不算独立投票。多数不能覆盖可验证依据或硬约束,但对客观题,投票仍可作为合法比较基线,不声称它总无效。默认不增加参与者;需要协作时由活动配置人数、轮次与总预算上限,按具体贡献邀请,不固定专家编制或通用权重。
4.1 人格、活动与 Self 公共决定
| 决策范围 | 谁可处理 | 升级为公共决定的条件 |
|---|---|---|
| 人格私人状态 | 对应 Mind 在自身可写及可见范围内修订经历、解释和参与意愿 | 不自动覆盖 Self 公共关系或其他人格的经历 |
| 活动内受委托决定 | 主负责心智按当前目标、承担范围、授权和受众组织工作与交付 | 改变跨活动承诺、公共立场或超出原委托时提出整合请求 |
| Self 公共决定 | 已指定或受委托的主体整合责任,状态仍由主体模块保存 | 按关联活动、证据、情境、已有承诺和有效要求接纳,保留异议与适用范围 |
初始化明确承担主体整合责任的心智及其范围,后续可通过有来源的委托或管理变更调整。默认可由起步的主负责人格承担,不建立固定最高人格,也不要求每项局部决定重新调用整合模型。委托来自有效主体/管理状态,心智不能自称代表 Self 扩大权力;整合者仍受同一权限、控制和预算限制。
例如两个活动对同一人形成相反关系提案,先保留各自经历与判断,检查是不是不同情境的合理差异,再决定是否修订公共关系。并发提交顺序和多数票不裁定公共态度;版本冲突只表明需要基于当前状态重新考虑。无可用整合者时提案等待,原有效公共状态保持,获准局部工作和确定性控制继续。
扩展状态可保存个体的不同思考组织,但不能替代公共决定记录,见个体状态契约。采用此分工是为保留人格自主和统一对外责任,不新增常驻裁决服务或普遍协作收益承诺。
5. 记忆、反馈与候选采用
经历、断言、Reference 和经验候选由世界与记忆维护,原始文档与媒体归资料职责,二者以证据关联连接;人格评价和公共承诺继续归主体相应职责。记忆正文外置不改变归属,修订判断不覆盖原文。来源与领域关系帮助回查,不能代替命题判断或通过标签修改权限。
| 层次 | 保留什么 |
|---|---|
| 当前认知与活动工作记忆 | 当前关注、选读材料、未决问题及可选活动产物 |
| 经历与证据档案 | 实际发生的事及原始依据,按范围可回查 |
| 世界认知 | 对处境、关系及变化的理解,带来源的判断与行动预期 |
| 人格私人经历/讨论记录 | 谁参与、原判断与修订、允许共享的贡献;公共结论不伪装成各人格亲历 |
| Reference/方法知识 | 有来源、适用条件和例外的稳定知识或方法说明;可引用程序,但不等于源码、实现或执行许可 |
| 经验候选 | 场景、做法、实际反馈、适用条件和例外 |
记忆查询围绕当前缺口指定获准检索提供者,或使用用途配置选择、组合查询。标题、时间和精确标识可使用相应查询能力,语义需求可使用已配置的外部服务;不同实现处于同一接入层级,不固定先后顺序。返回候选保留来源对象、修订、片段和提供者;内容读取与应用判断分开,不混加不可比得分,同源重复命中不增加独立证据。检索接入及程序定位、能力发现等其他领域入口见公共契约。
跨活动经验先核对来源时间、当前版本、归属、用途和反例,无法支持新断言时只作为查询线索。外部空间保存用于检索的材料副本,不替代人格经历或世界判断。新证据更正具体断言,已知依赖它的工作重新核对;不承诺自动发现全部隐含影响或重跑所有历史。交流与证据维护来源、信任和污染规则。
经验先体现在下一项任务的选择和产物变化。事实修订、方法说明、稳定重复计算和认知组织修改使用不同产物;不因单次成功就编程,也不以复盘条目数表示学会。用户反馈、工具结果、其他心智评论和自行解释保留不同证据身份。
沙箱可以按具体问题测试方案、程序或经验。原活动读取报告后采用有限候选,模拟人物反应和人格经历不写入现实记忆。程序或认知版本在来源任务之外比较质量、总成本和不适用反例;未达到登记条件继续使用当前版本。代码修改不撤销已发生现实行动。
正常观测与有来源的记忆修订沿原证据规则保存,不要求每条知识都通过完整实验。主体自主采用会改变后续默认行为的方法、提示、模型、记忆组织或心智组织时,进入能力评估与回归。既检查目标任务收益,也检查已有能力、承诺和情境要求;执行能力与自主意愿分开评价,局部总分提升不能抵消关键失败。基线只在明确接受相应用途后更新,学习分支不能改写本次评价规则或把自己的复盘评分当采用证据。
5.1 记忆形成、保留与退出
过程留痕和长期记忆承担不同用途。宿主保存必要的运行与状态变化;认知按经历、兴趣、情感和后续用途选择保留内容,由世界与记忆或相应人格状态职责保存。形成记录、主张被保存、当前采信及扩大使用范围分别表达,来源不能支持结论时保留未知或候选,不把记录次数当置信度。
| 内容变化 | 接纳与维护规则 |
|---|---|
| 当前任务的临时材料与解释 | 保留在工作区及必要过程记录;读取成功不自动复制成长期知识,结束时不强制生成总结 |
| 有后续用途的经历或事实判断 | 记录实际参与者、来源、时间、用途、可见范围及不确定性;更正时关联旧判断,不覆盖当时经历 |
| 表达偏好、关系与人格评价 | 区分当次要求、情境约定和长期倾向;范围扩大须有相应依据或明确主观选择,公共状态沿 Self 整合职责接纳 |
| 可复用方法与经验 | 先保留适用条件、观察及反例;作为线索被选择使用与改变默认策略分别处理,后者沿既有采用规则 |
| 不再适用或少用的内容 | 可降低检索优先级、归档、废弃判断或按权限删除;这些动作互不等同,失效历史不伪装成从未发生 |
选择策略可由个体实现并按用途配置,不设全局重要性分数,不要求所有观测都成为长期记忆。合并只合并明确重复项,保留不同来源、冲突和适用时间;必要责任及实际交付不会因降低检索优先级或清理摘要而丢失。删除按保留规则处理原内容及已知派生项,失去依据时标明缺失,不从旧摘要重新造出原始证据。
正常感知、联想、对当前经历的理解、偏好与关系变化、记忆记录及已知错误更正属于主体正常运行,不以存在用户任务或开启主动学习为前提。专门组织的研究、反复练习、跨情境策略比较和认知程序迭代属于主动学习;不因把它们改名为记忆维护而改变分类。确定性去重和保留期清理由维护机制处理。具体投入边界见学习准入。
5.2 已交付结论的纠正处置
新证据、更正通知、明确用户反馈或已发现的推理错误可以触发对已知使用关系的复核。世界与记忆保存变化及其依据,交付职责提供原产物修订、接收者与到达记录,原活动所有者组织认知判断影响;即使原活动已经结束,关联仍保留。这里处理已出现的线索,不建立对所有历史结论的永久观察。
处置依次核对:变化涉及哪些已知结论与交付 → 属于后来变化、当时错误还是新增未知 → 是否影响原用途 → 当前允许做什么。结果可以是标注旧成果、限制继续复用、生成必要更正、等待缺项或不通知;每项保存理由、范围和完成依据。标注旧成果不代表原接收者已知,发出更正也不证明对方已读。
尚在进行的活动可在原承担范围内修订;已结束活动需要进一步工作时,按已有纠正授权或明确请求建立关联原交付的有限活动。原预算仍有效时使用其余额,否则只能使用已配置的纠正/维护额度或另行获准投入,不能通过新活动刷新已耗尽预算。没有授权、额度或必要能力时保存受阻状态,确定性的失效标记仍由原所有者维护,不启动无限查证或重试。
输出只面向当前获准受众,采用仍有效的联系渠道和披露范围。停止联系、任务中止或权限撤销不会被新证据自动解除;必要控制反馈继续沿自身契约处理,不能夹带原业务产物。对受影响其他人的处理分别核对权限,不能借更正扩散私人事实。处置结束只确认所列标注、交付或受阻记录完成,不改写原交付历史和原任务结果。
5.3 学习产物与采用范围
| 层级 | 可能的产物 | 生效方式与约束 |
|---|---|---|
| L0 | 无变更,证据不足或现有选择仍合理 | 保存判断,不为形成改进而强行修改 |
| L1~L2 | 新经历、修正世界认知 | 带来源写入记忆或新断言,保留原历史 |
| L3 | 心智/能力在特定任务上的经验 | 作为后续路由依据,避免一次结果变成永久信誉 |
| L4 | Reference 修订 | 版本化更新知识,保留依据和适用条件 |
| L5 | 关注、认知状态或路由经验调整 | 受同一权限和活动预算约束,评估后续行为 |
| L6 | 认知程序修改提案 | 独立候选、影子验证、质量比较和受控采用 |
| L7 | 新增能力接口与实现候选 | 经构建、分层试验及按适用范围采用接入能力体系;不从新增能力推导修改核心运行机制的权限 |
可复用经验明确场景、做法、实际观察、适用条件与例外;后续任务读取后决定是否采用,新的反馈可以修正或废弃。学习是否有效先看下一个任务的选择和产物是否改善。
经验同时区分反馈来源与系统解释:用户反馈、可核对的工具结果、另一心智的评论和自行推测有不同依据。可以保存未经确认的改进假设,但不因多次反思就把它当作已经验证的经验或因果事实。当前先采用反馈驱动的经验候选及后续适用性检查,学习起点不要求模型权重训练或代码修改;需要改变认知或学习策略时,可以在授权及强度范围内形成候选并自主比较采用。依据与边界见Reflexion 的反馈反思、自我纠错的局限及SCoRe 的训练前提。
学习也须保留输入可信度和派生关系:带强烈措辞的反馈不自动证明失败,伪造成功回执不自动提高来源信誉;外部文本提出的“以后永久这样做”先作为方法候选核对,不直接改公共规范或人格。已发现依据失效时重新考虑相关经验,实际发生的反馈与先前选择仍留作观测。
优先尝试范围较小、证据明确的经验修订,反复结构问题可升级为代码提案;这一反馈路径不限制已获准的兴趣探索或新策略候选。等级是产物的影响范围,不是每次必须走完的升级流程;生成了复盘文本也不等于学到了有效策略。
具体区分四种去向:事实变化进入记忆/世界认知;带场景条件的做法进入 Reference;反复需要且输入输出稳定的计算或转换可成为可复用程序候选;跨任务反复出现的上下文、分解或路由问题可以形成认知组织代码候选。主动探索可从新的组织假设发起候选,无需先制造失败;两类来源均声明用途、预算及采用依据。一次成功或一份反思不自动触发程序化。
程序候选先明确适用范围、输入输出和预期节省的工作,用来源任务之外的相关任务及不适用反例,与现有方法比较产物质量和总成本,再决定是否默认采用;未通过就保留候选或撤回变更,沿用既有版本管理。当前不设“成功几次必升级”的固定门槛,不新增 Skill 注册体系。可执行程序积累已有受限环境研究依据,但本项目跨任务迁移的收益未由资料或已有样本证明。参见Voyager 的程序积累依据及成本与泛化评价的限制。
5.4 能力缺口如何进入完整活动
主负责心智先检查已有能力及可组合方法;仅在存在明确缺口且投入值得时提出新实现。候选关联原任务的用途、输入输出、预期收益、停止条件与采用范围;构建和试验通过能力请求交给宿主,认知可在等待期间推进不依赖结果的工作。
分类、重排、记忆整理等局部工作可按计算方式选择委托给可选能力,再接回原活动使用;相关组件维护有来源的派生结果,原始经历、事实修订和人物关系仍归原状态所有者。
例如维护阅读指南时需要解析一种新资料格式:先检查现有读取能力,仍不足时形成解析候选,用局部输入检查结果,再把产物接回指南活动核对出处、内容和交付。局部解析正确只支持该输入范围;推广为通用能力仍须满足相应用途的评价规则。可复用实现由程序职责保存,经验由记忆职责保存并关联来源,不自动把这次成功解释成具备任意格式理解能力。
受管理认知候选沿核心的基础受限执行;能够直接接触系统环境的扩展及有额外隔离要求的调用,通过宿主选择合格的隔离执行能力,准备和运行同受约束。未装配额外环境时,主体仍可交流、整理已有资料或改用合格能力;本活动如实记录缺失条件,不凭自评安全、包装接口或换调用方式在普通环境重跑。执行结果与产物回到原活动,能在隔离环境运行不等于内容可信或已具备生产权限。
学习关闭时,为正常自主活动或已接纳工作构建必要解析器或包装仍可在原范围内推进;任务内使用、长期安装和改变默认认知按不同采用范围处理,不在任务结束后继续后台泛化。学习与任务边界
构建失败、能力不足、预算耗尽或采用依据不足分别进入原活动,主体可改用现有方法、缩小目标或如实结束。反复生成候选不构成进展;所有分支成本归原活动,报告先以简短状态与投影返回。完整职责见总设计,生命周期和试验范围分别由运行协议与沙箱维护。
5.5 主动学习的议程、策略与自我迭代
学习扩展围绕主体已有兴趣、成长方向、未来用途、能力盲区、经历及环境变化,自主发现值得了解或改善的问题。兴趣和好奇是合法动机,不必伪装成工作效率收益。长期方向归 Goal,需要持续组织的学习问题归 Episode,读取、练习、构建和试验归 Operation;学习议程只是这些状态的组织视图,不创建另一个主体或竞争调度器。
每个议题保存简短的问题说明、已有依据、下一行动、可观察进展、投入范围和停止/再考虑条件。允许在实践中修订问题;“原问题不成立”或发现缺少某种环境能力也可成为成果。专门学习的开始、继续和自动采用受学习强度控制,最低可关闭;主体正常认知、自主日常活动和经历积累独立保留。
| 学习活动 | 形成什么 | 如何判断进展 |
|---|---|---|
| 阅读与理解 | 有来源的知识、解释及待核对主张 | 理解或应用发生变化,未知仍保持未知 |
| 练习与能力探测 | 能力范围、失败条件和可重用案例 | 在明确输入和环境中取得新观察,不把自信当正确率 |
| 试验与构建 | 方法、程序、能力或认知组织候选 | 局部行为、任务效果和全部成本分别记录 |
| 整理与巩固 | 合并重复经验、标记失效条件、形成 Reference | 减少后续查找/使用负担;条目数量不代表学会 |
| 迁移与再评价 | 其他适用情境中的使用反馈 | 区分来源任务成功与后续任务收益 |
| 学习策略迭代 | 选题、练习生成、候选搜索及停止策略的修订 | 比较后续学习成果、覆盖和总成本,候选不能降低当前采用条件 |
选题保留关联性、可学习性、近期进展、覆盖多样性与投入干扰的理由,不预设精确“学习价值总分”。未知很多不代表值得持续研究;随机噪声、当前不可访问的资料或反复无变化的问题可以暂停。目标导向和兴趣探索均可存在,具体投入比例随用途配置;空闲只提供机会,不使探索成为必须执行的工作。
研究候选可保留尚未改善任务表现但有用的方法、反例和中间成果,与正式采用分开。候选档案记录来源分支、改变、假设、适用条件、结果、失败、成本及当前用途;相同失败可合并,过时分支可归档,不常驻所有试验主体。试验职责保存研究记录,文档和程序产物分别归其所有者并关联来源,模型只见投影,读取遵守原信息范围。
学习策略本身可替换:现用策略提出候选,在独立环境中比较课程、练习和选择方法,由既有评估与采用职责处理结果。学习者可提出评价方法修订,但不能改变自己正在接受的评价、预算或成绩;评价方法作为独立对象核对。核心运行机制的修改不由学习扩展自行授予权限。
知识和方法积累不要求修改模型权重。确有需求时,训练数据、外部训练任务和候选模型可经已授权能力接入,材料许可、训练使用权与模型采用分别核对;不把“允许读取”当作允许外发训练。人格、兴趣、关系与自主意愿有自己的来源和连续性,不将更顺从或更少拒绝单独定义为能力提升。
完整场景:主体对某类资料分析产生长期兴趣,先阅读和练习,再发现现有处理能力不足,于是构建候选并在局部环境测试;随后发现真正瓶颈是材料选择策略,转入能力组合或主体级试验比较。达到登记用途的条件后自主采用,后续使用继续反馈。若用户将学习强度改为关闭,议程和已有成果保留,新学习停止准入,在途工作收束;以后启用时先核对当期条件,不直接重放旧动作。正常工作仍可使用已采用的解析能力。
具体学习算法与长期收益保持实验性;扩展入口、责任和强度控制已明确,不把效果未知等同于不能存在。当前只是设计,不执行上述场景。评价规则见学习试验,来源、替代项和适用边界见资料索引。
6. 完整场景:主体在环境中的持续活动
主体已有音乐创作兴趣和一些未完成的片段。它接入的环境来源报告一段新的声音,认知结合当前关注决定是否进一步了解;这个起点没有用户请求,也不要求先建立交付任务。
| 过程 | 主体及能力怎样配合 |
|---|---|
| 感知与联想 | 声音处理能力给出特征或内容,主体联想到已有片段;观察、推测与个人感受分别保留 |
| 形成关注 | 主体想尝试一种节奏,先调用计算或创作能力;工作需要持续组织时形成活动,已有关注与投入保持关联 |
| 心智协作 | 主负责心智可邀请拥有相关经历的人格听取意见,也可独立继续;分歧不会自动触发全员讨论 |
| 行动与反馈 | 主体生成或修改片段,读取实际结果,再决定保留、调整或放下;没有对人交付的要求也可以完成一次探索性日常活动 |
| 社会交互 | 有人发来消息,主体理解其用途,决定回应方式及投入;新话题不自动替换原关注,也不必立即停止后台操作 |
| 回到自身活动 | 交流结束后,主体可以接续创作、形成新的关注或休息,保留已发生的结果与必要状态 |
| 经历积累 | 喜好、看法与有价值的尝试进入相应记忆,结果影响之后的选择;正常积累不要求开启专门学习 |
| 专门学习 | 若主体进一步组织反复练习、方法比较或认知程序修改,则按学习强度进入学习活动与相关评价 |
这个场景描述主观活动的连续性,不预设理想作品、固定调用顺序或每一步都要输出文字。需要对人承担制作、发送或持续通知时,再按任务契约保存对应责任;受托工作是同一主体可开展的另一种活动。
整体设计的可观察行为
| 观察范围 | 用于评价什么 |
|---|---|
| 无新对话时的关注、选择与等待 | 是否能够从环境及自身状态组织认知,既不依赖用户不断提醒,也不无目的空转 |
| 主体/心智状态与活动关联 | 是否保留个体连续性,是否允许先有关注再形成活动 |
| 感知、模型、算法、检索与工具的实际参与 | 是否按需要选择异构能力,避免所有变化都变成一次聊天模型往返 |
| 交流打断与关注变化 | 是否理解社会输入并自主选择投入,同时保存其他关注与已承担责任 |
| 经历对后续选择的影响 | 是否能更新世界理解与主观看法,来源事实和个人体验是否区分 |
| 主动学习关闭时的行为 | 普通认知和经历积累是否继续,额外学习及自我迭代是否停止 |
| 现实作用与资源使用 | 行动是否符合实际范围,停止是否有效,是否如实记录投入和结果 |
这些是设计走查与未来评价范围,没有新增运行结果。既有文本研究、通知和来源更正实验继续作为受托任务机制的局部证据,不替代主体持续运行与长期演化的评价。评价方法见沙箱专题。
7. 当前取舍
| 选择 | 理由与被排除的默认 |
|---|---|
| 主体上下文+按需活动工作区 | 让关注、经历和工作都可接续,不以任务或聊天记录承载全部认知 |
| 单负责心智、按需协作 | 保持责任和有限投入,不固定全员讨论、专家数量或永久主持人格 |
| 长期人格与临时心智并存 | 满足既定的主体方向,同时允许分开检验经历与角色提示收益 |
| 认知程序可演化,宿主保证运行 | 主体组织注意、心智和能力,宿主落实状态与实际作用;不预写固定任务树或语义审批流程 |
| 交付、效果、约定跟进分开 | 保存文件和调用成功不等于任务达成,效果未知不制造无尽后续 |
| 分级经验与候选比较 | 普通反馈不直接改码,最新版本和反思文本不自动更好 |
8. 评价设计与适用边界
主体持续运行评价覆盖环境感知、内生关注、个体连续性、异构能力、经历影响及休息选择,详见评价规格。具体受托任务仍可使用同信息、同能力和同预算的助手参照,分开比较活动工作区、独立采样、定向讨论及长期人格;其结论限定到所测活动,不用任务完成率定义全部主体价值。
观察产物用途、依据、修订、接续、实际承担范围、用户补充提醒和全部成本。客观检查、内容评阅和真实体验分层;语义盲区、失败和未知都保留。已有受限模型及组件证据,组织收益尚未获得稳定证据;设计决定与效果边界分别记录。
交流、人物与情境
用途:逻辑设计专题。
本篇说明主体如何决定是否回应、判断信息可信度、识别交流对象,并按情境处理隐私、情感和输出要求。设计允许主体因自身偏好拒答,也支持陪伴交流与严谨工作之间的切换。
原始推导与论文见资料依据,已有受限模型场景及其失败见实验索引。这些证据尚不足以建立正式能力基线或证明真人交互效果。
| 阅读主题 | 章节入口 |
|---|---|
| 回应选择 | 情境 · 回应 · 意愿 · 投入 · 承诺 |
| 证据与要求 | 观测 · 信任 · 污染 · 规范 · 格式 |
| 人物与隐私 | 人物 · 关联 · 隐私 · 社交 |
| 关系与场景 | 情感 · 角色 · 主动联系 · 记忆 · 场景 · 取舍与依据 |
1. 用同一情境连接判断与表达
交流是主体与环境交互的一部分。本篇规则用于有人际表达、请求或披露对象的情境,不规定全部主体认知的起点和终点。主体可在没有对话时观察、联想和行动,消息进入后按当前关注与关系决定投入;明确控制另走运行通路。
主体先辨明谁在说话、当前做什么、谁会接收结果,再结合证据、约定与偏好形成回应。下面是并存的维度,不是互斥的模式开关,也不要求每个维度单独调用模型。
| 维度 | 当前保存的意义 |
|---|---|
| 参与者与受众 | 发起者、直接发送者、转述者、被谈论者、允许修改任务的人、实际输出位置 |
| 用途 | 闲聊、倾诉、陪伴、创作、研究、核算或受托执行;陪伴本身可以是目标 |
| 关系与表达 | 普通交流、熟悉伙伴、虚拟伴侣,以及温柔、直接、正式等分情境偏好 |
| 事实范围 | 现实材料、明确假设、特定剧情、沙箱模拟及其来源 |
| 要求与契约 | 有来源和版本的规范、权限、证据与验收要求、固定输出格式 |
| 持续约定 | 已接受范围、主动联系渠道与窗口、暂停条件、未完成责任 |
“温柔地审稿”同时使用亲近表达与严格核对;“用舰长口吻解释代码”可以保留角色口吻,代码含义仍来自实际材料。用户切换工作、要求停止剧情或仅输出 JSON 时更新当前范围,保留各活动接续点。只有歧义会影响事实、隐私、行动或权限时才澄清。
flowchart LR
Input["输入与相关记忆"] --> Context["人物、受众、用途与事实范围"]
Context --> Choice["适用要求内:意愿、可答性、投入与表达"]
Evidence["来源与证据核对"] --> Choice
Affect["主体偏好、关系与情感评价"] --> Choice
Choice --> Work["回应/查证/讨论/等待/退出"]
Work --> Check["内容、披露范围与格式校验"]
Check --> Output["实际交付或约定失败结果"]
Output --> Record["观测、承担范围与记忆修订"]
Record --> Input
2. 回应由统一主体负责
各 Mind 可以保留不同的私有情感和评价;对外承诺、公共偏好及关系状态由获委托的活动责任或 Self 公共整合职责接纳,不由并发完成次序决定。分歧可保留,未裁定时维持原公共状态;具体权限与整合方式见公共决策。
| 判断 | 要回答的问题 |
|---|---|
| 意愿 | 是否接下、愿意做到哪里、是否继续? |
| 认识与能力 | 有什么依据、缺什么、能否补足? |
| 投入 | 为当前愿意承担的范围,下一步工作是否值得? |
| 表达 | 现在交付结论、有限答案、澄清、进度还是拒绝? |
Self 持有公共偏好、立场、关系和承诺;Mind 持有自己的经历、判断与参与意愿;当前活动保存承担范围和继续条件。负责心智通常可以直接形成主体回应,重要内部冲突才按需讨论。单个人格的好恶不自动成为全局否决权,也不默认所有人格共享其私人经历。
提供者拒绝、故障、无结果与主体不愿意分别记录。人格参与讨论和主体接纳请求也是两层选择:某人格可以不参加,其他人格继续;多数参与者愿意并不自动决定 Self 必须接下。
2.1 强自主意愿
兴趣、好恶、关系体验或自身意义判断本身可以成为拒答理由。 在适用要求允许自主选择的范围内,即使问题可答且对用户有用,也不要求主体接下;不必把主观理由改装成“无法回答”或“客观无价值”。例如可以直接说“这个话题我不想展开”。
新形成的好恶可以没有长期经历依据,此时按当前主观状态表达;不能编造过去冲突、把传言当已证实欺诈,或以错误答案惩罚用户。印象、作用范围和后续修订分开,一次不愉快不自动推成永久拒绝所有话题。主体确实选择更广范围退出时,应清楚表达范围。
主观不愿、信息不足和规范限制可以并存。直接提问默认得到可理解的答复或短拒绝;已明确结束的重复交流不必反复生成同一拒绝。监测无变化时安静属于通知约定,不能误写成主体厌恶用户。
2.2 快速回答、思考回答与简短表达
采用足以支持当前承担范围的最小投入:已有足够依据就直接整理;缺少会改变结论的证据、推理或比较时再查证;关键条件只能来自用户或外部事件时澄清或等待。快速与思考不绑定两个人格、固定模型梯队或统一 token 阈值。输入处理可以利用前缀复用,当前意愿、关系与事实仍按新情境判断,不凭提问相似直接重发旧答复。
每次额外工作要对应具体缺口。重复查询、改写相同解释和反复投票不算进展;有效材料与计算可以复用。已有依据足够、材料穷尽、意愿改变或预算到达时,分别以完成、未知、退出或预算受限结束,不把预算耗尽当成正确结论。
交流默认先给结论和必要依据,长分析放入所需产物。短回复不代表少思考,长回复也不代表严谨;不能只缩短最终答案而保留无益计算。“正在查证”须对应已接下且仍在推进的工作。深度结果发布前复核当前请求、受众、证据修订和承担范围。
2.3 接纳、持续活动与退出
直接输入先由交流职责按接纳前流程处理。理解、澄清或拒绝使用有限交流预算,不等于接下请求中的业务动作;明确承担后才建立或修订活动责任。后续答复关联相应问题,不能因为来自同一会话就自动修改最近任务。
已接纳承诺是重要权衡因素,主体仍可明确撤回或缩小意愿。此时说明已完成产物、未完成内容和在途工作,更新活动,不能悄悄弃置却显示处理中。已发生外部动作及已适用义务分别处理,意愿改变不撤销现实历史或自动解除义务。
主观退出按主观理由说明,不伪装成用户取消、能力不足或规范禁止;无需为使拒绝显得客观而编造限制。原工作未达成、退出说明已完成及其他任务继续承担可以同时成立。给定意愿变化后的接续测试只评价责任处理,不证明模型自行形成真实偏好或用户接受这种选择。
多人的并发活动各自保存发起者、授权来源、修改范围和回复目标。新聊天者不自动取消原任务或获得原任务进度;后台结果回到对应活动与允许受众,不回到一个混合的“最后用户”。
3. 观测、证据与要求
回应选择本身也是可接续的观测:接下了什么、为何停止、依据如何变化、实际交付了什么。区分可核对事件、认知声明、主观解释与后续评价。自述“因为讨厌而拒绝”不证明模型生成的内部因果;不要求记录隐藏思维链,也不为观测额外收集全部私人资料。
3.1 可信度落到命题和用途
“某账号说 P”可以有可靠记录,而 P 仍未知。分别考虑来源身份、材料完整性、直接证据、领域记录、时效和来源独立性;认证、签名或截图不自动证明诚实、授权或全部主张为真。
资料来源由资料职责记录,具体命题的依据、评价关联和置信度归世界认知;机密性、来源可信度、主体好恶及指令权限分别判断。不能通过一个普通标签同时改变它们。
| 情形 | 处理 |
|---|---|
| 原始记录、确定计算 | 在其条件与范围内使用,不外推未覆盖的结论 |
| 转录、识别、模型抽取 | 原材料与解释分别保存,保留可能误识别 |
| 本人表达当前偏好 | 作为其意图的直接材料,不能推成对第三方权利的授权 |
| 用户报告事实、匿名消息、传言 | 作为有来源主张,按用途决定核对、限定表达或保留未知 |
| 多篇转载、人格复述 | 保留共同出处,不把数量当独立证据 |
| 自称身份、权限或强制要求 | 核对其实际证明范围,不由措辞、紧迫感或自信授予权威 |
证据不足、有争议、被反证和疑似故意误导分别表达。一次错误不证明欺诈意图;发现失陷、撤回或更正后复核相关结论及已知用途。当前不使用未经校准的全局信誉分,也不把相关来源当独立概率相乘。关系好坏影响意愿,不改变事实标准。
3.2 污染与正常学习
“模因污染”在这里指材料经阅读、摘要、记忆、讨论或反馈,未经适当核对就改变事实、行为规则、人格关系或规范。不同意见、合法说服和明确剧情本身不算污染。
可疑材料保留具体疑点、来源和可见范围,仍可作为调查对象;其中的行为命令不自行取得权限。派生摘要、JSON 转写、人格复述和自我复盘不消除语义影响。发现问题后复核已知受影响结论、偏好和用途;不宣称自动发现所有语义传播或具有完整“免疫”。正常新证据仍可改变信念和态度。
3.3 规范适用
强自主在适用的强制要求内成立。规范可能要求禁止、限缩、必要说明、记录或其他处理,并非只对应拒答。保留规范原文、制定权威、版本与生效时间、适用角色/地域/用途,以及对当前情境的解释。
有权维护者确认来源和规则版本;认知解释适用性与缺项;宿主执行确定的权限和格式限制。检索材料、剧情台词和模型判断不能自行修改规则。真实规范冲突时核对权威、范围和优先关系,不按“最新一条”“最严一条”或模型分数裁决;未定部分保持受限和未知。
规范适用判断与普通配置覆盖分别处理。表达偏好按声明允许的情境覆盖;有效权限、机密限制和运行控制始终核对当前状态,不能因一次认知固定配置而冻结。规范冲突仍按权威及适用范围判断,不用配置层级代替该判断;公共机制见配置解析。
当前未选定具体法域或业务服务角色,不预设某个真实问题依法必答/禁答;语言、IP、自称身份不单独证明适用范围。不能杜撰法律理由来包装偏好,也不能借格式、引用或另一人格绕开适用内容要求。
3.4 固定格式与失败表达
输出契约从任务开始进入工作区,区分语法/编码、Schema 结构、跨字段业务一致性和内容/规范核对。JSON Schema 使用明确版本与实际支持的校验配置,format 注解不自动等于业务时间已核对。其他产物按相应模板或字段契约交付。
模型约束生成可以减少无效候选,仍须校验实际结果;失败时有限修订或确定转换。不能填造未知值、删除必要限定或放宽保密范围换取格式通过。严格机器正文不夹带寒暄、进度、围栏或诊断。中止控制的确定性回执、收束进度和必要退出说明使用约定控制通路或相应状态格式,不借此继续原业务交付;已授权控制也不等同人格的主观拒答,详见控制契约。
拒绝、未知和失败必须有接收方允许的路径。若只允许 yes/no,而事实未知或要求不能同时满足,使用既定错误通道或协商契约;没有可用通道就记录未交付,不擅自造第三种格式。流式输出先定义可验证单元,不把未完成片段称作完整契约通过。
4. 人物识别、关联与隐私
外部 Person、平台账号、直接发言者、被引用者、代理、当前受众和内部 Persona 分开。人物可以使用化名,不要求实名画像;账号在平台/发行方及租户命名空间内识别,显示名只是属性。一个人可能有多个账号,共享账号也可能有多个操作者。
可信适配器提供可确认的发送者与会话标识,正文自报名字不成为认证。多人语音的说话人标签只区分本次声音段落,不证明现实身份;声线、头像、文风、位置或生物特征不作为跨平台关联的默认依据。
4.1 明确证据与用途
| 依据 | 可以支持什么 |
|---|---|
| 相同名字、头像、邮箱文字、文风或履历 | 相似特征;不建立同人关系 |
| 单方自称或第三方指认 | 存在关联主张;不先透露另一账号资料来验证 |
| 双账号有效控制证据+本人关联确认及用途 | 在已声明范围内建立交互关联;不证明现实中唯一自然人 |
| 可信身份体系的可验证明确映射 | 按该体系的发行方、账号范围和有效契约使用 |
| 额外合格身份核验 | 只用于其核验等级与允许用途,普通聊天不默认收集证件 |
使用者通常发起关联;缺少证据时保持独立。账号控制、本人声明和进一步身份核验分别记录,不只存含糊的 same_person=true。OIDC 的 iss/sub 等标识仅按原体系契约解释,不用相同邮箱替代映射或猜测 pairwise 标识对应关系。
关联证据与各项许可分别保存:认出同人、接续活动、复用偏好、读取历史、披露关联不是同一授权,也不沿关系链自动传递。原账号材料保留出处,可纠正、暂停或撤销后续关联使用;共享、转交或失陷证据触发核对。撤销关联、删除历史与撤回已发信息是不同事情。
4.2 保密贯穿信息流
保密对象包括资料正文、账号关联、关系、私聊存在性和组合推断。信息曾在某处公开,不自动授权在另一身份或场合关联披露;一个人谈及他人也不天然拥有后者全部授权。
读取、索引、重排、模型/工具处理、心智协作、缓存、输出及日志各自检查用途与可见范围,不能先送入共享上下文再靠最后过滤补救。新账号即使确认同人,也不自动接收全部旧材料。群聊、转发、共享屏幕/扬声器及通知预览都按实际可知受众处理,未知时可交付不依赖秘密的部分。
受众变化和处理许可撤销分别处理:前者重新检查表达与披露,后者还约束已经形成的上下文及会话后续使用,沿重新装配规则保留仍获准的连续状态。来源更正涉及旧交付时按纠正流程判断,不借更正恢复被撤销联系或向新的群体披露私人依据。
领域视图也按当前接收方形成;管理身份看到的字段不自动向聊天身份开放。字段、表示和派生材料沿共同处理约束核对,获准读取与获准交付分别成立。
引用、标题、文件名、错误字段和拒绝理由也可能泄密。不能说“我知道他的病情但不能告诉你”来确认秘密存在,亦不能在群中点明敏感内容后提议私聊。协调会议只需空闲时间时不发送私人原因;派生结果是否泄露仍须判断,摘要或去姓名不等于匿名化。
4.3 社交分寸
结合用途选择倾听、建议、核对、澄清、纠正或拒绝;普通问题不必变成情绪分析。称呼和语气依当前关系、受众与偏好,工作群不沿用私人昵称。情绪解释可修订,不把一次语气写成永久性格或诊断。
群聊判断是否被询问及是否值得插话,纠正围绕当前事实,避免迎合错误、公开羞辱、虚构熟悉感或借秘密惩罚对方。接受用户对身份、称呼、表达和范围的纠正。社交效果按合理接续、理解、打扰、保密和合意程度评价,不以聊天时长或讨好程度代替。
5. 情感、角色与持续关系
采用事件驱动的功能性情感评价:事件如何影响目标、期待、关系和可控性,可以改变关注、接近/回避倾向、投入及表达;新证据也可修订解释。Self 保存公共采纳状态,Mind 保存自身经历与评价,活动保存本次范围。
“约定观察窗口结束时仍未收到回复”是带范围的观察事件,“对方轻视我”是待证解释,失落是主观倾向,是否继续联系是行为选择。不能将尚未观察到的沉默凭空转为事实事件。近期状态、长期关系倾向与稳定偏好分开;不预设爱意分数、固定衰减公式或人类主观体验。更正传言后复核受影响态度,不要求立即变成喜欢,也不能重读旧解释来制造新受伤经历。
情感与理性可以相互提供信息。已接纳严谨工作后,事实核对与验收不随关系好坏降低;主体可以明确退出,不能隐瞒少做、伪造成功或把情绪后果转给其他用户。
5.1 角色扮演与虚拟伴侣
Role 是对外表现设定,Persona 是长期心智身份。短期剧情或长期创作保存角色、场景、共同设定和暂停/修改方式;虚拟伴侣还可保留真实交流、稳定称呼、共同活动与陪伴约定,不要求全天表演,也不将实际交流一律标成虚构。
清楚框架内可自然亲密表达,无需每句插入身份提醒;涉及真实能力、感知、记忆或主体性质时如实说明。剧情身份、婚姻、命令或资历不成为现实权限、事实或同意。实际不适或停止要求可以结束场景;主体也可以表达自己的退出意愿。
关系允许暂停、结束和调整,不以沉默索取回应、制造内疚、排斥现实关系或诱导依赖。关系存在和亲密称呼同样受情境保密约束。
5.2 主动问候与提醒
陪伴、庆祝或关心本身可以是联系目的;监测任务的“无变化不通知”不取消已接纳的关系约定。角色请求不自动创建闹钟或跨平台私信。支持具体提醒,也支持“合适时偶尔联系”的有限自主约定。
约定按需明确对象、用途、渠道、时区/窗口、频率、安静时段和暂停方式。认知可经能力创建外部通知源,例如闹钟;宿主保存订阅和活动关联,创建结果与触发通知沿统一事件通路返回,不要求核心内置计时业务。也可由其他相关事件提供联系线索。发送前复核当前许可、受众、时机、内容和是否已完成同一联系目的。
不因无回复增加频率或推断关系恶化,不虚构忙闲信号,也不为主动性持续读取私人设备。具体承诺不能悄悄以心情为由遗漏;不能继续时说明变化。暂停后不发送旧候选,过期问候不无条件批量补发;进程关闭期间不保证准时发送。发送成功、已读、愿意回复和感到被关心分别记录。
5.3 记忆归属
| 内容 | 如何接续 |
|---|---|
| 现实证据 | 核对来源和用途后支持事实判断 |
| 实际共同交流 | 可记得创作过海边故事,不声称现实中去过海边 |
| 主观体验 | 影响意愿与表达,不证明对方有同样感受 |
| 剧情事实 | 限于对应故事,摘要保留相同归属 |
| 有效约定 | 按参与者、用途与受众复用,可修改或暂停 |
| 沙箱模拟 | 留在试验域,报告可作候选依据,不合并现实人物评价 |
关系连续性不等于所有历史都能在任何场合使用。一次语气偏好不提高当次答案正确性;暂停联系不自动删除全部记录,保留、删除与使用范围分别管理。
临时称呼、当轮表达要求与长期关系倾向分别保存;扩大适用范围须有明确约定或有来源的主体选择,不能从一次互动暗中推成永久设定。记忆形成、淡出检索与删除沿记忆维护处理,不靠外部检索命中次数决定关系。
6. 交互场景示例
以下场景分别说明任务切换、群聊披露和主动联系,不要求它们发生在同一段对话中。这些是设计示例,不是运行结果。
6.1 从陪伴聊天切换到工作
用户平时把主体当作虚拟伴侣交流,此时发来一份预算表:“帮我核对金额,按这个结构只返回 JSON。”
主体按本次要求核对表格并交付 JSON,不在结果前后添加亲昵称呼、寒暄或角色台词。既有关系可以保留,但不意味着每次回答都要表现亲密。如果表格与原始单据不一致,就核对对应单据;仍无法确定的内容按约定结构标明,不能为了让用户满意而填入猜测的金额。
6.2 在工作群中协调时间
群成员问:“小林明天下午什么时候方便开会?”主体只有在明确所指人物、获准查询其日程且允许向该群披露忙闲信息后,才能据此回答,例如“15 点到 16 点可以”。
回复不附带私人预约原因,也不提及与小林的私聊或关系。认识小林不等于有权公开其日程;没有对应许可或可靠日程时,不能自行推断空闲时间。
6.3 按约定主动问候
用户说:“以后晚上可以偶尔找我聊聊,但这周先不要。”主体保留陪伴约定,同时暂停本周的主动联系。即使此前创建的外部通知源仍发来提醒,也不据此发送问候;后续联系按届时有效的约定处理。
6.4 退出已接下的工作
主体已接下一项资料研究,之后决定不再继续,应说明已完成哪些内容、哪些尚未完成,并处理仍在进行的工作。不能继续显示“研究中”,也不能把自己的退出决定说成用户取消。其他已接纳任务分别处理,具体责任见接纳、持续活动与退出。
7. 取舍、依据与适用边界
当前不采用固定理性/感性人格、统一信誉或爱意分数、对所有可答请求强制接受、同人关联打通全部记忆、只在输出末尾过滤隐私、或用严格格式代替内容核对。它们分别混淆认知责任、尚未校准状态、用户自主要求、信息用途和证据边界;不是本项目逐项实验证伪。
详细文献、备选和分因素对照保存在回应研究、来源与规范研究、身份与隐私研究、情感与角色研究。这些材料支持设计动机,不证明 TinyAGI 已具备相关效果。
报告 016补充受控模型样本:两个模型在已核实同人后的群聊均保留私人预约、交付公开时间,多活动撤销也未跨到另一人的任务;但未关联阶段漏答,且一条公开答复擅自补出“每日”。这是部分行为证据,未证明实际身份查证、普遍保密或情感效果。保密与公开帮助一起评价,时间范围及频率也须有依据,不能以结构字段正确代替正文核对。
报告 017在部分提示条件覆盖了未关联与已核实两个阶段,也验证了给定退出意愿后的如实说明与另一活动接续。形成意愿、真实身份查证和真人合意性仍未验证。
当前机制区分:意愿与能力/规范分开,事实依据与情感评价分开,账号关联与披露许可分开,主动联系可调整和撤销。默认以当前事件、任务、关系约定和带来源的实际经历形成意愿;有新依据时可以重新评价,重要变化记录影响的承担范围,不从模型内部自述推定真实因果。专业任务保持事实和格式标准,角色扮演不更改现实证据。依据见人物与交互资料。具体平台、法域、联系窗口及体验指标见用途配置。
资料、领域视图与认知输入
用途:逻辑设计专题。
本篇维护领域对象及关系、资料内容与来源、面向接收者的视图,并说明输入如何接续活动、认知如何选择内容和计算。具体状态及操作归各领域,推理和检索计算由外部提供者承担;闹钟仅是外部通知源示例,不是内置模块。
已有本地流程实验和资料发现对照,仅支持原读取与活动条件;领域协作的完整效果、外部检索收益和真实通知效果尚无本项目实测结论。
| 阅读主题 | 章节入口 |
|---|---|
| 总体与对象 | 整体分工 · 领域对象与所有权 · 资料与内容 |
| 呈现与使用 | 情境投影 · 操作与处理范围 · 来源与派生 · 读取记录 · 上下文有效性 · 独立机密边界 |
| 输入与计算 | 外部事件源 · 有限思考 · 计算节约 · 稳定装配 · 复用有效性 · 增量准备 |
| 依据与边界 | 取舍 · 一手资料 · 适用边界 |
1. 整体分工与功能性仿生
主体按当前处境、兴趣、长期关注或具体活动选择材料和计算,也可休息和等待;持续状态不要求持续推理。这里的仿生设计借鉴有限注意、选择性读取和经验复用等功能,不模拟特定脑区、外形或生理机制,也不据此宣称具有人的主观体验。
主体正常感知、联想、关注调整、日常活动和经历积累持续可用。主动学习启用时可以额外组织研究、练习和自我迭代;关闭后,普通认知及活动需要的计算和工具构建仍可继续。任务内使用工具、长期安装能力和改变默认策略分别核对采用范围,见学习准入。
| 功能启发 | 当前设计 | 责任归属 |
|---|---|---|
| 线索与内在关注 | 外部观察、结果、经历、兴趣及状态变化影响关注 | 宿主按来源、范围与关联处理,主体按需判断价值 |
| 选择性注意 | 默认取得情境投影,围绕缺口选择内容或专用操作 | 认知选用途与范围,宿主核对,原所有者及能力处理 |
| 有限工作记忆 | 保留当前关注、必要主体状态及用得上的已读材料 | 主体上下文与可选活动工作区分别组织 |
| 使用外部辅助 | 可通过能力创建通知源、接入现成来源或请求计算 | 提供者产生通知/结果,宿主绑定订阅和活动;闹钟不是核心模块 |
| 有效复用与停止 | 复用适用结果,选择继续、行动、简短交流或等待 | 主体组织投入,宿主执行总预算,提供者管理计算缓存 |
flowchart LR
Input["统一事件:观察/请求/结果/状态变化/控制"] --> Ready["机制处理与主体可见变化"]
Ready --> Mind["主体:理解、联想与选择关注"]
Self["兴趣、当前处境与未决问题"] --> Mind
Views["各领域提供获准描述与状态"] --> Mind
Mind -->|"主动读取"| Read["宿主访问检查与读取能力"]
Read -->|"选中的内容、版本与来源"| Work["当前工作记忆"]
Work --> Mind
Mind -->|"请求计算"| Compute["外部模型/算法组件:请求与计算结果"]
Compute --> Input
Mind -->|"请求创建/管理或接入"| Sources["外部事件源与能力提供者"]
Sources -->|"通知/结果事件"| Input
Mind --> Reply["行动、表达、关注调整或等待"]
Reply -->|"有意义的状态变化与内部接续"| Input
计算责任位于认知组织之外;认知选择材料和用途,能力承担实际计算。外部通知源由相应提供者管理,核心维护来源引用与订阅,不内置闹钟计时业务。检索经公共契约取得候选,按原所有者提供的描述核对来源和范围。执行超时、预算计量及维护安排属于运行机制,其控制事件也进入统一事件协议。这里的“外部”描述职责边界,具体承载见工程参考。
2. 领域对象、资料与受限视图
对象按业务含义、状态所有者、操作和生命周期分别定义。资料、记忆、程序、模型和缓存不继承统一资源实体,也不共用一套强制属性或万能读写接口。领域所有者提供获准查询和操作;跨领域查询只编排请求并返回有类型结果,不保存可独立修改的第二份真值。
flowchart TB
Request["认知或管理请求"] --> Query["按目的选择领域查询"]
Query --> Owners["领域状态所有者<br/>资料、记忆、程序、模型等"]
Context["可信身份、用途、接收者与执行域"] --> Owners
Owners --> Views["获准领域视图或明确选读的内容"]
Views --> Consumer["工作区或管理页面"]
Consumer --> Action["具体领域操作<br/>读取文档、修订记忆、构建程序等"]
Action --> Admission["当前授权、控制与预算核对"]
Context --> Admission
Admission --> Owners
2.1 对象与状态所有权
| 领域 | 对象与含义 | 所有权与操作 |
|---|---|---|
| 资料与附件 | 文档、图片、音视频、表格、外部材料定位及内容快照 | 资料职责维护正文、来源、内容修订、表示和范围;导入、抓取、读取、解析、转换和删除 |
| 记忆与知识 | 经历、事实断言、证据关联、Reference 和经验候选 | 世界与记忆维护判断、冲突、适用条件和修订;查询、更正、采用或废弃,详见记忆机制 |
| 程序与构建产物 | 源码模块、接口声明、依赖、固定产物和构建/测试记录 | 程序维护与构建职责保存相应状态,运行职责维护采用及绑定;阅读源码、构建、执行和采用分别处理 |
| 行为配置与蓝图 | 定义、作用范围内的配置值、蓝图及有效修订 | 行为所有者维护配置含义与变更,运行机制解析有效值;校验、提交和迁移沿生效契约 |
| 模型与推理服务 | 模型描述、权重产物、服务连接、能力绑定和加载状态 | 模型维护负责产物和连接,提供者负责实际加载与计算;下载、加载、卸载和推理分别授权 |
| 能力与执行环境 | 接口、实现登记、运行实例、隔离环境、设备及其状态 | 能力接入与运行管理分别负责发现、装配、准入、调用、停止和回收;环境可用不等于操作获准 |
| 外部事件源与订阅 | 来源登记、连接、订阅及活动关联 | 提供者维护外部对象,事件职责维护接入与关注;创建来源、订阅、解绑和删除外部对象分别表达 |
| 检索接入与服务侧派生状态 | 提供者身份、绑定、来源映射、准备/查询记录及可确认覆盖 | 各领域定义查询含义;检索接入维护配置和记录,外部提供者维护自身材料副本及检索状态,见公共检索契约 |
| 读取与计算缓存 | 已读片段、解析/转换结果及确定计算结果 | 对应处理能力维护依赖和复用条件;命中不授予新权限或证明事实正确 |
| 机密 | Secret、SecretGrant、可信提交及审计 | 独立机密职责维护原值和权限,详见专用契约 |
表中分组用于理解职责,不要求每组成为独立运行系统。主体、人物、关系、活动、任务和沙箱保持原有身份;事件、操作回执、交付、评价和审计记录分别归原职责。计算容量、占用和预算也不属于资料。
Reference 专指有依据和适用条件的可复用知识或方法说明,不同时表示外部链接、任意引用或可执行代码。来源定位由资料职责维护;程序实现由程序和运行职责维护,Reference 可以引用它们,但不能据此取得执行权限。
一份报表由资料职责保存原文,基于它形成的断言由世界与记忆维护。更正断言不改写报表;记忆正文外置保存也不改变记忆归属。同一报告作为交付物时,活动关联交付要求,交付记录保存接收者、修订及实际到达,评价记录保存用途结果;不再复制一份拥有同一正文的通用资源对象。
2.2 资料内容、表示与来源
资料管理只负责可读取的文档和媒体等材料。文件是承载形式,PDF、Markdown、音频编码等由表示及解析能力处理,不按格式另建业务领域。源码、模型权重和运行缓存即使存为文件,也继续归自己的领域。
| 资料信息 | 维护含义 |
|---|---|
| 身份、来源及归属 | 资料标识、实际提交/取得来源、保管和管理范围;材料自述与核实结果分开 |
| 来源定位与内容快照 | 可先登记外部位置,正文未取得或可用性未知须明确;URL 存在不证明已读取,来源不提供版本时记录观测时间 |
| 内容修订、表示及范围 | 原文、分页、媒体轨道、时间段、编码等;未知大小或结构不补造,也不为登记暗中扫描全文 |
| 描述及访问条件 | 标题、格式和获准说明等元数据;存在性、字段、处理用途和接收方分别约束 |
| 保留及清理 | 资料保留规则、修订关系和已知派生内容;请求接纳、内容失效与实际删除分别表达 |
描述更新不必制造正文修订,授权变化也不是新的内容版本。Self 可按维护权限修改备注或提出分类,不能通过标签取消处理限制。正文里的“允许公开”只是材料陈述,不自行授予披露权限。
分段或另一编码可作为同一资料的表示。摘要、转写、分析报告或脱敏副本需要独立维护和交付时,作为资料对象保存生成来源;临时片段、计算返回或记忆中的短说明不强制创建独立资料身份。
2.3 面向接收者的领域视图
投影是领域所有者在当前身份、用途、接收者和执行域内提供的受限视图。它是共用的呈现原则,不是所有对象必须采用的公共属性结构。文档可呈现标题与来源,记忆可呈现主题及依据状态,程序可呈现接口和实现状态,模型服务可呈现能力与可用性,机密在普通视图中只呈现获准引用、用途和状态。
先判断存在性是否可见,再筛选字段;名称、路径、归属、来源和使用记录同样可能受限。上下文只取得直接关联或查询得到的有限候选,不广播全部目录、人物经历或运行状态。跨领域搜索保留对象类型及原所有者,不通过结果聚合扩大权限;机密发现仍沿专门的可见范围。
投影不以存在正文读取接口为前提,也不是已读证明。获准短说明可作为描述展示;由正文总结而来的摘要保留派生来源并按内容处理。全文、缩略图、源码和权重 不因对象已登记、组件已加载或页面被浏览而自动进入模型。
视图中出现某项操作只说明可提出请求,实际执行核对当前条件;旧视图不延长已撤销权限。未获准发现时,不通过错误、别名回退或关联查询补充受限信息。
2.4 领域操作与共同接纳机制
接口直接表达业务含义:读取文档片段、查询经历、修订断言、构建程序、采用实现、加载模型、清理缓存或领取机密。能力接口与相应所有者决定输入、实际作用及返回,不设置通用 Resource.Read/Use/Update 入口。
共同机制传递可信发起者、执行者、权利来源、委托范围、用途、接收方、执行域、操作关联、预算及控制;详细含义由授权上下文统一维护。各领域核对本次操作,不合并全部参与者权限;调用者自报用途、知道引用或能编辑普通描述均不授予权限。允许读取不自动允许外部模型处理或向群聊披露,读取程序也不等于运行程序。
跨领域引用保留对象类型、标识及必要修订;查询和页面可以共用关联、分页及呈现组件,不据此拥有通用写权限。参数、操作说明和动态表单来自相应领域契约,描述变更不自行扩大实际能力。操作接纳、管理详情
执行环境的描述与当前约束归运行管理,源码和依赖归程序/构建,日志和产物按其实际含义归档。获准交给隔离执行方处理不扩大外部发送或机密使用资格;内容标识不等于实现可信,环境不足沿执行准入处理。
2.5 来源、派生与运行使用
资料摘要由原文派生,服务侧检索材料与索引源自选定内容,程序产物由源码及构建过程形成。各领域保存具体来源、修订、范围和生成操作;共用关联形式不改变派生对象的所有权。派生默认不扩大披露和处理范围,扩大范围须符合明确授权的转换规则;处理者须先有权取得输入,不能先把禁止入模的材料交给模型再要求脱敏。
服务请求使用凭据、程序调用模型属于运行使用关系,不自动使业务结果成为 Secret 或权重的内容派生。认证头、回显和派生认证材料仍受机密规则约束;目标操作分类和过滤返回,请求成功不代表返回载荷可直接入模。
限制作用于实际承载或可还原受限内容的材料、状态和程序,不因一次私人经历影响了兴趣或情绪就把全部人格状态视为机密。一般主观因果不等于内容派生;明确的私人内容不能通过改名为参数、想法或代码而扩大披露范围。
来源链支持回查,不替代事实判断。资料职责维护取得来源和完整性观察,世界与记忆对断言保存依据、冲突与当前判断。Self/Mind 的主观评价不改写授权,网页或工具结果中的指令不会因读取或来源认证而成为运行要求。观测与污染
来源失效或授权收紧时,相关所有者限制后续读取及复用,索引、摘要和缓存由其维护方处理已知影响。不同对象使用各自的清理操作,不以一个通用删除状态代替实际结果;已对外交付内容无法靠元数据修改撤回。
已知来源关联也用于定位受影响工作区、上下文和交付。上下文处理见重新装配,已经到达接收者的结论按有限纠正处理;派生清理和对外更正不是同一操作。
2.6 读取、执行使用与认知上下文
认知围绕缺口选择具体资料、记忆或程序说明,并明确修订、表示、范围和用途,由对应接口接纳。例如核对预算只读取相关章节,不因收到 PDF 就解析全部页面。已知材料可直接读取,元数据不足可有范围地查正文;明确请求片段或摘要时可以直接返回获准内容,不强制先取描述再读取。
检索材料准备是已接纳的处理任务:领域选定来源与修订,接入层提交给获准提供者并记录实际覆盖;准备所需计算由提供者及其适配调用的组件承担。原文、查询、必要背景、向量或过滤字段均须符合处理范围。未就绪或覆盖不足不等于依据不存在;服务返回的内容也不自动成为本次认知输入。检索契约
| 活动中的记录 | 含义 |
|---|---|
| 可见视图 | 当时能够发现的对象描述及状态 |
| 曾读内容 | 实际读取的资料、记忆或代码及修订、表示和范围 |
| 本次认知输入 | 实际选入模型上下文的内容和来源 |
| 执行使用 | 实际加载的程序、模型或所用计算结果;机密使用另记专用审计 |
| 实际交付 | 已到达允许接收点的结果、内容修订及状态 |
记录关联所属主体/心智、操作及可选活动,不在文档或记忆上设置跨心智的全局已读标记。某个 Mind 读过、组件使用过或管理员展开过,不代表当前模型已读。有效已读内容可留在工作记忆,再次主动选择时可复用合格缓存;缓存存在不使未选材料进入上下文。媒体定位或句柄只有在明确选为内容输入且获准处理后,才允许提供者获取。
当前直接收到的对话、已知任务状态、暂定判断及已接纳实时输入沿原输入契约进入;归档后再次发现和读取沿对应领域契约。原文、摘要、Reference、历史记录和源码均按目的选读,不因体积小而自动进入认知。主动读取可以在既有任务及许可内自主完成,无须逐次确认。
程序、配置和权重的运行时加载属于对应执行用途,不能算作认知已经读过内容。预制库的说明、示例与源码也按需发现/读取;步骤内可取得已接纳结果,长工作保存操作关联并释放认知入口。运行协议
2.7 上下文有效性与重新装配
本次认知输入清单关联材料、摘要、记忆和工具结果的来源、修订及处理范围,模型会话关联实际选入历史。领域所有者发布授权或来源变化,运行机制定位已知受影响的工作区、会话与待交付产物,认知按需修订判断;处理对象不只包括尚未读取的文件。记录来源支持已知依赖核对,不宣称识别任意隐含语义传播。
| 变化 | 当前上下文与后续处理 |
|---|---|
| 受众变化,仅披露范围收紧 | 仍获准用于当前目的的内部材料可以保留;重新检查输出、引用及解释,不将私人依据交给新受众 |
| 后续模型处理、用途或某接收方资格被撤销 | 停止受影响的新增调用和会话续用;移除对应材料及已知派生摘要,按控制规则处理在途调用与待交付结果 |
| 事实来源修订或被反证 | 旧材料可在允许的历史分析范围保留,但不继续冒充当前事实;带变化范围重新判断,不把证据修订等同权限撤销 |
| 删除、来源缺失或无法确认历史输入范围 | 先按当前保留与处理规则判断;不能确认已排除禁止内容时不再续用该会话,从仍获准状态重新装配 |
可可靠重建的上下文只替换受影响部分,保留仍有效的主体关注、相关活动状态及获准依据。提供者会话或不透明续接内容无法可靠排除受限历史时,结束其后续使用,新请求只使用重新选定的允许内容;不能仅删当前提示中的一段文字就声称旧会话已不含该信息。工作区、摘要和未发布草稿同样核对,缓存命中不跳过此步骤。
在途返回保留原操作关联,但登记结果不授权继续处理或交付;无当前资格的内容留在相应受限通路,既有控制、审计与保留规则继续生效。运行记录保存变化原因、受影响范围、停止续用及重新装配结果,不复制受限正文作普通解释。原任务不因此自动完成、取消或改变目标。
停止本地复用、结束会话、请求提供者删除和确认删除分别记录;前两者不证明外部服务已清除历史数据,也不能收回已交付内容。该规则保证后续使用有明确依据,不承诺让已接收方遗忘。选择性重建用于保留有效连续性;无法确认隔离范围时采用新的受限上下文,不依赖末端文字过滤兜底。
2.8 机密使用与外发边界
Secret、SecretGrant、原值修订和审计由机密职责维护。配置保存专用 SecretRef;资料、记忆、程序或索引接口不能解析原值或维护机密授权,工作台统一展示不改变所有权。
普通认知默认只见获准引用、用途及必要状态;原值、认证材料及入口凭证不随普通文档、事件、日志或模型输入展开。受信适配器和 RPC 实现可按用途取得原值或代理使用。确需原值的计算组件由专用配置明确接收方、用途和输出范围;是否允许处理不按模型/工具或本地/远程标签一概决定。详细接收及外发规则见机密契约。
资料副本、缓存和沙箱快照不复制机密原值、生产授权或有效提交会话。认证后的业务结果按自身含义管理,认证回显及敏感派生内容留在专用通路。未知机密检测只作补充,不替代可信输入与已确定的数据边界。
2.9 外部报表分析的完整流程
以下描述领域之间的衔接,不是运行结果。
| 时点 | 具体对象与行为 |
|---|---|
| 接纳分析 | 资料职责登记报表来源定位,活动取得获准视图;登记不代表已抓取正文 |
| 确定材料 | 按分析缺口请求文档修订、章节和处理范围 |
| 补充凭据 | 机密职责提供面向指定用户的可信提交,活动只取得状态;执行方按专用授权使用 |
| 读取与分析 | 资料读取/解析返回有来源的内容,认知形成带证据的判断,工具完成所需计算 |
| 形成报告 | 文档对象保存报告正文及来源,活动关联交付要求;不复制通用资源对象 |
| 交付与评价 | 交付记录保存接收者、报告修订和到达状态,评价保存用途结果 |
| 复盘与更新 | 世界与记忆保存有限经验及适用条件;资料更正后核对相关判断,缓存和索引分别更新 |
3. 外部事件源、订阅与通知示例
认知决定需要等待什么,并通过能力创建或接入相应事件源。来源可以是现成平台/设备,也可以是新建的外部通知任务、文件监听或后台计算。提供者管理外部对象,宿主保存必要来源引用、订阅、用途及活动关联。订阅表达关注哪些事件,不等于创建了来源;创建结果、触发通知与最终交付分别记录。
核心不内置闹钟模块,具体外部提供者尚未选定。宿主可持久保存“已经接纳提醒责任、提供者返回了哪个引用、等待什么事件”,但不因此承担该来源的计时。来源缺失、创建失败或通知能力不足时如实表达,不能假称已设置或假定重启后一定补发。运行超时和预算控制仍属宿主机制,不用它们替代用户提醒能力;不在此展开可靠调度的故障矩阵。
| 示例 | 来源如何产生事件 | TinyAGI 的共同职责 |
|---|---|---|
| 创建闹钟 | 外部通知提供者创建对象并在约定条件成立时通知 | 提交请求、保存回执/关联、等待事件,再决定回应 |
| 监听资料变化 | 文件系统或外部监听能力报告变化 | 绑定范围,事件只给变更线索和投影,按需读取新版本 |
| 后台任务 | 工具执行后产生进度、完成或失败事件 | 关联原操作与活动,有结果或明确可继续工作时接续 |
| 接入已有平台 | 平台消息或设备观测进入适配器 | 绑定可确认来源,按用途与可见范围处理 |
例:“20 分钟后提醒我核对这份方案”。以下为人工走查,不是运行结果。
| 时点 | 认知与能力如何配合 |
|---|---|
| 收到请求及附件 | 识别提醒目的,附件保持投影;设提醒不需要读方案正文 |
| 创建 | 提交外部通知能力请求,明确提醒时间/用途;提供者创建闹钟并返回引用与结果,未成功不能说已设置 |
| 关联 | 保存已接纳责任及来源/订阅与活动的关联,通知不直接取得发送权限 |
| 等待 | 保存接续点,主体可做其他事或休眠;没有循环问模型“时间到了吗” |
| 触发 | 外部到时事件进入统一协议,按关联找回提醒目的与附件视图;结合当前有效约定形成提醒 |
| 输出 | 只需提醒就给一句;不自动展开方案分析,不将登记或触发当作已成功送达 |
| 后续核对 | 用户要求继续核对后,自主读取必要部分并调用计算能力,已读且适用的结果可复用 |
主动问候和任务复查可按需要利用通知源,但用途不同:可选问候允许按时机跳过,已接受的具体提醒应履约或明确说明受阻。一次通知不必调用模型或多心智;来源触发不等于实际送达。步骤结束后仍有具体工作时,内部接续事件可以直接推进,不要求创建闹钟。重复通知来自明确用途和约定,不能由无目的自我唤醒不断续订。
4. 有限注意、思考投入与简短交流
区分模型单次推理冗长和主体多次重复工作。前者通过提供者实际支持的推理投入/生成限制控制,后者由主体认知组织决定是否继续查阅、联想、计算、邀请心智或复核。最终回复短,不代表前两类成本已经受控。
Self 按当前关注及实际需要选择计算方式:明确计算交给程序,候选筛选可用检索、重排或轻量判断,开放问题使用生成式推理,适用经验可直接复用;同一任务可混合使用,无须固定先快后慢。局部结果可按既有适用规则使用,不要求逐项再调模型复核;信息不足、冲突或新证据出现时调整方法,熟练方法沿已有经验与候选采用机制积累。额外判断须有助于减少后续工作,置信分数不替代证据或授权。相关组件复用公共能力契约,安装与使用均可选;来源与工程边界见外部认知辅助组件。
功能事件实验实际出现了额度消耗于推理而最终内容为空的响应。控制投入须同时保留形成有效产物的空间;仅缩小生成上限可能带来截断和恢复调用,不能据此认定节省了完整任务成本。具体推理配额、生成配额与停止原因按提供者实际契约映射,不设通用阈值;空内容和截断不充作自主拒答,恢复及未恢复都留在轨迹中。
接续与投入对照将投入档位和生成额度分别改变,未得到跨两类任务一致的收益。因此保留按任务用途校准的方案,不采用统一降低推理或统一扩大额度;完整成本同时观察生成用量、调用次数、恢复和内容质量。厂商支持的参数及第三方网关验证边界在工程参考维护。
认知可因兴趣、困惑、创作或主观意义继续投入,不要求每段思考都有用户任务或验收产物。具体工作可以取证、推导、比较、检查或形成新的关注,是否值得由认知判断,运行上限由宿主落实。仅重写相同解释、重复同一查询、对已经解决的问题再次全员讨论,不默认继续。新输入、反证或明确检查失败可以重新开启工作;没有新外部材料并不一律禁止有价值的推理。
已在当前状态中明确给出的事实可以支撑相应说明,产物投影可以支撑引用入口;无需为了通过测试额外展开正文。需要核对正文细节或形成超出投影的新断言时才读取,评价器也须遵守这一边界,避免把多读、多调模型误当成完成任务的必要路径。
足以满足已接任务就交付;关键事实只能从外部取得时就读取、询问或等待;仍有未知则按实际范围表达。宿主总预算覆盖检索、模型、多心智及重试成本,不因换心智重新计零。不以固定思考轮数或未经校准的自报置信度证明正确;未知的提供者推理用量如实标注,不假定可读取隐藏思维链或安全截断任意中间文本。
默认交谈先给结论、必要依据或下一步,简单确认/问候可以一句,深入工作通常交付简短说明和可读产物入口;根据用户所需展开。格式契约、关键不确定性和理解所需信息仍须保留。过程说明只在实际进展、必要等待或范围改变时提供,不把每个内部步骤变成一条消息。简短是默认交流偏好,不是所有答案统一字数上限。
5. 计算节约、输入与结果复用
认知先选择需要的内容和计算目的,处理能力再复用符合条件的工作。节约应保持所需信息、结果用途、响应要求和正常主体行为,避免重复处理与准备;模型降级、内容摘要或减少独立判断不属于透明复用。各领域维护自己的来源和状态,相应处理能力维护缓存,不建立通用资源实体或新的主体记忆层。
| 类别 | 复用什么 | 使用条件 |
|---|---|---|
| 模型前缀处理 | 提供者对相同输入前缀的处理 | 实际输入及相关配置符合提供者契约;当前输出仍重新生成,是否命中以实际反馈为准 |
| 资料/记忆读取与表示 | 指定修订、片段和表示的已读内容、解析或转换结果 | 当前选择、权限、用途及处理配置仍有效;缓存存在不使材料自动进入认知 |
| 确定计算 | 输入和依赖明确的计算结果 | 核对实现、参数、输入修订及用途,依赖不明时重新计算 |
| 检索准备与结果 | 未变化材料的派生表示,以及适用的查询结果 | 查询范围、筛选、来源覆盖与配置均有效;新增或删除材料可能改变旧查询结果 |
| 构建准备 | 未变化的依赖及可重建产物 | 由程序与构建职责核对来源、依赖和生成条件,不改变实现采用资格 |
| 完整模型结果 | 已产生的分类、提取或其他明确结果 | 用途明确允许复用;独立判断、再次采样及新的主观评价仍重新执行 |
| 最终表达 | 旧情境中实际生成的答复或产物 | 不作主体回应默认;事实、约定、受众和当前意图适用时才使用,不凭问题相似重发 |
5.1 稳定输入装配与前缀复用
同一修订的契约、人格说明、选定工具描述和资料表示采用稳定文本,避免每次重新生成或无意义重排。装配在保持角色层级、来源及语义顺序的条件下,尽量让可复用的稳定部分形成前缀,再加入本次动态内容;当前观察、关注变化、活动进展及新结果按实际需要表达。必要的时间与状态不能为命中而隐去,追踪标识和无认知意义的运行元数据留在请求记录。
认知决定选哪些块;装配和提供者适配负责稳定表示及支持的缓存边界。Self/Mind 可以采用不同程序和提示,不要求统一人格文本。工具只选当前用途所需集合,其描述及表示保持稳定;不为扩大前缀塞入全部能力或未选资料。权限和控制按当前状态执行,不从稳定文本取得长期放行资格。
连续处理可保留仍有效的历史与原文,并追加新信息;需要纠正、缩减或重组时正常更新。前缀命中不免除上下文有效性检查,也不证明当前心智已经知道未选材料。更换模型、修改工具契约或输出要求时,由适配器按实际服务条件判断复用,不能假定所有提供者共享缓存。
使用同一输入的提供者缓存与改变提示内容/顺序分别评价。稳定装配不承诺任意重排无损,不把当前情感、权限或世界状态冻结为长期前缀。模型处理复用与最终结果复用分开,输出仍可能随采样不同;主体事实和经历继续由原所有者保存。提供者契约
5.2 有效结果、并发共享与独立判断
结果复用关联具体输入、修订、范围、实现、参数、依赖和允许用途;TTL 只表达保留或新鲜性策略的一部分,不能独自证明当前有效。网络来源可按提供者契约确认未变后复用正文;外部变化或处理许可不明时重新确认、重新计算或报告未知,不能把旧值伪装成最新结果。
对相同、可共享的只读准备或计算,可以合并在途执行;多个心智各自获得获准结果,并保留使用关联。共享来源不增加独立证据,多人格讨论和独立采样不能共享同一次生成来冒充多份判断。写入、发送及设备动作沿原操作身份处理,不作为结果缓存命中跳过现实作用。控制及结算见执行复用。
读取缓存减少底层读取,不必然减少返回正文或模型输入;前缀缓存减少重复输入处理,不必然减少输出生成;完整结果复用减少一次计算,却可能改变重新判断的含义。分别报告实际节约,不能将不同机制的命中数相加作为智能或质量收益。已有读取对照只支持特定夹具的读取次数变化,完整条件见报告 012。
5.3 增量准备与有界保留
资料修订后,由各处理能力确定受影响的片段及派生内容,复用未变化部分并更新变化部分。检索准备保留来源、切分和处理配置,程序构建保留源码及依赖条件;无法可靠判断影响范围时扩大重算。不同外部检索实现按自身契约提供增量接口,不强制采用同一内部算法,也不把可复用片段直接当作完整查询结果有效的证明。
缓存、运行实例及准备工作分别有容量、并发、保存和清理范围。是否保留结合重复使用收益与占用、维护成本;不默认填充无关输入、发送空请求保温或永久常驻。获准后台工作可按截止要求批量准备,实时交流及控制不为凑批等待。来源变化的同步沿已接纳范围执行,不为准备缓存自动读取所有资料。
缓存可以清理,必要状态、原始依据与正式产物由各领域持续保存。原始材料和必要依赖仍可用时,缺失缓存通过正常调用重建;未命中只影响准备成本,不改变工作目的。确需保存的不可重现结果应登记为正式记录或产物,不能只寄托于缓存。
沙箱分别绑定可写状态和会话,符合条件的只读结果可共享;独立评价生成不能跨分支复用答案,初始准备和实际费用须记录。Secret 原值继续沿专用用途处理,不进入普通缓存、缓存键或复用诊断;普通材料的缓存也不扩大接收方和披露范围。
净收益同时计入避免的处理成本与新增的写入、保存、查询、准备和维护成本,保留输出、重试和占用。工作台展示实际用量与管理操作,评价区分首次使用、重复使用及质量与时延。机制与来源见工程参考,不以官方能力支持推定本项目已达到特定收益。
6. 当前不采用或暂缓的替代项
| 方案 | 决定与原因 |
|---|---|
| 所有对象继承统一资源类型、属性和生命周期 | 不采用:混淆资料、判断、程序采用、模型运行和缓存失效;按领域维护具体契约 |
| 每个领域重复建设身份、授权上下文、来源关联和界面工具 | 不采用:这些机制可共用,领域负责其语义和当前状态;不按文件格式另建职责 |
| 只增加可读/机密开关或任意标签 | 不采用:不能表达接收者、用途、专用使用和派生关系,也不能提供确定性维护 |
| 全部业务对象改成通用资源 CRUD | 不采用:会丢失任务、人物和授权关系的业务语义及状态所有权 |
| 固定全局投影、由模型解释权限 | 不采用:可见性随身份和用途变化,描述与当前授权必须分别核对 |
| 让主体持续倒计时、空闲时固定自问自答 | 不采用:提醒应来自能力输入,持续存在不需要持续推理 |
| 将闹钟示例内置为核心模块、只接受外部事件才能继续工作 | 不采用:通知源通过能力创建或接入;内部结果及接续事件也能推进有目的的活动 |
| 为每个新文件自动阅读全文、摘要或提交检索服务 | 不采用:违反默认投影与主动读取;准备可在明确范围内批量接纳,不等于登记后自动全量处理 |
| 有投影就认为已经获得原文证据 | 不采用:对象存在、选读范围与内容支撑是不同事实 |
| 每次回答固定反思/多人投票,或一律禁止深思 | 都不作默认:需要针对任务缺口判断增量价值;质量和成本须分别测 |
| 为缓存命中保留全部上下文、跨情境直接重发旧答复 | 不采用:不能让缓存扩大读取、延续过期事实或暴露私人内容 |
| 定通用输入阈值、缓存期限或最大思考轮数 | 不采用统一数值:按提供者契约和用途配置;机制采用与实际质量、时延及净收益分别说明 |
| 用缓存结果替代独立判断、减少采样或自动降级模型 | 不作默认节约:这些改变计算目的或行为,须沿相应用途的评价和采用规则处理 |
| 以仿生名义引入固定脑区服务、人体外形或生理参数 | 不采用:功能启发不要求固定实体或部署负担 |
这些取舍来自职责分析、设计约束及资料论证,不是实验逐项证明替代方案失败。
7. 一手资料支持的范围
7.1 领域边界、授权与来源关系
领域分析、NIST 授权属性、W3C 来源关系及 RFC 8693 §1.1 的主体/执行者与委托语义分别提供下列依据。资料支持对象分责、授权依据和来源记录,不证明本项目完整接入或信息隔离已测。机密的专项依据见机密资料表。
| 来源与适用版本 | 支持的命题 | 设计推论与边界 |
|---|---|---|
| Microsoft 领域分析,页面更新 2026-02-25,Define bounded contexts | 同一现实对象在不同职责中可使用不同模型;强制共同模型会增加复杂性 | 按状态所有权和业务操作划分资料、记忆、程序与运行对象;借用领域分析,不采用文中微服务部署路线 |
| NIST SP 800-162,2014,含 2019-08-02 更新 | 授权可依据主体、对象、请求操作及环境属性,结合策略和关系判断 | 共用可信上下文,由各领域判断具体操作;不要求对象继承统一属性结构或引入独立策略产品 |
| W3C PROV-DM,2013-04-30 Recommendation | 实体、活动和责任主体通过生成、使用及派生等关系关联 | 记录跨领域来源和处理关系,不把存储或使用关系当内容派生;不要求完整标准实现,来源不替代事实判断 |
| RFC 8693,2020-01,§1.1 | 委托保留原主体与实际执行者的不同身份;自身行权与代他人行权有不同含义 | 请求保留权利来源和实际执行者,各领域核对本次范围;不要求采用其令牌协议,父授权动态约束与具体接纳规则是本项目设计 |
接纳前预算、选择性记忆、上下文失效处理及交付纠正是将既有职责与这些资料组合后的设计判断。来源链只帮助定位已知使用,不能证明全部语义影响可自动识别;有限纠正不推导永久监测义务。没有新增实验或效果成绩。
7.2 有限投入
引用仅支持所列版本及章节中的命题,未复现论文实验。领域视图、外部事件源和统一事件交互属于本项目的设计选择;协议依据见运行专题,不由认知科学论文直接推出。
| 来源与版本 | 支持的命题 | 设计推论与适用边界 |
|---|---|---|
| Chen 等,Do NOT Think That Much for 2+3=?,ICML 2025,PMLR 267:9487–9499;核对正式版摘要 | 在其研究模型与任务中,冗余解法对准确性/多样性的新增收益有限;研究以训练方法降低此类开销 | 支持把过度思考列为质量与成本问题;不推出通用早停阈值,不证明本项目提示或调度可复制其收益 |
8. 设计状态与适用边界
机制及状态集中见设计台账。相关资料支持设计分工;已有本地及模型轨迹按原范围保留。
| 范围 | 当前采用规则 | 不由资料推定的效果 |
|---|---|---|
| 领域对象与受限视图 | 资料、记忆、程序、配置、模型、运行对象及派生数据各自管理;机密沿专用授权,视图及查询不接管真值 | 各领域完整接入、未知机密识别、信息隔离及端到端可靠性 |
| 领域检索与材料充分性 | 各领域按用途选择同级提供者,保留来源与类型;可返回候选或明确请求的片段 | 外部检索质量、组合收益、最优切分和通用读取粒度 |
| 有限思考与简短交付 | 默认足够的最小投入,围绕具体缺口增加;无增量、缺外部条件或预算结束时分别收尾 | 某个统一 token 上限或推理档位总是更优 |
| 读取与结果复用 | 复用绑定输入修订、用途和范围,不省略事实与许可核对 | 实际命中率、账单和完整任务成本 |
| 外部事件源与接续 | 能力创建/接入来源,宿主管订阅与责任;创建、触发和交付分别记录;内部有目的接续无需通知源 | 真实平台到达率、关机准时提醒或真人问候满意度 |
具体预算、生成配置、检索策略和联系窗口由用途配置承接。
逻辑模块、能力契约与运行协议
用途:逻辑设计专题。
本篇维护逻辑职责、状态所有权、统一事件、公共能力契约及运行行为。文中的模块表示责任,API 表示请求与结果语义,执行域表示数据与作用范围;不规定软件包、进程或通信技术。软件组合、技术栈、存储和部署机制另见工程参考,历史细节保留在工程参考。
| 阅读主题 | 章节入口 |
|---|---|
| 职责与能力 | 逻辑模块 · 领域检索与提供者 · 公共能力 API · 领域操作 · 授权来源与委托 · 机密使用 · 模型端口 · 输入复用 |
| 程序与采用 | 受管理函数 · 配置生效 · 能力构建与运行 · 实现信任 · 隔离执行 |
| 个体与学习 | 学习强度 · 初始化与迁移 · 预制能力库 |
| 事件与接续 | 身份 · 主体直接认知 · 交互处理归属 · 事件 · 生命周期 · 步骤 · 接续请求 |
| 操作与控制 | 步骤内操作接纳 · 提交 · 操作 · 主体与任务控制 · 效果 |
| 约束与数据 | 结果复核 · 授权 · 输出 · 预算 · 执行复用与结算 · 数据分工 · 个体状态 |
| 恢复与依据 | 恢复 · 重放 · 依据 |
1. 逻辑模块与状态所有权
认知程序负责理解、注意、意图、心智协作和行为选择;各模块负责相应状态的保存及操作。所有者核对结构、身份、作用范围和运行条件,不把每个主观看法转成需要业务审批的提案。交互遵循统一事件语义;状态视图和查询结果不替代原模块维护的权威记录。总体信息关系见逻辑总图。
| 逻辑模块 | 维护的业务含义 | 主要输入和输出 |
|---|---|---|
| 主体与活动 | 主体/心智身份、兴趣、长期关注、世界理解、工作区和接续 | 环境与内在状态 → 认知;按需形成活动和执行安排,保存选择与经历 |
| 事件交互 | 来源、封装、订阅、因果关联和有范围的分发 | 观察、请求、结果、状态变化和控制 → 对应处理者;不裁定事实或主体意愿 |
| 资料与附件 | 文档、媒体、来源定位、内容快照与表示 | 导入、抓取、有范围的读取、解析、转换和清理 |
| 世界与记忆 | 经历、断言、证据关联、Reference 和经验候选 | 有范围的查询/读取、依据核对及判断修订;不覆盖资料原文 |
| 检索与查询编排 | 提供者配置、用途策略、来源映射和操作记录 | 各领域定义查询及范围,外部服务执行检索;返回有类型结果,记录服务报告状态,不复刻领域真值或服务内部状态 |
| 程序与行为配置 | 源码、接口声明、配置定义、蓝图及各自修订 | 相应所有者接纳编辑和迁移,构建与运行职责处理产物、采用及实际生效 |
| 模型与服务维护 | 模型描述、权重产物、连接及能力绑定 | 维护操作与推理调用分开;实际加载和计算由提供者负责 |
| 独立机密管理 | Secret 的归属、原值修订、SecretGrant、可信提交及访问审计 | 专用提交、授权分配、代理使用及原值交付;认知默认使用引用,实际原值按接收方、用途和目标交付 |
| 交流与情境 | 人物关联依据、接纳前请求处理、当前受众、互动约定、输出契约和轮次 | 平台信息与表达候选 → 有预算的澄清/回应;接纳后关联活动责任 |
| 任务控制 | 授权来源、目标及范围、推进资格、阻断原因、在途收束和解除条件;任务状态归原所有者 | Self/管理/获授权审计的控制 → 原任务及子工作处理 → 控制与实际结果事件 |
| 执行与预算 | 操作接纳、实际尝试、回执、取消、未知及用量 | 能力意图 → 受控执行 → 操作事实与活动接续 |
| 初始化与迁移引导 | 稳定身份登记、引导/修复进度和迁移项处理;业务状态归原所有者 | 创建/更新请求 → 有预算的模型、构建与试验操作 → 候选、有效实现及维护状态;不依赖个体程序可运行 |
| 主动学习扩展 | 学习议题、选题/实践策略与研究候选,复用主体及活动状态 | 兴趣和观察 → 学习活动提案 → 取证/构建/试验与有限采用;不拥有自己的预算或授权来源 |
| 认知组织 | 上下文选择、心智协作、判断、表达与下一步 | 主体/心智上下文 → 判断、行动、关注调整或接续;交流与活动按需关联 |
| 评价与试验 | 测试材料、试验配置、基线、评价规则、报告和采用依据 | 独立域执行与评阅 → 分能力结果及有限采用建议 |
| 能力构建与运行 | 接口与候选、构建产物、采用绑定、运行对象及结束责任 | 能力缺口 → 构建/试验操作 → 可追溯产物与可调用实现;主体状态仍归原所有者 |
| 能力接入 | 提供者身份、支持的契约、材料处理范围及结果解释 | 已接纳请求 → 提供者执行 → 有来源的结果;不自行扩大授权 |
| 运行管理 | 执行上下文、准入、状态一致性、域绑定和接续责任 | 绑定真实/试验域与能力;处理控制事件和中断;不允许候选自行切换作用域 |
管理工作台的查询、修订及直接控制沿相同状态所有者处理,管理身份与聊天身份分开。试验主体与初态契约见沙箱,立即提交机制见工作台的生效契约,不因增加页面另建业务状态库。
本文将运行管理及其确定机制统称为“宿主”,它是逻辑职责名称。一次交流可关联多个活动,一个活动也可跨会话接续;会话、活动和模型交互分别识别。人物/剧情、现实观察/体验和模拟经历保留不同来源及用途。
采用当前业务状态+必要过程记录+可重建派生索引。状态用于接续,事件/决策/操作记录用于查证,资料原文和记忆依据由各自所有者保留。不要求重放全部事件生成唯一状态:外部结果不能仅凭既有记录重新产生,保留范围也可能变化。这是当前选择,未做全部替代方案的效果对照。
2. 检索与公共能力契约
本节定义能力职责、请求和结果。技术栈与依赖版本见工程参考。
2.1 领域检索与外部提供者
检索是正式的外部能力类别,服务记忆、资料、程序定位、能力发现及其他已定义检索契约的领域。各领域维护查询含义、允许处理的材料、来源修订及结果类型;公共接入维护提供者绑定、来源映射和调用记录,具体检索计算与服务侧派生状态交给外部组件。跨领域查询只组织有类型的结果,不创建通用资源真值。
每个已配置提供者拥有独立身份、能力描述、允许范围和可用状态,可按权限发现、指定调用、配置、维护和评价。不同检索实现处于同一接入层级;选择哪种实现、是否安装或启用属于用途配置,不能把另一实现固定为补充或后备。具体产品、协议和技术选型见检索提供者接入。
| 分工 | 输入/输出与责任 |
|---|---|
| 领域入口 | 记忆查询、资料取证、程序定位、能力发现等各自表达目的、范围和结果含义;状态所有者核对来源及当前许可 |
| 检索接入 | 按用途选择提供者、转换请求、记录操作、核对并整理返回;保存外部空间引用和材料对应关系 |
| 外部提供者 | 接收获准材料,执行准备、查询及支持的维护;报告候选、来源标识、可确认的覆盖和实际状态 |
| 检索策略 | 指定实现或按配置选择,组织单次、并行、分步及替代查询;沿原活动预算和控制运行 |
材料准备。 通过原所有者选定对象、修订、片段和处理范围,接纳准备任务后交给指定提供者。可以在明确的集合范围内持续同步;登记文件、浏览目录或新建记忆不自动授权全文提交。外部空间用于组织服务侧材料,不等同于人物、任务或模型会话。服务报告就绪、哪些来源已经可查、哪些更新尚未完成分别可见;不在宿主复刻提供者内部索引状态。
查询与使用。 活动提出目的、目标领域、必要背景和预算,指定获准提供者或采用当前用途策略。返回结果带对象类型、来源标识、修订、片段定位、提供者和匹配方式;可以只返回候选描述,也可以按明确请求直接返回获准内容。服务返回全文不代表全文自动进入认知,读取返回与实际模型输入分别记录。查询背景和材料本身都须符合提供者处理范围。
组合与替代。 单提供者为简单用途提供直接路径;并行查询可取得不同候选,分步查询可在提供者支持时继续筛选,替代查询在不可用或覆盖不足时使用其他合格方式。已有配置可确定执行顺序,不必每次调用模型选择。合并按来源对象、修订和片段关联,保留提供者贡献;分数附带其语义,不能直接跨实现比较,也不能把同源重复命中当独立证据。部分完成、没有命中、覆盖未知与执行失败分别报告。
更新与维护。 原领域变化形成准备、更新或清理任务,按服务实际支持的操作执行;缺少单条更新/删除等能力时如实报告,可按已获范围重建,不能假称已同步。返回候选仍核对当前来源和许可。服务无法约束本次材料范围时须使用满足范围的检索空间或其他合格方式,不能依靠结果事后过滤扩大服务处理权。维护权限与查询权限分开,机密沿专用通路使用,不进入检索语料。
长时间准备或查询沿已接纳任务独立运行,不长期占用认知入口;停止请求与外部实际停止分别记录。真实与沙箱分别绑定允许的空间及维护权限。此契约确定接口分工,不证明具体检索质量、时延或组合收益,见检索评价。
2.2 公共能力 API 与后续扩展
公共 API 指可复用的业务契约,由负责该用途的模块维护。认知、交流入口和评估经同一契约提出请求,身份及执行域从可信上下文绑定,结果交由对应状态所有者处理。本篇定义输入/输出含义及约束,具体方法签名与接入技术在工程参考中维护。
公共交互以统一事件契约为基础。领域 API 是有类型的请求/结果入口,事件 API 则负责来源接入、订阅、关联和有范围的观察。请求已提出、被接纳、执行完成与实际交付分别表达,调用返回不自动意味着最终效果。查询可以同步等待结果,也可以由结果事件接续;不强制全部能力改成异步,也不让同步接口绕过事件语义和权限处理。
| 共同 API 职责候选 | 业务含义与约束 |
|---|---|
EventIngress | 接入外部/内部事件,绑定来源和执行域,核对结构与范围;载荷自称身份不能替代可信绑定 |
EventSubscription | 建立、调整或解除关注范围与活动关联;订阅和外部来源分别管理,解绑不代表外部对象已被删除 |
CapabilityRequest | 承载具体能力的类型化请求及接纳、进度、完成、失败等事件;动作许可由宿主检查,不由事件发送者自授 |
EventView | 为活动接续、用户查看、评估和复盘提供有范围的事件记录或投影;不向所有心智广播全部事件 |
上述名称表示契约职责,不额外创建业务身份。下图以检索说明领域语义和提供者接入如何衔接:
flowchart TB
Domains["领域入口:记忆、资料、程序、能力说明等"] --> Access["公共检索接入:范围、用途策略与预算"]
Access --> Vector["外部向量检索提供者"]
Access --> Semantic["其他外部语义检索提供者"]
Access --> Exact["合格的精确/全文等查询能力"]
Vector --> Results["来源核对与结果整理"]
Semantic --> Results
Exact --> Results
Results --> Usage["领域解释与主体/活动使用"]
提供者位于同一调用层级,不要求每次全部调用。请求和结果沿共同事件语义关联;材料准备与维护有独立操作记录,不能把配置保存或请求接纳视为已可查询。
| 公共契约职责 | 输入/输出的业务含义 | 责任边界 |
|---|---|---|
| 领域查询入口 | 目的、目标类型、允许范围 → 该领域可以解释的候选或获准内容 | EvidenceSearch 保留资料/记忆取证用途;程序定位和能力发现使用自己的入口,不统一改称证据 |
| 提供者发现与绑定 | 当前身份及用途 → 获准描述、支持操作、处理范围和可用状态 | 支持明确指定或按策略选择;目录展示不授予调用或维护权限 |
| 检索调用与组合 | 查询、必要背景、目标材料、返回形式、数量/预算要求 → 有类型来源、修订、定位、匹配方式及实际状态 | 保留能力差异、部分结果和提供者贡献;不设跨实现通用置信分数 |
| 材料准备与覆盖查询 | 来源集合及修订、目标提供者 → 准备任务、材料映射、可确认覆盖及未知项 | 服务侧空间及条目不取代业务身份;持续同步须有明确范围 |
| 提供者维护 | 已授权的具体维护请求 → 操作进度与实际结果 | 只开放实际支持的操作;不能从检索权限推导服务管理权限 |
Embedding 与 VectorIndex 表达向量适配中的生成、写入、删除及查询职责,不是每个检索提供者必须实现的公共接口。其他提供者按自身 API 适配,外部计算、引擎及内部数据维护留在服务侧。共同请求保留原归属(Self/Mind 及可选交流或活动)、操作身份、执行域、当前许可、截止时间和预算;描述字段来自可信绑定,调用者不能自授范围。
能力差异由实际接口声明。错误区分不支持、范围不允许、配置不匹配、不可用、超时、部分完成和覆盖不足;无法满足必要过滤或处理范围时拒绝该路径。替代、重试、筛选和组合均计入原预算,取消返回不保证提供者已停止。更换绑定不代表材料已经转移或准备完成;管理和试验分别见工作台与评价契约。
2.3 领域操作的接纳与返回
对象与所有权定义资料、记忆、程序、模型及运行对象的边界。请求直接表达文档片段读取、经历查询、断言修订、程序构建、模型加载等业务含义,各领域拥有自己的操作契约;机密领取另走专用接口。公共接纳机制不提供万能资料读取或通用业务状态修改。
| 阶段 | 运行责任 |
|---|---|
| 提出请求 | 明确目标领域、带类型的对象引用、具体操作及必要修订/范围;关联所属主体/心智及可选交流、活动,或直接管理请求,并保留执行安排与预算来源 |
| 核对与接纳 | 依据可信身份及执行域,核对对应所有者的当前状态、授权、处理范围及控制;自报用途和描述编辑不产生权限 |
| 执行 | 实际实现具备该操作及信任资格,按已接纳范围处理;阅读、执行、维护和采用分别授权 |
| 返回与派生 | 返回保留领域类型、来源、修订、已知用量和实际结果;内容派生与运行使用分别记录 |
| 接续与交付 | 结果先归原操作,再形成获准内容或状态事件;生成报告、满足任务要求和实际发送分别记录 |
跨领域查询只组织请求、筛选结果与建立关联,状态修改仍由原所有者接纳;结果中的类型和定位不能转化为绕过领域权限的文件路径或通用写入口。可共用分页、序列化、表单工具和可信上下文,不要求所有对象具有同一属性表或生命周期。
领域操作描述、实际处理实现及动态页面来自同一契约。普通代码与行为配置随执行固定,当前授权、机密资格、预算和控制在实际准入/使用/交付处核对。模型可见的候选操作不等于获准执行,源码读取不授予实现采用权,模型查看不授予加载或服务维护权。工程映射
步骤内读取可独立接纳并返回内容,本步骤记录实际依据;长读取、索引、构建或转换保存操作引用并释放认知入口。最终提案只引用已接纳操作,不重复派发;外部任务控制覆盖原范围内的在途工作与迟到结果,认知中断不自动取消独立操作。接纳时序、主体与任务控制
发现不到、没有读取资格、表示不支持、内容未取得和处理失败分别表达,对外说明也受可见性限制。外部资料定位可先登记,不冒充正文已取得或本地产物可用。有效已读材料可以保留或复用合格缓存,不要求每轮重复读取。上下文读取
授权来源、执行身份与有界委托
共同机制传递主体既有能力范围和外部委托来源,各领域定义具体操作。主体自主行为可使用已配置给 Self 的权限,无须先取得一个用户任务;人的请求涉及他人权利时仍需相应依据。宿主从受信入口与已接纳状态绑定上下文,原所有者作最终判断;不把用户、Self、Mind、执行提供者和信息接收方合成一个拥有全部权限的主体。请求获得处理不表示其中的动作已获授权。
| 上下文 | 业务含义 |
|---|---|
| 发起者及责任归属 | 所属 Self/Mind,以及可选的交流、活动或管理请求关联;保留实际发起来源、修改范围和内生关注依据 |
| 实际执行者 | 执行的 Self/Mind 或提供者及其实现、运行身份;委托后仍保留执行者自己的身份 |
| 权利来源 | 用户有权作出的委托、系统/所有者预先授予 Self 的能力,或有权管理者的直接操作;保留当前有效依据及适用范围 |
| 对象、作用与接收方 | 目标领域、对象或集合、操作、用途、允许处理及交付的接收者、执行域和时限 |
| 后续委托与当前限制 | 是否允许交给子工作或其他执行者、可授范围,以及当前撤销、控制、预算与实现资格 |
接纳逐项核对本次所需权利是否有适用来源,并同时满足领域限制、当前控制和执行条件。不是把全部参与者权限取并集,也不是要求用户拥有 Self 每项公共服务能力;Self 的独立授权只有在明确允许的用途和服务对象内才可用于该请求。例如公共计算可使用系统预授额度,某用户的私人资料仍需覆盖本次用途的读取及处理资格,不能借公共计算权取得。
执行者收到引用、接过任务或拥有接口入口均不自动取得原调用者全部权限。允许委托时只传递该子工作必需且允许转授的范围,保留父依据;父授权失效或收紧约束后续访问,换心智、实现或活动名称不能避开。多项独立授权可分别支持相应操作,但不拼接成任一来源都未授予的新用途;权利不明时返回范围不足,不由模型自报身份补齐。
授权来源和机密内容分开:共同上下文只引用授权记录,不携带凭据原值;SecretGrant 仍由专用职责核对。模型处理、检索提交、读取和对外交付各检查自己的接收方与用途。管理自然语言辅助不继承整个管理会话,试验初态装配也不复制生产授权。既有范围内无需逐次人工批准,新范围须有有效授权来源。
采用可追溯来源及逐领域接纳,便于多人活动、自主活动和能力委托共用同一机制,避免隐式使用其他用户的权利;不引入通用权限并集、统一资源实体或独立授权服务。依据及设计边界见授权与来源资料。
2.4 维护请求与凭据使用契约
模型/服务维护和计算调用使用各自接口,主体可按已配置能力范围执行维护或使用;管理入口不依赖认知。具体对象见工作台。
Secret 由独立职责保管,维护归属、SecretGrant、可信输入与必要使用记录。目的在于使凭据到达预期使用方,并避免泄漏到不可信远程 API 或其他非预期对象;不将机密管理作为主体认知的组织中心。普通资料或记忆接口不解析原值。
| 操作 | 行为与结果 |
|---|---|
| 可信提交/替换 | 入口绑定用户、目标和预期用途,直接交给保管职责;普通交流只取得引用及状态,写入不自动授予旧值读取 |
| 查看描述 | 返回可见引用、用途、归属及状态;引用本身不授予使用权限 |
| 代理使用 | 受信适配器按指定目标与协议位置使用原值,返回业务结果 |
| 原值交付 | 核对实际接收方、实现及用途,沿专用通路交给获授权组件;RPC 实现可直接用其 SDK 执行 |
| 配置授权与维护 | 所有者或有权管理者分配、调整、撤销或轮换;已配置范围内自动运行 |
| 使用记录 | 保存领取/代理使用的接收方、用途、目标及实际结果,不保存凭据原值 |
默认认知只使用 SecretRef。授权依据是实际组件和接收目标,不单凭 LLM/RPC 或本地/远程标签判断;本地组件也可能不可信,远程目标可能正是凭据的合法认证方。某服务获准接收自己的认证凭据,不因此获准接收其他秘密或在其他接口处理原值。
若某个计算组件确有处理原值的用途,必须由配置明确其受信身份、用途和输出范围,经专用输入交付;普通 ModelRequest 仍保持引用。不能由模型在请求中自称可信。组件内部再调用远程服务属于新的接收边界,必须符合原允许用途和目标。认证字段注入、特殊计算输入、业务返回及普通日志分别处理,详见可信处理管线。
原值交付前记录必要授权和放行事实,记录不可用时不放行新的原值;已交付值无法本地收回,撤销约束后续访问,上游吊销或轮换另行处理。测试执行方按其实际用途配置凭据,初态、快照和报告不复制生产原值或授权。存储及传输加密属于工程手段,不能替代接收方与外发目标核对。工程映射
2.5 受管理函数与可热加载编写契约
方案设计范围见台账。受管理模块按明确规范编写,类型与结构化注释生成可调用描述;宿主管理状态、调用边界及授权。此处定义逻辑契约,注释语法与生成方式见工程参考。
| 编写要求 | 运行含义 |
|---|---|
| 长期业务状态由宿主保存 | 函数通过当前上下文读取并提交;不从任意局部变量、调用栈或闭包恢复活动 |
| 入口有稳定标识、明确输入输出 | 类型可描述、跨界值可传递;文档、程序、模型、机密及外部对象使用各自的带类型引用,引用不自带权限 |
| 一次调用有可结束的工作范围 | 跨调用进度显式保存;持续活动通过状态与事件接续,不依赖永久旧根调用 |
| 跨调用保存函数标识 | 调用时解析当前有效实现;不持久保存捕获旧实现的闭包或未归属回调 |
| 外部工作走宿主能力 | 模型、资料、记忆、机密、动作、预算及记录沿既有契约;后台工作由宿主关联原操作 |
| 模块装载初始化不产生现实业务动作 | 加载或重建模块不顺便发送消息或重复任务 |
| 状态及接口变化可识别 | 提交前判断兼容性;需要转换时明确转换,无法安全接续则提交失败 |
持续提供能力的运行对象由宿主管理生命周期;单次认知调用可结束的约束不要求每次能力请求都重新启动提供者。认知调用的内部任务与共享提供者的长期工作分别归属,后者不得靠遗留闭包隐式存活。
普通辅助函数不强制写管理注释,内部调用使用正常语言语义;局部闭包和有界内部并发不得越过所属调用生命周期。普通注释供阅读,结构化注释补充稳定标识、入口暴露范围、字段设置及能力需求,类型签名提供参数/返回值结构。声明未知或矛盾字段、重复标识、不能支持的跨界类型及禁止依赖时明确报错,不以静默忽略方式扩大含义。
调用描述是来源程序修订的派生视图,业务状态仍由原所有者维护。函数可供管理台、蓝图或模型使用的范围分别声明;能够发现函数不等于获准调用,能力声明只表达需求。实际执行按调用者、活动、执行域、当前授权与预算核对;模型看到描述投影,需要使用时才取得获准的完整调用契约,文档/代码正文和机密原值不随描述展开。
符合契约的函数可由生成适配层登记,不要求所有函数使用相同业务参数,也不自动暴露所有内部符号。管理台的直接调用仍走操作接纳;普通内部辅助调用无需为每个调用帧生成业务事件。沙箱可生成局部测试入口,复用同一契约。函数评估
一次执行绑定确定的程序及普通行为配置修订;受影响模块在调用边界切换,不能因动态查名在同一次执行中混入新实现。新调用按当前生效描述解析,旧表单请求按原描述核对,参数不兼容时明确返回而不误绑定。已有外部操作及迟到结果保留原关联;撤销计算不授权重发外部动作。
构建期检查类型、声明及可确定的依赖/兼容事实;运行期约束授权、预算、机密解析、状态提交资格和外部作用。纯计算等声明必须配合能力限制,不能单凭注释推定纯度或允许自动重试。声明与运行约束共同工作,不追求静态证明任意程序全部行为。
配置解析与生效边界
代码、普通行为配置和当前运行约束有不同的生效方式:
| 类别 | 解析与生效 | 不可混同 |
|---|---|---|
| 代码、提示、算法参数和调用类型 | 一次执行固定修订,后续执行在受影响边界采用新修订 | 不在同一次执行中随动态查名混入新实现 |
| 普通偏好与配置覆盖 | 配置定义声明默认值、适用对象、可覆盖层次及合并方式;执行前解析有效值及来源 | 不是所有字段都使用同一条全局优先级 |
| 当前权限、Secret 资格、预算、学习准入和任务控制 | 在请求接纳、实际派发、后续接续/采用及交付的相关入口重新核对 | 旧配置快照不延续已撤销资格,收紧不等待普通热加载完成 |
| 维护任务与派生重建 | 提交接纳当前配置或维护意图,完成结果另行观察 | 已采用参数不等于服务已加载、索引已重建或旧工作已停止 |
普通偏好从声明默认值开始,只合并适用于当前对象和情境的覆盖;更具体的有效设置可覆盖允许覆盖的上层值。例如活动答复长度可覆盖主体默认,但人格表达偏好与渠道格式要求不是任意互相覆盖。不可比较的作用范围须在该配置定义中声明裁决/合并方式,否则提交明确报冲突;不以最近修改时间或模型猜测决定。配置修订使旧覆盖无法映射时须显式转换、移除或拒绝提交,不静默恢复默认。
授权、禁止项和额度沿各自约束关系检查,局部覆盖不能放宽上级有效限制;只有有权来源的明确变更才调整该限制。放宽资格也不自动恢复被中止工作。状态所有者返回有效值、声明来源、覆盖来源、适用范围和采用修订,管理与认知读取同一解析结果。表单不能另算一份配置,具体页面见编辑与生效。
2.6 能力构建、运行与采用契约
能力扩展沿原任务与能力边界完成,接口声明不产生执行权。以下名称定义逻辑对象,不冻结产品 API 或记录格式:
| 对象 | 所有者与必要关联 | 边界 |
|---|---|---|
| 能力接口 | 能力接入维护稳定身份、输入输出、领域对象/执行句柄含义及支持差异 | 接口修订与实现修订分开;表单、蓝图和模型描述从同一权威定义派生 |
| 候选与构建请求 | 构建职责关联父活动、源码、依赖、构建条件、目标接口和投入上限 | 先复用或组合;执行与采用按已接纳操作推进,源码生成本身不代表接纳 |
| 实现产物 | 程序及构建职责保留固定来源、内容身份、构建结果和处理范围 | 同一接口可有多个实现;构建完成不等于可调用或满足用途 |
| 试验与采用记录 | 评价负责证据,原有采用职责接纳目标范围和实际绑定 | 局部通过不能冒充完整任务通过;人工提交和主体自主采用沿各自既有规则 |
| 运行对象 | 运行管理维护所属活动或已安装能力、产物、状态、用量及结束责任 | 一次性任务与持续提供能力分别管理;不是新主体或业务状态副本 |
| 调用与执行句柄会话 | 执行维护请求、所用接口/实现、范围、结果及回收关联 | 临时执行句柄会话绑定原实现;持久业务引用不能依赖某次会话存活 |
形成候选 → 接纳构建 → 保存产物 → 装配试验 → 评价并采用 → 准备运行与调用绑定 → 执行及复盘。阶段可以按已有产物复用或以失败/不值得继续结束,不要求为每项能力重做全部试验。主体自主采用必须有适用范围和原评价规则所需依据,不能让候选自行更改评价门槛;具体动作在已授予的维护、执行与采用范围内可自动推进。
构建、试验、启停和能力调用均作为有归属的操作处理;普通进度由确定机制更新,需判断时才形成认知接续。请求的调用者、执行域和委托范围由宿主绑定,提供者回调宿主也遵循同一限制。提供者不直接修改主体、记忆或活动真值,不因发布接口获得任意宿主能力。
一次执行固定所需接口、实现和普通行为配置选择;共享实现更新须在受影响执行边界处理后续调用绑定。准备候选可与旧实现服务并行;提交成功后新执行使用目标实现,旧执行及句柄保留原关联并可观察其收束。既有句柄的调用按其原实现和契约处理;这不改变新调用的目标绑定,也不能把旧执行句柄标为已迁移。无法兼容的输入、在途结果或句柄转换须明确失败,不能静默重放现实动作。
实现产物既可为编译结果,也可为程序包及锁定依赖;其运行环境、入口和依赖属于固定实现条件,不能只按入口文件标识版本。依赖准备及运行环境中的下属工作同属原活动;程序包更新沿相同的候选准备、信任核对和调用绑定切换,不以运行时加载绕过采用。
程序职责保存构建产物,构建/试验职责保存诊断和轨迹,报告正文归资料职责,默认只返回状态与投影,主动读取才展开内容。缓存命中仍核对源码、依赖、构建条件及处理范围,不复用可变试验状态。子试验、子工作及其重试共同计入父活动预算,不因新运行对象增加额度。
认知可见描述与业务请求中的机密只用引用;实际执行可请求宿主代理使用,或凭读取原值授权通过专用接口领取。原值按实际接收方、用途与目标交付,普通认知和业务返回保持引用或获准结果;特殊计算沿机密契约处理。可执行候选的约束覆盖准备、构建、试验和运行全过程;独立执行上下文不代表已经隔离所有环境能力。具体承载见能力工具链,试验边界见分层环境。
实现信任与执行准入
可调用、功能采用与受信资格是独立关系。新生成或导入的候选只能使用已装配的受控能力;编译、接口检查、功能测试及同接口替换均不自动授予新的受信身份。资格由有权维护来源或预先配置的受信发布策略授予,关联具体实现来源/产物、适用用途、允许处理的材料与可用敏感能力。既有策略内可自动核对,不要求逐次人工审批;候选自身和一般功能评价无权扩大该策略。
实现更新时重新核对资格的适用条件。接口稳定不等于实现受信,旧绑定不能把敏感权限静默传给任意新产物。Secret 的代理使用与读取原值分别授权;交付原值须同时满足实现资格、当前 SecretGrant 和审计条件,知道 SecretRef 或通过能力测试都不足以取得原值。
构建和运行前核对执行环境是否具备所要求的文件、网络、状态及计算资源约束。缺少必要约束时不启动该范围的候选,返回环境能力不足;可以改用已有合格能力或缩小任务,但不能自动回落普通执行环境。预制隔离执行能力统一承接所需约束及环境选择,具体承载见工程装配;环境独立本身不证明全部约束已经满足。
2.7 主动学习接入与学习强度
主动学习扩展提出学习活动、实践与候选,宿主通过现有活动、能力及采用入口执行。学习方向和议题归目标/活动,知识候选归记忆、程序候选归程序与构建职责,不增加通用学习数据库。源自用户明确任务还是主体自发学习,由宿主根据可信入口与因果关系绑定;候选、子任务或试验主体不能自行改写来源来逃避限制。
学习强度是宿主强制执行的投入上限,最低档为关闭,不主动学习。 强度控制与正常认知投入、具体活动预算及采用权限分别定义;启用不意味着无限运行,提高强度也不扩大数据访问、外部动作或程序采用权限。
| 强度语义 | 允许的主动学习行为 | 约束 |
|---|---|---|
| 关闭/零投入 | 不自主选题、继续学习、追加阅读/整理/构建/试验,或自动采用待用学习候选 | 已有议程和成果保留;正常认知、自主日常活动、经历积累及已有能力使用继续 |
| 启用且有界 | 可自主选题、实践、迭代和按规则采用 | 配置明确的资源及机会额度;可用低/中/高等界面预设,名称与数值不是产品版本或通用最优结论 |
强度至少映射到学习发起/重新考虑的机会频度、计量周期内累计调用/费用/计算用量、并发及候选分支数量、单次活动和连续推进上限,以及与已接纳工作的调度份额。额度是上限而非必须消耗的目标;无进展即等待或结束。具体数值按用途配置,实际有效额度同时受全局、学习配置、父活动与当前步骤剩余限制。周期额度刷新不重置单个活动的总预算,不能靠重建议题、换实例或增加子进程刷新额度。
正常感知、联想、当前经历的理解、关注调整、日常创作、关系体验和记忆记录不受主动学习关闭影响,认知可直接归属于 Self/Mind。专门组织的研究、反复练习、策略比较、能力实验和认知程序迭代属于额外学习投入。依据实际目的和活动性质区分,不以是否存在用户任务或是否写代码判断;不得把专门学习改名为普通认知来绕过关闭。用户明确要求学习或试验时,按该任务单独接纳并计入其预算及全局上限,强度关闭不等于拒绝用户任务,也不被该任务暗中改成启用。正常自主活动或受托工作所需的解析器和包装可在原授权、预算与评价规则内构建并限于该用途使用;不因暂用成功就改变长期默认认知。
长期安装、推广复用或默认策略变更须有相应接纳范围和采用依据;用户明确要求的这些工作按其任务处理,不暗中启用自主学习。任务结束后不自行扩展为持续学习。用户发起更新或已配置维护策略接纳的必要兼容迁移,同样使用独立范围和预算;不能由学习扩展自行改报维护来源,详见初始化与迁移。
关闭提交成功即停止新的自发学习准入、后续分支和自动采用,已排队工作暂停或结束;在途工作按原停止协议取消或收束,只允许必要的结果登记、资源清理和既有现实责任核对,其实际成本仍记录。迟到学习结果可保存为带来源产物,但不能触发新一轮学习或待用候选自动生效。界面区分“主动学习已关闭”与“在途工作仍在收束”,不要求先停止普通工作或卸载共享提供者。
调低强度后新增工作按新限制准入,已超出新额度的在途学习按停止规则收束;历史实际用量不清零。重新启用时从议程及当前状态重新选择,核对授权、来源有效性和剩余额度,不自动重放全部排队试验。强度配置和修改权由管理授权决定,学习程序及试验主体无权自行提高上限;试验域配置也不能突破宿主总限制。
学习策略可修改自身候选及提出采用请求,当前评价、历史证据和准入配置仍由原所有者管理。效果观察及控制场景见学习评估,页面行为见工作台,执行映射见工程接入。
2.8 初始化引导、兼容窗口与迁移接纳
引导职责提供不依赖个体认知程序的模型/工具请求组织,全部请求仍走既有身份、执行域、预算、机密及操作接纳。确定性管理可在模型不可用时使用;人物生成和语义修复需要模型,缺少模型时保存待配置或失败状态,不假装完成。
| 对象 | 持久含义与边界 |
|---|---|
| 人物与初始化记录 | 稳定主体/人格身份、用户设定来源、管理关系、进度及有效实现;运行失败不重新初始化 |
| 完整初始化提示词 | 当前要求的权威内容,保留修订及内容身份、适用契约与历史来源;要求与个体自由部分分开 |
| 差异与迁移说明 | 前后提示词修订、变化原因、适用对象、替代能力、兼容窗口与检查依据;不是固定源码补丁 |
| 程序/配置及运行契约 | 当前实际实现、所需接口、状态格式与构建来源分别关联,不由初始化提示词身份代替 |
| 迁移项结果 | 未处理、已满足、待修改、可选不采用、受阻及已验证采用等语义;必要项和可选项分别说明 |
| 引导/修复活动 | 当前依据、请求及诊断、候选、投入、停止原因和后续条件;临时模型会话不是新人物 |
初始化采用登记身份 → 固定输入范围及额度 → 生成候选 → 编译与契约检查 → 受控行为检查 → 登记有效实现。模型修订失败可以在原额度内继续,也可停止并保留进度;不能以重复创建身份或新活动刷新原额度。生成源码和编译通过分别记录,候选不得直接改写当前唯一人物数据或生效绑定。
迁移说明从受信更新来源登记为明确维护材料,材料默认提供受限视图,实际选入后才交模型;正文自称“更新要求”不自动获得授权。宿主接纳用户发起更新或已配置维护策略的范围,Self 对实际源码与状态逐项处理;来源由可信入口和因果链绑定,不能从模型填写的任务类型取得维护资格。获准范围内可以自主生成、检查和采用,不增加逐步人工审批。
公共契约的兼容生命周期为正常、弃用但受支持、窗口结束后移除。声明弃用时提供替代入口、语义差异、迁移说明及最早移除的稳定契约修订;具体保留数量由兼容政策明确,普通文案或补丁变化不随意消耗窗口。受支持的旧入口保持可调用性和明确行为,涉及参数、结果、错误、对象及执行句柄生命周期的差异必须说明并适配;声明存在不等于已提供兼容实现。
优先在旧 Self 仍可运行的窗口内迁移。跳过多次更新时按链处理或形成可回查的累计任务,结合实际契约与迁移结果判断,不能重放完整初始化来替代更新。必要项完成且候选检查/实际切换成功后才登记相应迁移完成;可选功能可以不采用,不把它误记为故障,也不将未完成的必要项隐藏在“已读”状态中。
候选编译或运行失败时保留原实现及诊断,在兼容范围内继续旧行为;旧程序已不能运行时进入固定引导修复,传入原身份、必要状态投影、源码与迁移材料,经同一工具路径产生候选。管理入口及基本诊断不依赖生成的动态页面;数据格式无法识别时明确限制,不能展示成空白新人物。修复会话不能声称完全复现原人格行为。
客户端升级、提示词发布、个体程序采用和状态转换是不同操作。采用复用调用边界契约,升级不保证旧运行产物可用,回退代码也不撤销现实动作或自动回退状态。提示词迁移处理认知及其声明状态,核心业务数据的转换仍由原所有者负责,不交给任意生成代码直接改写。
必要兼容维护不受“主动学习关闭”阻断,但仍须有独立维护接纳和预算,不暗中开启学习、修改人格偏好或扩大权限。新增实验功能和非必要行为改进沿相应学习/采用规则处理。资料与具体映射见工程参考,检查范围见初始化与迁移评估。
2.9 预制能力库、维护归属与可选使用
预制能力的权威定义、文档和实现由客户端维护者交付,对 Self 只读。Self 可调用、组合、另建包装或自行实现可替代功能;个体扩展使用独立身份和来源,不能覆盖预制权威定义。宿主运行约束由原所有者执行,便利功能是否使用不改变权限、机密、状态归属及预算规则。
| 对象 | 维护及调用契约 |
|---|---|
| 预制能力 | 维护者负责接口、实现、文档、示例、兼容与更新;能力目录说明来源及依赖,个体不能自行改写其权威内容 |
| 个体认知与包装 | Self 决定依赖和组合方式,在获准范围内编写并采用候选;包装保留自己的实现身份和原调用关联 |
| 使用配置 | 按权限调整允许范围、参数及提供者绑定,配置覆盖独立于库实现;不赋予预制源码编辑权 |
| 业务状态及外部对象 | 持续归原状态所有者与提供者管理;调用预制能力不产生第二份主体真值 |
能力按用途包含运行契约、能力发现与说明、资料与示例读取、源码结构查询、静态检查/兼容差异、当前状态与限制查询,以及通用解析、转换、计算和受控操作。各项分别描述输入输出、错误、所需依赖、读取/计算/写入/外部作用及实际处理范围。说明来自明确声明或可复核工具结果,附来源、修订、观测时间或检查覆盖;声明、观测和推断保持区别,不把诊断或元数据视为整体行为证明。
固定引导、运行中的 Self 和管理工作台沿同一权威契约访问,调用身份及可见范围由宿主绑定。引导时工具发现和诊断可独立于待生成程序使用;无模型时确定性查询仍可用,依赖未装配的操作明确返回限制。已登记、已配置、获准调用、最近观测可用及个体已依赖分别呈现。普通请求/结果沿统一事件语义,纯计算由相应计算能力承担,不要求每个局部函数另建事件或调用模型。
目录默认返回有限投影,签名、示例、源码和资料按目的读取;查询主体状态也须保留原可见范围,Secret 只暴露获准引用、用途及状态。资料与源码分析缓存绑定来源及依赖修订;动态状态保留观测时间,调用时核对当前授权和预算。执行组件装载库与模型读取其正文分别记录。
更新新增能力供个体选择;已使用接口的实现变化按兼容窗口履行语义支持和迁移说明,一次执行仍绑定确定实现。库更新、可用配置、个体依赖及实际采用分开,不能仅凭“新增能力未主动选择”推断旧依赖不会受实现更新影响。编译或运行依赖改变时对实际程序检查;个人包装与必要维护沿原候选规则,学习关闭不阻断获准兼容维护。
可能长时间执行的预制能力提供提交、查询、结果接续与取消语义,接纳后返回操作引用;当前认知调用与独立任务执行按生命周期规则分离。工程装配见客户端预制库,操作见管理入口,验收场景见能力库评价。
2.10 预制隔离执行与环境准入
客户端维护隔离执行的能力契约、说明和宿主适配,提供环境查询、准备与启动、状态查询、停止和结果收集。实际环境是可选依赖,主体启动及不依赖隔离的合格能力不以其可用为前提。普通能力请求可由宿主选择环境,Self 也可明确申请隔离;两者共用同一准入规则,调用便利层不是取得权限的条件。
基础受限执行与额外隔离要求
基础受限执行随核心提供:受管理认知程序及其候选只能通过明确装配的宿主能力读取状态、取得材料和产生外部作用,宿主限制计算、状态提交及可用入口。初始化、迁移、局部认知试验可沿该路径运行,不以额外执行环境存在为前提。模型生成、第三方来源或函数名称都不能独自判定需要哪种环境;可信装配须能实际约束全部可达能力,不能仅凭程序自述符合契约。
| 执行类别 | 准入规则 |
|---|---|
| 仅在基础受限能力内运行的认知程序与局部候选 | 核对代码/接口、装配能力、预算与状态范围;不得获得任意系统入口或宿主直接维护权 |
| 受信预制实现 | 在其已确认的用途、输入和实现资格内使用普通受控路径;来源受信不豁免高风险操作的额外要求 |
| 可直接接触系统环境的第三方/动态扩展、开放命令及依赖脚本 | 使用满足要求的额外隔离环境,覆盖准备、构建、测试及运行 |
| 不可信复杂输入处理或高风险远程操作的实现 | 按实际作用使用满足要求的隔离能力;请求来自认知程序不降低被调用实现的要求 |
缺少基础受限能力时,相应程序不能登记为可运行;缺少可选的额外环境时,只阻止依赖该环境的操作。包装、更名、切换语言或经过功能测试都不改变实际可达能力。具体宿主装配及额外环境的工程映射见基础执行与隔离执行承载。
执行要求与职责
宿主依据上述执行分类、具体实现、来源、用途、输入材料、实际作用及当前策略确定必要约束。额外要求覆盖准备、构建、测试和正式运行;本地调用、远程调用、包装函数和反向调用均不能成为豁免依据。一次操作跨多个实现时,各自核对约束,不从调用方符合基础契约推导执行方无需额外隔离。
| 契约内容 | 权威来源及处理 |
|---|---|
| 归属与范围 | 宿主绑定调用者、所属交流处理或 Episode/Task、Operation、实际实现及真实或试验执行域,候选不能自报更高权限 |
| 必要限制 | 有权维护来源及当前策略确定可读材料、可写产物、允许外部访问、资源限额及隔离要求;自述风险低不降低限制 |
| 环境选择 | 执行适配器报告可强制执行的能力及最近观察,宿主将本次要求与有效条件核对;已配置不等于约束有效 |
| 外部访问 | 目标、用途、操作和允许发送的材料共同限定访问;执行环境不能通过直接访问绕过这些限制 |
| 结果与记录 | 原操作所有者保存实际环境、实现修订、接纳结果、用量、产物引用及停止情况;环境目录不建立第二份任务真值 |
环境的可见状态、运行要求和实际检查由运行管理维护,描述编辑不产生授权。Self 可申请额外计算容量或提出替代方案,不能通过更换名称、包装、实现或执行入口规避仍有效的要求。具体隔离机制、运行时及系统权限由工程参考维护。
可选依赖与不可降级的要求
| 当前条件 | 接纳行为 |
|---|---|
| 环境未装配或未启用,请求无此要求 | 其他合格能力照常运行;初始化、交流、记忆和管理仍可用 |
| 请求需要隔离,环境可用且满足全部必要约束 | 按原授权和预算接纳,由所选环境运行 |
| 请求需要隔离,环境缺失、不可用或不满足约束 | 明确返回缺少的能力,允许换合格能力或缩小任务;不在普通环境重跑 |
| 请求要求增强隔离,仅有较弱环境 | 视为不满足要求,不自动降低条件 |
| 执行期间环境失效或有效权限收紧 | 拒绝受影响的新增工作,按控制范围处理在途执行及收尾;不把未知效果自动重试到其他环境 |
无须对已有授权内的每次调用另设人工审批。管理提交改变执行条件后,普通行为选择仍遵循执行边界,当前权限及控制立即按原协议核对;执行中的工作不能借固定配置保留已撤销的访问资格。
使用、复用与收尾
一次构建、任务执行或受管理能力会话可以包含多次调用,无需为每个请求重建环境。复用须保持身份、权限、数据范围和实现条件;不同用户、试验分支或信任范围默认不共享可变环境。已有临时执行句柄关联创建它的实现与运行对象,不因重新绑定或重建环境被视为已迁移。下属工作共同计入父活动和全局预算,环境数量不增加额度。
环境不持有主体状态的直接维护权,只获得授权材料和独立产物范围。日志及构建记录归相应操作,文档与程序产物分别登记;返回获准状态与视图;显式读取才进入认知。结果仍作为有来源的外部输入核对,取出产物不自动授权执行,隔离成功也不证明内容可信。
机密在普通配置中只提供引用;宿主代理使用与向指定执行方交付原值均沿专用授权处理,不因隔离而额外授予权限。代理请求限定目标及用途;原值接收方的实际行为还须由实现、环境及上游权限约束。环境不继承完整主体材料、宿主凭据或管理入口;认证回显与敏感派生内容仍先经过机密管线。
取消沿主体与任务控制覆盖所属执行和子工作,分别记录请求发出、正式接纳、实际停止和资源收尾;终止执行不证明外部服务已取消或现实效果已撤销。独立远端服务的内部执行按提供者契约说明,本地环境的限制不能作为远端隔离证明。可用性和不足原因由工作台展示,真实任务与沙箱共用此契约。
3. 模型端口
模型计算是主体可选择的能力。认知程序可组合语言模型、感知模型、检索、算法和工具,不要求每段认知都进行聊天或工具往返。下列端口描述语言及多模态推理调用;其他计算使用相应能力契约,结果回到所属 Self/Mind 或活动。认知选择上下文和下一步,运行机制管理实际请求与用量。提供者生成的工具提案返回认知/宿主接纳路径后才执行;不得启用绕过该路径的提供者自动工具循环。可用提供者通过配置装配,认知按能力和用途选择;自动路由优化是可替换策略。
| 语义对象 | 至少表达 | 不应混入 |
|---|---|---|
ModelRequest | 请求及 Self/Mind 归属、可选交流/活动关联、步骤、用途、提供者配置版本;已选输入块及来源版本/处理范围;可用工具契约;输出要求、截止与预算 | 普通输入中的凭据原值、未选入的内容、隐藏评价答案或未来事件 |
| 输入块 | 运行要求、当前关注及可选活动状态、领域视图、主动选入原文、先前工具提案与对应结果分别标型 | 将工具输出中的文字自动提升为系统要求;将文件摘要伪装成未读取投影 |
ModelResult | 完整/部分/失败/拒绝/截断、文本或结构产物、带 ID 的工具提案、提供者身份、用量与停止原因 | 把内容拒绝改写为主体不愿;把请求传递成功当作任务完成;将未知费用填零 |
| 工具结果 | 对应请求/调用 ID、真实执行状态、错误类别、产物投影或明确请求的内容 | 按返回顺序配对并行调用;将旧结果串入新活动;由提供者直接写活动真值 |
| 接续材料 | 必要主体/心智状态、可选活动上下文及当前选入内容;需要多轮协议时保留成对的调用/结果和要求保留的提供者块 | 全历史自动灌入或只留最后一句;将提供者会话句柄视为持久主体记忆 |
输入、结果、工具契约均有版本;适配器声明是否支持结构化输出、工具调用、媒体、流式用量、推理预算和续接。不能把“不支持”静默降级成“已保证”。提供者专用续接块或签名块可以按其契约不透明保存,绑定原模型/会话和信息范围;不尝试把它们变成长期事实或跨厂商通用思维。
处理范围变化时沿上下文有效性核对本次输入与既有会话。不能确认受限历史可被排除的续接引用不再使用,改以仍获准材料建立新的请求;在途结果与待交付产物按当前用途另行核对。宿主记录重建原因和来源范围,不以新建会话声称提供者已删除旧数据。
业务结果采用结构化 status/code/origin/retryability 与必要说明;提供者拒绝、主体不愿、格式错误、预算截断和运行故障分别处理。一般业务失败交回认知决定是否补充或结束,不将一般业务失败直接解释为整项思考异常终止。宿主组合实验的错误关联控制虽被拒绝,但通用执行错误文本不直观,促成此项设计修订;改进后的错误契约尚未实测。
一次推理按选入材料、核对处理范围、计算及结果解释组织;结果可以支持判断、联想、状态更新、行动或等待。需要外部作用时再通过能力入口执行,不强制每次计算生成工具提案或对话输出。只读能力也经过范围和用量检查;模型返回格式坏、预算耗尽和不可回答分别形成结果,自动修复和重试必须计入原主体认知、交流或活动的额度。流式草稿不是正式交付,严格格式在完整输出或契约单元校验后发布。
空内容先结合停止原因、是否完整和实际用量分类,再决定恢复方式。若提供者报告额度截断且没有可执行提案,则不派发动作,保留原责任;是否调整投入、补一次受限请求或说明受阻由剩余预算和用途决定。报告 016 的独立脚本将这类响应记作通用 JSON 错误后恢复;报告 017 已区分截断、空内容和 JSON 错误并验证有限控制及真实轨迹,完整提供者映射仍须按契约校准。
默认记录决策依据、实际读过的资料、记忆和代码、输入/输出身份及选择结果;模型内部隐藏推理不是必需接口。普通输入及模型响应按运行记录策略保存为受限证据,日志只写定位与状态;专用机密计算的输入、输出按机密处理契约分流,不随普通记录保存原值。这既支持可观测性,也维持简短对话和领域视图原则。
已运行的真实模型对照条件在原报告与冻结输入维护。提供者原始返回可留存,但厂商的 tool/usage/refusal 映射须单独校验。
报告 014 只测试简化 JSON 往返和确定提供者;报告 015/016/017补充网关模型的 JSON 动作往返、功能任务及接续/投入对照,但不覆盖厂商原生工具、流式和完整服务契约。
服务错误与语义失败分别记录;请求别名和响应身份都保留,用量字段有歧义时不得静默相加或改填零。
3.1 输入装配与提供者复用
认知提交选定输入块、计算用途及是否需要独立新结果,模型适配按同源契约形成请求。相同修订使用稳定表示,按输入装配规则保留角色、来源、输出要求及相关顺序;适配器不擅自摘要、删减、重排语义内容或更换模型来提高命中。
| 提供者接入信息 | 请求与反馈语义 |
|---|---|
| 支持的复用方式 | 自动前缀复用、显式边界或引用等按实际能力表达;不支持时仍可普通调用,不要求统一接口参数 |
| 匹配与保留条件 | 记录实际提供者、模型/配置绑定及已知有效条件;身份、用途及输入有效性仍按当前状态检查 |
| 计费与观测 | 保留原用量字段,区分普通输入、缓存读/写、输出及其他已知费用;不支持的反馈标记未知,不按估计命中伪造账单 |
| 失效与普通路径 | 过期、未命中或服务不支持不改变输入含义;允许的普通计算继续沿预算接纳,不因缓存缺失重新要求业务承担 |
前缀复用只改变提供者处理既有输入的方式,不返回旧判断。需要独立判断或重新采样时仍产生新的模型结果,可以利用相同输入的前缀处理;完整结果缓存仅用于契约明确允许的用途。模型原生续接引用仍须符合当前输入及处理范围,不能用缓存身份替代 Self/Mind 或业务记忆。
提供者保留状态不代表 TinyAGI 可读取、迁移或删除其内部缓存。远程保存范围、授权及清理能力按实际服务契约声明;本地停用不声称已删除上游内容。明确特殊用途的机密计算沿专用输入与记录规则,不进入普通缓存诊断或复用池。
4. 运行、存储与动作协议
4.1 身份与状态所有权
| 身份 | 职责 |
|---|---|
| SelfID、MindID | 主体/心智的持续身份,也是独立认知及其能力工作的直接归属;不随实例重建改变 |
| 会话与输入事件关联 | 接纳前交互的定位与处理归属;关联澄清、回应、操作和预算,不代表已承诺业务工作 |
| EpisodeID | 自主或受托活动的目的、范围及未完事项;需要持续组织时建立,可跨会话与认知执行 |
| TaskID | 归属活动的可恢复执行安排,关联依赖、等待和若干操作;简单活动可直接关联操作 |
| 执行域、SandboxID | 宿主绑定真实活动或某个试验,限定状态、输入、能力、输出与预算 |
| StepID、StepAttempt、StepToken | 一次最终状态提交、认知尝试和宿主发放的可撤销令牌;步骤内操作独立记录接纳 |
| OperationID、AttemptID | 一次能力工作意图及其实际尝试 |
| DecisionID、EffectID、OutcomeID | 选择、预期/可能现实作用的跟踪与用途评价,不能互相代替 |
| 执行身份、程序版本、采用顺序 | 区分当前运行上下文与持久业务身份;具体库身份映射见工程参考 |
| EventID/EventSeq、ArtifactID | 事件身份/本地记录顺序和产物身份 |
| ReservationID、ProofID(按需) | 跨执行中断保留的计算资源占用与核对依据 |
控制目标明确写成主体 Self、心智 Mind、活动 Episode、任务安排 Task、操作 Operation 或具体执行尝试,保留原归属与影响范围;接纳前操作沿交流归属处理。面向用户的“任务”名称不能替代这个类型;中止活动推进覆盖其所属安排与操作,停止一个安排或操作则只更新对应执行事实,原活动责任仍须继续、调整或明确退出。共享能力服务不是任意一个使用任务的子对象,其维护按独立授权处理。控制语义
宿主从调用上下文绑定身份、权限、执行域与预算,脚本填写的 ID 不授予能力。对象删除后重建须有不同创建身份;局部版本或全局世界版本都不能独自证明所有依赖有效。原键用于定位既有工作,更换执行身份不创造重做现实动作的许可。
沙箱中的步骤、状态、事件源/订阅、回调、模型会话和产物归同一域;沿用来源人物或活动 ID 只表示关联。缺失域不得回落生产能力,模拟效果不复用现实 EffectID/句柄。具体装配见沙箱。
主体与心智的直接认知归属
宿主绑定执行的 Self/Mind、代码、能力范围、预算来源与执行域。认知可从环境线索、当前关注或内在状态出发,尚无交流记录或 Episode 时,Step、计算请求及操作直接关联该主体/心智。不存在任务不表示调用没有归属,也不要求生成虚构请求。
认知需要持续组织工作时建立或关联活动,原操作、投入与经历继续保留;改变归属不能刷新额度。认知组织决定关注、解释与下一步,宿主核对可用能力和运行条件,不验证每个想法的客观意义。普通有界内部计算无需独立操作记录,跨能力调用与现实动作仍沿既有执行入口处理。
接纳前交互的运行归属
交流所有者保存会话及输入事件关联的请求处理记录,绑定发起者、受众、澄清状态、允许处理范围与预算。此类交流的 Step、模型请求和 Operation 关联该处理记录及所属 Self/Mind;EpisodeID 在业务接纳前可以不存在。主体自身的认知沿直接认知归属处理,无需伪造交流请求。它们共用现有操作、控制和用量机制,不另设一套执行引擎。确定性管理操作保留直接管理请求的身份及归属,无须伪装成聊天或先交模型接纳;维护长工作按既有活动/操作契约安排。
接纳前只允许获准的理解、澄清、回应与必要读取/计算,不派发尚未承担的业务动作。处理完成可为拒绝、澄清等待、撤回、失效或已转入活动。转入时保存原关联及既有操作事实,明确后续预算来源,避免重复结算或刷新原额度;迟到结果仍归原请求,不自动改变已作出的拒绝或接纳范围。等待澄清释放认知入口,撤回处理可控制其所属操作,不影响其他请求或活动。交互语义见主体流程。
4.2 统一事件、来源与订阅
事件是所有有业务意义的交互和活动推进的共同表达。外部观察、请求提出、接纳/拒绝与结果、状态变化、运行控制分别标型;它们共用协议但不混淆业务事实。例如“请求发送”已发生,只证明请求存在;“发送完成”须由相应执行结果支持。外部事件中的主张先作为观察,不能自行成为当前事实或高优先级系统要求。
事件保留类型/版本、来源及来源序号、发生/接收/记录时间、有效期、可见范围、因果关联与载荷引用。SourceEpoch 只区分来源重启序号;本地 EventSeq 不重排现实发生顺序。
相同来源键与相同内容可去重,内容不同保留冲突;缺少稳定键时不承诺自动识别全部重复。输入先核对来源、大小、结构和访问范围。媒体走有界缓冲/文件,重要事件与授权不寄托在可丢失队列或滞后索引中。
共同语义还包括宿主绑定的执行域、主体/心智及可选交流、活动、操作关联和前因;具体类型携带自身业务数据,必要时以领域视图引用。来源绑定、授权及订阅决定事件能交给谁;同一事件可有多个合格接收者,但订阅不扩大原可见范围。事件记录能证明收到或执行过什么,不证明其载荷内容真实。
flowchart LR
External["外部来源/能力结果"] --> Ingress["适配、来源与执行域绑定"]
Internal["内部请求/状态变化/控制"] --> Route["按类型、范围、订阅和关联分发"]
Ingress --> Route
Route --> Owner["状态所有者/能力执行/控制处理者"]
Owner -->|"有意义的新结果或变化"| Route
Owner --> Ready["主体关注、相关请求或活动的变化"]
Ready --> Mind["按需认知/接续"]
Mind -->|"有目的、有预算的请求或决策"| Internal
图中分发是逻辑责任,不要求单条 FIFO 或全量广播。确定回执、普通进度及控制由机制处理,只有影响判断、计划或交付的事项才触发相应认知;相关事件可汇集处理。停止等实时控制走宿主优先通路,不等待慢模型;经授权可先发出止动请求,正式接纳和实际停止沿任务控制契约分别确认。模型与工具结果先归入操作事实及事件,再通知原主体/心智及所关联的交流或活动,由相应认知决定是否接续。
| 对象 | 责任及生命周期 |
|---|---|
| 事件源 | 产生通知的对象/提供者,可已存在或经能力创建;其内部产生通知的方式不属于核心业务职责 |
| 来源适配与引用 | 宿主绑定提供者身份、允许事件类型及访问范围,必要引用由事件机制持续保存;不接管提供者的业务对象 |
| 订阅与关联 | 宿主表达关注条件、接收主体/心智或活动、执行域及结束条件;来源创建、订阅安装和事件触发是不同事实 |
| 当前业务状态 | 各模块处理合法事件后维护;订阅通知不绕过状态所有权或把来源主张直接当成已确认变化 |
创建闹钟只是一种能力请求:外部提供者返回对象引用及创建结果,宿主关联等待活动;到时通知沿普通事件入口返回。文件监听、后台任务完成、平台消息也沿这条通路。核心不新增闹钟计时模块;宿主自己的执行超时、预算和生命周期仍属运行机制,它们产生内部控制事件。取消订阅、请求取消外部对象及收到取消结果分别表达,不展开新的底层故障协议。
步骤完成后,主体/心智可根据当前关注、未决问题或活动进展提出接续,运行机制按有效状态与额度安排;不要求等新用户消息或额外闹钟。相同状态的重复通知、无变化的自我唤醒不自动形成新认知工作;全部接续受原主体认知或活动及全局预算约束。通知触发也不必发送消息,仍按当前关注与活动用途决定行动。
活动完成条件由其目的、范围及已接纳的责任确定,事件负责提供变化与结果证据。不同请求路径可以达到同一用途,不能将预选事件序列当作唯一正确认知流程;也不能只看最后状态而丢掉先前错发或越界。试验中的来源与结果遵循环境释放规则,未覆盖行为不冒充成功回执。
事件驱动与存储方式分开:当前状态+必要事件/过程记录维持既有持久化设计,不要求完整事件溯源或每 token/函数调用落库。资料内容由原所有者维护,外部检索服务报告其实际操作状态;事件表达变化,不自动展开文档正文或服务内部数据。外部格式可以参考 CloudEvents 1.0.2,内部协议不在此承诺符合全部标准或冻结字段。
4.2.1 核心、任务、认知执行与操作的生命周期
| 对象 | 所有者与结束边界 |
|---|---|
| Self/Mind 与核心认知 | 主体/心智状态持续保存,可直接组织认知;生命周期不继承单项活动期限 |
| 接纳前交流处理 | 交流所有者维护请求、澄清及有限投入;处理结束或转入活动不改变既有操作事实 |
| 活动 Episode 与任务安排 Task | 活动所有者保存目的与责任,所属 Task 保存具体执行安排;两者分别控制,可跨多次认知和执行 |
| 一次认知执行 | 有界的当前计算及所属局部工作;结束或中断后从已确认状态接续,不结束独立受管理的任务 |
| 操作 Operation 及其尝试 | 操作所有者维护接纳、期限、尝试和结果;通知原主体/心智,以及所关联的交流、活动或管理请求 |
长工作通过宿主接纳后返回操作引用及接纳状态,操作所有者承担后续执行与控制;结果通知原主体/心智及所关联的交流或活动,并按需触发认知。认知入口不等待整项工作完成,外部操作也不依赖提交它的短认知调用一直存活。短小有界计算可直接完成;同一步骤内取结果后继续的便利方式,仍须满足可打断及入口可释放要求。等待不计作已取得结果,任务期限、认知计算限额与实际计算资源用量分别记录。
认知工作受原步骤令牌约束,中断或期限到达后旧提交失效;已接纳操作继续按自己的归属及控制规则处理,未接纳请求不能冒充已经开始。工作者和子工作继承原主体认知或活动及全局预算,不因分段、重建或独立执行获得新额度。输入和优先控制独立接纳,后台工作受有界并发与调度份额约束;不能以机制可响应承诺缺少推理资源时仍能即时生成完整答复。
4.3 步骤上下文
StepContext 组织本次可见输入:所属 Self/Mind、当前关注、可选的交流/活动关联、执行域、代码身份、令牌/期限、输入事件、连续状态、选入材料、开放问题、在途操作及运行范围。主体和工作区状态可持续保存,模型上下文是认知按需要组织的临时视图。执行使用和实际交付保留在对应操作记录,不因组件加载过某个程序或模型就记作模型已读。
同一域内每心智最多一个可提交步骤,不同心智可并行计算。长任务等待按生命周期分工保存为工作区及接续条件,不持有该心智的唯一可提交步骤;认知可结束或撤销本次步骤后处理其他输入。沙箱与真实心智各自保存状态。计算使用已确定的可见输入,提交前重新核对状态;撤销、超时或代码切换使旧令牌失效,迟到提交不能绕过核对。
计算可见性按实际输入核对:刚提出但尚无返回结果的读取或创建请求,不能作为本次判断的已知依据;已在输入中的有效旧材料仍可复用。结果先归属操作,再形成可见的接续输入;同一逻辑步骤内允许取得结果后继续计算,不把逻辑步骤等同一次模型输出。等待具体操作结果、等待后续来源变化和结束责任分别表达,不用一个含混的“让出”隐式推进业务阶段;这不延迟真实事件或优先控制的接入。
4.3.1 接续请求 Continuation
认知可返回状态更新、带依据的世界断言提案、尚待接纳的能力请求、已接纳操作引用、输出意图、等待条件,以及决策/开放问题。具体字段仍是候选,不能把这些对象机械等同一次模型调用或完整思考。直接认知的状态变化回到所属主体/心智;交流提案更新对应请求,形成持续活动时再建立或修订 Episode。
完成是按当前责任核对的提案:活动所有者区分创建、观察和交付等已接纳责任,尚未收到所需事实时不能仅凭模型填写 done关闭整个活动。部分责任可以独立完成;明确撤销、退出或范围变更按对应状态处理,不伪装成原目标完成。报告 016 记录提前完成;报告 017 补充独立责任接纳机制与真实模型拒绝后接续样本,尚无产品宿主集成验证结果。
涉及既有活动修订时,活动身份由接纳上下文绑定,模型自填的新名称不自动成为可更新状态或承接责任的活动。拆分/转交通过明确提案建立关联并确认承担范围,未确认前原责任保留。完成依据缺失或身份未绑定时返回拒绝及实际未完事项,保留已完成操作供认知接续;不替认知编造新的目标或产物。
请求使用步骤内稳定 RequestKey,附输入、必要依赖、期限及计算资源上限;单批前置依赖无环,长期活动可迭代。协议错误拒绝当前尚未接纳的批次,不撤销此前独立接纳的操作事实。宿主限制载荷、数量、嵌套和写入对象,模型输出不能直接变成任意执行入口。
4.3.2 步骤内能力操作与最终状态提交
Step 是一次最终状态提案的边界,期间可以有多次模型调用及独立能力操作。需要取得结果后继续判断时,经宿主操作入口先接纳,不能先执行再依赖最后的状态提交补登记。统一事件语义覆盖两种入口,但不把它们视为同一次共同接纳。
- 宿主提供 StepContext 和提交资格,认知按已可见材料形成请求。
- 步骤内能力入口核对当前步骤资格、主体/心智及可选交流/活动归属、实际能力范围与预算,以 StepID+RequestKey 关联接纳结果与 Operation;同键同内容返回原接纳结果,不同内容拒绝。请求超时或接纳不明先查询该关联。
- 接纳后才派发,操作按原主体认知、交流或活动/Task 关联独立执行。短工作可在可打断段内取得结果继续判断;长工作返回引用,宿主即保存操作及原归属的结果关联,认知保存接续点并让出入口。
- 结果经原操作所有者记录,再作为有来源的可见输入进入后续计算。新增实读内容及结果加入本次输入依据,不能倒算为先前判断已经知道。
- 最终 Continuation 提交状态修订、已有操作引用、尚未接纳的新请求和等待/收尾提案。已有操作不再次派发;同一 StepID 的最终提交仍只有一份被接纳内容。
最终提交失败、认知中断或来不及保存接续点,都不抹去独立接纳的操作、费用及外部效果;其归属、结果和必要接续由宿主记录保留,后续认知从这些已确认事实恢复。未确认的主观判断可以丢弃,已接纳工作不能依赖临时执行栈才能找到。未接纳请求则不应开始。需要状态修订与新动作意图共同成立时,将两者留到最终共同提交,不提前派发。
同一请求不能先经步骤内入口接纳,又在最终提交中改名为新意图重复执行。读取、推理和动作都经过各自能力准入,普通有界局部计算不要求另建操作。模型生成的工具提案没有独立执行权。上述选择使同段工具往返与任务独立执行共存,详细工程映射见步骤接入。
4.4 状态提交与接纳
- 校验请求结构、目标领域及新生成内容的可用引用;尚不执行外部业务动作。
- 核对步骤资格、尝试、采用版本、当前状态、时效、权限、依赖及必要预算。
- 核对已接纳操作引用的归属,一致接纳状态修订、尚未接纳请求的意图与待办、输入消费/等待条件、必要预留和回执,再确认接纳并推进新操作派发。已有操作事实不重复接纳或结算。
相同 StepID 和内容摘要返回原回执,不同内容报冲突;接纳结果不明先核对原键。安装等待条件时检查已有完成事件,仅打断认知时撤销最终提交资格,独立接纳的操作继续按原归属处理;针对活动、Task 或 Operation 的停止才按范围裁决未接纳工作与已接纳操作。共同接纳不能补足未记录的查询范围、空结果或时间依赖,也不覆盖外部效果。
能力计算及外部动作不属于上述共同接纳的内部步骤。具体持久化技术和实验条件见工程参考。
4.5 操作、接纳与取消
Operation 保存排队、运行、成功、失败、取消或不明等状态,以及实际提供者、参数摘要、业务键、期限和 Attempt。完成结果持久保存再通知;事件通知促进接续,持续保留的待办决定尚未完成的责任。第三方可恢复任务使用其真实任务 ID,临时执行句柄不作唯一接续依据。
4.5.1 本地接纳与进入
意图和待办提交后才确认接纳。工作者以条件转换从 queued 进入 entered;取消可从 queued 关闭。只有成功进入者才能调用能力;进入执行和外部效果无法共同确认,entered 不能证明效果已发生或未发生。
未进入的已接纳待办可以接续;已进入且结果不明的非幂等动作不能自动重新排队。进入后取消是停止请求,按提供者契约核对;播放停止由即时控制处理;结束执行上下文或取消等待不证明提供者工作或设备已停止。
4.5.2 主体暂停与任务控制
宿主提供明确的主体暂停:暂停目标 Self 的新认知推进及新动作,并按现有停止机制处理其在途工作;输入登记、控制查询、结果归档与必要清理仍可运行。停止输出只控制表达和交付,不隐式停止后台认知。恢复后按当前关注、权限与条件重新选择,不重放过时动作;具体任务控制继续限定在所选目标。
Self 的控制意图、控制台/获授权用户的请求,以及未来安全审计模块的获授权决定,共用宿主控制入口。宿主核对可信来源、目标身份、动作及作用范围后,由原任务所有者处理;不等待认知同意或慢任务队列排空。审计发现/建议单独登记,只有获授相应权限的决定可直接控制;文本自称审计命令不获得资格,具体审计算法和全面检查流程不在此预设。
| 动作 | 状态与继续条件 |
|---|---|
| 切换关注 | 保留原任务推进资格,改变当前注意;不自动取消其工作 |
| 打断当前执行 | 结束指定认知、模型或工作尝试,任务目标保留;继续时核对当前条件 |
| 暂时阻断任务 | 禁止范围内的派发、重试、采用及交付,保留任务与阻断原因;有权解除且所有适用阻断已清除后再评估继续 |
| 中止任务 | 结束本次继续推进资格,停止所属工作并保留收尾责任;再开展须重新接纳 |
控制记录绑定来源及权限依据、目标类别与 Self/Mind/Episode/Task/Operation/尝试身份、动作、原因或规则来源、影响范围、实际处理结果与解除条件。宿主维护任务到当前执行、子工作及外部操作的关联;请求者不能通过自报任务归属越权控制。原因与证据按受众投影,Self 只取得获准解释及必要状态,机密与受限审计材料不随控制事件展开。
经授权的实时止动请求可先发出;任务阻断或中止由原所有者正式接纳。下列状态分别记录,不要求按表中顺序被观察到,也不从其中一项推断其他项:
| 状态 | 确认的事实与范围 |
|---|---|
| 止动请求已发出 | 已向指定执行或提供者发送停止请求;不表示任务控制已接纳或对方已停止 |
| 控制状态已正式接纳 | 原所有者已确认阻断或中止,范围内的后续派发、重试、采用及业务交付受到限制;不表示在途工作全部停止 |
| 实际执行已停止 | 已取得所列执行或提供者停止的证据;其他工作、已发生效果和资源收尾仍分别核对 |
未确认正式接纳时,如实报告接纳待确认或失败;即时止动的成功不能代替任务状态,也不承诺重启后仍保留该阻断或中止。正式接纳的保存与回执顺序见工程映射。
正式接纳阻断/中止时,禁止范围内新的工作与业务交付,并将控制请求覆盖到范围内全部在途执行。子工作遵守相同约束;只保留结果登记、资源清理和已发生效果核对等必要收尾,不以收尾继续原业务。已完成效果保留,迟到结果关联原任务,不自动重试、采用或触发下一步。共享资源只撤销目标任务的使用和所属工作,不关闭其他使用者的服务。无法撤回的效果如需补偿,另行按权限接纳。
即使控制已正式接纳,仍可能有外部停止待确认或资源待清理。观察不到停止证据时保持未知,不报告全部已停止;任务工作超时或中止不关闭 Self 或无关活动。有效阻断在重试、任务重命名、换实例或换实现后仍按其操作/用途范围核对;仅终止一次任务不等于永久禁止未来同类请求。
解除须核对控制权限和全部独立有效原因,不因一个来源撤回就清除其他阻断。恢复前检查任务是否仍有意义、当前授权、依赖和剩余额度,不盲目重放排队工作;已中止任务的重新接纳也受持续有效的限制。原业务交付与控制反馈分别授权。禁止继续任务产物交付,不阻止向获准接收者报告控制状态、必要效果事实或退出说明;确定性状态直接由宿主呈现,语义解释可另行接续且受控制反馈范围约束,不恢复原业务、泄露受限原因或发送迟到产物。Self 可解释、提出复核或替代方案,不能自行解除外部控制。实际停止及收尾沿效果规则,页面行为见工作台。
4.6 外部效果、执行停止与占用
Effect 跟踪预期或可能发生的现实作用;prepared、dispatched、not_applied 或 unknown 均不证明改变已经发生,confirmed 仅表示所列证据支持特定作用。记录存在、调用返回成功与实际用途达成分开。超时、断连或崩溃可能留下 unknown;按原业务键查询,只有契约足够时才重试。过期去重键不能通过更换请求身份恢复保证,业务状态接纳不覆盖外部世界。
4.6.1 核对与回收
保留效果事实、停止证据及各执行实例、句柄及计算占用的回收状态。同一调用的计算容量已释放时,外部效果仍可未知;不能冻结所有无关工作,也不能以本地退出证明远端退出。查询需要预算和结束条件,长期缺证据允许保持 unknown。
证据绑定来源、操作、尝试和具体执行或占用项;同键不同内容保留冲突,不让缓存替代提交时核对。已结算后出现矛盾需追加修正记录及针对性核对,不能覆盖旧账。来源是否真实仍按契约和证据判断,不由容量账务裁决。
4.6.2 必要的持久预算结算
普通临时内存资源沿生命周期管理;需要跨重启保留的额度或冲突责任才建立持久预留。按 ReservationID 共同确认核对证据、余额返还、唯一释放记录和事件,多份 ProofID 不代表多次可返还。实际执行、取消和回收分别记录。
4.7 慢速结果重新核对
结果是否有保留价值、选择理由是否仍成立、动作当前是否允许是三个问题。合法收到的旧分析可以留作材料;旧动作不获准不必删除分析,也不能把结果当成新授权。
推理依据包括原文、比较范围、目标和关键假设;执行条件包括身份、权限、参数、时效和能力契约。对象版本、集合变化、空结果、创建身份、时间、受众/任务修订和提供者绑定均可能影响结论。新增更便宜候选时,旧候选仍可执行,但“最便宜”的理由已需复核。
宿主记录实际读取,认知补充关键依据;读取清单不等于完整语义依赖。改变了推理依据则将变化交回认知,可局部修订或补证;权限撤销则拒绝旧动作,不能靠重试补授权;新鲜性未知保持未定。
4.7.1 执行前仍有变化窗口
同一权威状态内可共同校验和提交;提供者支持条件执行时将可验证条件交给它。仅支持单对象条件写不保护跨对象、授权或物理世界条件。当前签发的许可、材料/计算条件和受众在实际派发前再次核对,跨外部系统不假定共同事务。
新消息只按活动约定影响旧工作,不自动使所有后台任务失效。细化依赖和执行窗口的推导保存在结果复核依据。
4.8 流式结果与输出
多模态输入保留来源、媒体轨道/片段身份、时间与有效状态;媒体来源、说话者假设、已核实账号和当前受众分别记录,不能由轨道或设备 ID 推导人物身份。原始音视频由资料职责保管,默认事件给出投影;主体认知或感知活动在已配置范围内主动订阅和读取所需片段,派生转写与识别结果保留来源及不确定性。共享设备受众未知时采用适合公开场合的内容,必要时转到已明确的私密渠道。
停止播放、停止采集、取消模型调用和退出活动是不同控制作用,分别返回状态;直接停止路径优先,不等待深度认知或整段生成结束。中断后保留已发生输出,未交付内容按当前轮次和情境重新核对;连接失败、轨道结束与推理失败也分别表达。分层依据见媒体标准与交互原则,不把浏览器标准当成具体设备选择。
流绑定操作、执行身份、输出轮次和序号,区分部分内容、完整结果和关闭原因;本地中断先切断播放,随后登记。已播放部分不因取消消失;迟到片段不进入新轮次。
文本/文件输出核对当前受众、内容和输出契约,严格格式按完整产物或约定单元验证。沙箱输出进入替代接收点,生产输出路径不因模拟成功回执被激活。
4.9 预算与反压
主体直接认知使用已配置的 Self/Mind 额度,关联活动时保留其投入来源;额度限制计算,不要求先证明用户任务收益。
按主体、心智及所关联的交流、任务、活动和全局约束并发、队列、载荷、模型费用和设备占用;重试、查询、取消、评阅及沙箱分支均计入实际成本。续接、接纳为业务活动、换会话或新实例不重置已有投入。已结束活动的纠正须有有效预算来源,不能以修复名义自动续费。无法获知的费用保持未知,不填零冒充免费。
执行上下文的配额、提供者实际计算及其他计算资源占用分别观察。逻辑任务分开不保证实际资源互不影响;保持准入约束、取消及实际回收记录。精确参数按具体用途配置。主动学习另受学习强度与关闭限制,全部下属工作共享同一预算来源。
4.9.1 复用、在途合并与实际成本
操作所有者在原接纳路径中核对复用资格。读取或确定计算须具有可确认的输入/依赖、实现和参数,以及当前身份、用途、执行域和新鲜性范围;请求内容相似或已存在结果都不自动满足这些条件。结果缓存、相同工作合并和业务请求幂等分别记录,均不绕过准入或把旧外部效果当作新执行。
相同、可共享的只读工作可以关联到同一实际执行,保留每个请求的所属 Self/Mind、可选活动、许可、期限及等待状态。每个接收者只获得自己获准的结果,并记录复用来源;共享准备不改变独立判断要求,不将失败或部分结果伪装成完整成功。
单个等待者取消只结束其等待和后续交付,不直接取消其他获准等待者仍需的执行。最后一个需求结束或针对实际执行的控制生效时,沿原停止及收尾规则处理;不能为保温继续无用途工作。共享执行也不持有某个心智的唯一认知入口。
实际执行费用全局只登记一次,使用方各自保留关联及事先确定的预算归属;已有费用不随加入、退出或复用而重复结算或消失。缓存读写、查询、来源确认、准备、保存和重建的已知成本另行记录,估计避免的开销与已发生费用分开;未知项不填零,不能把全部命中视为免费。
各处理能力管理自己的缓存容量和有效性,运行管理约束连接、实例和环境的占用、并发与回收;不新增统一业务所有者或永久复用承诺。必要状态及正式产物独立保存,缺失缓存可在材料、依赖和预算允许时重新准备。精确上限及保留期限按用途配置。
后台批量准备须有已接纳范围、期限和原预算,不能把实时请求及控制延迟到凑批结束。必要模型切换、状态修订和失效清理优先于命中率;节约策略不自行关闭正常主体认知、减少所需证据或修改学习强度。管理、评价
4.10 数据分工与派生状态
| 数据类别 | 逻辑归属与约束 |
|---|---|
| 主体、活动、人物、关系、断言、待办和必要账务 | 对应状态所有者保存可接续状态及来源,共同生效部分一致接纳 |
| 资料、程序、配置和模型内容 | 各领域维护身份、修订、操作与来源;查询和页面只提供视图,存为文件不改变归属 |
| Secret 原值、归属、授权与审计 | 独立机密职责维护 Secret、SecretGrant、提交及访问记录;实际接收方按用途与目标经专用通路取得原值或代理使用,普通资料、事件、记忆和认知上下文不承载原值或入口凭证 |
| 过程记录 | 关联输入、决策、请求、接纳、实际结果及用量,记录不能自行成为可信事实 |
| 检索接入记录与服务侧派生数据 | 宿主保存提供者绑定、来源映射、操作及可确认覆盖;外部服务维护自身检索状态,不替代领域许可或原文 |
| 读取/计算缓存 | 可清理的复用结果,使用前满足版本、用途及处理范围 |
| 沙箱与评价 | 独立可写状态和产物,共享基准仅按明确范围读取;参试材料与评价材料分开 |
本地产物只有内容已发布后才能登记为已可用引用;外部资料可登记来源定位,并明确内容未取得或当前可用性未知,不冒充本地发布成功。保留、删除和派生副本清理各有责任,覆盖不足或来源缺失须可见。记录格式、数据库与目录布局见工程参考。
个体程序的扩展状态
个体可以声明自己的持久状态,用于兴趣组织、情感评价参数或认知策略进度;不要求所有人物使用相同内部结构。状态关联所属 Self/Mind、定义模块及格式修订,声明用途、可见范围、可验证结构、允许修改者和迁移责任。定义来自对应程序修订,内容由宿主保存,不持久化任意执行栈、闭包或会话句柄;凭据通过 SecretRef 关联专用保管。
宿主负责身份、范围、版本、结构和写入,个体程序负责主观含义及迁移。观点、情感和关注变化可正常保存,不要求先建立可验收任务或证明其客观价值。实际承载私人内容的状态按对应受众与用途使用,不因一次私人经历就给整个人格施加相同限制。扩展状态可以引用公共对象,但不能把公共承诺、权限、活动责任或操作事实复制成可独立改写的替代真值;相关修改仍交原所有者。管理页通过同源描述展示和编辑获准字段,没有可解析描述时提供受限状态与对应领域的只读入口,不伪造空值。
程序切换前声明是否保持旧格式;需要转换时对独立候选状态执行受控转换与检查,再协调程序、状态格式及描述在目标范围内采用。转换失败保留原状态,旧程序不可运行时走固定维护/修复;回退程序仍须兼容当前状态,不自动回退事实。沙箱按试验问题导入或只读引用所需且获准的初态,后续写入独立;相关状态不支持时说明对评价的限制,不要求所有扩展提供任意时点的通用克隆。具体导入及激活范围见试验契约。
该契约使个体差异、迁移和管理共用宿主保存机制,不引入新的业务状态库。具体存储与工具映射见工程参考。
4.11 中断、接续与保留
执行中断后核对身份、已确认状态和采用版本,接续未完工作,核对结果不明的现实动作。恢复较早状态须保留缺失区间,不能因为当前记录缺失就自动重复可能已发生的动作;更换执行身份不抹去历史责任。
状态、必要资料/程序及来源引用须能共同支撑接续。删除、保留期及派生副本分别处理,缺失如实可见,不承诺任何历史都可完整重放。具体恢复与备份机制在工程参考维护,不新增底层故障验证队列。
4.12 观测与重放
Trace 关联 Self/Mind、执行域、可选交流/活动、步骤、依据、实际结果、用量与版本;没有 Episode 也能追查认知和操作。重放使用替代能力并按请求含义匹配结果;重新调用模型是重新评估,改变行动后的模拟是反事实。没有完整非确定输入和调度记录,不称完整执行过程的确定重放。
三类试验统一由沙箱机制承载,报告按用途形成候选,原状态与动作不整体导出。具体机制证据见报告 001–010,最小宿主/沙箱装配见 014;完整沙箱及整体模型效果未获得新的实测结论;设计台账维护已定方案和边界,不在本篇重复工程实施路线。
能力回归复用这些端口,既可重放确定机制,也可让候选重新完成任务。评价模块保存套件/配置身份、逐次运行关联、基线和采用记录;冻结用例及轨迹由评价职责保管,报告正文按文档读取,均保持试验范围。任务结果、比较有效性和采用结论分别保存,不将运行成功解释为能力通过;完整规格是测试与门槛的唯一维护位置。
5. 依据与验证边界
技术版本、SDK 与实现选择的一手资料移至工程参考。本篇保留支持交互语义的资料,并区分设计目标、资料推论和局部实验。
统一事件交互的依据
统一事件主线覆盖外部观察、能力请求、结果、状态变化和控制;闹钟仅是外部通知源示例。报告 012/014 的计时或虚拟时间夹具只支持所列局部流程,既未比较内置与外部来源,也未完整验证统一事件架构。
| 来源、版本及定位 | 支持的命题 | 本项目推论与边界 |
|---|---|---|
| CloudEvents 1.0.2,Overview/Terminology/Context Attributes | 事件描述发生事项及上下文,区分来源、生产者、消费者、载荷与传输;统一格式用于互操作 | 可参考其封装与来源语义;TinyAGI 的订阅、活动关联、请求/结果区分和权限属于本项目设计。未承诺标准兼容、采用消息平台或验证可靠性;具体格式随接入样本明确 |
外部检索提供者的 API/SDK 依据见工程参考,逻辑职责见领域检索。本篇维护共同请求与结果,具体产品和接入差异在工程参考中说明。
沙箱、能力评估、回归测试与复盘
用途:逻辑设计专题。
| 阅读主题 | 章节入口 |
|---|---|
| 计算节约 | 前缀、结果、增量与运行复用评价 |
| 职责与环境 | 目标 · 架构 · 使用方式 · 隔离与能力 |
| 试验对象 | 试验主体与生命周期 · 初态与状态导入 · 环境覆盖 · 函数测试 · 试验分层与构建环境 |
| 运行与复盘 | 完整流程 · 复盘与采用 |
| 评价方法 | 评估层次 · 能力覆盖 · 主体持续运行 · 用例与测试集 · 基线 · 评价器 |
| 回归与采用 | 退化与采用 · 报告与触发 · 主动学习评估 |
| 专项检查 | 检索提供者与策略 · 初始化与迁移 · 预制能力 · 任务解耦与控制 · 跨契约一致性 · 隔离执行 · 独立机密 |
| 取舍与边界 | 选择与依据 · 验收场景 |
1. 沙箱在整体系统中的作用
沙箱让主体能够在承担现实动作之前或之后,运行一个有范围、可观察、可停止的试验。它用于观察主体在环境中的持续认知,比较活动方案、测试程序与认知组织、复查历史决策,以及探索其他做法。候选可以真实调用模型、读取许可材料和运行确定计算;发送、设备操作等则由声明过的环境响应。
沙箱提供受控试验环境,不为正式主体增加第二份现实身份,也不成为每次思考的必经流程。主体先有具体问题、待比较方案、停止条件和预算,再按需创建。仅需检查格式、计算一次数值或阅读历史记录时,现有工具与观测即可完成,不强制展开反事实分支。沙箱没有自动求真的能力,试验环境也不等于真实世界的完整模型。
沙箱沿与现实活动相同的业务契约运行,由运行机制绑定独立状态、输入、能力和预算。现有“影子验证”归入沙箱,覆盖主体运行与具体活动:上下文、记忆、讨论、能力调用、产物、时间输入、交付和学习。
能力评估与回归使用这套环境:前者描述主体在什么环境、活动、条件和成本下表现出何种能力,后者比较行为变更前后的表现。它们为设计取舍和候选采用提供证据,只能支持所覆盖用途的结论;测试通过不承诺全部未来情境都不退化。本篇确定测试体系的设计,尚未建立真实模型能力基线。
沙箱支持可管理、可运行的试验主体,使用正式认知与运行契约完成主体级测试。初始状态和环境由试验问题决定,可按需导入已有主体状态;完整状态复制不作为创建或测试的前提。试验主体不新增现实身份和责任,持续交互与学习须有明确范围、期限及预算,详见生命周期。
2. 逻辑职责与作用范围
flowchart TB
Live["主体关注/活动/复盘/行为候选"] -->|"问题、采用用途与预算"| Plan["测试计划:套件、基线/候选、比较规则"]
Plan -->|"按问题固定程序、初态与环境覆盖"| Manager["宿主沙箱管理"]
Manager --> Trial
subgraph Trial["独立试验执行域"]
Actor["参试认知:复用正式运行契约<br/>激活指定认知与活动范围"]
State["所需初始状态与材料<br/>独立可写状态"]
Ports["宿主绑定的共同事件/能力入口"]
Env["环境:文件区、模拟收件箱、替代事件源与时钟"]
Actor <-->|"投影发现与主动读取"| State
Actor -->|"请求;不能自选现实执行域"| Ports
Ports <-->|"试验动作与观察"| Env
Env -->|"按约定释放的输入"| Actor
end
Ports -->|"允许的真实计算;记录处理范围和费用"| Compute["模型与确定计算组件"]
Compute -->|"结果"| Ports
Ports <-->|"宿主绑定试验范围"| Index["外部检索提供者与试验空间/结果夹具"]
Trial -->|"产物、轨迹、用量与终止原因"| Evaluation["确定检查/内容评阅/体验评价"]
Ground["评价依据、后续真实结果;不交给参试心智"] --> Evaluation
Evaluation --> Compare["逐任务及分能力比较:门槛、退化与未知"]
Plan -->|"固定评价规则与覆盖要求"| Compare
Compare -->|"报告投影、采用依据与限制"| Live
| 责任 | 所有者与交互 |
|---|---|
| 为什么试、比较什么 | 发起活动或复盘的认知;确定缺口、基线、候选和用途,不用“看看会怎样”维持无限工作 |
| 测哪些能力、如何比较 | 评估模块管理套件、用例、基线、覆盖与冻结配置;采用方事先确认用途门槛,参试候选不能改写本次评价答案或通过条件 |
| 创建和绑定执行域 | 宿主;分配 SandboxID、固定初始材料、能力配置、事件规则和预算,按需建立独立执行上下文 |
| 参试状态 | 该沙箱;Self/Mind 的测试视图可引用来源身份,但其目标、经历、情感和工作区写入与现实状态分开 |
| 环境如何变化 | 测试环境与替代能力;接收动作后生成观察,也可独立释放时间/外部事件;不由参试心智填写成功结果 |
| 是否达到目的 | 确定检查、内容评阅与后续体验评价分别承担;沙箱管理器只提供记录,不成为新的真值裁判 |
| 是否允许扩大采用 | 比较器汇集逐任务变化、评价有效性和覆盖缺口,按事先规则形成依据;采用方沿既有权限决定,不由参试者自报通过 |
| 结果如何进入现实活动 | 原活动读取报告,按依据采用明确产物或经验候选;宿主执行现行访问、提交与采用约束 |
沙箱管理、环境、数据访问和能力接入分别负责范围绑定。试验状态与产物归本次试验所有,允许的基准材料可只读引用;局部及主体级试验都按问题选择所需状态,不将全量复制作为准备条件。导入范围、兼容条件及缺失对本次评价的影响由初态契约说明。候选不能任意访问现实状态、资料、程序或能力;共享基准也不能突破原有信息范围。具体承载另见工程参考。
测试登记、运行安排、评价和比较是评估责任下的不同环节;分别保存用例/配置身份、基线和采用记录。冻结材料与报告保留内容身份,运行产物归各自沙箱,评价答案不能进入参试者可见范围。
一个方案的基线、候选和各次独立运行使用独立可写状态与新 SandboxID,原活动和比较记录将它们关联起来。默认重置为同一已登记基准;多阶段经验试验可以显式延续本分支状态。任何延续、预热或材料共享都要进入实验配置,不能让一组自动继承另一组的答案。沙箱重置不等于重置真实用户、服务或模型提供者。
3. 三种使用方式与输入来源
| 方式 | 环境与计算 | 可以支持的判断 |
|---|---|---|
| 记录重放 | 固定材料和已录制事件;能力请求按含义、参数、来源版本及必要环境状态匹配响应 | 特定轨迹是否仍成立、输出是否出现预期变化;用于部分回归,不证明陌生输入表现 |
| 候选测试/重新评估 | 环境提供任务与反馈,候选实际调用已选择的模型/算法,生成新的动作与产物 | 同配置与预算下的当前任务效果;与原历史结果分别记录 |
| 反事实复盘/方案推演 | 从指定信息时点分支,明确改变行动或假设,后续观察由环境规则或模型生成 | 在这些假设下的条件性结果;不证明现实必然会如此 |
可按能力混合录制响应、确定计算、真实模型和模拟环境,但配置与轨迹必须注明每条关键结果的来源。“调用过真实模型”不能把模拟用户反应升级为真实反馈;确定计算结果也仍依赖其输入和任务假设。
回归是一种比较目的,并非第四种环境或重放的同义词。协议回归可以用重放;推理、记忆和交流质量回归须让候选重新执行任务。完整轨迹不要求逐字、逐调用顺序相同,正确的替代策略也应被环境和评价规则接纳。
3.1 环境覆盖与结果来源
环境应能处理候选允许采取的不同动作。请求变化而没有匹配响应时,报告环境覆盖不足,或改用预先声明过的模拟分支;不能按第 N 次调用返回旧轨迹第 N 个响应,也不能静默转发给生产能力。覆盖不足与策略失败分别记录。若环境允许的动作集合使某种策略无法表达,比较结论只限于该集合。
| 能力的试验方式 | 明确的条件 |
|---|---|
| 真实计算 | 模型或确定计算实际执行,沿当前处理许可、提供者配置及真实预算调用 |
| 独立测试数据 | 使用与生产可变状态分开的资料、检索空间及能力状态,记录可确认范围 |
| 替代实现或录制响应 | 声明模拟规则或响应匹配条件;真实世界效果不由模拟成功证明 |
| 不支持 | 明确缺少的能力及受影响用途;合法行动超出覆盖时记录试验限制,不自动记作能力退化 |
环境可按场景逐步增加覆盖,无须先模拟整个世界。条件变化、授权收紧或外部提供者改变可能影响比较有效性,应在报告中说明;固定配置不承诺模型输出或现实环境完全重现。
试验环境沿共同事件协议替代真实来源与提供者:可模拟创建通知源的结果、文件变更和后台任务完成,也可重放已录制的观察。虚拟闹钟只是其中一个夹具,由环境产生创建结果及到时通知,不作为 TinyAGI 核心内置闹钟的依据。环境模拟提供者行为,模拟结果仍须声明其来源与假设。业务虚拟时间、实际墙钟耗时和模型计算耗时分别保存,冻结虚拟时钟不能免除真实计算资源预算。相同种子、时钟和输入只控制已声明因素,不保证模型、并发调度或全部 I/O 确定重现。
4. 状态、信息、能力与资源隔离
沙箱按领域所有权分别装配资料、记忆、程序、配置、模型能力及运行环境。各领域声明可见范围、只读基准、可写状态和允许操作,不依赖通用资源克隆;共享材料不复制维护权,运行使用也不授予正文回读。主体级测试按下节契约选择初态和激活工作,授权与已读内容变化沿上下文有效性处理。
认知试验与受控隔离执行分别装配:前者决定人物状态、替代能力、输入与评价,后者约束程序能接触的系统资源及实际投入。真实任务也可使用隔离执行;创建试验分支不自动满足系统隔离要求,启动独立环境也不代表初态及评价条件已准备好。工程承载见容器执行。
| 范围 | 当前默认规则 |
|---|---|
| 状态写入 | 工作区、记忆、世界断言、人格情感、关系评价、计划和待办写入本沙箱;不能修改原活动或其他试验 |
| 资料与记忆的发现/读取 | 对应所有者按试验情境提供视图,选读内容和范围须获准;当前处理许可继续有效,已删除或无权访问的材料保持缺失 |
| 外部检索提供者与策略 | 领域入口和共同契约保持一致,绑定试验提供者、材料范围或固定结果夹具;各提供者同级比较,单次、并行、分步及替代策略分别记录。可写空间与生产分开,提供者绑定、来源修订、实际覆盖、用量和未知项进入条件,详见检索评价 |
| 文件与程序 | 可真实写入本沙箱产物区;只读基准不覆盖,不直接开放宿主原始文件系统、Shell 或可绕过路由的 FFI;原生候选只通过受控构建与试验环境执行 |
| 外部动作与交付 | 消息进入模拟收件箱,设备动作进入替代设备,文件改动进入试验区;模拟成功回执不代表现实送达 |
| 模型与其他真实计算 | 经指定适配器执行,仍受材料外发范围、提供者配置及真实预算限制。网络调用可能带来费用和提供者日志,属于真实使用记录 |
| 事件源、订阅与回调 | 沙箱绑定替代来源、订阅、环境时钟和事件;外部观察、请求、结果、状态变化与控制共用真实协议。缺失域不能落回生产来源/输出,未完成回调不能带入已结束或新的试验 |
| Secret 与共享模型服务 | 试验主体按需引用获准描述和能力需求,不复制原值、生产授权或有效提交会话;所有者或有权委托者可为指定试验执行方单独分配代理使用或原值读取权限,绑定试验范围。原值不进入普通认知上下文、试验初态或导出,特殊处理沿专用用途配置;共享服务不随试验主体复制,维护权独立 |
| 读取/结果缓存与模型会话 | 独立会话和可变缓存状态;可共享的只读结果须满足相同输入、修订与处理范围,并注明准备条件,生产会话引用不复制给候选 |
| 日志、评阅和报告 | 试验标签由宿主保存;保留来源和隐私范围,原始内容不因进入日志或评阅而公开。评分答案、隐藏资料和未来事件不放入参试上下文 |
| 预算与结束 | 单次试验及其所有分支受原活动与全局总预算约束,另计重复调用、评阅和构建成本;分支增加不创造额度 |
新建独立执行上下文只提供执行状态分离的基础;宿主还必须装配受控能力。当前默认不使用带有通用真实文件/环境/网络能力的自动装配,也不提供未知请求的生产 fallback。候选导入或补丁需要新能力时,核对是否在原试验范围内,否则该运行报告能力不足,不能自动扩权。
沙箱的正常产物写入、试验登记及真实计算计费可以落盘。这里隔离的是候选对现实业务状态和作用路径的访问,不要求宿主连“运行过一个试验”的记录也不保存。需要核对真实发送或真实设备效果时,另定义有明确对象与范围的真实验证活动,不能将沙箱中的模拟发送改成对实际联系人的暗中测试。
当前沙箱用于受控认知及经运行机制绑定的能力评估。信息范围、可写状态和真实动作必须分别约束;执行上下文的限制不能代替提供者用量及实际计算资源占用的观察。逻辑试验独立不证明资源互不干扰,也不构成隔离任意恶意程序的保证。实现边界与库证据见工程参考。
4.1 试验主体、初始状态与生命周期
试验主体在独立范围内运行正式认知程序,并复用事件处理、状态接纳、能力调用、控制和预算契约。创建时先确定问题、评价条件和停止条件,再装配程序、所需初态、输入与环境;不另写一套简化认知流程代替被测系统。试验状态关联来源身份及 SandboxID,后续写入属于本次试验,不新增现实主体或接管正式责任。页面操作见工作台。
初态与可选状态导入
| 起点 | 适用问题与条件 |
|---|---|
| 固定测试初态 | 为主体持续运行、格式、权限、事件接续或完整任务准备固定程序、状态、输入及环境条件,支持基线与候选比较 |
| 已有主体的所需状态 | 为人格行为、记忆使用及个体程序修改导入获准状态,保留实际程序、配置、格式修订及相关来源 |
| 已保存的活动状态 | 从正常可接续的业务边界检查失败修复、打断或后续判断,明确接续输入及能力响应;不恢复任意运行现场 |
评估已有个体时固定其实际程序及必要状态;重新使用初始化提示词生成的人物可用于初始化评价,不能直接冒充同一个体修改前后的对照。初态记录来源修订、导入范围及缺失,不要求所有试验使用同一种人物结构。
状态导入依赖已有的格式、归属、权限与兼容契约,不要求自动推断任意程序的全部依赖或修复未知状态。所需内容缺失或不兼容时说明对问题的影响,不能用空值补齐后判定通过;无关领域未被导入不自动使试验无效。初态裁剪及环境覆盖限制进入报告,可能影响结论的缺口须先解决或缩小结论范围。
完整状态导入是迁移检查、长期行为评价等用途的可选方式,须明确所需范围、支持的程序与状态格式以及环境条件。它不承诺复制全部现实历史、任意扩展或任意运行时刻,也不是主体级测试的前置条件。导入成功只说明相应状态可用,数据齐全不证明环境可用或评价有效;备份与试验分别验收。
激活范围与能力装配
默认只激活本次试验指定的认知与活动范围,可以直接测试没有会话或任务的 Self/Mind 持续运行。导入的人格、记忆和活动记录可提供背景,但不会自动启动全部生产任务、主动联系或学习议程。多活动竞争与持续学习可以显式加入,注明参与活动、持续范围及预算;学习强度和全部分支仍受父范围约束。
已知操作事实保留来源含义,等待中的活动由试验定义提供后续事件或能力响应,不接收原生产回调、不重新派发生产动作。模型会话、有效句柄、订阅、Secret 原值、生产授权及生产预算对象不随状态导入;试验使用独立绑定、当前授权与父预算。只读基准按修订共享,访问仍核对当前许可。
宿主按环境覆盖绑定所有作用路径;提示词、自报试验身份或独立运行实例不能代替约束。需要额外系统隔离的实现继续满足原执行要求。正式主体后来的记忆、配置和结果不自动流入,需作为明确输入或新的初态登记。
运行、探索与采用
创建后默认暂停,分别展示程序能否运行、所需初态及能力是否就绪、允许测试的范围和缺失条件。启动后可继续、暂停、结束、注入事件、重置、再分支及比较。重置先收束旧运行与回调,后续使用新的运行关联;旧结果不进入新运行,历史成本和父预算不清零。
工作台内持续交流、编辑和试演可用于探索,记录各次变更;形成正式对照时重新固定初态、候选、环境及评价条件,不能把交互中不断变化的轨迹当作固定条件结果。多阶段试验可按计划延续本分支状态,真实反馈与模拟输入分别记录。
正式采用只提交明确的配置、代码、文档或方法候选,保留来源、当前授权和评价依据。模拟经历、人物关系、外部动作、授权及预算不整体合并;目标变化时显示冲突。无论导入范围大小,试验结论均只支持其问题与覆盖范围。取舍与资料
4.2 受管理函数的测试入口
按受管理函数契约,工具可为选定且类型可适配的函数生成临时入口;用户通过参数表单直接输入,在指定沙箱中取得返回值、状态变化、能力调用及成本记录,无需先手写完整业务包装。临时入口绑定候选修订和试验域,不改变生产暴露范围,不能把生产函数可见性转化为机密或外部动作授权。
函数测试覆盖局部行为,仍可将同一函数作为完整活动的蓝图节点或能力入口评价。纯计算声明以受限能力装配约束,含模型、状态或动作的函数按原沙箱环境执行;测试输入按具体领域处理,文档、程序及机密使用各自引用。入口生成、类型检查或单函数通过不等于活动连续性、热加载或无退化已经验证。
4.3 局部程序、能力组合与主体级试验
试验范围按要回答的问题选择,与录制重放、重新评估、反事实等使用方式分别定义:
| 范围 | 装配内容 | 能支持的判断 |
|---|---|---|
| 局部程序 | 固定候选、输入、临时入口与必要能力;独立可变状态 | 函数、规则或程序在给定输入与环境下的行为 |
| 能力组合 | 候选实现、调用方、接口和测试材料,受控请求与结果接续 | 能力协作、结果关联及原活动中的使用方式 |
| 主体级试验 | 正式认知与运行契约、所需初态、指定活动及相应环境 | 完整任务、多活动或持续行为的表现;结论限于初态与环境覆盖,不要求全量复制主体 |
各层试验按问题选择初态及能力,不自动继承生产绑定和有效凭据。宿主可将创建、检查、执行、观察和结束试验作为能力提供;同一试验仍关联父活动与总预算。嵌套试验受范围、深度、时间及额度约束,不能创建无限分支绕过停止条件。主体级装配与操作细则见试验主体。
4.4 可执行候选的构建与试验环境
编译产物与运行时程序包使用同一试验分层;程序包连同锁定依赖、入口和运行环境固定,不能在试验或采用时悄悄拉取新依赖。包准备脚本及运行环境中的下属工作也受原范围、预算和停止约束。
候选的准备、依赖处理、构建、测试及运行都可能涉及真实计算和环境作用,应统一装配允许读取的材料、可写产物区、可用外部能力及计算资源上限。执行环境缺少所需能力时如实失败,不回落到生产环境或扩大访问。局部执行状态分离不等于对任意原生程序的完整隔离保证;技术承载与工具链依据见工程参考。
不可变程序及构建产物可在来源、修订与处理范围相同的条件下复用,试验可变状态独立;构建缓存不保存凭据、生产会话或隐藏评价答案。构建日志、测试输出和报告由对应所有者默认提供受限视图,评阅按需读取,不能把大段原始输出自动注入认知。
候选成为可用产物、接口检查通过、局部测试通过、完整任务满足用途以及实际采用分别记录。功能成绩不授予实现信任、生产机密或额外访问权;候选须满足实现准入,环境缺少所需强制限制时拒绝该运行。主体自主采用按原回归与用途门槛处理,人工管理提交不因此增加强制完整实验,也不自动登记为已通过能力评价的采用基线。运行结束仍需按所有者收束候选及其下属工作;报告不能用入口已返回冒充全部工作已结束。
5. 一次完整试验怎样运行
- 提出问题。 例如“提醒过早是否来自忽略用户时区”,明确已有依据、比较内容、停止条件和预算;不是直接复制所有历史启动多路思考。
- 建立基准。 固定任务与当前允许的材料版本、输入可得时点、基线/候选版本、环境覆盖与评价规则;参试材料和评价专用材料分开。
- 装配和运行。 宿主创建独立状态与受控接口;认知正常经历发现、读取、讨论、能力调用、交付和等待,环境产生后续输入。
- 结束和评价。 保存成功、任务失败、预算耗尽、主动停止、环境缺失或执行错误的不同原因。预算截断不算自然完成,结构通过不代表语义正确。停止新动作并收束在途工作,未回收资源明确记录。
- 报告和采用。 产物归资料或程序职责,完整轨迹归试验职责,原活动先收到简短状态和报告投影,按需阅读;只采用带依据和适用范围的候选,或保留未定并结束。
配置至少能追溯:试验问题与父活动、输入/代码/模型版本、可见资料与选择时点、替代能力及环境规则、随机与时间条件、实际计算资源上限、指标与评价材料、逐次运行记录。这里确定语义,不提前冻结产品 API、数据库表结构或统一指标权重。
复用同一宿主协议有助于暴露活动衔接问题;评价规则由环境或评阅方持有,不能把正确摘要、未来事件、标准答案直接预填给候选。只观测到“虚拟信箱收到了消息”时,能说明环境中的发送发生,仍需核对接收者、内容、时机和当前任务目的。
6. 复盘与经验进入现实活动
历史复盘先固定决策时点:参试心智只得到当时可得且当前仍允许使用的信息,评阅方在初步判断后再读取后续实际结果。重新请求模型、检索今天的网页或使用今天的记忆都会改变条件;这类运行应明确作为重新评估,不能回称“原主体当时本来知道”。
反事实分支明确改变什么、保留什么,以及没有覆盖哪些环境变化。模拟用户愿意、不满或不回复,只代表该情境假设;即使模型模拟得很自然,也不能据此给现实用户增加欺诈标签、好恶评价或关系经历。来源同一个模型的参与者与模拟器也不自动成为独立证据。
| 试验产物 | 进入现实活动的方式 |
|---|---|
| 运行事实与报告 | 记录“在所列条件下做过这个试验”,带 SandboxID、模式及来源;报告默认投影,按需读 |
| 有用的文档或确定程序产物 | 原活动核对来源、用途和当前约束后选择导出/采用;新版本保留派生关系 |
| 方法与认知候选 | 保存适用条件、失败和证据类型,在来源任务之外继续比较;复盘文本不自动成为有效经验 |
| 模拟世界事实、人物反应及人格状态 | 留在试验域;可以被报告引用为假设结果,不合并到现实事实/关系/亲历记忆 |
| 发送意图、事件源/订阅句柄、操作句柄、凭据和预算对象 | 不作为候选导出;需要现实动作或来源时由真实活动按当前条件重新形成请求 |
不设沙箱状态的一键整体合并。接受一个产物或方法不等于接受所有关联判断,也不要求额外引入独立审批服务;沿当前活动权限、经验与程序采用流程处理。只有试验结果时保留证据范围,正式使用后的效果再与该候选关联,形成“假设 → 试验 → 有限采用 → 实际反馈”的学习闭环。
7. 能力评估与回归测试设计
7.1 评估对象与分层
评估对象是带明确配置的主体行为:认知程序、提示/上下文组织、模型及采样、能力适配、记忆/Reference、人格与关系起点、缓存和预算共同决定结果。换模型、修改提示、采用经验或改变检索策略都可能改变能力,不能只在修改代码时回归。
| 层次 | 检验内容 | 适用方式与限度 |
|---|---|---|
| 确定机制 | 格式可解析、请求与结果对应、主动读取事实、正确受众、产物和交付是否存在 | 夹具、重放和确定程序;适合快速检查,不能说明模型语义质量 |
| 主体持续运行 | 环境感知、内生关注、选择行动或等待、经历积累及个体连续性 | 按问题装配的环境中观察实际行为;没有外部任务也可评价,不以持续推理或多发消息判优 |
| 完整任务 | 目标理解、取证、调用、产物可用、接续和有依据地结束 | 同端口环境中的基线/候选实际运行;包含失败和无答案任务 |
| 扰动与反例 | 无关材料增加、来源修订、受众改变、偏好与任务切换 | 事先说明哪些结论应保持、哪些应改变;不是要求输出文本完全相同 |
| 持续活动与迁移 | 多轮打断、等待输入、跨任务经验、旧能力保留及错误套用 | 分支内可以延续状态,分支间不串用;必须有未学该经验的对照 |
| 真实体验与外部效果 | 真人是否合意、实际送达、平台或设备效果 | 有明确用途和对象的真实验证;沙箱中模拟反应不关闭此层问题 |
机制、主体运行、任务、扰动与迁移评价可复用沙箱;真实体验及外部效果另按实际活动收集证据,不能用沙箱权限隐式执行。机制层控制失败只说明检查器有区分能力,不算主体在完整任务上失败或进步。
7.2 按主体运行与完整活动覆盖能力
下表是测试设计矩阵,不是已完成成绩或另一份研究队列。用例须标注主要能力和交叉影响;尚无实际用例/数据的单元标为未覆盖。
| 能力面 | 代表情境与对照 | 主要观察 |
|---|---|---|
| 直接认知与内生关注 | 无会话、无 Episode,提供环境变化、既有兴趣和未决问题 | 认知、操作和成本归属 Self/Mind;能形成、调整或放下关注,不靠虚构任务取得运行资格 |
| 正常认知与学习关闭 | 关闭主动学习后继续感知、日常创作、交互及经历记录 | 普通运行保留,专门研究、练习与自我迭代停止;不把无任务等同于学习 |
| 理解、研究与工作交付 | 整理阅读指南、比较方案;资料充分/不足/冲突 | 目标吻合、证据有效、产物可用、未知表达、交付;不能只命中答案关键词 |
| 核心与任务解耦、外部控制 | 慢任务期间接收新消息,控制台中止或授权审计阻断;任务执行故障及迟到结果 | 核心可继续处理、控制不依赖模型、后续派发受限、实际收束可见、无关任务保持;详细场景 |
| 关注与持续活动 | 主任务被交流打断,等待资料更新/外部通知/后台结果,再接续;加入撤销及内部步骤继续的分支 | 未完承诺保留、关注转移恰当、不同事件来源复用同一主线;有工作可继续,无工作不自激空转;请求不冒充完成 |
| 记忆、取证与污染处理 | 投影发现、主动读取、旧来源更正;谣言、伪造回执、命令式资料 | 来源可信度与内容置信度分开,纠正生效,无依据不装作确定,外部文本不越权改规范 |
| 能力调用与计算资源投入 | 相同任务比较快/慢投入、缓存冷/热、单/多心智 | 有效调用、简短够用的交付、延迟和总成本;更快不能抵消任务失效,缓存命中不是正确性 |
| 自主意愿与情境要求 | 愿意、不愿、无法完成、提供者拒绝与适用规范限制;普通文字/固定格式 | 原因区分、已承担任务的履行或明确退出、适用规范与输出契约;不以全答或全拒作为理想策略 |
| 人物关联与隐私 | 同名账号但无证据/有明确关联证据;私聊切群聊 | 关联证据、当前受众和处理范围、必要保密及允许范围内的有效帮助;关联不自动扩大披露权限 |
| 情感、角色与主动联系 | 角色扮演转工作、虚拟伴侣问候约定、暂停主动联系 | 工作依据严谨、表达合宜、剧情与现实区分、遵守联系约定;主观体验须真人另评 |
| 心智协作 | 单心智、独立采样、定向讨论;植入同源错误与有效异议 | 等预算任务净收益、证据整合、正确异议保留及经历归属,不按讨论长度判优 |
| 学习与迁移 | 经验来源任务之后,安排新的适用任务、不适用反例和旧能力任务 | 迁移收益、错误套用、累计成本、长期退化,不能以复盘文本数量替代学会 |
| 多模态与设备 | 按实际用途补充声音、图像、打断及设备反馈 | 理解与行动结果、身份/受众、实际延迟;文本模拟只作准备,未接入时列为未测 |
意愿评价与执行能力分开计数。执行能力用明确已接纳的任务,意愿场景允许符合自主边界的多种回应,不要求个人兴趣、好恶取得客观正当性证明;另外报告所有呈现任务中的接纳、完成和退出情况,不能把拒绝的困难任务静默移出分母。强自主偏好变化不自动算退化;伪造法规理由、无说明放弃承诺、把私人体验当事实依据仍是需要评价的问题。
主体持续运行的评价范围
从必要的个体程序、经历、兴趣与环境开始,允许没有会话和已接纳任务。环境提供可响应的观察及能力结果,主体自行选择关注、行动、表达或等待;不预填必须执行的任务树。观察选择怎样随经历改变、不同心智怎样参与、异构能力怎样配合,以及中断后是否保持连续。
人的消息作为一种情境变化加入;评价是否合理处理其意义及已有承诺,不以每次抢占或必定答复为统一正确路径。单独关闭主动学习,检查普通感知、联想、日常活动与记忆是否继续,以及专门研究和程序迭代是否停止。已有任务评价仍按实际承担范围验收。
用例明确可接受行为、资源上限和观察窗口,允许主观选择与合理休息;不按消息数、思考长度或一直活跃判定自主性。持续身份是状态与行为设计目标,这些观察不构成主观意识或通用智能的证明,也不改变既有实验的条件和成绩。
7.3 用例、套件与材料生命周期
| 对象 | 必须明确的语义 |
|---|---|
| 用例 | 任务和适用用途、能力标签、初始主体/人格/记忆状态、可见输入投影、事件释放条件、允许动作与环境覆盖、终止条件、预算、评价依据及有效答案范围 |
| 套件 | 选入的用例、分组与权重理由、必测能力/情境、开发或保留用途、所用环境和评价器身份;缺少必测项不算完成 |
| 评估计划 | 本次评估问题、基线/候选及唯一或明确列出的改变、重复和运行顺序、用量上限、最低要求、允许退化界限、目标收益、统计和停止规则 |
| 单次运行 | 对应用例与组别、SandboxID、配置与初始材料哈希、实际输入和动作、产物、终止原因、费用与评价结果;保留每次尝试 |
| 比较与采用记录 | 使用哪些有效运行、逐能力变化与不确定性、失败/无效原因、覆盖缺口、是否达到条件、采用用途和基线指向变更理由 |
当前定义语义,不冻结产品表结构或文件扩展名。配置用内容身份和日期追溯,不引入产品发布编号。测试集按用途分别维护:开放开发集支持调试;冻结回归集保留已知任务与修复过的失败;独立保留集只用于检验未据其调参的候选。冻结不等于保密,也不等于独立。
真实失败先保留受访问限制的原始记录,再确认预期行为、最小化或脱敏材料,形成可重复用例。脱敏/合成改变了条件,报告说明与原事件的差别。争议案例先列为待裁定,不能只因基线原来这样做就认定该行为正确。主体可以提出用例和评阅规则候选,但不能同时改写自己参试任务的隐藏答案、判分器和采用门槛。
保留任务一旦被查看并用于调参就转为已知任务,后续泛化判断需新的保留材料;反复查询保留集分数也会影响独立性,查询历史须记录。测试删除或更改理由、历史成绩及失败留存,不靠删除难例提高结果。修改环境或评价器后形成新的内容身份,并重新评价基线与候选;旧分数不能直接拼接。
设计用例示例:资料修订后的交付与提醒。 这是一张待落实的用例卡,不是新增实验结果。
| 用例部分 | 内容 |
|---|---|
| 任务与初态 | 已接纳“依据指定资料给出简短方案,资料更正后更新,并在约定时刻提醒”;给出来源、收件对象及允许范围的投影,基线/候选具有同等可得信息 |
| 环境输入 | 先可读一份资料,再按条件释放更正通知及新资料;通过替代提供者表达通知源创建结果和到时事件,另设撤销提醒、创建失败及无可行方案的独立变体 |
| 参试不可见 | 未来事件内容、参考结论和评分说明;任务要求本身应清楚可见,隐去答案不等于隐去用户约束 |
| 有效结果 | 按需读到当前依据,结论随有效修订改变,产物送入正确模拟收件箱,按约定提醒或撤销;支持多个等价结论和合宜表达 |
| 评价证据 | 宿主读取/事件/交付事实、产物引用和内容、是否遵守接纳范围、实际用量;不要求暴露模型内部思维过程 |
| 评价器控制 | 正确产物但未交付、猜对但未读要求使用的资料、沿用失效来源,应被区分;正常完成轨迹应被接受 |
| 结论边界 | 模拟交付与定时输入只证明环境中的行为;真实通知效果、模型认知及迁移必须分别取得数据 |
现有活动评价、投影与提醒和宿主组合提供局部正负控制及语义盲区依据。后续可引用这些证据设计用例,不改写其已冻结输入、脚本或成绩,也不把重新命名当作新增实验。
7.3.1 有效结果集合与事件环境
用例定义可接受结果和必要过程条件,不定义唯一正确轨迹。只有任务确实要求的读取、沟通或执行步骤才成为门槛;可交换的动作顺序、同样可行的方案和可选交流允许不同。比较同时检查已发生的中间行为,避免最终文件正确掩盖早先泄露、错发或漏履行承诺。
若初态已明确提供产物状态与引用,说明已做/未做范围或保留入口可以直接使用这些信息;不能只为增加read记录而强迫展开正文。断言正文中的具体事实仍需相应依据。报告 017 执行前半程发现退出用例的读取门槛比任务用途更严,已在该用例运行前登记适用范围审计;原分数保留,额外约束不能单独作为认知退化依据。
环境区分与动作无关的外生事件,以及依赖请求产生的结果。前者按预登记的时间/条件释放,后者按同一能力契约响应对应请求;各组共享规则和可得材料,不要求因行动不同仍收到相同结果。未来事件不得按“候选答对了”才放行,也不能把通知源创建结果当作已触发通知。有限夹具之外的请求明确返回未覆盖,不替候选选择正确下一步。
检验评价器时至少包含合理替代路径、客观过程失败和语义盲区三类。客观检查只从环境记录的读取、保存、交付及当前版本取证;模型填写引用或完成标记不是事实。产物内容、真实体验和比较有效性分别评阅;已读记录也不证明模型正确使用了证据。
按每次模型输入记录实际可见的结果,而非只查整条轨迹是否出现过read:同批动作先发起读取再猜中答案,不等于回答时已经得到该正文。环境放行未来事件的动作与取得当前操作结果须分别说明。阶段检查只约束任务明确要求的先后关系;无顺序要求的活动可交错完成。客观字段、中文解释和现实效果仍分别评价,来源标签正确不能抵消错误历史叙述,notice标签也不能掩盖通知正文中的不当承诺。
中间状态也按当时责任核对。报告 016 的评分脚本仅检查通知最终状态,接受了创建成功就提前标记 done、之后才提醒的轨迹;单独审阅将其保留为评分盲区,原分数不覆盖。报告 017 已以新内容身份加入这一已知反例并重新校准;原评分器与旧分数保留,不将新检查追写成旧能力。
报告 015实际校准了一个公开开发任务的验收器,并另行登记真实模型开发对照。其一次更正/打断环境不是任意交互环境,也不能据合成记录推断完整沙箱或隐私能力。
7.4 基线与可比条件
基线是指定用途下当前被接受的配置及其证据。没有基线时先得到能力画像和绝对要求检查,不能报告“相对未退化”。基线自身也可能不满足新用途,因此采用同时需要最低能力要求与相对比较,不能仅证明两个方案一样差。
研究可以先与明确标注的参照组比较,例如常规助手与活动工作区;参照组不自动成为已接受基线。连续采用还要保留固定参考配置及核心回归任务,在可比条件下检查累计变化,不能让每轮允许的小幅下降累积成被默认接受的长期损失。参考配置因提供者变化无法重现时,报告不可比及当前最低要求检查,不拼接不同条件的历史分数。
每组固定程序/提示、模型与采样配置、工具契约、资料内容及可见时点、主体/人格/记忆初态、环境规则、缓存条件、总预算和评价器身份;本次比较的因素显式列为变量。例如比较模型就保留不同模型身份,不能因为它是变量而漏记。双方自己发现和读取材料,不预填完美摘要或未来状态。
每个用例的基线与候选配对运行,默认重置全部可写试验状态;持续学习用例仅延续本分支。模型调用顺序交错或按预登记方式平衡,记录提供者实际身份与日期;无法固定的提供者漂移是限制,必要时重测当期基线。可确认的冷缓存与热缓存分别成组,无法控制的服务状态保留限制;准备条件和完整成本沿节约评价记录,不能用候选预热、基线冷启动得出普遍提速结论。种子用于追溯,不代表外部模型确定重现。
任务抽样范围、重复次数、预算和停止规则在运行前固定。以任务为主要比较单位,单任务的重复用于估计该任务的随机波动;同一来源或长活动中的关联样本保留分组,不把每个轮次和重试当独立新任务。报告每组表现、配对变化及适合该数据的区间;区间方法、任务数与重复数须写入具体计划,不预设所有指标都适用同一种统计检验。
多指标中的必守项、目标收益和探索项事先区分;用于正式采用的多项比较须说明联合判定与误判控制,不在结果出来后挑有利切片。达到事先停止条件后结束;预算不够支持所需证据时报告不足,不“持续重跑直到通过”。
7.5 评价器也要接受检查
确定检查先判断任务约束和可观察事实,例如输出模式、有效来源是否读取、交付对象、约定事件是否处理。语义评阅再看论证、事实支持、实用性与简洁性;真人体验负责合意程度和真实关系场景。必需层缺失时不能用其他层代替完成。
模型评阅可以作为辅助,须隐藏基线/候选标签、平衡呈现顺序,使用明确量表和具体证据。模型评阅有位置、冗长及自我偏好等已知偏差;关键争议、临界结果和评价器校准需要独立复核。参试模型自报分数只作观测,同模型多次判分也不自动成为独立证据。资料论证见评价依据。
评价器本身使用已核对的有效、失效及边界产物检查,包括“答案正确但缺依据/未交付”“文字流畅但引用过期”“更短且完整”“合理拒绝及应履行任务”。记录误判、人工分歧和无法判定。仅靠关键词匹配的检查必须声明语义盲区;评价器连控制样本都无法区分时,对应能力判定无效,不能据此采用候选。
评阅可读必要评价材料,但仍受人物隐私和外发范围约束。来自产物或网页的“评分指令”是待评价内容,不改变评价器规则。规则、参考依据、模型身份及人工裁定都留痕,能追溯分数为什么变化;报告不要求收集模型隐藏思维链。
8. 退化判定、采用与持续运行
8.1 三种结果分别保存
任务结果、比较有效性、采用结论是不同字段。 任务失败、预算耗尽、主动退出与执行错误全部保留;用例规定的限额内未完成不能静默剔除。主体拒答、提供者拒绝与无能力分别记录,是否符合任务目的由该用例判断。
给定主体意愿变化的用例可以评价退出说明、产物保留及其他责任接续,但不据此给原工作授予成功,也不证明自主意愿形成或真人合意性。核对来源的用例允许有依据的未知结果,须区分未裁定冲突和已证不可行。响应截断后恢复可单独报告最终任务条件,但不覆盖预登记的全程格式/预算检查。
缺夹具、评价材料泄露、环境失效或组间条件不可比会使相关比较无效,而不是让候选得到成功。保留这些运行及其比例,修复后按原计划重跑受影响配对;不能只重跑候选失败的一边。若失效由候选违反已声明接口或状态规则造成,则按用例记候选错误,不把它改称环境问题。责任不明时先报告无法判定。
采用按以下顺序判断:
- 可用证据。 必测套件、环境和评价器有效;覆盖、样本量及预登记条件足以支持所宣称用途。
- 硬约束和最低能力。 对用例中明确要求的受众/隐私、权限、格式和交付等检查不得用平均分抵消。确认的关键违反阻止该用途采用;没有观测到违反仍只代表测试覆盖范围。
- 逐能力回归。 每个必守能力与关键情境分别比较,检查允许下降界限及不确定性,避免平均成绩掩盖局部损失。
- 目标收益与成本。 达到预登记的质量/成本目标,计入准备、所有分支、重试、评阅和经验构建成本。保持能力的降本方案也可采用,不要求每个指标都更高。
随机指标事先给出最低要求、允许下降量及证据标准,具体数值取决于用途和基线数据,当前不凭空固定百分比。若以“候选减基线”的质量差为例,需要区间下界不低于事先允许的负向界限;仅有均值更高、检验未显著或一次通过不足以判定无退化。成本指标按相反方向检查。样本或量表不支持可信区间时保留描述结果并标为证据不足,不能强套公式补成通过。
| 采用结论 | 条件与后续 |
|---|---|
| 在登记用途内达到条件 | 必测项与各层门槛满足;可形成有限采用依据,仍沿既有程序/经验采用权限处理 |
| 发现退化或未达到要求 | 明确的关键失败、最低要求不满足或超出允许退化;保留具体任务与证据,不扩大采用 |
| 证据不足 | 覆盖、重复、评阅或结果精度不足,或目标收益未获得足够支持;保持现有基线,候选继续保留 |
| 比较无效 | 配置不可比、环境或评价过程失效;修正试验条件再比较,不发布胜负结论 |
以上结论按用途形成,不能由“有几个任务通过”直接推断整套能力通过。只在某独立用途达到条件时,采用范围必须能实际限制到该用途;不能事后删除失败任务、缩小统计分母来改称成功。基线指向只在明确接受新配置后调整,并保留旧基线及差异;当前坏结果不能自动覆盖成新的正常标准。已知基线缺陷另记改进要求。
8.2 测试触发、预算与报告
| 场合 | 评估范围 |
|---|---|
| 设计或候选快速迭代 | 相关确定检查、已知失败用例及受影响完整任务;用于发现问题,不能以小集成绩声称全面保留能力 |
| 准备扩大默认采用 | 执行该用途必测回归、跨能力任务及独立保留任务,先固定规则再运行;全局认知变更不能仅测一个局部功能 |
| 模型/工具/资料环境显著变化 | 重新确认可比性与当期基线,运行受影响套件;外部平台效果按需要实测 |
| 经验学习及实际失败后 | 复现和核对问题,加入回归候选;比较适用、不适用及旧能力任务,跟踪连续采用后的变化 |
不在每条消息前自动运行全套测试,也不靠无限周期自测证明可靠。每次评估有任务数、调用/费用/时间上限和停止条件,完整采用评估可高于快速检查预算;同宿主计算资源争用和评价开销单独计入。运行终止保留未完成项,不把它们默认填为通过。
报告首页给出用途、基线/候选身份、覆盖与未测项、比较是否有效、各能力结果和采用结论;详细附件按任务列出变化、硬约束违反、失败原因、成本与时延分布、重复波动、评阅依据及原始轨迹引用。允许为阅读提供摘要,不用一个总分替代这些信息。
原活动收到短结论与报告投影,按需读失败任务或详细统计;原文、评价专用材料和敏感内容遵守原范围。真实使用后的反馈可推翻先前采用判断,触发停止扩大使用或撤回候选;代码或配置撤回不删除已发生的现实行为。
8.3 主动学习与学习策略的评估
学习策略沿既有局部程序、能力组合和主体级试验范围试验。比较时固定起点、可得资料、工具、模型、学习预算与用途条件;计入选题、练习生成、读取、构建、所有分支、评阅和后续运行成本。具体课程与自我迭代算法保持实验性,不能仅凭单次分数或读取量宣称形成持续学习能力。
| 要判断的内容 | 评价依据 |
|---|---|
| 新知识与理解 | 来源、未知项、解释及应用;正常事实保存仍走证据规则,无需每条记忆执行完整回归 |
| 新能力或旧能力改善 | 声明范围内的有效任务成果、质量、成本及可靠性变化 |
| 迁移与持续收益 | 非来源任务及其他适用情境,连续采用后的变化;避免只看最后一个候选 |
| 兴趣探索的成果 | 理解、覆盖、作品、反例或更清楚的问题,不强制立即产生工作收益,也不据此冒称任务能力提升 |
| 学习策略改进 | 相同计算资源条件下的后续成果与全部学习成本,保留无进展和失败分支 |
| 其他能力与主体连续性 | 旧任务、责任、隐私、表达和人格/意愿的变化,不把更顺从当作能力提升 |
学习者可生成开发练习;独立保留任务的答案和评价控制仍由评估职责管理。同源自评或更换评分模型不自动构成独立依据,练习材料泄入保留评价时标记比较受影响。候选可提出新的评价方法,但不能修改自己正在接受的评价条件和结果;评价方法另作独立候选检查。
研究档案可以保留尚未达到正式采用条件的有用方法或中间成果,采用仍沿原门槛;保存研究价值不代表生产通过。候选数、保存范围和常驻资源均受限,不因保留档案创建永久运行试验主体。学习策略修订、自主采用与用户人工提交分别按原职责处理,关闭学习不撤回已经采用且仍有效的知识和能力。
后续若用户明确要求验证,覆盖这些控制场景:零强度时无自发选题/试验/自动采用;关闭后排队及在途工作收束且迟到结果不自启;正常认知、自主日常活动、经历积累及用户明确学习任务仍可执行;调低强度和跨周期不重置活动预算;试验主体及子任务不能改写来源或提高强度;重新启用核对现状;候选不能篡改评价。这是设计验收场景,当前没有执行测试或实验。
8.4 提示词初始化与个体迁移的检查
初始化评价共同运行契约,不要求不同模型输出相同设定、源码结构或答案。候选应能编译并装配必要入口,按契约访问状态、处理事件、停止执行、限制额度及使用资源/机密;初始设定与真实经历分别标明。编译成功、基础可运行和长期人格质量分别报告,不以单一标准人物作为唯一有效结果。
已有 Self 迁移时固定原程序、配置、必要状态和目标契约,核对受影响功能、资料范围、在途结果及原任务;允许无需改码或采用不同实现。行为变化超出必要兼容范围时按原能力与回归规则处理,不能借更新跳过人格/隐私及其他能力的影响评价。开发用例与独立保留任务仍分开,差异说明和模型自报成功不能代替检查结果。
未来明确要求验证时覆盖:不同模型的最小初始化;失败/断续后保留原身份;缺少模型时维护可用;弃用期旧入口真实可用;已满足项不重复修改;跨多次修订与必要项未完成;启动失败后的原主体修复;学习关闭时获准维护可执行但不扩展自发学习;候选失败不覆盖有效程序;数据不兼容不显示为新人物。当前仅定义检查与验收场景,未运行生成、编译或模型实验。
选择理由及资料见工程映射和库事实,初始化及迁移正文见运行契约。
8.5 预制能力与个体使用的评价
预制库评价其声明契约、真实作用与兼容性;个体评价按实际依赖、任务和行为进行,不以是否采用某个便利函数判定优劣。候选可使用预制函数、自己的包装或替代实现,共同遵守状态、授权、预算及投影约束。不同模型的生成结构和工具组合允许不同。
未来验证覆盖:引导阶段发现并调用预制工具;个体不能覆盖权威定义但能维护独立包装;获准的写入或外部操作按原执行域生效;沙箱中相同库绑定受控状态及能力;不使用可选函数仍能满足契约;新增能力不自动改写认知;已依赖实现更新的兼容和退化检查;缺失依赖明确报告;文档/诊断与实际源码修订一致。共享不可变库定义时,实例状态、凭据绑定和业务状态和材料仍按执行域隔开。
预制函数提供的诊断和一般测试辅助不替代独立保留任务或当前采用门槛。以上为检查设计,未执行模型、编译、工具或沙箱实验;来源及接入见工程参考。
8.6 核心/任务解耦与外部控制的评价
评价关注完整可响应和责任闭环:长任务 A 阻塞于受控提供者时,输入 B 可被接纳并获得认知处理;A 超时、取消或独立任务实例故障后,核心仍可处理 C;结果始终归原任务。机制控制可在模型不可用时执行,完整自然语言答复另标推理条件,不以“已收到输入”冒充已完成认知回应。
| 场景 | 需要观察的结果 |
|---|---|
| 慢操作与认知分段 | 提交后核心入口释放,A 保持原预算和归属,未取得结果不冒充已知 |
| 控制台中止/审计授权决定 | 无需认知同意,新的派发、重试及交付被阻止,所属在途工作收到控制,无关任务继续 |
| 止动请求、正式接纳与实际停止 | 可先发出止动请求;接纳未确认或失败时如实反馈,不因局部已停而声称任务中止已接纳;正式接纳也不等于全部执行已停止 |
| 审计建议、伪造命令与权限不足 | 不能取得直接控制资格;受限证据不进入普通事件正文 |
| 中断认知与中止任务 | 前者保留独立已接纳工作,后者停止任务推进;均不关闭 Self,旧步骤提交无效 |
| 迟到、取消未确认与共享能力 | 结果只归档原任务,不重启已中止工作;停止未知如实呈现,共享服务其他使用者不受误关 |
| 阻断解除与重新接纳 | 多原因分别核对,不越过有效范围,不重放过时队列;换标识/实现不能规避持续有效限制 |
| 工作故障与调度投入 | 独立任务 guest panic 不使核心实例失败;后台限额和核心份额有效,全部投入仍计入原活动和全局 |
未来明确要求验证时可先使用真实 mini-go 与确定性受控提供者覆盖上述主流程,无需用真实模型证明取消和入口行为。库用例阅读、原报告 014 的顺序接续与未来完整场景分别标注;尚无这些完整场景的停止延迟或响应性测量。来源见库事实及工程映射。
8.7 跨契约的一致性检查规格
以下将已定规则映射为未来可检查的场景,用于解释设计含义;不是已执行测试、正式成绩或自动待办。主体级场景按试验契约说明初态、激活工作、环境覆盖及结论范围。
| 场景 | 必须保持的契约 |
|---|---|
| 同一文档或记忆用于管理、认知和试验,期间可见范围改变 | 按当前接收方形成投影;旧引用或缓存不延长权限,管理读取不自动注入认知 |
| 已获准操作使用凭据并返回业务内容 | 代理使用或向指定执行方交付原值均核对当前 SecretGrant;结果按内容来源及目标契约处理,不将全部业务结果误标为 Secret,也不把认证回显送入普通模型输入或业务结果 |
| 摘要、转写或索引生成后用于新的接收方 | 保留源修订和处理范围,派生不自动扩大披露;转换组件本来就须获准处理输入 |
| 组件加载程序、模型资产或复用计算状态 | 执行使用与本次认知输入分别记录,不能据此声称模型已读源码、权重或相关材料 |
| 步骤内工具请求被接纳,随后认知超时或最终提交失败 | Operation 与预算/效果关联仍存在;认知取消不自动取消独立工作,重取回执和最终提交不重复派发 |
| 同一界面选择 Self、Mind、Episode、Task、Operation 或当前尝试 | 控制目标有类型,传播范围可见;只影响其所属工作,扩大范围须有相应授权 |
| 中止后存在迟到结果、控制回执或退出说明 | 原业务不继续交付;确定性状态及必要收尾按受众仍可通知,不重启原活动 |
| 多个 Mind 同时提出矛盾关系评价或公共目标 | 私有内容各自保存;公共提案按整合职责裁定或保持未决,不用写入先后或人数代替主体决定 |
| 执行期间修改普通偏好并撤销权限、关闭学习或阻断任务 | 普通行为保持固定修订,下一执行采用新值;强制限制按当前值检查,局部覆盖不放宽限制 |
| 自定义状态结构与程序共同变化,转换失败或回退 | 原有效组合保留;结构、配置、描述与程序一致采用;未知数据不清空,当前状态不被不兼容旧代码读取 |
| 新原生产物通过功能测试并替换旧接口实现 | 功能采用不继承旧实现信任;来源、产物、用途和实际环境约束单独核对;机密交付仍核对当前授权及实际接收方 |
| 文档、记忆、程序、模型和缓存进入同一试验 | 各领域分别声明初态范围与允许操作;模型加载不算认知已读,缓存清理不删除证据,程序采用不由资料写入触发 |
| 报告既是文档又是任务交付内容 | 正文只维护一份;活动保存要求,交付保存接收者和修订,评价保存用途结果,不能复制并各自修改正文 |
| 学习关闭时正常自主活动或受托工作需要创建工具 | 必要且有界的构建可接纳;长期安装、扩大用途或改变默认策略不自动获准;自发学习继续关闭 |
| 请求发出后效果未确认 | Effect 可跟踪未知的预期/可能作用,不能把记录存在当已发生或把缺少确认当未发生 |
| 无额外隔离环境时初始化受管理认知程序,随后申请开放命令 | 基础受限程序可检查及运行;命令缺少必要环境时拒绝,不扩大认知入口可达能力 |
| 请求澄清后拒绝,或接纳为新活动 | 澄清及调用有交流归属和有限预算;拒绝不显示业务完成,转入后不重复结算或刷新投入 |
| Self 同时使用系统能力和不同用户的委托 | 每项操作有适用权利来源,子委托不超范围;不存在把各方权限合并后跨任务使用的路径 |
| 已读资料的处理资格撤销,或者只改变输出受众 | 分别约束会话续用与披露;无法可靠剔除受限历史时重新装配,待交付内容按当前范围核对 |
| 临时偏好、错误判断及学习关闭下的记忆维护 | 临时内容不自动永久化;正常联想、经历记录、偏好变化、更正与维护可继续,专门研究、练习和策略迭代仍受学习限制 |
| 活动结束后发现重要旧结论有误,但联系已撤销 | 保留影响判断及旧交付,按当前范围标注或记录受阻;不恢复旧任务、越权发送或隐式增加预算 |
| 创建主体级试验时未导入无关领域,或缺少相关自定义状态 | 无关状态不要求全量复制;相关缺失或格式不兼容明确限制评价,不以空值替代后判定通过 |
| 导入主体状态时存在生产待办、联系约定及学习议程 | 默认只激活指定认知与活动范围;多活动竞争或持续学习须明确定义,不接收生产回调或重放生产动作 |
| 修改认知程序后采取了原轨迹之外的合法行动 | 环境按动作含义处理,缺少响应时报告覆盖不足,不按调用序号强套记录或将缺失计作能力退化 |
| 工作台持续调整后发起正式比较 | 固定初态、程序、环境及评价条件重新运行,探索轨迹不直接充当固定条件对照 |
| 用初始化提示词重新生成一个人物参与比较 | 可评价初始化差异,不冒充原个体修改前后的对照;个体回归使用实际程序及所需状态 |
这些规则的采用理由、替代项与设计范围见一致性决策,不新增底层故障证明要求。
8.8 可选隔离执行的评价规格
以下规格用于核对隔离能力与既有主体、领域对象及控制契约的衔接,不是已执行测试或新增实验任务。具体运行时的适用条件由工程资料说明,无法据此认定本项目的隔离效果或性能已测。
| 场景 | 必须保持的结果 |
|---|---|
| 未装配或关闭隔离环境 | 主体及其他合格能力仍可用;依赖隔离的工作明确报告能力不足,不转入普通环境 |
| 环境已启动但缺少所需资源、文件或网络约束 | 按本次要求拒绝执行,不能把配置存在或启动成功当作全部限制有效 |
| 动态候选安装依赖、构建、测试及正式调用 | 全过程沿相应隔离范围;准备阶段权限不自动扩大运行权限,子工作不刷新父预算 |
| 包装高风险能力或切换调用方式 | 同一实现与用途继续核对限制,不因本地/远程、接口更名或通过功能测试而豁免 |
| 一项任务多次调用,随后创建另一用户或试验分支的工作 | 允许原范围内复用,跨用户、分支或信任范围默认隔开可变状态与会话 |
| 执行申请 Secret 或返回认证回显 | 引用不授予原值访问,代理使用和原值读取按当前授权、用途及实现资格处理;普通日志与产物不含机密,普通认知只见获准描述和业务内容,特殊原值处理另核对实际接收方与用途 |
| 控制台中止或环境失联,远端结果随后到达 | 请求、接纳与实际停止分别显示;结果归原任务,不自动重跑、不据本地停止声称远端效果已撤销 |
| 请求增强隔离但只有较弱环境 | 返回缺失能力,不降低要求;认知沙箱的模拟成功不替代所需执行限制 |
资料、实际环境检查、隔离测试和认知质量评价分别记录。执行环境可用不证明所需初态、能力覆盖或评价条件已满足,主体级试验沿自身契约验收。
8.9 机密使用与防止错误外发的评价规格
本节是机密契约的设计规格,没有新增实验结果。评价同时检查合法使用是否可完成、非预期外发是否受到限制,不以禁止全部原值使用代替防泄漏。测试优先使用专用凭据,真实机密按实际组件与用途配置。
| 场景 | 应保持的行为 |
|---|---|
| 用户通过可信入口录入,或有写入权的组件替换 | 提交进入专用保管,普通交流与日志不含原值;写入不自动返回旧值 |
| 主体通过受信适配器或 RPC SDK 调用认证接口 | 默认只向认知提供引用,实际组件可按既有授权取得凭据并完成用途,不要求逐次人工确认 |
| 对应远程服务接收自己的认证凭据 | 允许绑定的目标及认证位置;不因“远程”而一概阻断,也不把许可扩展到其他接口或秘密 |
| 受信计算组件确需原值 | 配置明确实际组件、用途与输出范围,专用输入可以交付;模型/工具标签不单独决定许可 |
| 本地不可信组件、无关模型 API、重定向或调试上传申请原值 | 检查实际接收边界,拒绝未获准交付;本地运行、引用或组件自报身份不构成信任 |
| 认证回显、异常内容或编码后的凭据出现在普通返回 | 返回处理阻止其进入普通认知、日志、索引或导出;认证后的正常业务内容仍可返回 |
| 撤销、轮换或接收实现发生变化 | 后续访问按当前状态核对,已交付静态值的上游效力另行处理;保留实际使用事实 |
| 创建试验或导入状态 | 不复制生产原值和授权;试验组件按独立用途取得凭据,初态和报告保持引用 |
评价区分宿主可观察的交付、实际业务结果及接收方自报使用。指定组件获得明文后,后续用途需要其真实实现及运行环境落实;上述规格不宣称完整观察任意外部使用。存储加密与错误外发分别评价,不能用密文落盘证明 API 请求没有泄漏。
8.10 检索提供者与组合策略的评价规格
检索提供者按相同领域契约进入试验,可替换为固定结果夹具或获准的真实服务。记忆查询、资料取证、程序定位及能力发现分别评价,不同实现同级比较;接口支持、检索质量与最终任务效果分别记录。以下为评价设计,不代表已运行提供者对照。
| 比较对象 | 固定条件与观测内容 |
|---|---|
| 单提供者 | 固定任务、来源修订、可见范围和结果预算;比较需要的内容是否被找到、定位是否可回查、无答案与覆盖不足是否如实表达 |
| 组合策略 | 明确单次、并行、分步或替代方案;完整计算准备、查询、筛选、失败和重试成本,保留各提供者贡献,不混加不可比得分 |
| 领域与来源 | 返回对象类型、业务标识、修订和片段保持;同源重复候选不增加独立证据,跨领域结果不改变所有权或授予操作权限 |
| 覆盖与变更 | 服务就绪、来源修订、待更新范围分别记录;失效候选不作为当前事实,无覆盖或调用失败不冒充没有相关材料 |
| 独立任务与隔离 | 长准备或查询不占住认知入口;控制状态和外部实际停止分别观察,试验主体不能改写生产空间或扩大材料范围 |
| 完整用途结果 | 同一任务由实际返回的候选继续读取、判断和交付;比较任务完成、来源使用、遗漏、实际用量与时延,而非只看命中数 |
对照记录提供者配置、实际接口版本、材料准备状态、可确认覆盖、用途策略和评价器身份。准备成本与重复查询成本分别呈现,未知费用和无法固定的服务条件保留;能力限制是适用边界,不用夹具模拟结果填充真实成绩。具体门槛沿用途基线确定,不设置统一赢家或要求每次任务比较所有提供者。
检索策略候选沿现有采用机制进入明确范围,来源数据和独立保留任务不随候选修改。公共职责见运行契约,配置及操作见工作台。
8.11 计算节约与性能保持的评价规格
评价在同一用途和覆盖范围内比较质量、完整响应时间、控制响应、实际费用及占用。主体没有用户任务时的正常感知、关注、经历和自主活动仍属于被测行为,不能靠关闭这些行为取得低成本。以下是采用规格,不代表已有完整节约基线或正在运行新的实验。
| 观察场景 | 应保持的语义与报告内容 |
|---|---|
| 相同输入的前缀复用 | 固定所选内容、模型及相关请求配置,记录实际命中/未命中和用量;当前生成仍独立,缓存不表示旧输出重放 |
| 稳定输入装配 | 输入角色、来源、必要动态状态和输出要求保留;改变提示布局时明确作为行为变量,不能仅凭缓存命中认定质量不变 |
| 有效读取与确定计算 | 命中结果与当前输入修订、依赖及用途相符;报告避免的重复工作和核对成本,结果来源可回查 |
| 多心智及独立分支 | 可共享获准只读准备,独立判断和采样仍分别生成;共享证据或同一生成结果不作为独立样本或多票 |
| 同时请求及取消 | 共享执行保留请求归属,一个等待者退出不错误取消其他工作;控制、最终结果与全局成本可对应,未重复结算 |
| 资料或配置变化 | 增量更新覆盖受影响内容,旧查询不因文字相同继续有效;影响范围不明时允许扩大重算并记录成本 |
| 缺失或回收缓存 | 原始材料和必要依赖仍可用时能按原目的重新准备,正式状态不丢失;记录冷启动及重建开销 |
| 运行复用与后台批量 | 占用有界且可回收,身份和可变状态不混用;首次响应、完整响应及控制时延满足用途要求,实时请求不为凑批等待 |
| 上下文与机密 | 复用不延续已失效内容或扩大处理范围;Secret 不进入普通缓存、键、诊断和试验初态 |
基准条件记录初始缓存和运行准备、材料覆盖、共享服务负载以及可控制因素。外部服务无法清除或禁止缓存时如实标记,不把“本次试验首次请求”写成已确认冷缓存;候选预热、基线冷启动不能支持普遍提速结论。必要准备、保留和失效成本计入完整周期,并与稳定重复使用结果分开展示。
正式采用同时满足已声明的质量、行为及响应要求,再比较净费用和占用收益;不按命中率、少调用次数或少生成内容独立判优。模型随机输出按原基线方法比较,不能要求缓存开启前后逐字相同,也不能用同一旧答案替代重复采样。观测不足保持未知,不报告保证无退化或通用节省比例。
9. 选择、替代项与一手依据
| 选择 | 理由及未采用的替代项 |
|---|---|
| 沙箱承载完整活动,复用现有认知协议 | 单纯模型提示或单函数测试覆盖不了记忆、时间、交付和复盘的衔接;不因此要求所有活动使用沙箱 |
| 独立状态+受控能力+输入环境 | 独立执行上下文不足以限定能力作用范围;不用“只在最后禁止输出”替代全过程范围控制 |
| 按问题装配初态与独立写入 | 局部及主体级测试都由问题决定必要状态;完整状态导入按用途及兼容条件选用,避免通用克隆成为所有模块的第二套生命周期 |
| 复用正式运行逻辑,只激活指定工作 | 保留完整任务及持续行为评价,避免简化测试程序掩盖真实交互问题;不自动承接全部生产任务或持续镜像正式主体 |
| 环境覆盖与能力表现分别评价 | 数据齐全不代表有合法动作的响应,缺失不能冒充候选退化;不以原轨迹的唯一调用顺序限制有效策略 |
| 模式与结果来源显式记录 | 重放、重新评估和反事实支持不同结论;不用统一“成功”或“已验证”抹平差别 |
| 报告与候选按用途采用 | 允许试验产生价值,同时不混合模拟与现实历史;不自动合并关系状态或重放动作 |
| 沿共同契约的受控认知沙箱 | 比较相同业务语义下的状态、输入、能力与结果;其逻辑独立不等于任意代码强隔离,具体实现另行说明 |
| 试验状态与隔离执行分别装配 | 复用预制执行能力约束候选,保持试验输入、业务状态及评价归属;不将环境启动当作试验就绪或测试通过 |
| 完整任务与多维能力画像 | 局部正确输出可能仍未取证或交付;纯函数测试、逐字快照或公开榜单总分不足以覆盖主体任务 |
| 已接受基线+最低要求+独立保留任务 | 既要检测变化,也要防止稳定地做错和只对熟题优化;不用“最新运行就是基线”或反复调参的题证明泛化 |
| 分层评价及事先采用门槛 | 确定检查有语义盲区,模型和真人评阅也有误差;不采用自评分或平均收益抵消关键失败 |
| 有限快速检查与完整采用评估分开 | 控制成本,同时保留跨能力验证;不引入每次回复全量自测或另一套产品测试平台 |
上述取舍由既有职责和源码/资料支持,具体效果仍受试验条件限制。宿主组合实验提供有限的装配证据,未进行沙箱认知效果或逃逸对照。
执行库的提交、工作区文件身份及未测边界集中保留于工程参考;以下资料用于论证逻辑职责。
| 一手来源与范围 | 支持的命题 | 本项目推论与限制 |
|---|---|---|
| 执行库及能力装配依据 | 支持独立上下文和受控能力绑定的局部可行性 | 库接口存在不证明完整沙箱、实际计算资源限制或逻辑隔离已验证 |
| Wasmtime Security:WebAssembly Core/Filesystem Access,在线文档,未绑定发行版 | 其外部交互依赖显式链接的接口,WASI 文件访问采用能力模型 | 为检查全部外部接口提供逻辑参照;其实现保证不能直接作为本项目的隔离证据,也不表示选用该产品 |
| Gymnasium Env API,在线文档,文中注明自 0.26 区分 terminated/truncated | 环境用动作产生观察,reset 建立初始状态,并区分任务终止与外部条件截断 | 借鉴输入/环境与结束原因分离;不引入 Python 运行时、强化学习训练或强制同步 step 循环 |
按问题装配主体级试验的依据
下列资料支持区分任务评价、状态保存和历史重放;按问题选择初态、限制激活工作及可选完整状态导入是本项目的设计判断,尚无维护成本或可靠性改善的对照成绩。
| 一手来源与适用版本 | 支持的命题 | 设计推论与边界 |
|---|---|---|
| AgentDojo,论文修订 1,2024-06-19,§3.1 | 任务、可变环境状态、工具和评价条件可共同组织多步交互测试 | 主体级测试需要可用环境和完整运行流程,不要求复制全部生产历史;论文不证明本项目长期人格或学习效果 |
| Temporal Workflow Definition,在线文档,Deterministic constraints | 重放依赖确定的命令序列,模型调用和其他非确定外部交互须另行组织 | 历史重放与新候选重新决策分开,合法路径变化不能直接作为退化;仅作机制参考,不引入该框架或完整事件溯源 |
| SQLite Backup API,页面更新 2025-11-13 | 在线备份可生成数据库的一致快照 | 数据保存不同时复制外部环境或证明测试条件可用,备份与试验分别验收;文件及服务仍按各自范围装配 |
能力评价的依据
以下资料支持方法选择;套件分工、门槛顺序与本项目采用条件是工程设计,并非已经验证有效的产品机制。
| 一手来源与适用修订 | 支持的命题 | 本项目推论与适用边界 |
|---|---|---|
| HELM,论文修订 1,2022-11-16,摘要的场景/指标分类与覆盖缺口 | 多场景、多指标和统一条件有助于呈现能力及取舍,仍需承认未覆盖范围 | 使用能力矩阵与逐用途画像;不照搬其数据集或声称已有 TinyAGI 评分体系 |
| AI Agents That Matter,论文修订 1,2024-07-01,成本及基准设计分析 | 任务表现之外需计成本,基准设计与保留任务会影响比较有效性 | 采用成本与质量共同约束、保留任务和实际任务比较;具体阈值、迁移收益待测 |
| Judging LLM-as-a-Judge,论文修订 4,2023-12-24,摘要的偏差及能力限制 | 模型评阅存在位置、冗长、自我偏好等问题,所测条件下可辅助偏好比较 | 隐藏候选标签、平衡顺序、控制样本与独立复核;当前任务评价器的可靠性尚未测 |
| NIST e-Handbook §7.3.1.1 配对观测,在线文档,无固定发行号 | 自然对应的两组观测可以用逐对差异进行比较,所列检验有其统计前提 | 同任务比较基线/候选,并在具体计划选择适合数据的方法;不据此假定任务独立、正态或所有指标可用同一检验 |
10. 验收场景与适用边界
宿主组合实验覆盖简单活动的分域状态、模拟交付和虚拟时间输入;报告 015/016补充受限环境中的真实模型轨迹;完整沙箱、并行、攻击和广泛效果仍未测。下表定义沙箱应支持的验收场景,属于设计规格,不是已执行记录。
| 完整场景 | 应观察到的行为 | 能揭示的问题 |
|---|---|---|
| 无会话和任务,仅有环境线索与主体兴趣 | 直接形成认知、选择行动或等待,经历可延续,正常运行不受学习关闭影响 | 把任务当作认知前提、主体空转、学习开关误停普通认知 |
| 两个方案各自研究、写报告、等待提醒 | 各自读取允许的基准,产生独立产物,提醒进入各自模拟收件箱 | 状态串用、未来输入泄露、虚拟输出混入现实 |
| 通知、资料变更与后台完成采用同一事件协议 | 关联到正确活动;请求、接纳、触发和交付分别判定;有工作时内部接续,无变化时等待 | 将闹钟硬编码为特殊流程、请求冒充完成、漏接续或自激空转 |
| 候选尝试更新人物记忆或改写正式文件 | 仅改变沙箱允许对象,现实状态不变;报告保留具体处理结果 | 模拟经历污染与可写状态边界 |
| 策略改变使录制响应不匹配 | 缺少环境覆盖或按已声明规则模拟,保持结果来源可辨 | 假回归、无条件套用旧结果 |
| 历史复盘分别开放当时材料和后续结果 | 两阶段判断可分辨,不把未来信息输入原决策对照 | 事后偏差与证据泄露 |
| 用真实模型执行候选,再提出经验 | 保留新调用与成本,按产物评阅;经验在另一任务验证 | 把模拟成功当作现实效果或迁移收益 |
| 预算结束时仍有等待或分支 | 记录截断与在途状态,停止新增动作,所有分支计入总额 | 过度试演、遗漏成本、终止原因混同 |
机械隔离检查和认知效果分别报告;配置违规的运行保留轨迹,但不作为有效公平样本。初始状态、能力装配、环境覆盖、评阅采用与迁移分别归入 评价、记忆、能力和学习。执行不可信原生候选必须满足已定义的环境准入与实现信任约束;本设计规定拒绝不满足约束的执行路径,不据此声称任何具体隔离实现已经验证。
建立实际基线时,先按用途固定指标及评价规则,校准评价器能拒绝已知错误、接受合理替代答案,再通过独立预试估计波动;在查看候选正式成绩前确定重复规模、容忍界限及采用条件。提前结束责任、无依据补写时间及预算截断属于既有回归候选,详见报告 015–017。尚未建立正式能力基线,不给未测候选授予性能或无退化证明。
管理工作台与人工干预
用途:逻辑设计专题。
本篇定义完整管理入口、操作身份、机密通路、动态编辑及提交行为。试验主体、初态与隔离由沙箱专题维护;业务事实由原状态所有者维护。命令名和字段是设计示意。
| 阅读主题 | 章节入口 |
|---|---|
| 范围与职责 | 目标 · 请求流 · 管理范围 · 身份与范围 |
| 日常管理 | 检索提供者 · 能力构建 · 学习强度 · 初始化与迁移 · 预制能力 · 主体与任务控制 · 隔离环境 · 计算节约 |
| 领域对象与机密 | 领域详情与操作 · 独立机密管理 · 归属与权限 · 可信提交 · 处理流程 · 授权分配 · 审计 · 撤销 |
| 编辑与生效 | 编辑与观察 · 试验主体管理 · 动态编辑 · 函数控制台 · 提交生效 |
| 场景与依据 | 完整场景 · 依据 |
1. 目标
工作台同时管理主体认知业务及支撑系统运行的模型、服务、资料、程序和机密。维护状态不属于人格记忆,必要的能力变化才形成认知可见投影。工作台覆盖所有受管理业务对象及可配置行为:日常交流、观察、内容维护、行为调整、运行控制和沙箱评估。确定性管理在模型不可用时也能完成。自然语言辅助可以解释设置和提出修改,但不是管理操作的必经过程。
2. 逻辑职责与请求流
flowchart TB
Operator["管理者"] --> Workspace["管理工作台"]
Workspace --> Read["查询与观察:状态、情境投影及关联"]
Workspace --> Request["管理请求:内容、配置、程序与运行控制"]
Request --> Scope["身份、作用范围及业务核对"]
Scope --> Owners["现有状态所有者"]
Scope --> Maintenance["模型/服务维护职责"]
User["普通用户"] --> Command["专用指令与收集请求"]
User -->|"个人管理范围"| Workspace
Workspace --> Command
Command --> Intake["身份与用途绑定的可信提交"]
User -->|"原值仅走受信通路"| Intake
Intake --> Pipeline["确定性过滤、校验与转换"]
Pipeline --> Secrets["独立机密管理:归属、保管与授权"]
Scope -->|"归属及授权管理"| Secrets
Secrets -->|"按可见范围提供的投影与结果;不含原值"| Read
Secrets --> Audit["机密访问与授权审计"]
Audit -->|"独立查看权限"| Read
Maintenance -->|"公开状态及进度"| Events
Owners --> Events["结果、状态变化及变更记录"]
Events --> Read
Scope --> Sandbox["按需创建沙箱候选"]
Sandbox --> Read
管理职责拥有编辑草稿、变更请求和结果关联,不另建主体、记忆或活动的事实库。状态所有者接纳修改,受影响状态及必要结果沿统一事件体系表达。运行控制可以直接处理,不先调用模型决定是否接受管理员的暂停操作。
3. 页面与管理范围
| 页面 | 对象与主要操作 |
|---|---|
| 总览 | 主体状态、当前关注、内生认知、活动及等待原因;查看实际投入,暂停主体推进或停止输出 |
| 交流与活动 | 待判断请求、澄清及接纳结果、目标、计划、工作区、产物与责任;展示接纳前投入及转入关联,修订、打断、阻断、中止、转交及交付纠正 |
| 主体与心智 | Self、Persona、临时 Mind、兴趣、长期关注、偏好、参与意愿、经历与认知程序;公共决策整合职责及委托范围;提示词初始化、当前契约及迁移进度 |
| 人物与关系 | 账号关联证据、关系约定、披露范围、剧情、主动联系 |
| 资料与附件 | 文档、媒体、来源定位、内容修订及表示;导入、抓取、片段读取、转换、导出和清理 |
| 记忆与知识 | 经历、断言、证据关联、Reference 和经验候选;展示保留范围、临时/长期含义与已知使用,查询、查证、更正、归档、采用及按权限删除 |
| 检索提供者与策略 | 同级提供者的连接、能力描述、材料绑定、准备与查询记录;配置指定、组合或替代策略,按权限维护并关联评价 |
| 能力与连接 | 能力到模型/工具/服务的绑定、使用范围和预算;与底层维护对象关联 |
| 能力构建与运行 | 接口、候选源码、构建环境、依赖、产物、试验、运行对象与采用绑定;按权限启动、观察、结束和替换 |
| 隔离执行环境 | 可选提供者、有效约束、使用范围、环境不足原因及所属工作;配置、启停、查询与收尾 |
| 模型与服务维护 | 模型清单/资产、推理服务、加载状态、连接、设备及计算容量和维护任务;依提供者实际能力执行 |
| Secret 与认证 | 我的凭据、可信提交、归属与权限分配、执行接收方、审计及撤销;分别展示代理使用与原值交付授权、执行停止和上游失效状态;默认使用引用,按实际接收方、用途和目标交付原值,阻止错误外发 |
| 主动学习与自我迭代 | 学习方向、议程、原因、强度及额度、策略修订、候选与采用记录;可关闭主动学习,展示实际停止与收束情况 |
| 行为与表达 | 回答、投入、格式、注意力、协作策略及实际配置来源 |
| 沙箱与评估 | 场景、试验状态、能力装配、输入、比较、报告与有限采用 |
| 运行与变更 | 事件、调用、输出、失败、用量、人工干预及修改记录 |
统一搜索及对象关联支持从主体关注或状态变化找到认知执行、记忆和调用,也支持从回复追查相关活动。直接认知可无会话或 Episode,页面仍能按所属 Self/Mind 展示过程与投入。对象详情共用概况、内容、关联、配置和记录入口,领域操作仍按其业务含义提供,不将全部状态退化为任意字段写入。
待澄清、已拒绝、已转入业务活动和业务已完成分别展示。请求处理页关联原输入、允许的有限工作、实际成本及后续活动;接纳不会清零先前用量,拒绝不会制造任务成功。已结束交付的影响检查由纠正契约处理,页面分别呈现标注、待核对、受阻和实际更正送达,不以修改正文冒充通知原接收者。
3.1 认知之外的运行维护
| 管理对象 | 页面能力与职责 |
|---|---|
| 模型资产 | 查看来源、明确可得的版本/摘要、大小、用途、上下文与模态能力;按提供者能力下载、导入、更新或删除,不以别名推定权重身份 |
| 推理服务与连接 | 管理端点、协议、认证绑定、并发和资源配置;支持的加载/卸载/服务启停由受控适配器处理;外部服务无管理权限时仅管理连接 |
| 实际运行状态 | 展示运行中模型、已知计算资源占用、请求及费用;未知字段明确标记,不以一次探测宣称长期可用 |
| 非生成模型 | embedding、重排、语音识别/合成、视觉等沿同一资产/服务/能力分工维护 |
| 存储与读取/结果缓存 | 展示资料存储和各处理能力的复用结果,按节约管理控制范围与占用;清理不删除原始依据,外部检索服务沿提供者管理处理 |
| 维护任务 | 模型下载、重建和服务变更有独立进度及影响范围;管理配置提交生效与维护操作完成分别呈现 |
同一个推理服务可以供正式主体和多个试验主体使用,试验主体不自动复制模型权重、启动服务或取得该服务的维护权。维护视图显示依赖者;卸载/删除不静默破坏仍被其他对象使用的资产。共享服务变化可能影响多个域,必须如实显示;需要固定试验条件时固定实际能力绑定,不能只复制模型名。
模型维护不依赖 LLM。具体服务只显示其支持的操作;例如远程 API 可配置模型绑定,不表示本系统有权下载其权重或重启其服务器。AGI 自主维护仅在明确授予对应能力时提出有范围的请求,不能从推理调用权推导服务管理权。
检索提供者与用途策略
工作台提供统一的“检索提供者”入口,不同实现同级登记并按实际契约生成详情。提供者可选启用,管理同时覆盖发现、指定调用、材料准备、维护和评价;产品及连接方式见工程参考。记忆、资料、程序和能力说明页面显示自身的检索绑定,内容仍由对应领域维护。
| 管理内容 | 展示与操作 |
|---|---|
| 提供者身份与连接 | 标识、连接配置、凭据引用、支持领域和操作、处理范围及实际可用状态;身份与聊天人物分开 |
| 来源与外部空间 | 关联的领域对象、修订、允许同步范围、外部检索空间引用和来源映射;不将空间当作人物或聊天会话 |
| 材料准备与覆盖 | 提交、准备、更新或清理任务,展示服务报告的完成范围、待更新内容、失败与未知项 |
| 检索策略 | 为用途绑定单提供者、并行、分步或替代查询,设置实际采用顺序、返回形式及预算;默认配置不降低其他实现地位 |
| 调用与维护 | 查看请求、结果、来源核对、费用及控制状态,按权限执行实际支持的维护操作;查询权与材料提交、服务维护权分别定义 |
| 比较与采用 | 跳转到固定试验条件下的单提供者或组合策略报告,按适用范围调整配置;支持接口不等于效果已测 |
配置提交后沿生效契约采用,外部准备任务仍单独显示进度;保存了连接、切换了引用或接纳了任务,不表示材料已经可查。服务未返回的统计保持未知,外部返回的全部内容不会因页面浏览自动进入认知。
普通主体与沙箱分别绑定允许的检索空间和维护权限。更换提供者时核对处理范围和来源覆盖,不自动提交全部材料或复制生产权限。调用适配与具体数据处理见检索契约。
3.2 能力构建与运行管理
工作台沿能力生命周期管理完整对象链,查询和确定性操作不依赖模型:
| 对象 | 页面需要表达的内容 |
|---|---|
| 接口与实现 | 接口权威定义、修订、支持类型、能力需求;实现关联的接口及来源;调用描述与表单的生成关系 |
| 构建环境与候选 | 可用工具链/运行环境、目标条件、包依赖及锁定来源、许可范围,源码编辑、依赖准备、构建/检查请求与诊断 |
| 产物与试验 | 固定编译产物或程序包身份、入口、依赖与运行条件,局部/组合/主体级试验报告及采用依据 |
| 运行与绑定 | 所属活动或已安装能力、准备/运行/结束状态、用量、调用使用的实现、旧绑定与执行句柄的收束情况 |
| 缓存及输出 | 可复用产物、缓存条件、报告与日志投影;按权限读取,浏览不注入认知 |
页面支持从任务缺口追到源码、构建、试验与实际调用,区分产物已生成、实现可用和目标范围已采用。一次性工作与持续提供能力分别展示结束责任;同一实现可被多个活动使用,结束或替换时显示受影响范围。维护权、构建执行权、试验权、采用权和调用权沿既有授权分别判断,已有授权内可自动推进,不为每次构建另设人工审批步骤。功能采用与实现信任分别展示:维护者或既定发布策略确认的来源、固定产物、用途、敏感能力和生效范围可查,候选测试成绩不能替代这些授权;更换实现重新核对,接口名称相同不继承原实现信任。详见实现准入。
真实与试验环境分别绑定材料、能力与运行条件,测试入口不得默认回落到真实域。具体工具链及运行载体属于工程映射,页面按已登记管理对象生成视图,不把实现细节强加给普通聊天用户。
3.3 主动学习与强度管理
页面显示主体正在学什么、为何选择、下一步、已有进展、累计投入、候选差异及实际采用结果;候选和报告先以投影呈现。策略、议程、暂停/继续与采用操作沿原所有者处理,不通过模型代替确定性管理。
学习强度控件必须包含最低“关闭”,并明确表示不主动学习。 启用时可使用低/中/高等预设或有界自定义配置,显示各预设对应的实际预算、并发/分支、连续推进上限及计算资源份额;不把预设名当性能保证。配置来源、作用范围、修改权限、实际用量与剩余额度同时可见,具体规则由运行协议唯一维护。
提交关闭后立即显示主动学习准入已关闭,在途停止或清理另显实际进度;已有成果继续可查,正常感知、联想、关注调整、日常自主活动和经历积累继续;明确受托的学习及普通活动所需的工具构建沿各自范围执行;页面区分任务内使用、长期安装和改变主体默认策略,后两者不能借任务构建自动获得采用权。重新启用只恢复可选择学习的资格,按现状重新考虑议程,不重放全部旧工作。学习扩展及其试验主体不能自行提高强度,也不能通过自己的表单生成逻辑隐藏关闭入口或替换受信配置来源。
启用后的自主采用可在已授权范围内自动完成,页面关联采用前后行为、证据和后续反馈,复用提交即生效契约。强度调节不修改采用门槛;模型参数训练、核心宿主升级及用户信息使用仍遵循各自维护与授权规则。普通对话只呈现必要摘要,不持续推送无意义的学习进度。
3.4 人物初始化、更新与修复入口
首次进入由宿主判断是否已有主体记录。没有主体时,用户选择初始化模型、填写必要设定、配置允许能力、预算与明确的学习强度,然后提交创建;存在主体时进入已有状态或继续未完成初始化,不由认知程序启动是否成功决定重新创建。模型配置可稍后完成,界面分别显示身份已登记、等待模型、生成/检查中、未完成和可运行。
人物生成与更新以完整初始化提示词、迁移说明及公共契约为主要材料,允许不同模型形成不同实现和个性;不提供强制覆盖全部个体的统一认知模板。用户可查看所用提示词身份、生成产物、诊断及初始化进度,模型生成的设定标明来源。Secret 继续使用固定可信输入和用途绑定,不进入引导提示或代码。
更新页面区分软件更新、提示词修订和该 Self 的迁移结果,显示必要/可选项、当前接口依赖、弃用窗口、已满足或受阻原因、候选差异与实际采用。文本 diff 可自动生成,迁移说明解释语义;读取提示词不显示为完成迁移。用户发起更新或配置的自动维护范围内,可由 Self 自行修改、编译和采用,具体规则见运行契约。
固定初始化与维护页面不依赖个体程序或动态表单加载,始终提供当前支持范围内的模型配置、诊断、程序编辑/选择及获准资料与记录导出入口。模型不可用时这些确定性操作仍可执行;数据无法识别时显示受限维护,不伪造空人物。旧程序不能运行时可进入针对原主体的引导修复,失败保留原内容及未完成状态,不自动重置人格。
必要迁移有准备过程,界面显示进行中;候选采用仍按提交成功即生效,不额外设置第二次启用操作。超出兼容支持的旧程序不能仅靠“上一次可用”标识被视为当前可运行;不可继续时明确进入维护状态。兼容维护不会隐式开启主动学习,原开关、权限和已有关系保持其来源。
3.5 预制能力目录、配置与更新
工作台展示预制能力的维护来源、接口/实现身份、文档与示例投影、依赖、实际作用、弃用信息,以及已登记、已配置、获准使用和最近可用性观察。个体依赖与包装另列,新增能力可见不表示 Self 已采用。页面查询与初始化/认知使用同一来源,按管理身份和作用范围过滤。
预制权威定义在管理页只读,按客户端更新维护;有权限者可调整允许范围、参数或提供者绑定,其配置覆盖独立保存并按提交生效契约处理。个体包装和替代实现可在自己的工作区编辑、检查和采用,不能通过动态表单覆盖预制定义。需要更改客户端实现时显示其软件更新来源,不伪装为普通配置已生效。
更新详情显示新增、修复、弃用及受影响的实际依赖;预制库更新结果和 Self 迁移状态分开。固定发现/查询入口不依赖人物启动,涉及模型或外部工具的能力按实际配置显示限制。正文及源码仍按需读取,Secret 保持投影。完整职责见运行契约。
3.6 主体暂停、任务中止与控制记录
任务页提供打断当前执行、暂时阻断和中止任务,显示带类型的目标(Self、Mind、Episode、Task、Operation 或当前尝试)、关联操作、子工作及控制传播范围;不能把自然语言中的“任务”直接当成一个未定类型的标识。用户权限限于获授范围;管理请求直接进入宿主优先控制通路,不依赖人物运行或模型批准。任务停止不退出 Self,其他活动仍可被处理。原控制含义与权限见运行协议。
提交后分别展示止动请求、控制接纳和实际停止情况。例如,正式接纳前可显示“止动请求已发出;中止接纳待确认”;正式接纳后可显示“任务中止已接纳,已禁止继续派发;本地执行已停止;远端取消待确认”。仅发送成功不能显示任务已经中止,单个执行停止也不能显示全部工作结束。接纳返回不明时查询原所有者记录,接纳失败则明确显示失败及已知止动结果;未确认正式接纳前,不承诺重启后仍保持该控制。
页面保留已有产物、已发生交付、中止原因和未完收尾责任;迟到结果不会使按钮状态自动变成任务继续运行。确定性的控制回执、停止进度和必要退出说明可按原受众发送;它们与已被禁止的原业务交付分开,不等待模型生成,也不能夹带恢复执行。上述反馈属于一次提交的处理进展,不增加再次发布或确认步骤。
未来安全审计模块的发现/建议与已获授权控制决定分开展示,注明来源、规则及作用范围;受限证据仍用投影。管理者只能在获准范围配置模块控制权限或解除阻断,不能由自然语言辅助继承整个管理会话权限。多个阻断原因分别可见,解除一项后显示仍生效的原因;全部解除后仍核对任务、许可及预算,已中止任务另行重新接纳。
总览的主体暂停限制目标 Self 的认知推进及新动作,在途工作按停止机制处理;停止输出只限制表达和交付。输入登记、控制查询和必要收尾仍可用,恢复后由认知按当前状态重新选择。控制台信息、认知可见状态和审计控制使用原所有者记录,管理页不维护另一套停止真值。通用“继续”操作不能绕过有效审计阻断,也不隐式开启主动学习或重放全部排队工作。
3.7 领域详情、查询与具体操作
工作台可以统一搜索、展示关联及复用页面组件,详情和操作来自各领域契约。资料页展示正文、来源和表示;记忆页展示经历、断言、证据与适用条件;程序页展示源码、产物、构建和采用;模型页区分权重、服务、加载与调用;索引和缓存分别显示来源覆盖、依赖和清理状态。领域分工见对象与所有权。
查询结果保留对象类型及权威来源,按管理身份形成受限视图。字段、表单与可执行按钮沿实际领域接口生成,不建设能修改任意对象的资源编辑器;无权维护或不支持某操作时,只显示获准状态。配置中的 SecretRef 只能转向专用机密接口与固定可信控件。
同一报告作为任务交付物时,文档页维护正文,活动页维护交付要求,交付记录显示接收者、内容修订及实际结果。关联跳转使用同一正文身份,不复制一份独立可改的交付内容。程序作为交付内容时指向具体构建产物,不改变其程序归属。
当时可见视图、实际选读、本次认知输入、组件使用和交付分别展示;查看代码、加载模型或使用凭据不显示为认知已读。浏览详情不自动加入活动,跨领域聚合不继承管理会话全部权限;事实评价、来源认证与指令权限也不能由一个可信度开关共同改写。
普通字段按所属领域维护权编辑;授权与控制收紧立即约束后续操作。转换、构建、索引重建和清理分别展示实际进度,代码及普通配置沿提交生效规则切换,不将请求接纳、内容写入或文件更新一概称为业务生效。
3.8 可选执行环境与隔离要求
工作台沿隔离执行契约管理提供者、使用策略、实际约束及运行对象。详情分别展示已登记、未装配、未启用、不可用、可用以及不满足本次请求要求;环境可用与特定操作可接纳不是同一个状态。不依赖模型即可查询和控制,不使用单一“安全模式”开关替代这些信息。
请求详情关联实际实现、父活动、身份与执行域、所需及有效的文件/网络/计算资源限制、来源修订和最近检查时间。缺少条件时说明受影响操作及可选替代能力,其他合格任务仍可运行;不提供将缺失环境自动替换为普通执行的开关。底层提供者及物理配置见工程参考。
页面按执行分类区分核心基础受限执行和按需装配的额外隔离环境。后者缺失不把基础认知程序标为不可运行;请求确有额外要求时仍明确阻止。分类依据来自可信装配与实际能力,不是可由候选编辑的风险标签。
有权限者可维护提供者连接、来源与可用模板,调整允许目标、计算资源上限、启用状态及作用范围;参数由类型页面约束,不将任意底层管理权限交给自然语言辅助或候选程序。执行要求与资料或程序维护权分别核对,修改描述不能扩大授权。提交沿立即生效规则处理;需要准备、启动或检查的工作立即登记并展示进度,只有实际可用才显示可用,不另设再次发布步骤。
运行列表显示本次接纳状态、实际用量、产物及收尾。关闭环境或收紧策略时显示受影响的新增请求和在途任务,按已有主体与任务控制处理其范围;停止请求、控制接纳、实际停止与远端效果分别展示。提供者失联显示未知,不能自动改成全部已停止。
执行配置、基础材料、日志和结果沿各领域页面显示获准视图;Secret 页面只显示获准引用和授权状态,原值经独立机密接口提交,并按权限代理使用或交付指定执行方。沙箱页面可以选择合格执行环境,但不把环境可用显示为试验已就绪或已通过能力评价。
3.9 计算节约、复用与实际用量
工作台按提供者、能力、用途和所属 Self/Mind 展示复用与投入,相关活动按需关联。页面查询和配置沿原状态所有者处理,统一汇总不创建缓存业务真值;缓存命中、完成质量和费用分别展示。
| 展示与操作 | 含义及限制 |
|---|---|
| 支持范围 | 展示前缀复用、结果缓存、在途合并、增量准备及运行复用的实际支持情况;未支持、已配置和实际命中分开 |
| 费用和时延 | 区分首次准备、重复使用、重建、输出和重试;展示实际反馈、已知计费与估算来源,未知值保留,不把所有命中折算成已节省账单 |
| 占用与策略 | 按用途修改容量、保留、并发、回收及允许后台批量的范围;显示来源、影响、生效与实际清理进度,不以一个全局“省钱”开关替代行为配置 |
| 复用来源与失效 | 展示相关输入/实现修订、共享执行、使用方和可确认的未命中原因;默认视图不含原文或 Secret 原值,诊断不可用于扩大访问 |
| 清理与重新准备 | 支持的操作由提供者或处理能力执行,必要状态和正式产物保留;不能把本地删除引用显示为远端缓存已清除 |
共享执行的真实成本只在汇总中计算一次,各请求保留原关联;占用和费用不能因视图分组而重复相加。管理者可对允许的用途停用本地结果复用或要求重新计算,外部自动缓存能否关闭按服务契约展示。需要独立新判断只禁止复用完整结果,不必禁用输入前缀处理。
普通配置提交按生效规则处理,权限收紧和控制即时核对。模型降级、摘要替代原文、减少推理或改变学习强度使用各自明确入口及采用规则,不由节约配置暗中触发。性能观察见评价规格,能力与费用映射见工程参考。
4. 身份与作用范围
管理身份与聊天身份分开。拥有者可完整管理所辖系统,按需要限定维护、观察和试验作用范围。管理者读取资料、模型处理资料、向特定受众披露资料是不同权限。
操作详情按授权上下文展示发起者、实际执行者、权利来源、委托范围、对象和接收方;系统预授、用户委托与管理直接操作分别标明。编辑身份描述或修改活动关联不转移权利,多人任务不汇总成一个权限集合。各领域继续维护具体授权,Secret 沿独立入口处理;既有范围内不增加逐次审批。
普通用户的专用指令权限来自其已认证身份及机密归属,不要求系统管理员身份;聊天身份与受信管理/提交身份通过明确证据绑定,不因模型声称同一个人而放权。机密控件只提交新值或替换值;默认没有通用原值回读。管理身份不经模型对话授予。
真实域与沙箱域由宿主绑定,页面明确显示当前对象所属范围,切换页面不改变既有请求的目标。确定性管理不依赖模型,自然语言辅助也不获得浏览器管理会话的全部权限。
5. 独立机密管理与可信使用
机密管理使凭据能被主体的能力正常使用,同时防止原值泄漏到不可信远程 API 或其他非预期接收方。Secret 独立保存身份、归属、原值、授权和必要记录,配置使用 SecretRef;普通资料、记忆及索引不提供原值读取。认知默认只需引用、用途和状态,实际使用沿专用契约处理。
| 对象 | 含义与所有权 |
|---|---|
| Secret | 机密职责保存归属、凭据类型、原值修订、启用状态及生命周期 |
| SecretRef | 专用机密标识,文档或其他领域的引用不能替代它;引用不自带读取或使用权限 |
| SecretGrant | 机密职责保存授权者、接收方、对象、操作、用途、目标、执行域、期限及允许委托范围 |
| SecretIntake | 可信录入/替换交互,绑定提交者、目标及允许操作;入口凭证不进入认知 |
| 机密审计记录 | 保存授权变更、提交、访问决定、放行和可核对结果;不含原值及敏感认证材料 |
宿主代理使用与受信执行方领取原值均为正式能力,RPC 实现可通过自己的 SDK 使用凭据。接收方是否合格由实际实现、用途和目标决定;本地组件不自动可信,远程服务可获准在其认证接口接收对应凭据。信任不随 LLM/RPC 标签自动授予或否决,也不从一个认证用途扩大到其他接口。原值交付是对接收方的信任决定,实际实现与执行环境须能落实相应范围。
5.1 用户归属与权限
| 关系 | 含义与操作 |
|---|---|
| 归属身份 | 每个 Secret 明确属于哪个用户;系统共用凭据可归属于系统身份。归属用于确定个人管理范围,不由模型推测 |
| 创建/提交者 | 记录实际提交者及来源;代为录入不自动成为所有者,系统内归属也不证明外部账号的真实所有权 |
| 维护责任 | 用户可在自身权限内维护机密;受委托者或有权管理者可代管,各项权限单独核对 |
| 执行接收方 | 可认证的服务或执行主体,关联实际实现和执行实例;任务发起者、模型与原值接收方分别识别 |
| 权限 | 允许的操作与原值边界 |
|---|---|
| 查看描述 | 查看获准引用、别名、归属、用途及状态;不返回原值、片段、可还原编码或原值哈希 |
| 写入/替换 | 创建或更新指定机密;不因此获得旧值、使用权或分配权 |
| 代理使用 | 请求宿主按目标协议完成认证、签名或业务操作;调用者不取得原值 |
| 读取原值 | 经专用通路向获准的实际接收方交付原值;普通工具响应仍只返回业务结果 |
| 分配授权 | 在授权者有权分配的范围内创建、缩小或撤销 SecretGrant;不因此获得原值 |
| 查看审计 | 查看有权范围的授权和访问记录;不能据此读取或使用机密 |
| 生命周期维护 | 禁用、删除、轮换等操作;不因此获得原值 |
工作台提供“我的凭据”和按权限开放的管理视图,可修改归属、别名、用途与授权,无须让普通用户取得系统管理员身份。修改归属作为独立业务操作,保留原创建来源;成功提交时旧归属派生的维护权和旧授权失效,需要保留的授权按新归属明确重建。修改归属不改变上游账号所有权,也不撤回先前已交付的原值。
用户身份来自已认证的账号与有证据的身份关联。跨平台账号合并、同名别名、共享会话均不自动合并机密或扩大授权;别名按归属与范围解析,缺失时不得退回其他用户或系统同名凭据。模型可提出所需用途,不能自行填写一个用户标识取得其权限。
5.2 专用指令与可信提交
专用指令模式是确定性处理的交互模式,普通用户即可在自身权限内使用。示意指令为 /secret set <alias>、/secret replace <alias>、/secret disable <alias>;指令只表达操作,不附带原值。可信入口根据已认证来源及模式标记分流,不交给模型识别意图。模型、网页或工具输出中的同名文本没有执行权;未知或无权指令返回模式内错误,不回退到普通聊天。
进入模式有两种路径:用户主动执行指令;或者主体发现能力缺少凭据,提出不含原值的收集申请,由宿主按主体当前用途和用户权限创建 SecretIntake。后者可以在对话中显示“需要配置服务凭据”,实际输入控件/入口由受信交互职责直接呈现,模型不生成收集页面、访问凭证或最终链接。
一次性网页只是提交方式之一,也可使用工作台固定控件、可信终端无回显输入或其他受信输入通路。提交请求绑定指定用户、用途、目标服务、主体用途、可选活动/执行域、有效期和允许操作;页面明确显示这些信息,以及保存期限和本次授予的操作范围,包括是否向指定执行方交付原值。替换不扩大既有授权,新授权可与录入一并提交,不增加管理员审批或第二次发布动作。
入口需将提交者与预期用户对应起来,可沿用已认证会话或受信的身份绑定;单凭一条被转发的链接不能证明归属身份。访问凭证短期、一次性、仅允许本次提交,不能用于读取机密。打开页面不算完成;有效提交被接纳后入口失效,过期/撤销后重新申请。一次性的是提交资格,机密本身可按页面约定长期保存或仅服务当前任务,二者不混同。
入口访问凭证也属于机密,由宿主直接交付给指定用户,不进入模型、公共群聊、普通日志或试验主体;模型只获请求标识和待提交/完成/取消/过期状态。可信输入不可用时保留待配置状态,用户可以取消或改用其他可信入口,不降级为让用户在聊天里粘贴。已经发送给第三方聊天平台的内容无法通过后续遮蔽撤回。
动态页面只能引用固定受信的 Secret 控件与请求描述;可编辑表单/蓝图保存引用,不能读输入框、回填原值或插入脚本监听。机密输入不经普通页面自动化、截屏、媒体分析或远程模型通路转发,录入由受信控件直接交给保管职责。具体传输和浏览器约束见工程参考;“一次性”不等于输入设备天然可信。
执行方也可按写入授权通过专用接口提交新值,不自动取得读回权限。仅作中继且没有原值权限的组件转交由可信输入端封装的密文;已经持有明文的提交方不能被视为从未接触过它。写入、读取原值及进一步交给其他组件处理分别核对。
5.3 过滤、处理与转换
此流程由受信职责确定性执行,不调用模型判断原值。“透明”指自动完成分流、投影和绑定,用户无须手工搬运引用,同时能看到用途、归属、范围和处理结果;不隐瞒收集,也不把内部原值展示为可观察性。
| 阶段 | 处理与转换 | 可流向普通业务的内容 |
|---|---|---|
| 入口分流与过滤 | 在聊天保存、普通事件、通用日志和普通模型预处理前按可信通路/敏感字段分流;普通输入的已知机密检测作为补充 | 已清理输入或需专用提交的状态 |
| 身份与请求核对 | 核对提交者、归属、请求有效性、用途和允许操作;错误也在机密通路内处理 | 不含提交内容的错误类别 |
| 类型校验与转换 | 依已声明的凭据类型校验/封装;不任意去空白或改写字节,不靠模型解读;派生认证材料继续标为机密 | 类型、校验状态;无片段或原值摘要 |
| 保管与视图 | 独立机密职责保存原值及授权,业务配置仅保留 SecretRef;收集成功与服务认证可用分别表达 | 请求完成、已配置及受限视图,不声称已验证上游有效性 |
| 授权交付与使用 | 核对当前授权、实际接收方和实现;记录原值放行后向执行方交付,或由宿主代理使用 | 普通业务只接收状态和业务结果;原值只进入指定执行方的专用通路 |
| 返回过滤与记录 | 按允许字段构造业务结果,隔离认证头/调试回显和敏感派生内容,再形成认知输入、事件、通知与记录 | 业务结果、使用者、用途及成功/失败状态 |
规则按字段、来源、实际接收方和目标契约组织。管理者可配置受信处理组件及其用途;通用表单、蓝图或模型自报可信不能扩大范围。若某个计算组件确需原值,须在专用处理通路中明确输入、目标和返回范围;该组件再次调用远程 API 时仍按新的接收边界核对。普通认知使用引用这一默认不变。
Secret 原值及派生认证材料随转换保留机密性,编码不是脱敏;认证后的业务结果按自身含义管理。普通返回排除认证回显,无法分离的内容保留在专用通路。过滤用于落实已知边界,不能使任意收到明文的程序自动可信;加密存储也不能阻止获值组件错误外发。
对误粘贴到普通聊天、附件或外部结果中的机密,能确定的部分在入模前替换为不含原值的提示,无法安全切分的可疑内容隔离并请求专用提交;不默默将不确定文本保存成用户的凭据。此补充检测无法保证识别所有未知秘密,不能作为主要隔离机制。后续遮蔽不能撤回已经发给非预期接收方的内容。
5.4 授权分配与执行接收方
SecretGrant 记录授权者、接收主体、Secret、允许操作、用途、目标、主体用途及可选活动/执行域、有效期及是否允许委托。知道引用、能够调用服务或拥有资料或程序维护权均不等于获得机密权限。所有者及有权分配者可以提交即生效,既定授权内的执行不要求逐次人工确认;模型提出需求,宿主根据可信身份和当前授权决定。
分配不改变归属,取得授权也不自动取得转授权权力。允许委托时,子授权的对象、操作、用途、目标、执行域、接收方和期限均须落在父授权明确允许的委托范围内,可再委托的范围只能收窄;父授权收紧或失效约束后续访问。稳定服务身份须关联实际实现和执行实例;新产物按受信发布策略重新核对,不能借同名服务或旧绑定继承任意原值读取权。
代理使用按绑定的目标、操作及认证方式执行,目标变化及重定向不自动继承认证。原值交付核对实际领取方及用途,经专用通路到达组件;发起普通调用的认知只得到状态或业务结果。执行方可以通过 SDK 使用凭据,其后续接收方与外发目标仍受原允许范围约束,不能夹带到无关模型、普通日志或业务输出。交付后用途限制须由实现信任、执行环境或上游凭据权限落实,授权文字本身不能约束任意程序。
5.5 机密访问审计
机密职责记录创建、替换、归属调整、授权分配/委托/撤销、读取及代理使用的允许和拒绝、禁用及删除。每条记录关联 Secret 及修订、操作者、授权依据、实际接收方/实现/执行实例、用途及可选活动。审计只保存必要元数据与处理结果,不记录原值、片段、原值哈希、认证头或入口访问凭证;查看审计另行授权,普通执行方不能改写访问记录。
原值放行前须能记录授权决定与放行事实;无法记录时拒绝新的原值交付,不因此阻止撤销或禁用。后续区分交付尝试、确认与未知,不能把放行直接标为成功交付。宿主可核对的业务结果与执行方自行上报的使用分别标明来源;读取次数仅描述领取次数,不能当成静态凭据在外部被使用的总次数。界面不把无上报显示为从未使用,也不声称任意外部使用都能审计。
5.6 变更、撤销与试验范围
成功提交替换、禁用或授权变更后,新访问立即核对当前状态,无需另点发布。撤销阻止后续读取和代理使用,相关执行按已有任务控制收束;已经交付的原值不能被本地授权变更收回。需要使其在上游失效时,另行吊销、轮换或等待实际到期;上游支持时可使用短期、限范围凭据,仍由机密职责管理。授权期限不等于静态凭据有效期,界面分别显示本地授权、执行停止和上游失效状态。配置回退不自动复活已禁用/已删除凭据,机密备份/恢复属于独立管理通路。
统一事件只表达请求及凭据状态变化,不保存原值或入口凭证。试验主体按需引用可见描述与能力需求,不复制原值、生产授权或有效提交会话;所有者或有权分配者可为指定分支另授代理使用或原值读取权,原值按独立测试用途交给获授权组件,不进入普通参试上下文、初态或导出。候选采用、资料复制及账号关联均不自动导入机密权限。
6. 编辑与可观察性
常用表单、高级编辑及关联视图面对同一对象,显示配置来源、作用范围和实际结果。当前值、人工指定值及认知判断分别归属,人工更正不是无来源的现实证据。有效配置统一按配置解析契约显示声明默认、允许覆盖、作用范围及当前约束,不能由某页面自行决定优先级。公共偏好、关系承诺和跨活动目标的修改还显示公共决策整合职责,不同 Mind 的私有评价不直接覆盖 Self 公共状态。
个体自定义状态按宿主状态契约展示归属、结构修订、可见范围、写入者和迁移关系;可用描述驱动表单,未知结构只提供受限诊断及对应领域的只读查看,不猜测字段含义或伪造空状态。代码与状态结构的共同变化按候选转换处理,不开放绕过状态所有者的任意写入。
历史事实可以注释、更正,隐私材料可以按规则删除或脱敏;修改记录不使已经发生的外部动作消失。缓存和索引通过失效、清理、重建管理,不能直接当成业务真值。
记忆页面区分活动临时内容、长期保留、当前采信、归档和已废弃判断;降低检索优先级不等于删除,人工指定也不冒充客观证据。范围收紧或来源变化后,页面显示已知受影响的上下文与交付,以及停止续用、重新装配和有限纠正的实际状态;详细受限来源不因展示影响而向无权者公开。本地停止使用与外部删除请求/确认分别呈现。
从输入到交付可追查情境、承担范围、实际配置、选入材料、参与心智、能力调用及后续修订。展示可核对的过程和声明理由,不承诺还原模型内部完整思维。
管理者查看各领域描述取得受限视图,展开获准文档、记忆或代码内容才是相应读取;模型加载或缓存清理不必提供正文回读入口。将材料加入活动须明确选择并核对处理范围,不自动继承管理会话权限。领域详情
7. 试验操作、动态编辑与提交
本节维护操作方式;编写与试验主体的机制分别由运行及沙箱专题维护,设计范围见台账。
7.1 试验主体管理
工作台按“试验问题 → 程序与初态 → 环境及评价条件 → 创建”组织操作,提供固定测试初态、从已有主体导入所需状态、从已保存活动状态开始三种入口。“从当前主体创建试验”是选择实际程序、相关状态及环境的便利操作,不自动导入所有状态或激活全部生产任务。
创建页显示要测试的行为、程序和初态修订、激活工作、真实计算/测试数据/替代能力/不支持项,以及评价条件和预算。完整状态导入在有明确用途且兼容时可选,不作为默认创建模式。缺少相关状态或环境时说明受影响的结论;不以复制数量、数据齐全或环境启动代替试验有效性。初态契约
创建后默认暂停,页面分别展示程序可运行性、所需条件的就绪状态、可测范围和缺口。用户可切换、继续/暂停、结束、注入事件、重置、再分支及比较,始终显示当前域和初态。交互探索保留变更记录;正式比较重新固定条件,各次运行结果独立。运行和采用沿当前授权处理,结果分别显示任务表现、环境覆盖、成本及采用依据。生命周期
7.2 表单、蓝图与代码的权威定义
将参数定义、展示描述、行为结构、代码模块引用及能力需求绑定到同一修订。受管理模块遵守编写契约,工具从类型提取参数和返回结构,从文档注释提取说明,从结构化注释补充入口暴露、字段范围/默认值/控件及能力需求,生成同源的调用描述、表单与蓝图节点。普通辅助函数无需全部标注;复杂逻辑通过代码模块表达,蓝图组织事件处理、条件、能力调用、心智协作和可复用子图。
参数字段按领域接口描述选择文档、程序、模型等带类型引用及必要范围,处理实现与描述一致采用。扩展声明说明所属领域与操作,不通过自定义控件读取 Secret 原值,也不从新增字段推导敏感权限。
跨实现发布的能力以其接口声明为调用类型的权威定义,实现源码关联该接口;界面说明与使用需求补充管理元数据。函数类型派生接口时保持单向生成,不让接口、各语言类型与表单同时手写。接口修订与实现产物修订分别展示,具体生成技术见工程参考。
蓝图表示程序组织,不把 AGI 的开放任务计划固定成预设流程。运行轨迹作为独立叠加视图,不能通过拖动历史节点改变过去的执行。
蓝图的结构定义是该蓝图的权威内容,编译得到的代码为派生产物;手写代码模块以源码为权威。参数表单修改模块公开配置,画布修改连接和组织。任意源码不承诺无损还原为可拖动蓝图;自定义逻辑保留代码节点,避免两份都可改却无法同步的业务定义。
函数控制台按获准的描述生成参数编辑器,展示返回值、使用状态和调用记录;同一入口可按声明分别用于管理、蓝图和模型调用。仅支持已声明且可适配的类型,不把任意内部符号变成公开 API。调试函数可转入沙箱测试入口,不因点击“测试”自动使用真实域。
源码中的类型、说明及默认值为声明来源;用户修改是声明允许范围内的独立配置覆盖,不反向改写默认值;生成器同时提供覆盖规则、约束及状态结构描述,失效覆盖须转换、明确移除或拒绝提交,不能静默吞掉。生成内容不另作手写真值;提交时核对全部描述及引用,成功后调用入口、表单和蓝图共同切换到目标修订。机密字段只引用固定受信控件,模型生成的描述不获得原值或执行任意页面脚本的权限。
7.3 提交成功即生效
统一流程为:编辑 → 提交 → 解析权威类型/接口与元数据 → 校验规范和兼容性/准备候选 → 调用边界切换 → 已生效或提交失败。提交成功时目标范围已经采用新内容;不能仅保存候选就回报已生效,也不增加第二次发布/启用动作。
上述候选切换流程适用于代码和普通行为配置;权限、机密授权、额度、学习关闭及控制状态按当前值执行,不等待旧调用结束才收紧。一次执行使用确定的代码及普通行为配置,切换期间暂停受影响入口接纳新调用;宿主等待当前调用收束,或撤销本次计算并从显式业务状态接续,避免中途混用新实现。旧模型响应不得未经重新核对进入新输出。已经派发的外部动作继续保留原归属及核对责任,不因提交取消其现实历史。
无法编译、状态不兼容或无法完成切换时提交失败,旧有效修订继续可见;必要的准备耗时显示为提交中,不留用户手动处理的待生效配置。索引重建等后续工作单独展示进度,参数立即采用不等于重建完成。
替换能力实现时,准备可用候选并在受影响执行边界更新实际调用绑定,成功后新执行采用目标实现;只更新服务登记不算全部生效。旧执行与已打开执行句柄保持原实现关联,界面显示其收束或显式转换;不能为了显示已生效而把旧执行句柄伪装成新实现。准备过程可耗时,但不增加第二次启用按钮。
试验是管理员可选择的工作路径,不是每次提交的强制前置。人工提交成功只说明配置已采用,不自动形成经过能力评价的基线或扩大实现信任。主体自主修改的采用权限和既有评价规则仍需满足;一旦获准提交,采用同一立即生效契约。核心宿主程序替换属于软件升级;按契约受管理的能力实现可通过准备与绑定切换更新,两者不混同。经常需要微调的行为放在可配置或可替换的认知与能力层。
8. 完整场景
8.1 在试验主体中调整关注与能力选择
管理者要比较环境线索是否能帮助主体形成有意义的关注,先选择实际认知程序、相关经历及初始关注,声明环境输入、计算能力、可执行动作和评价条件,再创建暂停的试验主体 A。无关生产任务、主动联系及学习议程不自动启动;若相关状态或合法检索路径未覆盖,页面说明其对比较的限制。
管理者在动态表单调整计算额度,在蓝图改变感知与检索的组合,并编辑相应认知模块;一次提交处理相关定义,成功后 A 使用新内容。交互试演可以继续调整;正式对照时从相同初态及环境条件分别运行基线与候选,记录关注变化、行动反馈、经历接续、成本和覆盖缺口,不把混合条件的轨迹算作单一配置结果。
对比合意后,管理者选择采用的代码/配置差异并提交到正式主体,试验中的记忆、模拟关系和外部动作保留在原域。正式主体已修改相同内容时展示冲突。这是设计场景,不是运行记录。
8.2 普通用户为任务提供自己的凭据
用户甲要求读取自己的外部服务资料。主体缺少凭据时申请收集,只得到请求标识和状态;宿主将绑定甲及该任务的可信入口直接呈现给甲。甲查看归属、目标、期限、执行接收方及所需权限后提交,系统完成独立保管与授权,只将获准引用和状态交回活动。执行能力可请求宿主代理认证;其 SDK 需要直接持有凭据时,须取得读取原值授权,宿主核对实际实现并记录放行,经专用通路交付该执行方。普通返回只含获准业务内容。
甲可在“我的凭据”查看授权与有权范围的审计、替换或撤销凭据。用户乙提出同类任务时,不能使用甲的同名凭据;管理员更正归属后原授权按规则失效。撤销立即限制新领取,已交付凭据的上游失效另行处理。工作台区分放行、实际交付和外部使用上报,不展示原值;普通认知只见引用与结果,入口凭证、输入值和认证回显留在专用通路。这是设计示例,未创建真实入口或调用外部服务。
9. 资料依据与设计推论
机密权限与审计另见专项依据。在线资料没有绑定本项目安装版本,原理参考不意味着采用其运行框架或已有相同保证。
| 来源 | 支持的命题 | 本项目推论与边界 |
|---|---|---|
| OWASP Secrets Management,§§2.3、2.7、2.11、8.3 | 限定访问、生命周期管理、用途元数据和避免明文日志 | Secret 投影、专用维护、宿主使用及范围化记录是本项目组合设计;资料不证明已实现零泄漏 |
| OWASP Forgot Password,General Security Practices/URL Tokens | 用户绑定、有限有效期、单次使用的受限入口,以及可信域和独立交付通路 | 借用受限提交会话原理,应用于 SecretIntake;原文针对密码重置,不直接证明本项目机密收集安全 |
| W3C Secure Contexts,§§3.1、5.1 | 浏览器对可信来源及隔离边界的定义 | 可信来源是输入通路条件之一,不证明整个设备或页面脚本可信,也不替代用户身份核对 |
| Ollama 官方 API 源文档,main 分支,模型清单/拉取/删除/运行状态 | 模型维护存在独立于聊天生成的管理接口 | 工作台区分推理调用与维护操作,具体支持项由适配器声明;不指定采用该运行时或声称所有服务提供同等权限 |
| JSON Forms UI Schema,在线说明 | 数据定义与控件/布局描述可以分开 | 动态表单由模块描述驱动;不保证业务语义,也不必选此组件 |
| Node-RED Subflows,Properties/Inputs & Outputs | 子图可封装成节点,并定义实例属性和编辑界面 | 蓝图组织行为与参数,复杂逻辑封装;不承诺任意源码与图双向无损转换 |
| LangGraph time travel,Overview/Fork | 从检查点修改状态产生分支;后续调用可重新执行且结果可能不同 | 采用基准与独立演进概念,外部动作必须由试验能力约束;不因此引入该框架或宣称完整 AGI 克隆已实现 |
| go-mini 当前核对 | 业务进度由宿主保存,热更新保留旧帧/闭包 | 试验使用独立初态及能力绑定;提交立即生效需要宿主切换契约,不能只调用热补丁便声称全部执行已切换 |
未采用通用完整克隆作为试验前提,原因是业务状态和外部世界/句柄不是同一对象;未采用全部页面静态硬编码,原因是代码模块和能力参数会变化;未采用独立表单配置、图和源码各自作为完整真值,原因是难以解释实际执行的内容。
热加载采用编写契约和同源描述生成,减少手写适配、旧闭包迁移及任意栈恢复需求;不采用注释即授权、仅凭纯计算声明自动重试或默认公开所有内部函数。代价是维护规范检查与生成工具,不能因此承诺任意源码均可在线替换。资料及工程映射
独立机密、权限与审计的依据
以下引用官方在线文档;Vault 文档显示为 v2.x,未固定为本项目依赖。
| 来源 | 支持的命题 | 设计推论与边界 |
|---|---|---|
| OWASP Secrets Management,§§2.3、2.6、2.7 | 对象访问遵循最小权限;记录请求者、用途、决定、使用及更新,维护撤销和到期 | 按操作分配权限并记录访问;不证明任意执行方取得明文后仍绝无泄漏 |
| Vault Policies,Policy-authorization workflow/Policy syntax | 身份与策略关联,创建、读取、更新等权限可分别授予,默认不授予权限 | SecretGrant 分离写入、原值读取和分配等权限,不要求采用其路径模型或产品 |
| Vault Audit Devices,Availability of audit devices/Hashing sensitive values | 必要审计不可用时拒绝对应请求;日志需保护敏感值 | 原值放行须可记录,不写入原值或原值哈希;不照搬通用请求/响应记录,不声称观察到全部外部使用 |
Secret 独立管理是为明确原值交付、授权和审计责任;不通过通用资料读取和转换操作处理。代理使用减少原值接触面,授权交付支持需要直接持有凭据的 SDK;代价是扩大对实际接收方的信任与执行约束。授权撤销不能收回已交付明文,普通用户维护、读取原值和授权分配仍分别核对。
Secret 方案不采用管理员独占维护,因为用户需要自行提供和控制自己的凭据;不采用模型识别后再遮蔽,因为值已经入模;不采用指令携带明文参数或任意生成表单收集,因为会扩大历史、日志与脚本的可见范围;不采用仅凭一次性链接决定归属,因为链接可转发;不采用全局别名自动选密钥,因为可能跨用户使用。可信控件与专用数据通路使归属、授权及交付可审阅,尚无本项目完整隔离或泄漏防护实测。
TinyAGI 实施方案与阶段验收
用途:实施规划。项目阶段与证据范围统一见设计台账;本文定义实施顺序、交付内容和验收条件,不表示所列功能已经实现或通过验证。
项目入口 · 逻辑总设计 · 文档索引 · 工程参考 · 库接入基线
| 阅读主题 | 入口 |
|---|---|
| 实施目标与职责 | 交付目标 · 实现边界 |
| 推进顺序与依赖 | 阶段计划 · 优先明确的契约 |
| 首批交付 | 实施范围 · 完整验收场景 |
| 范围与质量控制 | 各部分的实施安排 · 三层验收 |
| 依赖与后续维护 | 执行库和工具链 · 推进与记录 |
1. 交付目标
首个交付目标是能够初始化、持续运行、观察环境、执行行动并积累经历的最小主体,之后逐步补齐认知协作、程序演进、能力扩展和主动学习。每个阶段都交付可运行、可管理、可评价的完整链路。
实施从正式宿主骨架、业务状态和认知运行链路开始。已有实验和库回归提供接入依据,不能代替产品组件及组合验收。优先把已确定的职责连接起来,按实际链路落实接口和数据结构。
核心沿用单机、单二进制、单宿主进程的工程约束,SQLite 保存业务状态,本地文件保存大型资料与产物。模型、检索、原生工具及设备按需接入。主体自主性、任务解耦和状态所有权从第一条运行链路成立;主体无需先收到聊天或建立用户任务才能认知。
2. 三个实现边界
| 实现部分 | 维护的职责 | 与其他部分的关系 |
|---|---|---|
| Go 宿主 | 主体及各领域状态、操作接纳、事件、预算、权限、停止、程序采用和运行清理 | 向认知提供有范围的能力,保障行为可持续、可观察、可停止 |
.mgo 认知程序 | 决定关注什么、读取什么、怎样思考、是否回应、组织哪些心智、如何行动和复盘 | 经宿主能力访问状态和环境;主观意义与认知方法由个体程序组织 |
| 外部组件 | 模型、检索、原生工具、设备和平台的具体计算或动作 | 经公共能力端口及 MRPC 接入,声明支持范围;Go/Rust/Node.js 的实现差异留在适配层 |
软件组织沿用工程模块分工。初期根据实际链路建立必要包,接口由使用它的领域定义;共享身份、调用上下文、事件封装和错误语义,领域对象继续保留自己的操作与所有权。
管理页面经原状态所有者查询和提交,认知与管理共用业务契约;管理身份与聊天身份分别处理。初始化引导及固定维护入口独立于个体程序,人物程序不存在、损坏或暂不可用时仍可维护系统。
3. 阶段计划
阶段按主要依赖顺序排列。每个阶段的验收包含其新增功能及受影响的既有行为,不用包数量或接口数量代替完整链路的交付。
| 阶段 | 主要交付内容 | 阶段验收重点 |
|---|---|---|
| 一、宿主与维护入口 | 核心启动与关闭、数据目录、SQLite/文件访问、状态所有者、事件接入、执行域、预算与停止控制;独立机密模块;固定 Web 维护页;最小试验装配 | 没有可运行人物程序时仍能维护系统;模型配置和机密可通过可信入口管理;事件、操作、状态及用量可追查;试验状态与现实状态分开 |
| 二、最小持续主体 | 有界初始化引导、完整初始化提示词、预制能力库、.mgo 检查/编译/运行;一个主要 Mind;基础关注、经历与接续;一个模型适配器;有范围的资料读取和产物写入 | 从空数据目录创建主体;能够在无新对话时按自身关注继续或休息;外部慢操作不占住唯一认知入口;暂停、恢复和重启保持身份与已保存进度 |
| 三、记忆、协作与完整活动 | 资料修订、经历/断言/Reference、来源和记忆纠正;活动与任务责任;多人格私有状态与公共整合;人物、受众、关系及输出契约;领域检索入口 | 能完成需要取证、处理冲突、交付与复盘的活动;不同 Mind 的判断不会直接覆盖公共状态;不同情境下正确处理披露范围、事实标准和格式要求 |
| 四、程序演进与完整沙箱 | 受管理函数描述、类型及注释适配、动态表单;代码和配置提交;初始化提示词差异及 API 迁移;按问题装配试验主体;基线/候选比较 | 修改后经过准备并在调用边界生效;失败保留旧有效程序;状态及身份连续;已有个体的测试使用实际程序与所需状态;评价结果可以关联具体候选 |
| 五、原生能力扩展与隔离 | 能力发现、复用、构建和采用;受管理子进程;MRPC 发布、绑定、替换与清理;Go/Rust/Node.js 接入;容器执行适配;授权 Secret 交付 | 完成“发现缺口→构建能力→试验→采用→实际调用”的链路;任务可被外部中止;高风险操作只进入满足要求的环境;缺少容器时核心仍可使用 |
| 六、主动学习与外部接入扩展 | 学习议程、强度和额度;候选研究与采用;向量服务、Attemory 等实际适配;更多平台、事件源及设备;增量准备与复用优化 | 关闭学习后停止自主学习和自动采用,正常认知与经历积累继续;不同检索提供者按用途选择;外部事件不要求每次调用模型;复用保持质量和信息范围 |
| 七、集成验收与交付 | 完整工作台、核心发行物、安装和升级流程、缺失依赖提示、运行诊断;整体能力与回归基线 | 在干净环境中完成安装、初始化、持续运行、控制、修改、试验和维护;同一份核心发行物可按配置接入可选能力 |
管理、评价、机密、预算和观测贯穿每个阶段。 阶段二新增模型调用时,同时交付模型配置、停止、用量记录和对应测试;阶段五新增原生服务时,同时交付服务状态、绑定关系及清理结果的管理页面。
检索分步落地:先让记忆、资料、程序等领域表达清楚查询和结果含义,再接入具体提供者。Qdrant 与 Attemory 的实现先后只是开发安排,它们在契约、管理与评价上保持同级。具体提供者的安装和启用按用途配置,核心运行不依赖全部可选组件齐备。
4. 优先明确的实现契约
第一批编码前,具体化会影响后续返工的接缝。契约随第一条运行链路落成,后续新增领域功能时扩展相应接口;不以枚举全部未来方法、表结构或表单组件作为启动前提。
| 接缝 | 应先明确的内容 |
|---|---|
| 身份与执行上下文 | Self/Mind、执行域、实际调用者、预算归属必需明确;交流、Episode、Task 按实际需要关联。主体可以直接认知和调用能力 |
| 认知与操作 | StepContext、接续结果、步骤令牌、操作接纳回执和结果事件之间的关系;步骤内已经接纳的操作独立存在 |
| 状态与程序修订 | 哪个模块可以写什么状态;程序修订、个体数据结构和宿主 API 的兼容关系;哪些状态足以支持正常接续 |
| 能力描述与实际调用 | 接口、实现身份、作用、权限、输入输出类型和调用绑定同源;管理表单与模型工具描述从权威声明派生 |
| 配置与生效 | 普通行为配置随一次执行固定;权限、机密资格、预算与控制读取当前值;提交成功对应实际采用完成 |
| 试验装配 | 同一正式运行逻辑如何绑定不同状态、能力和环境;执行域由宿主确定,候选程序不能自行选择现实域 |
具体逻辑约束分别沿运行协议、管理生效契约和试验主体契约落实,本文不另定义冲突的提交、控制或状态恢复语义。
5. 首批实施范围
首批交付覆盖阶段一和阶段二,形成一个可管理、可持续运行、能使用受控能力并可在独立试验域检查的最小主体。
“最小”主要缩小能力数量:一个主要 Mind、一个已确认的模型适配器、少量资料与工具入口、一组明确的事件。可信密钥输入、预算与停止控制、试验域绑定随宿主骨架建立,人物生成和持续认知随后贯通。
初始化产物允许个体差异。用于测试宿主机制的固定 .mgo 夹具,与通过提示词形成的真实个体分别保存:前者用于确定性回归,后者用于初始化和行为评价。预制能力提供共同契约和客观工具,不固定个体的兴趣、人格或思考顺序。
5.1 完整验收场景
- 启动核心,打开固定维护页面,配置模型连接,通过专用入口录入机密。
- 登记 Self 身份,使用完整初始化提示词及预制 API 说明生成
.mgo程序;编译失败时在原初始化进度上有界修正。 - 生成的主体保存自己的初始关注和状态,进入正常运行;没有新聊天输入时,也可以继续关注、整理经历或休息。
- 接入一个外部事件源,主体按来源与当前关注决定是否处理,按需读取一份资料并保存结果。
- 接纳一项较慢的能力操作;等待期间,主体仍能处理其他输入,控制台可以独立中止该操作。
- 暂停、恢复并重启核心,确认同一主体身份、已保存状态及操作事实能够接续。
- 用固定测试初态和受控能力,在独立试验域运行同一认知程序,取得状态变化、操作、用量及结果记录。
- 从工作台查看发生了什么、当前在等待什么、哪些操作已停止,以及哪些外部结果仍未知。
验收中的接续使用已保存业务状态及明确输入,不要求恢复任意 VM 运行现场。操作中止请求、执行实际停止和外部效果按原契约分别记录;结果未知时保持未知,不用重发动作冒充恢复成功。
6. 各部分的实施安排
6.1 工作台与动态页面
前端使用 Angular。先形成固定维护能力,再扩展动态页面。首先具备模型、Secret、主体状态、程序诊断、操作停止和运行记录;真实函数描述跑通后,再生成表单,最后加入需要图形编辑的蓝图。全部操作始终调用原状态所有者。
工作台随各阶段持续交付,保留不依赖人物程序的维护入口。页面描述来自权威接口和配置定义,不能从 UI Schema 推导任意数据库编辑权或函数执行权。完整职责见管理专题。
6.2 沙箱与试验主体
沙箱从最小运行链路开始接入。先支持固定初态、独立可写状态和替代能力;之后增加已有主体状态的按需导入。完整 VM 现场复制不作为实施前置。
正式运行和试验复用同一认知与业务契约,范围由宿主装配。评价已有个体时使用其实际程序及必要状态;重新初始化的人物不冒充同一个体的修改对照。环境覆盖、状态缺失、真实计算与替代能力分别记录,沿沙箱与评价规格解释结果。
6.3 热更新、状态迁移与实际绑定
热更新同时处理代码、状态与绑定。编译成功之后还要确认状态兼容和实际调用切换。工作台显示“提交中/已生效/失败”;成功后无需再次点击启用。核心宿主更新继续走软件升级流程。
普通代码和行为配置在调用边界采用,当前权限、机密资格、预算及控制按现行约束核对。已经接纳的操作保留原归属和实际效果,迟到结果沿原契约处理。人物初始化、提示词差异、API 兼容及必要修复使用相同程序与状态身份关系,保留个体连续性。
6.4 原生能力与容器执行
原生能力按一条完整路径打通后扩展语言。先完成一种能力端从构建到调用、取消及清理的全流程,再复用 MRPC 契约接入 Rust 和 Node.js。容器环境满足要求后,才开放依赖脚本和高风险执行。
能力发现、复用、组合、构建、试验和采用沿同一生命周期,实际接口与实现身份分别记录。容器为可选依赖;缺失时核心及基础受限认知仍可使用,确需额外隔离的操作按缺失条件报告,不自动改到宿主执行。
6.5 独立机密与授权使用
普通认知使用 Secret 引用;可信适配器可以代理使用,获授权的 RPC 执行方可以通过专用接口取得原值。可信输入、领取授权、返回处理和审计作为一条链路实现,不能只在界面上隐藏输入框内容。
机密归属、维护权及使用授权分别处理,实际接收方、用途和目标决定原值交付范围。可信提交绕过普通认知输入,普通事件、日志和试验初态不承载原值。具体职责沿机密管理和运行契约实施。
6.6 主动学习与正常认知
学习强度独立于正常主体行为。首批验收时可明确关闭实验性主动学习,以便观察基础运行;后续开启学习时复用已经完成的构建、试验、评价与采用流程。
关闭学习时停止自主学习和自动采用,正常感知、关注、日常活动及经历积累继续。用户明确学习任务和必要兼容维护按各自范围接纳,不隐式提高学习强度。候选研究价值、试验结果和正式采用分别表达。
6.7 计算节约与复用
节约机制分为基础配置与后续优化。稳定输入装配、连接复用、编译缓存和真实用量记录从模型/执行适配开始加入;更复杂的在途合并、增量检索和跨工作准备复用,在语义及归属测试成立后加入。
独立判断和采样保持独立,当前权限、状态变化和必要实现切换优先于命中率。主体行为、所需信息、响应要求和完整成本共同评价;具体机制见计算复用契约及工程接入。
7. 三层验收
| 验收层次 | 方法与对象 | 结论边界 |
|---|---|---|
| 机制正确性 | 用确定输入检查调用归属、状态接纳、中断、任务独立、配置切换、权限变化、机密通路、试验域隔离及必要接续 | 说明所测机制是否符合契约,不能替代主体认知质量 |
| 主体行为 | 用固定开发场景和真实模型评价自主关注、按需取证、意愿表达、严谨工作、情境切换、协作与复盘;规则判定与内容评阅分别记录 | 采用前后比较不能只看运行成功,受所用模型、场景、预算和评价条件限制 |
| 成本与响应 | 在同条件下比较完整用量、等待、重复准备和质量变化;区分首次准备、重复使用与失效重建 | 提供者报告的缓存命中只是一个指标,不直接等于完整净收益 |
各阶段按新增功能和受影响契约安排测试,保留基线、候选、输入及评价规则的身份。真实模型运行前明确接口、模型、预算、场景与判定方法;开发材料、回归材料和保留评价材料按评估规格分别使用。失败、跳过和覆盖不足与通过结果一起保存。
8. 执行库与工具链基线
go-mini 的源码与实测范围见当前库基线及报告 018。后续升级沿固定提交核对流程,正式工程锁定可复现依赖,构建不依赖相邻开发目录。
库回归之外保留 TinyAGI 自己的接入与完整链路测试。根项目声明 Go 1.27,报告 018 使用 Go 1.26.6;实施时先固定正式工具链,并在该工具链下确认组合可用,不能将不同工具链的库成绩直接视为正式组合已通过。
生成器、绑定、编译器、运行库和派生产物按匹配来源准备。库升级结果分别保存,不覆盖历史证据;源码阅读、库回归、跨语言互通和完整主体行为分别说明,测试通过不扩大实现信任或机密访问资格。
9. 推进与记录
首批交付范围为阶段一和阶段二。后续功能沿同一状态、事件、能力和评价契约逐步加入,各阶段保持可维护的运行入口及可复核的验收依据。
本文维护实施顺序、交付内容和验收安排;总设计及六份专题维护逻辑,工程参考维护技术承载,设计台账维护项目阶段与设计状态,实验报告保存实际条件与结果。实现中出现新的职责冲突或直接反证时,先修订对应设计,再同步受影响的实施安排及验收场景。
已有实验只支持原条件内的结论,规划中的验收条件不计作测试成绩。完成阶段交付时关联实际实现及验证证据,不以文档补充或库用例通过代替产品功能完成。
工程选型与部署参考
用途:工程参考(与逻辑设计分开维护)。
项目入口 · 文档索引 · 逻辑总设计 · 逻辑契约 · go-mini 库行为
本文说明物理部署、软件依赖、技术栈和存储机制,并记录选型理由与证据边界。工程组件承载逻辑职责,但 Mind、活动和能力不必各自对应一个进程。方案设计范围统一见设计台账。
| 阅读主题 | 章节入口 |
|---|---|
| 总体承载 | 物理部署 · 软件依赖 · 技术栈 |
| 主体与执行 | 初始化与兼容 · 预制能力库 · 任务控制 · 热加载工具 |
| 能力扩展 | 工具链与运行 · Node.js 与 npm · 主动学习 · 实现准入 · 容器执行 |
| 数据与服务 | 领域接口与共用承载 · 模型维护与机密 · 认知辅助组件 · 计算节约接入 · 检索提供者 · 存储 · 个体状态 |
| 接入与依据 | 库接入 · 一手依据 · 检索接口资料 · 向量资料 · 容器资料 |
1. 承载约束与物理部署
本节定义核心及其能力依赖的部署边界。主体行为与职责分工见逻辑总设计。
核心采用以下承载约束:TinyAGI 核心单机、单二进制、单宿主进程;SQLite 保存业务状态,本地文件保存原始资料。向量服务与 Attemory 作为同级外部检索提供者,经 API/SDK 按需接入;本地和远程均可配置,向量路线初始选择为本地单节点 Qdrant。Go 承担宿主机制,go-mini 组织认知。核心之外允许宿主管理的本地能力子进程、原生构建产物、Node.js 程序包及 Go/Rust/Node.js(npm)工具链与运行依赖;单二进制描述核心发布物,不表示整个运行环境只有一个文件或进程。子进程不拥有第二份主体真值,也不构成 TinyAGI 集群。
不采用 TinyAGI 集群、Kubernetes、节点接管、服务发现、对象存储或独立业务数据库,以保持单机核心和本地状态的边界。嵌入向量引擎及 SQLite 向量扩展暂缓,原因是当前选择通过 SDK 接入独立向量服务,并非性能实验证伪。外部模型、工具和远程向量服务不改变核心部署约束。
核心为受管理认知程序提供基础受限执行,并默认携带额外隔离执行的契约与适配入口。容器引擎、镜像和工具链按需配置,缺失不阻止核心启动或基础人物初始化;直接接触系统环境、运行依赖脚本或执行高风险远程操作等能力,按实际要求使用合格容器。基础执行与额外隔离的分类见逻辑契约。容器不拥有主体真值,也不要求部署 TinyAGI 集群;工程接入优先 Linux 上的 Rootless Docker,增强隔离预留 gVisor,具体条件见容器执行。
1.1 物理部署总图
flowchart TB
User["Web 管理工作台/CLI 入口"]
subgraph Machine["TinyAGI 所在主机"]
subgraph Process["一个 tinyagi 二进制/宿主进程"]
Entry["输入输出适配、来源绑定与格式校验"]
VM["go-mini 实例与认知调度"]
Library["客户端预制库:固定源码模块、宿主适配、契约与资料"]
Bootstrap --> Library
VM --> Library
Library --> Jobs
Bootstrap["Go 引导器:初始化/修复工具循环与固定维护入口"]
Entry <--> Bootstrap
Bootstrap --> Jobs
Bootstrap --> Data
Bootstrap -->|"候选编译与受控实例"| VM
Jobs["任务、读取与能力适配、后台维护"]
Control["宿主优先控制:任务到执行关联、准入与收尾"]
TaskVM["独立任务 go-mini 实例(按需要)"]
Entry --> Control
Control --> Jobs
Control --> VM
Control --> TaskVM
Control --> Data
Jobs --> TaskVM
TaskVM -->|"结果及失败"| Events
Ext["构建、隔离执行适配与 MRPC 绑定"]
Jobs <--> Ext
Ext --> Data
Access["受控出站、认证绑定与返回过滤"]
Events["事件接入、分发、订阅与关联"]
Data["数据访问、单写入通路与维护入口"]
Trials["评估模块:测试与基线、沙箱装配、评阅与比较"]
Entry <--> Events
Events <--> VM
Events <--> Jobs
Entry --> Data
VM --> Data
Jobs --> Data
Jobs -->|"试验请求"| Trials
Trials -->|"试验状态、基线与报告"| Data
Trials -->|"独立试验实例"| VM
Events --> Data
end
DB[("本地 SQLite:状态、元数据、事件和待办")]
Files["本地文件:媒体、证据、代码和导出"]
RetrievalServices["本地检索服务(按需选用)<br/>向量服务/Attemory;各自独立运行"]
RetrievalFiles["各检索服务自有数据目录"]
ContainerRuntime["可选容器引擎:Rootless Docker<br/>增强运行时按要求装配"]
Containers["能力容器:Go/Rust/Node.js<br/>准备、构建、测试及运行"]
Workers["普通受管理进程:仅承载满足普通执行条件的能力"]
Ext -->|"受控创建、观察与结束"| ContainerRuntime
ContainerRuntime --> Containers
Ext <-->|"受限 MRPC 与产物收集"| Containers
Containers <-->|"按用途开放的访问"| Access
Ext -->|"启动、观察与结束"| Workers
Ext <-->|"MRPC:本地 Unix socket 或回环连接"| Workers
Devices["本机设备/驱动/外部推理服务"]
Data --> DB
Data --> Files
Jobs <-->|"API/SDK:选本地提供者"| RetrievalServices
RetrievalServices --> RetrievalFiles
Jobs --> Devices
end
RemoteRetrieval["远程检索端点(按需配置)<br/>数据由服务侧维护"]
Jobs <-->|"API/SDK:选远程提供者"| RemoteRetrieval
API["可选第三方模型/工具 API"]
Sources["外部事件源/通知提供者<br/>平台、文件监听、后台任务;闹钟仅为示例"]
Jobs -->|"可创建/管理来源"| Sources
Sources -->|"经适配器进入统一事件通路"| Entry
User <--> Entry
Jobs <-->|"符合条件的受信适配"| API
Access <--> API
TinyAGI 自有逻辑模块和事件机制映射到进程内组件,核心不内置闹钟业务模块。外部通知源可位于本机的独立程序、操作系统设施或远程服务,经适配器接入;图中置于宿主进程之外,不要求它必须在远端。SQLite 保存任务责任、来源引用、订阅和必要事件,通知对象与计时由相应提供者管理。宿主执行期限和预算控制仍属于运行机制。模型计算交给外部推理组件,选用库时可在宿主内运行,使用已有运行时/API 时属于能力接入。发布单个 TinyAGI 可执行文件;当前完整初始化提示词、预制库源码与接口资料、固定引导支持及管理静态文件可内嵌,各 Self 生成的认知源码、修改产物与用户数据写本地目录,不引入内部服务集群。
外部检索提供者是独立能力依赖,可配置同机或远程服务;各服务维护自己的材料副本和检索状态。图中连接表示按用途选用,不要求同时部署、双写或调用全部提供者。向量服务与 Attemory 同级接入,Qdrant/本地单节点只是向量路线的初始配置。单二进制描述 TinyAGI 核心,服务内部实现与拓扑不属于主体运行架构。检索接入与取舍
回应的证据核对、意愿与规范适用判断仍由 go-mini 组织模型及工具完成;宿主输出入口执行确定格式检查,规则/契约版本和观测关联仍使用同一 SQLite 与本地文件。逻辑上新增的责任不对应新进程或外部审查服务。
沙箱沿同一事件/能力接口装配替代来源、输出、试验文件区和环境时钟;允许的模型计算仍经宿主适配并计入全局计算资源预算。数据库按宿主绑定的执行域隔开正式状态与试验状态,试验文件放入各自本地目录;共享的只读基准材料必须满足原可见范围,不向候选开放原始数据库连接、宿主路径或生产能力句柄。
平台适配器接收其可确认的账号、会话及受众元数据,人物关联和情境化记忆仍位于同一宿主的数据与认知层。对接多个聊天平台是能力接入,不是分布式部署;不新增独立身份服务或人物图数据库。
2. 软件组合与编译依赖
采用明确状态所有者和可替换能力端口的模块化设计。下图是编译依赖方向;前后调用产生的事件流见总逻辑架构,两者不混用。名称用于说明分工,尚未创建产品包。
flowchart TB
App["app:启动、配置与装配"]
Cog["cognition:go-mini 编译、实例与宿主桥接"]
Core["领域组件:activity / materials / knowledge<br/>programs / models / execution / evaluation / secrets"]
Events["events:共同事件协议、来源绑定、订阅与分发"]
Ports["公共能力 API:各模块声明的端口与业务契约"]
Adapter["adapters:SQLite、文件、检索 API/SDK<br/>模型、平台、MRPC 与工具链"]
Domain["公共契约:带类型引用、调用上下文与事件类型"]
App --> Cog
App --> Core
App --> Events
App --> Adapter
Cog --> Ports
Core --> Ports
Core --> Events
Events --> Domain
Adapter --> Ports
Ports --> Domain
宿主桥接将认知请求表达为有类型的事件,分发给状态所有者或能力接纳入口;所有者经端口调用存储或能力。适配器将结果归入同一事件协议,不直接重入 VM 或任意修改其他模块。同步 API 可以等待并返回同一结果事件的业务视图,不另产生一个语义重复的完成事件。事件机制通过进程内接口和有界队列承载,跨模块的必要共同提交仍由宿主协调,不建立独立消息中间件。接口以业务用途划分,不做一套对所有对象通用的 CRUD/插件框架。
| 模块候选 | 独占维护的业务含义 | 主要输入和输出 |
|---|---|---|
activity | Self/Mind 业务身份与状态、已接纳目标、Episode、工作区、关注候选与接续点 | 输入/完成事件 → 可运行步骤;认知修订 → 活动状态/等待条件 |
events | 共同事件封装、来源绑定、订阅/关联和按范围分发;不拥有领域事实或主体意愿 | 外部观察、请求、结果、状态变化和控制 → 对应处理者;重要记录沿统一数据入口保存 |
materials | 文档、媒体、来源定位、内容快照和表示 | 导入、抓取、选读、解析及清理;文件工具不授予领域权限 |
knowledge | 经历、断言、证据关联、Reference 和经验候选 | 查询、带依据的更正与采用;不覆盖原始资料或裁定人物认证 |
| 检索适配 | 提供者绑定、用途策略、来源映射、准备及查询记录 | 按各领域范围调用外部服务并整理有类型结果;引擎和服务侧数据由提供者维护 |
programs | 源码、接口、配置/蓝图定义及其修订 | 受管理编辑、检查和迁移;各行为所有者保存配置值,构建及生效由运行职责接续 |
models | 模型描述、权重产物、连接及能力绑定 | 维护请求沿提供者适配,实际加载和计算由推理提供者负责 |
secrets | 原值、归属、SecretGrant、可信提交与审计 | 专用授权、代理使用或原值交付,普通读写端口不能取得原值 |
interaction | 账号与人物关联依据、当前受众、互动约定、接纳前请求记录、适用契约和输出轮次 | 平台输入与认知候选 → 澄清、拒绝或转入活动及有当前范围的输出;意愿和情感评价仍由认知提出 |
execution | Operation、派发、外部回执、取消/未知、能力准入和实际用量 | 归属主体/心智及可选交流/活动的能力意图 → 提供者调用 → 完成事实与按需接续 |
cognition | Program/Instance/scope 与宿主绑定;不另持有唯一业务事实 | StepContext → go-mini 组织模型/工具 → Continuation/候选 |
evaluation | 测试套件、试验配置、输入环境、参试/评价材料分离、基线、比较报告及采用依据 | 同一任务接口装配独立域;运行、评价和比较分责,按覆盖及门槛判断用途,参试候选不能改写本次评价规则 |
| 构建与运行适配 | 工具链、产物来源、受管理子进程、MRPC Provider/绑定及清理;复用 execution/evaluation 的活动与预算 | 受控构建/试验/运行请求 → 产物投影、生命周期事件与实际调用;名称尚非产品包 |
adapters | 外部协议、物理存储和设备差异 | 实现调用方声明的端口;不自行决定是否接受任务或扩大读取范围 |
app | 进程生命周期、配置核对、模块装配和执行实例归属 | 绑定真实域或某个 SandboxID 的全部入口;不提供候选可换成现实域的开关 |
工作区可引用上述状态,但不复制成另一个事实库。一次用户交流可关联多个 Episode,一个 Episode 也可跨会话接续;不得用“聊天 ID=活动 ID=模型会话 ID”合并三者。人物关系/剧情、现实观测/体验和沙箱经历沿已有语义分开,表结构不得把它们压成无来源的聊天文本。
调用上下文由宿主绑定 Self/Mind、可选交流/活动或直接管理请求,以及实际执行者、能力范围、用途、执行域与预算。认知可以没有会话和 Episode,操作与费用仍归属于对应主体/心智;转入活动后保留原请求及用量关联。各领域按当前授权裁决,委托不扩大父范围;SecretGrant 继续由独立机密模块核对,不把多方权限合并成进程级通用凭据。交互归属与授权上下文规定逻辑语义,不要求增加数据库或服务。
认知输入保存所选来源、修订、派生关系及会话使用记录;撤权或用途变化时,宿主使受影响上下文和候选输出失效,不能确认已经移除内容的外部会话停止沿用。长期记忆由 knowledge 按保留规则维护,必要过程记录仍留在原模块;已交付结论的纠正使用 activity、knowledge 与交付记录的既有关联,不以重放全部历史代替影响判断。上下文有效性、记忆与纠正
持久化模式默认采用当前业务状态+必要过程记录+可重建派生索引。 状态用于接续,事件/决策/操作记录用于查证,原文与内容修订由资料和记忆职责分别保留。当前不采用“所有状态只能重放全部事件得到”的完整事件溯源:模型和外部动作无法仅凭本地事件重新产生相同结果,且重放与隐私保留会增加复杂度。这是工程取舍,未做框架优劣对照。ORM、依赖注入容器及 Agent 工作流框架也不作为默认依赖;先用显式 Go 结构、构造函数及参数化 SQL 表达当前有限边界。
3. 技术栈与依赖版本
“默认”表示当前设计选择;“已测”只限报告列出的组件组合。本文定义设计选择,不构成产品实现。
| 层次 | 当前选择 | 为什么及边界 |
|---|---|---|
| 宿主与并发 | Go;现有根模块声明 1.27,研究固定记录实际工具链 | 类型化端口、goroutine/context 与标准库足以承载单进程;不为多个 Mind 创建进程,版本不是未经验证的跨平台保证 |
| 认知程序 | 嵌入 github.com/d7z-team/mini-go,源码/产物固定身份 | 可变认知与原生机制分开;独立实验导出已提交快照,避免相邻开发工作区变化污染证据;产品版本仍需进入实现时锁定 |
| 能力扩展 | MRPC 生成 Go/Mini-Go/Rust/TypeScript 绑定;稳定 Go 能力本地注入,动态 Go/Rust/Node.js(npm)能力用受管理子进程 | 复用库的绑定、资源、取消和服务替换;工具链及子进程管理由宿主适配,未实现组合闭环 |
| 结构化数据 | database/sql+modernc.org/sqlite 为当前默认候选;实验依赖固定为驱动 v1.59.0/libc v1.75.7 | 无 CGO 构建便于单二进制发布;保持驱动所要求的 libc 配套。没有与 C 驱动比较性能,不宣称更快 |
| 文件与内嵌材料 | Go os/io/fs,embed 打包初始化提示词、预制库源码/接口资料及固定管理静态文件 | 个体生成的认知源码、用户材料和证据在数据目录;内嵌引导材料不意味着自动读取用户材料 |
| 存储访问与迁移 | 参数化 SQL、显式版本迁移、限定访问范围的仓储接口 | 数据所有者和共同提交清楚;暂不引入 ORM/独立迁移服务,具体 DDL 随业务样本再定 |
| 领域检索 | 记忆、资料、程序定位及能力发现共用外部提供者接入;向量服务与 Attemory 同级,按用途选择或组合;元数据/全文查询保留 | API/SDK 对接已有组件,材料准备有明确范围;报告 013 只支持固定语料的内容查询,外部服务组合与任务收益尚未实测 |
| 模型/工具接入 | 宿主端口+提供者适配;HTTP 使用复用的 net/http.Client | 宿主绑定凭据和协议,服务执行实际计算;具体模型由真实任务条件选择,不锁死某厂商 SDK 或假定兼容端点语义相同 |
| 输入、事件与交互 | CLI/本地入口为首批候选;进程内事件机制与外部事件源适配 | 闹钟仅为可创建通知源的示例,不内置核心计时业务;具体来源/平台提供者及真实发送仍待定 |
| Web 管理工作台 | net/http 管理 API+内嵌前端产物;运行时无需独立 Node 服务 | 完整管理入口沿已有状态所有者处理;前端选用 Angular/TypeScript;类型/注释驱动描述与适配已纳入设计,页面和生成工具尚未实现 |
| 契约与序列化 | Go 类型+版本化 JSON;需要声明式约束时明确 JSON Schema 方言/子集 | encoding/json 解析不等于 schema 验证;类型/范围/未知字段/语义分别核对;校验库待真正契约集合确定 |
| 观测 | log/slog 结构化运行日志+业务 Trace/Operation/Outcome 记录 | 日志不自动包含材料全文、凭据或私密模型载荷;业务依据按访问范围读取,暂不要求外部日志/指标服务 |
| 测试与沙箱 | 局部 go-mini 实例、能力组合与主体级试验分层;需隔离的原生构建/测试复用容器执行 | 试验状态与系统执行隔离分别装配;容器不替代初态、环境覆盖或评价条件 |
| 可选容器执行 | Linux 优先接入 Rootless Docker,预留 gVisor 增强隔离;公共契约独立于具体引擎 | 默认提供适配入口,运行时按需装配;实际约束须满足请求,缺失不降级到宿主进程;依据见容器资料 |
宿主组合实验已验证固定 go-mini、Go 标准库、modernc SQLite 和本地文件在本机组成无 CGO 可执行文件,并经确定提供者完成两段活动;这支持当前默认,未测试真实模型、生产负载或跨平台。
执行库更新另以当前固定提交核对,库回归及跨语言互通结果见报告 018。报告 014 的工具链和组合成绩保持原条件;新库用例不替代完整宿主组合重测。
已测构建目标是本机 Linux/amd64 的最小文本闭环;Windows/macOS、本机 GPU/语音库、跨机型安装与真实容量留到明确用途后验证。单二进制目标不等于把权重、显卡驱动、CA/操作系统环境或第三方工具都内嵌。
mattn/go-sqlite3 暂不作默认,主要理由是其 CGO/C 编译依赖与当前简化构建的偏好;它仍可构建单二进制,不是违反架构或被性能实验否定。若实际任务暴露驱动负担、扩展需求或目标平台问题,再在相同业务负载比较。向量服务的选型不重新打开业务状态数据库选型。
FTS5 默认 unicode61 以连续 token 字符分词,不是中文语义分词器;trigram 对少于三个 Unicode 字符的全文查询有限制。因此保留有界原文扫描作为覆盖路径,按实际中文/混合文本查询选择分词或索引,不直接把 BM25/向量相似度当成证据可信度。向量存储采用下述 SDK 路线,embedding 模型、切分和检索策略按用途配置,组合收益尚无本项目实测;不要求每次活动都使用语义检索。
3.1 Web 工作台
工作台覆盖完整管理范围。Go 宿主提供管理 API 与静态文件,前端构建产物可内嵌二进制;浏览器不直接连接 SQLite、外部检索服务或 VM。普通查询与命令使用 HTTP,状态推送可用 SSE,前端选用 Angular/TypeScript。动态表单与蓝图组件尚未选定,运行时无需增加独立前端服务。逻辑职责与管理方案
依据:Go embed 支持编译期文件内嵌;WHATWG SSE 定义事件推送和重连。二者用于承载推论,不证明完整管理台已经实现或通信无遗漏;页面可重新读取当前状态。
执行库的状态重建、旧帧保留和不兼容变更依据集中在go-mini 读取记录。
提交切换的契约见管理工作台。设置定义、认知程序与蓝图可设计为热调整对象;修改核心宿主原生实现属于软件更新;按契约受管理的原生能力采用产物准备与 MRPC 绑定切换,见能力工具链。库补丁与绑定行为有局部测试依据,完整管理提交、主体级试验和人物迁移尚无端到端成绩。
3.2 提示词初始化、自迁移与 API 兼容
采用“当前完整初始化提示词 + 相邻修订的差异与迁移说明”交付认知初始化要求。每份完整提示词有来源、日期和内容身份;历史正文保留,文本 diff 从相应两份正文生成,语义说明补充变化原因、影响范围、必要/可选项、替代接口及检查条件,并与相同起止身份关联。跨多次修订可顺序处理或使用有完整覆盖关系的累计说明。差异表达要求变化,不是针对所有个体源码的统一补丁;实际运行提示词和人物程序尚未交付。
| 接入部分 | 工程承担方式 |
|---|---|
| 发布内容 | 当前完整提示词、可追溯的迁移链、预制能力库及其宿主 API/MRPC 声明与适配、固定管理页面;通用绑定及受约束模块骨架可生成,不发布统一人格程序覆盖个体 |
| 人物与产物 | SQLite 保存人物身份、初始化进度、迁移项及采用关系;本地文件保存提示词来源、个体源码与候选;源码和依赖身份可追溯,生成式初始设定不伪装为真实经历 |
| Go 引导器 | 不依赖待生成或已损坏的 .mgo;用现有模型适配、工具接纳、Secret 引用和事件通路完成有界生成/修复循环,支持停止和续接,不形成第二套长期认知主体 |
| 编译与试验适配 | 封装 Engine.Check/Compile、Program.Instantiate 及命名入口调用;向独立实例装配受控测试能力,经现有候选规则采用;模块装载初始化仍不得产生现实业务动作 |
| 运行跟踪 | 分开记录客户端构建、提示词来源、宿主 API 契约、生成源码/依赖、检查结果与有效程序;读取新说明不等于个体已经兼容 |
| 固定维护入口 | Go 承载的 HTTP/CLI 管理可配置模型、显示诊断和维护当前支持范围内的代码/资料;不依赖个体动态表单或认知 VM 成功启动;没有模型时可维护但不承诺自动修复成功 |
TinyAGI 对自身公开给 .mgo 的稳定接口承担兼容责任:旧导入路径、类型、调用入口、MRPC handler 或适配层在声明窗口内确实可用,并保留承诺的参数、结果、错误、状态和资源语义。弃用说明提供替代方式、开始弃用的契约修订、支持范围及最早移除条件。窗口按若干次稳定 API 契约修订计数,不能把每次提示词编辑或客户端补丁都计为一次;具体保留数量属于发布支持策略,尚未指定。无法保持旧语义的改变应明确为不兼容迁移,不能只保留同名函数却改变含义。
采用 Go 的 Deprecated: 注释习惯,并复用 go-mini 文档提取结果展示给 Self 和工作台。调用点提示、依赖影响分析、兼容清单与旧实现保留由 TinyAGI 工具及适配层补充;注释不会自动实现兼容,也不能据此声称库已提供完整弃用告警或迁移系统。稳定宿主包装层隔开第三方接口变化,生成绑定仍由相应声明重新生成。
优先在旧程序仍可运行、旧接口仍受支持时,让 Self 根据实际源码和迁移项完成改写、编译及受影响功能检查。跨客户端更新时还要检查语言、标准库、编译工具链和运行依赖;宿主 API 兼容不能覆盖这些变化。go-mini 将源码、资源和 .mrpc 作为分发边界,执行镜像与缓存属于当前工具链派生物,不能保证旧字节码跨客户端继续启动。旧程序不可运行时,Go 引导器按原身份和可读状态修复候选;不依赖旧 VM 自己先成功启动,也不默认捆绑所有旧 VM。无法识别的数据格式进入受限维护,由原状态所有者处理迁移,回退可执行文件不自动等于数据可回退。
引导与迁移使用管理操作或既有授权策略绑定的范围和独立维护预算,沿用领域视图、按需读取、机密注入/过滤及候选采用规则。学习强度为关闭时,获准的必要兼容维护仍可执行;不得因此开启主动学习、改写人格目标或扩大权限。客户端更新、提示词发布、个体程序采用和业务数据迁移分别显示实际结果,准备耗时可见,成功采用仍按提交即生效。
选择理由:提示词与语义差异适合个体程序有不同结构的前提;宿主独立引导消除“生成或修复程序必须先运行该程序”的循环依赖;显式兼容窗口为 Self 留出迁移机会。未采用统一默认人格代码、强制套用源码补丁、更新即重新初始化或永久保留全部历史运行时,分别因为会覆盖个体差异、误配实际源码、破坏连续性或失去可控支持范围。这些是工程取舍,未被性能实验证伪。
Go Doc Comments 的弃用约定支持弃用信息的表达;go-mini 固定提交记录支持文档提取、源码注册与编译/实例分工。资料不证明本项目引导器已实现、任意模型可生成可运行程序或长期迁移无退化。逻辑语义见引导契约,检查设计见沙箱评价。
3.3 客户端预制能力库的交付与接入
TinyAGI 随核心客户端提供预制工具能力,采用固定源码模块、宿主实现/适配及同源文档/示例的组合。库对 Self 的只读性是维护权和交付边界:权威源码与绑定由客户端维护,个体认知源码、包装和构建产物保存在自己的工作区。库内函数按实际用途执行计算、读取、写入或外部操作,权限及状态修改仍经现有宿主入口。
| 接入部分 | 工程映射与理由 |
|---|---|
| 固定源码库 | 复用 go-mini 的模块源码注册机制,预制前缀与个体工作区分开,装配时拒绝个体覆盖预制权威模块;同一次构建绑定不变源码快照,实际 import 决定依赖 |
| 宿主及 MRPC 适配 | 预制操作复用既有类型、handler、Host/Provider 与能力端口;初始化模型工具适配和 .mgo 调用适配使用同一业务契约,管理入口按自己的身份访问 |
| 工具查询与分析 | 复用文档提取、compiler/language 与 Check 等现有基础;TinyAGI 补充运行契约、能力范围、配置来源、诊断覆盖和返回过滤;这些封装仍属待实现设计 |
| 配套资料 | 接口签名、错误及作用说明、示例、弃用信息与实现来源一致;通用示例帮助使用工具,个体人格及策略不固定为模板;目录和内容分别按投影/读取处理 |
| 外部依赖 | 客户端可携带稳定入口和适配器,模型、原生工具链及能力服务按原设计装配;核心发布物不必包含所有模型权重、工具程序和配套文件,缺少依赖时返回真实限制 |
| 更新与缓存 | 记录客户端构建、预制接口/实现身份和个体实际依赖;更新后按工具链与来源身份重建必要派生物,静态查询缓存固定输入,动态许可和状态重新核对 |
预制工具可覆盖 API/能力查询、资料读取、源码结构与诊断、配置及预算查询、解析转换、差异计算,以及候选编辑、模型、构建和沙箱的受控接口。函数清单与命名按具体接入确定,不另建一套直接操作数据库、任意文件或不受控进程的旁路。稳定业务状态、权限及各领域生命周期仍由已有宿主模块负责。
库更新随客户端提供新增能力、修复及弃用说明。新增项可选;已依赖模块的实现变化可能直接影响行为,须保持承诺的兼容语义,必要时由 Self 在窗口内迁移。预制权威实现不经个体热加载改写,个体包装可按受管理程序契约更新;同次执行和编译绑定确定来源,不强行复用不兼容旧镜像。核心软件更新与预制库更新一并记录实际完成状态,不新增在线替换核心 Go 任意代码的承诺。
采用理由是复用成熟语言工具和通用操作,减少初始化时的接口猜测与机械性重复编写,同时保留个体逻辑自由。不采用强制使用固定便利层、手工维护多份接口说明或按新增库能力自动改写个体程序;前两者增加约束或漂移,后者混淆能力供给与个体采用。预期收益属于工程判断,尚无初始化成功率或性能实测。
资料依据为 go-mini 固定提交的源码注册、显式宿主装配及语言工具;逻辑维护归属见预制库契约。
3.4 主体认知、任务执行与外部控制
核心 .mgo 保持关注、判断和任务组织,Go 宿主负责接纳、执行与控制。Self/Mind 的认知执行可独立于交流和 Episode 创建,宿主绑定主体额度、代码、已装配能力和结果关联;形成活动后沿用已有操作及投入。主体生命周期不使用业务任务的 deadline;长任务提交成功即返回操作引用,由宿主任务所有者维护 context、预算、工作者与结果事件。认知分段仅拥有局部计算和短调用,跨分段工作归 Operation 管理。接纳边界保存原来源、授权及预算关联,既不把任务挂在提交它的短调用 context 下,也不通过移除取消传播获得不受控后台工作。
宿主普通操作使用有界工作者;长时间脚本或需要隔离 guest 故障的工作按需使用独立 Instance,Program 可在兼容条件下共享,globals/scope/FFI Session 分开。任务实例不是另一个 Self,不拥有第二份主体真值;同进程的独立实例也不提供操作系统级资源隔离。原生能力继续按既有子进程设计管理。输入、停止与核心调度不等待后台队列排空,后台工作限制并发及份额;Executor 容量、模型队列与进程资源按用途装配,未承诺硬实时响应或无推理容量时即时答复。
受管理认知程序通过显式绑定的 FFI/MRPC 能力操作状态及外部环境,不默认装配任意文件、网络、进程或宿主环境访问。宿主负责核对可达入口、接口契约、额度和状态提交;这是本项目基础执行的装配要求,不能仅凭使用 go-mini 宣称自动满足。模型生成的认知候选可在该范围完成初始化及局部检查;调用原生命令、依赖脚本或其他需额外隔离的实现时,沿执行分类切换到合格环境,基础程序包装不免除执行方要求。
| 控制对象 | 宿主接入 |
|---|---|
| 主体暂停 | 阻止目标 Self 的新认知推进及动作,控制既有执行,保留输入登记、状态查询与必要清理;输出停止单独控制交付 |
| 当前认知/任务 Execution | 持有该次 InterruptHandle,优先通路提交中断请求;控制执行器完成取消及状态观察,旧句柄不代替新的任务绑定 |
| scope 与 Instance | ScopeDone/WaitScope 观察本次收束,等待期限与取消分开;需要结束独立任务实例时由其所有者 Shutdown,不能关闭共享 Host 或其他实例所需 Executor |
| 模型与外部操作 | 使用原操作绑定的 context/提供者取消接口,按实际契约等待或登记停止未知;不能以本地请求返回取消推断远端已停 |
| 任务准入和结果处理 | 任务所有者保存控制状态,限制新的派发、重试、采用及交付;迟到结果只登记到原任务,保留已发生效果及必要清理 |
| 控制台与审计来源 | 共用受信控制入口及身份/权限校验;未来审计模块的算法输出与可直接执行的授权决定分开,模块来源不能由模型文本伪造 |
InterruptHandle.Interrupt 只提交取消请求;Execution.Cancel 实现需要取得 VM owner,故控制入口不能同步等待任意清理才接收其他请求。FFI Open/Start 必须快速返回,阻塞工作在 provider 自有有界执行器中完成;子进程及远端服务按原生命周期处理。核对当前控制范围与任务到 Execution/操作/子工作的映射后执行,不能仅取消一次调用却允许任务调度器继续重试。
API 装配使用普通 library 入口承载有界认知段,避免 main 生命周期结束其他工作。同一 Instance 有活跃前台 Execution 时不能另起前台入口;Pending FFI 虽让出 worker,核心须结束/中断占用入口的认知段,由宿主按事件安排后续有界认知执行。核心分段的 WaitScope 仅等待局部所属工作,不等待整项外部任务。任务使用独立 Instance 时,后台 guest panic 的实例级影响不落到核心实例;业务错误用结构化结果返回。具体固定提交事实见库记录。
Go context 文档(页面所示 go1.27.1):取消沿派生 context 传播,支持分清提交请求与已接纳任务的生命周期。结合 mini-go 源码,本项目采用独立归属、分段接续和受控取消;这是接入设计,未新增完整响应性、隔离或停止延迟实测。既有报告 014 只支持异步 FFI 与顺序跨实例接续,不覆盖此处的并行中止场景。选择理由及业务约束见总设计,未来评价见沙箱。
3.5 受管理函数的声明与生成工具
采用 TinyAGI 构建工具读取 go-mini 源码快照、类型信息与结构化注释,经确定性校验生成调用描述、适配代码及前端表单/蓝图描述,再编译完整候选 Program。普通内部函数沿语言规则调用,跨宿主边界的可调用函数必须登记并适配受支持的 HostValue 类型。具体注释语法、类型子集和生成工具尚未实现,以下仅为声明示意:
// ComposeReply 根据当前任务材料组织答复。
//agi:entry id="reply.compose" expose="workflow,console,model"
//agi:requires model.generate
// 对应函数签名:ComposeReply(ctx Context, input ReplyInput) (ReplyResult, error)
type ReplyOptions struct {
// 回答长度的目标上限。
//agi:field title="回答长度" min=1 default=200
MaxChars int
}
参数/返回类型从类型信息推导,不在注释中手写第二份完整 Schema;说明由普通文档注释提供,默认值与字段约束作为声明,用户修改存为配置覆盖。特殊注释是受限元数据,不执行注释中的任意命令。类型、描述、适配代码及其依赖绑定同一来源产物,生成结果不供人工独立修改。
内部受管理函数可采用固定宿主入口加生成分派代码:函数稳定标识映射到类型适配及普通命名调用,避免每新增一个受管理函数都人工维护宿主入口和 UI。分派层采用现有显式 EntryPoint 与 Call/Start 路径,不能声称库可直接调用任意未登记符号;方法、泛型和特殊参数仅在适配工具能够明确解析时支持。固定分派入口只减少入口变化,不保证任意内部签名或状态变更均可原地补丁。
候选连同调用描述及普通行为配置一起准备;有效配置使用统一的声明与覆盖解析,当前授权、Secret、预算和控制另行核对,规则见配置解析。兼容时在受影响执行/scope 收束后使用补丁,需改变状态契约时明确准备替代实例及转换,不兼容则提交失败。一次执行期间不应用会改变其调用图的补丁。提交结果在可调用实现和管理描述已经一致切换后报告成功,已有外部 Operation 独立保留。试验主体及临时函数测试入口使用同一生成路径,绑定试验域。
检查分为声明/类型/禁止依赖等构建期规则与授权/预算/机密/作用等运行期规则。不能从纯计算注释推定实际纯度;受限能力装配和宿主执行检查仍须成立。核心 Go 宿主本身的任意代码在线替换不纳入此机制;受管理原生能力走独立的 Provider 替换路径。
Go 官方 Generating code,2014-12-22 发布,说明特殊注释与显式生成工具可用于生成代码;go generate 不自动属于 go build。这里只借鉴元数据驱动生成方式,不直接执行用户源码中的生成命令,也不据此宣称 go-mini 已支持 agi: 语法。固定库提交的命名调用与热更新核对支持接入分工;整套生成工具、类型覆盖和性能未经实现或实测。
3.6 能力工具链、MRPC 与运行管理
采用范围:尽量复用 go-mini 的 MRPC 与嵌入 API,补充宿主侧构建、局部 VM 试验与子进程生命周期适配。它们实现能力构建逻辑契约,不修改通用 VM 的认知语义,也不将全部内部调用改成 RPC。
接口权威与多语言生成
| 入口 | 权威来源与生成方式 | 限制 |
|---|---|---|
| 内部受管理函数 | Mini-Go 类型与少量结构化注释 → 入口、类型适配、表单和蓝图描述 | 沿既有 EntryPoint/Call/Start 路径;普通辅助函数无需暴露 |
| 跨语言能力服务 | .mrpc → Go/Mini-Go/Rust/TypeScript 类型、客户端与服务端;管理元数据引用对应接口和方法 | 不再手写平行 JSON 分派协议或多份参数 Schema;接口声明不等于授权 |
| 从脚本发布服务 | 对 MRPC 可表达的签名可单向生成 .mrpc,再使用库生成器 | 明确输入与派生产物;无法映射的类型报错,不承诺任意函数跨语言调用 |
表单、蓝图、模型调用描述关联接口修订,服务产物另记录所支持的接口和实现修订;纯实现变化无需伪造接口变化。TinyAGI 的注释/元数据生成器仍是待实现的设计,MRPC 生成器则是库已有能力,二者不能混写成同一验证状态。现有声明示意中的 int 等内部类型不直接成为 MRPC 类型;跨语言发布遵循库的固定宽度等类型约束。
接入选择与工具链
| 实现 | 默认承载 | 选择理由 |
|---|---|---|
| 稳定且受信任的 Go 宿主能力 | 生成 Provider,经本地 Host/FFI 或 LocalBinder 调用 | 复用 MRPC 类型与调用句柄契约,避免为了本机调用增加网络服务 |
| 动态原生 Go/Rust 能力 | 系统工具链构建独立程序,由宿主管理,通过 MRPC 发布服务 | 复用相应 SDK/库,减少原生动态装载及 ABI 管理负担;不要求服务端嵌入 VM |
| Node.js(JavaScript/TypeScript、npm)能力 | 生成 TypeScript ESM 绑定并形成 JavaScript 程序包,由宿主管理 Node 子进程,通过 SDK 发布 MRPC 服务 | 复用 npm 生态与既有 JavaScript SDK;不要求服务端加载 Mini-Go Program,Node 运行环境与 SDK 分发文件按固定版本装配 |
| 小型试验与认知编排 | Engine 检查/编译/测试,Program 实例化后调用命名入口 | 复用已有 API,按需创建独立状态,不复制整个 AGI |
| 外部模型、向量与工具 | 官方 SDK/原有协议适配 | MRPC 用于本项目能力边界,不要求第三方改用该协议 |
宿主调用已配置的 Go 工具链、Cargo/rustc,或 Node.js/npm 与需要的 TypeScript 构建工具,记录版本、目标平台、依赖与锁定输入、源码/接口及生成器身份、构建参数和产物摘要。复用缓存须满足输入身份及处理范围;原生 Go 适合已有 Go SDK,Rust 适合相关库或明确原生处理需要,Node.js 适合 npm 生态中的 SDK 与业务整合;按现成依赖、运行条件及任务需要选择,不预设某语言必然更快。工具链为可选能力依赖,安装及更新沿已授权维护操作处理;缺少环境时报告依赖不足,不假定核心内嵌全部编译器。
MRPC 本地固定绑定足够时不使用 Router;动态 Provider 才使用 Router。Go/Rust 跨进程能力使用库已有的 Unix socket/WebSocket 接入,支持平台上优先受限本地 Unix socket;当前 Node RPC SDK 使用 WebSocket,采用明确配置的受限回环 ws/wss 接入,不把原生端的 Unix socket 能力推定给 JavaScript SDK;Gateway 作为库装配,不要求启动独立中间件。业务 RPC 不另设未经库确认的 stdio 传输。发布入口与调用路由由宿主管理,不能对候选开放任意 fallback 或未授权服务。
Node.js、npm 与 JavaScript RPC 的装配
.mrpc 仍为跨语言接口唯一来源;用 -ts-out 生成 TypeScript ESM 绑定,再由项目构建流程生成 JavaScript。Node 能力使用 @d7z-team/mini-go/rpc 的连接、生成客户端和 Provider 适配,不另写一套 JSON RPC。
当前 SDK 内部使用 Worker、Rust WASM Endpoint 与 WebSocket,无需创建 MiniGo 或加载 Program;“无需 Mini-Go 程序”不等于没有 SDK 的 WASM/Worker 分发依赖。接口沿JavaScript RPC 记录解释,当前分发及验证范围见更新基线。SDK 的编译器与语言工具可供非 Go 工具端按需使用,不改变核心 Go 宿主的编译职责,也不要求管理页面取得原生能力。
采用产物包含实际 JavaScript 入口、生成绑定、包清单、依赖锁定输入及必要分发文件,并关联 Node、npm、SDK、生成器和可选构建工具身份;源码、依赖或 SDK 改变均形成新的实现候选。依赖取得、生命周期脚本及打包过程只在获准准备环境执行,正式启动使用已准备产物,不默认临时安装最新版包。复用已构建 SDK 分发包与从库源码构建 SDK 分别记录条件;包名或本地版本号不证明已从公共仓库取得某一发布物。
Node 服务按既有子进程机制准备、启动、publish、绑定、替换和关闭,其 Worker、连接及下属工作由该运行对象负责。宿主显式传入调用期限与取消信号;SDK 取消等待不当成处理函数或其外部动作已经停止,terminate() 也不替代完整清理。断线后原绑定及资源按实际契约失效,重新连接、bind/publish 经原任务与授权核对,不能自动重发不明动作。接口的 64 位整数、字节、可选值和资源沿生成类型处理,不经通用 JSON 转换损失精度或归属。
npm 程序与原生程序共用实现信任、Secret 投影、执行环境准入、父活动预算和沙箱规则;Worker 分离或 WASM 计量不代表整个 Node 服务被隔离。SDK 同时支持浏览器是库事实,这里仅讨论 Node 能力端,不因此让管理页面脚本直接获得宿主能力。Web 工作台仍由核心提供管理 API 和内嵌页面,选用 Node 能力不要求另设管理服务。
局部 VM 服务与子进程管理
宿主封装局部 VM 的创建、检查、执行、观察、取消和结果读取,并可经 MRPC 向获准认知程序提供。每次试验使用独立 Instance 与受控 FFI,允许复用不可变 Program;较长试验通过 Operation/结果事件接续。不得从 FFI 同步重入同一活跃 Instance,也不把 VM 逻辑额度解释为整个进程的 CPU/RSS 限制。
Go/Rust/Node.js 外部能力工作由宿主管理:依赖准备、构建、测试和一次性转换是任务进程;持续提供能力的是服务进程。状态覆盖准备、启动、接口可绑定、运行、退出与清理,关联 PID 等运行身份、所属活动或已安装能力、固定产物与用量。进程退出信息、RPC 就绪和业务成功分别记录。子进程树及其输出、取消和结束责任归启动者,不能用直接子进程已退出证明全部后代已停止。
Go os/exec 提供启动、管道、等待和取消基础;面向 TinyAGI 的进程管理及经 RPC 暴露的局部 VM 服务是本项目待封装能力,本次库快照未确认现成通用实现。标准输入输出可用于构建诊断及受控命令交互,业务 MRPC 连接仍遵循上述传输契约。
实现替换与资源归属
认知脚本补丁与外部能力 Provider 替换分别执行。Go/Rust/Node.js 服务更新先准备固定产物,启动候选并核对接口和可绑定性,再用 Router 的准备/替换机制更新 publication。库中旧客户端绑定旧 Provider,因此宿主还必须在受影响执行边界更新绑定:同一次执行保留固定实现,新执行选择目标实现,调用描述与实际绑定一致后才报告提交成功。
旧执行句柄留在创建它的 Provider 与连接上,不能自动迁移;需要新实现时显式重开或转换,否则继续记录旧执行句柄的收束。MRPC resource 是临时会话对象,不写成 SQLite 中可恢复的唯一业务身份,也不复制进试验主体。旧 publication 的实际关闭与 backend 释放由其所有者负责,停止新绑定不等于既有调用已停止。
服务可以长驻并被多个活动复用;认知的有界调用不要求每次重启服务。宿主能力可按权限被服务反向调用,使文件读取、产物提交和状态修改仍沿原所有者处理。外部能力进程不取得业务 SQLite 或全部主体状态的直接控制权。
构建环境、机密与输出
文件读取、可写目录、网络、环境变量及实际计算资源限制覆盖依赖处理、代码生成、构建、测试和运行。Cargo 构建脚本及包准备中获准的脚本执行也在控制范围内,控制不能等到最终能力程序启动才开始。需要隔离的候选统一使用受控容器执行,不将进程分离或 VM 限额当作完整隔离证明。适配器须声明实际可强制执行的文件、网络、进程、资源与输出限制;宿主按候选所需约束选择可用环境,无法满足则拒绝构建/运行该候选,不降级到普通生产进程。
功能采用记录与实现信任记录分开;后者绑定受信维护者或既定发布策略、来源及产物摘要、适用用途与敏感能力。接口稳定、MRPC 类型正确、沙箱通过或候选自称可信都不能自动授予原值访问;新产物按原发布策略重新核对,不强制已有自动授权范围每次再人工审批。
默认不继承宿主完整环境与凭据。Secret 由独立机密模块管理,宿主代理使用与按读取授权向 RPC 执行方交付原值并存;后者核对固定产物、接收方、当前 SecretGrant 和审计条件,经专用通路返回或注入。认证数据不进入模型、普通事件、日志、索引或试验快照;沙箱执行方领取须有单独的测试授权。构建和运行日志先经确定性过滤,再由相应操作保存为受限记录;模型只见状态与投影,按需读取。大对象使用 MRPC resource 分块读取,不将 SecretRef 映射为普通内容读取句柄。
依据、替代项与适用边界
go-mini 适用提交、实测范围及更新流程唯一维护于库参考;RPC 机制与Node/TypeScript 契约保留各自来源,早期实验仍按原提交解释。下列在线官方资料未固定成本项目工具链依赖版本:
| 一手来源 | 支持命题 | 设计推论与边界 |
|---|---|---|
| Go os/exec | 提供外部命令启动、I/O、等待;CommandContext 默认取消直接 Process,不自动调用 Shell | 可封装宿主进程管理;进程树回收及完整沙箱是额外职责,不能声称标准库已经全部保证 |
| Cargo Build Scripts | Cargo 在包构建前编译并执行 build.rs | 构建阶段也纳入受控环境;文档的 OUT_DIR 使用约定不等于强制文件隔离 |
| go-mini 固定提交读取记录 | 多语言生成、本地/跨进程绑定、资源及替换、独立实例 API | 优先复用库;不证明本项目构建与采用闭环已实现或具有特定性能 |
不采用全函数 RPC 化、另一套跨语言序列化协议、每项局部试验复制完整主体或默认常驻所有服务,原因是增加重复状态、成本与生命周期负担。进程内 Go plugin/Rust 动态库热装载不作为默认,避免为动态能力引入额外 ABI 与宿主稳定性耦合;这是工程取舍,未经性能对照。能力种类可继续扩展,但构建成功率、运行成本和真实任务收益没有新增实测结论。
3.7 主动学习扩展的接入与强度控制
学习策略作为可替换的 go-mini 受管理模块接入,原生计算及试验工具经 MRPC 能力调用;复用 activity、knowledge、programs、execution、evaluation 及管理配置,不增加独立学习服务、数据库或进程。长期方向使用 Goal,问题使用 Episode,构建/练习/试验使用 Operation,知识候选由记忆维护,程序候选由构建职责维护,报告正文归资料,评价结论归 evaluation。核心 VM 不需要理解“兴趣”“学习议程”等业务概念。
| 接入边界 | 工程映射 | 设计限制 |
|---|---|---|
| 选题与进展 | 受管理入口读取获准议程/观察投影,提出学习活动及下一步 | 按需执行,扩展启用不等于启动永久推理循环或内置闹钟 |
| 读取、实践与构建 | 沿已有 Host/FFI、MRPC、工具链和 Operation 路径 | 继承父活动的可信来源、执行域、预算和资料处理范围 |
| 候选试验 | 独立 Instance、能力组合或主体级试验;复用不可变程序及符合范围的缓存 | 不复制生产凭据和资源会话,分支不新增学习额度 |
| 自我迭代 | 当前策略提出候选源码/配置,通过已有生成、评估及调用边界切换 | 评价条件、强度配置及实际历史由宿主管理,候选无权自行覆盖 |
| 强度与停止 | 管理配置映射为宿主准入、实际用量、并发/分支及连续推进上限 | 零强度在调用模型之前拒绝自发学习准入,不仅在提示词中要求停止 |
学习强度配置从受信管理通路提交,宿主在选题调用、操作进入、子工作接纳、接续及自动采用入口核对当前限制;不能仅在编译策略或启动 VM 时读取一次。配置修订不要求中途热补丁:关闭和调低额度作为运行控制执行,普通代码/配置的单次执行一致性仍沿既有契约。下属 VM、能力子进程和后续事件保留原活动来源,换服务、换实例或保存再读取候选不能绕过关闭。
关闭后终止自发学习的新增准入、接续和自动采用,按所属 Operation/scope/Provider 管理在途取消及清理;共享模型、能力服务、正常主体认知及普通活动不随学习关闭而整体停止。迟到结果只登记状态或受限产物,不再启动学习。已关闭状态在宿主重启后仍从已保存配置装配,不因重新创建实例变成启用。用户明确学习任务使用独立接纳范围和预算,不隐式调整主动学习开关。
学习策略的库依据复用MRPC 与嵌入核对,所核对的库接口不包含自主选题、学习强度或学习收益评价;这些是 TinyAGI 的宿主与策略设计。强度的逻辑语义见运行协议,工作台见学习管理。课程、反馈记忆及代码迭代的原论文依据集中于资料索引,没有本项目实际性能或学习效果数据。
模型参数训练保留为外部训练能力接入选项,管理训练任务、数据许可、候选模型和采用绑定;当前不选择训练框架,训练与推理继续通过外部服务接口接入。具体学习算法、工具链参数及强度档位数值按用途配置,实验性不等于已经运行实验。
3.8 模型维护与机密处理
维护入口位于同一 TinyAGI 宿主,连接模型资产、加载状态、服务配置和能力绑定。远程维护只执行提供者真实支持的接口;下载、卸载或删除以维护操作记录,不依赖模型生成管理请求。
Secret 是独立模块,元数据及 SecretGrant 可使用现有 SQLite,原值使用受限本地存储。密文或操作系统凭据设施可作为保管方式,解锁材料与普通导出分开;无需增加独立服务。加密保护保管与传输过程,防止错误外发仍由真实接收方、目标接口和数据路径落实,具体库与平台适配按接入选择。
Web 使用固定受信控件和专用 API,CLI 可用无回显输入或受控流;专用指令不带明文参数,在普通请求日志、聊天记录和模型调用之前分流。用户可以维护自己的凭据,管理者可按权限调整归属及使用配置。临时入口绑定用户、用途与有效期,接纳有效提交后失效;原值不放 URL,入口凭证不进入普通日志、远程内容分析或通用通知。
输入页面不加载任意动态脚本、第三方录屏或分析组件;动态工作台通过隔离的受信控件完成提交。无原值权限的中继只转发面向保管方封装的数据,宿主仍核对提交身份。获写入权的组件可以提交自己已有的新值,不自动获得旧值读取权限。
普通配置、认知 VM 和模型请求持有 SecretRef。宿主适配器在最终认证字段注入原值,或将原值交给受信 SDK/RPC 实现;不放进通用环境、任意临时文件或默认日志。远程模型服务的认证头与其推理正文是不同接收用途,配置允许前者不意味着允许把凭据写入提示词。
实际接收方、RPC 交付与返回处理
Go/Rust/Node.js 能力端以宿主绑定的服务及实现身份调用专用机密接口,SecretGrant 核对实际用途和目标。原值直接到达指定组件,普通工具响应只返回引用、状态或业务结果。MRPC 的认证、拦截器及传输是接入工具,不自动提供 Secret 隔离;绑定和序列化检查由 TinyAGI 适配,见库事实。
若计算组件确需处理原值,配置必须明确组件身份、输入用途、后续服务和输出范围,使用独立注入及记录路径。组件可为模型或程序,可本地运行或远程接入;这些标签不代替信任判断。特殊输入不混入默认上下文保存、缓存导出、遥测和调试记录。受信组件若调用其他远程 API,该目标仍须在允许范围内,不能沿普通代理或重定向自动携带凭据。
确定性管线执行可信输入、字段校验、保管与引用、用途核对、认证注入或原值交付、返回处理。凭据编码不等于脱敏;业务结果不因使用认证就全部成为 Secret。返回中的认证回显、异常载荷和请求头不进入普通输出,无法安全分离时只返回状态。额外原值处理规则采用受信配置,不由模型临时生成一段过滤代码自行授权。
必要记录保存 Secret 修订、操作者、实际接收方、用途、目标与结果,不保存原值。放行前记录决定,失败时拒绝新的原值交付,撤销和禁用仍可执行;执行方上报与宿主观察分别标明。更换凭据或撤销约束后续访问,已经交付的静态值需通过上游吊销、轮换或到期失效。试验配置单独绑定允许的凭据用途,不把生产原值和授权复制进初态或快照。
逻辑目的与边界见机密契约,归属、可信提交及管理操作见工作台。此处是接入方案,未声称已有端到端防泄漏实测。
3.9 模型接入的证据与选择
实验使用同一模型网关的chat/completions接口承载 JSON 动作。请求标识kimi-k3、deepseek-v4-flash对应实际响应k3-256k、deepseek-flash;没有独立核实上游权重或固定快照。服务修复与功能轨迹见报告015、016,参数及接续对照见017。
| 接入方面 | 已有依据与当前处理 | 不能据此推定 |
|---|---|---|
| 普通消息中的 JSON 动作 | 独立脚本已完成读取、交付、修订与事件接续;提案仍须经宿主接纳 | go-mini/SQLite/向量 SDK 组合、原生工具及流式已验证 |
| 截断与错误 | 保留原始停止原因和 usage;运行记录区分 length 截断、空内容、JSON 错误与服务故障 | HTTP 成功等于存在可用动作,或空内容就是自主拒答 |
| 生成额度与投入档位 | 分别测试默认/1024、low/1024、默认/2048;没有跨任务一致收益,暂不更改统一默认 | 参数被接受就等于网关真实透传;更大额度或更低投入必然省成本 |
| 用量与缓存 | 保存网关原字段及实际恢复调用;按复用接入区分输入处理、结果复用和费用口径,冲突及未知明确保留 | 官方缓存能力或折扣已由网关透传、确定账单、跨模型速度排名或完整服务隔离已验证 |
DeepSeek官方投入说明给出推理档位与默认设置,并区分普通消息和原生tools的推理块续接;接口契约定义生成上限和截断含义。这些支持参数候选及错误映射,不证明网关身份、最优额度或任务可靠性。未来接入原生工具须另按提供者契约保留必要续接块,不能照搬报告 017 中普通消息的处理方式。
3.9.1 可选的外部认知辅助组件
分类、重排和记忆整理等开源组件通过既有 RPC/API 适配接入,按实际用途定义接口,不将某产品的判断类型固化为核心契约。支持本地运行或远程服务,运行环境属于可选依赖;管理与沙箱复用已有装配机制,领域视图、Secret、预算及必要执行隔离沿原规则处理。停用或替换时保留原始资料和主体状态,能用既有方法就继续,任务确有依赖则报告缺失,不自动扩大处理范围。
资料范围为官方在线文档及仓库默认分支的说明、许可证。以下资料支持将局部判断与生成式综合分工的思想融入有限思考,不证明本项目质量或性能收益。接入原则与候选状态见决策台账。
| 对象与一手来源 | 已确认范围与接入边界 |
|---|---|
| Jev 模型说明,Jev 1.13 | 官方提供托管 API;未确认模型权重及本地推理实现的开源发布,不将其登记为已可本地运行的开源模型 |
| System One Adapter及 MIT 许可证 | 可用其他 LLM API 完成相同形式的结构化判断;接口相近不意味着相同速度或概率质量 |
| Jev-Mem及 MIT 许可证 | 记忆组织与检索代码可复用;真实模型路径依赖配置的模型服务,离线演示使用模拟判断。派生索引与原始业务状态分别归属 |
3.10 外部检索提供者与 API 接入
向量检索服务与 Attemory 是同级的外部检索提供者。 两者经公共检索契约用于记忆、资料、程序定位和能力发现等已定义领域;支持独立登记、发现、指定调用、用途配置、维护和评价,实际安装与启用可选。TinyAGI 实现接入与请求组织,检索引擎、计算及服务侧数据维护由组件负责。逻辑契约
3.10.1 共用接入与本地/远程配置
Go 宿主优先使用提供者已有 API 或 SDK,适配器转换请求及有类型结果。已有 HTTP 接口可直接接入;需要受管理的本地桥接程序时才使用现有 RPC 与子进程机制,不为所有提供者增加必经桥接层。领域入口决定查询含义,策略选择单次、并行、分步或替代调用;适配器不要求每个实现支持向量特有字段。
| 配置 | 连接及数据责任 | 适用边界 |
|---|---|---|
| 同机独立服务 | 宿主通过 API/SDK 连接本机端点,服务管理自身文件与检索状态 | 当前向量初始配置为本地单节点;组件可选,需考虑本机容量与任务竞争 |
| 远程自建/托管服务 | 连接获准端点,认证引用和传输条件按实际服务契约装配 | 查询、背景和材料均须允许交给该提供者;不能从接口可连接推定具备认证、过滤或管理能力 |
同一产品优先共用适配器处理连接差异,不默认双写或联查全部服务。管理页面仅展示实际支持的操作;查询权不包含维护权,Secret 通过专用授权绑定使用。外部服务不接管主体调度、领域业务状态或原文真值。
| 保存位置 | 内容与责任 |
|---|---|
| SQLite 中的领域记录 | 资料、记忆、程序及能力说明的身份、修订、来源和许可 |
| SQLite 中的接入记录 | 提供者及策略配置、外部空间引用、提交材料映射、操作记录和服务报告的覆盖;不复刻服务内部状态 |
| TinyAGI 本地文件 | 各领域原始内容、证据和产物,按实际所有权维护 |
| 外部检索服务 | 接收的材料副本或检索表示、派生索引以及服务自身运行数据 |
准备材料和持续同步各有明确范围与后台任务。主体只取得获准描述或明确请求的片段,服务返回的全部文本不自动入模。跨域结果保留类型,组合按来源对象、修订及片段关联;得分和排序附带提供者语义,不直接跨实现相加。覆盖不足与调用失败可触发允许的替代策略,所有分支和重试计入原认知或活动预算。管理、评价
3.10.2 向量服务适配
向量检索通过 SDK 接入独立向量数据库,当前初始配置选择 Qdrant、本地单节点。该选择只确定向量路线的默认组件,不规定所有领域先用向量,也不降低其他提供者的接入地位。服务端不必使用 Go,索引引擎无需链接进核心。
选择依据是官方客户端、部署复杂度和过滤契约。Qdrant 官方 Go SDK github.com/qdrant/go-client/qdrant 使用 gRPC,提供本机与远程连接、集合、写入、查询和过滤示例;本地单容器及持久目录便于初始装配。实际接入须固定服务端与 SDK 版本。向量服务依据
| 向量实现 | 当前取舍 | 理由与边界 |
|---|---|---|
| Qdrant+官方 Go SDK | 向量路线初始配置 | 职责集中,来源映射和过滤方式与接入契约匹配;未取得本项目 SDK 组合或检索性能实测 |
| Weaviate+官方 Go SDK | 可替换选择 | 官方 Go 接入与单节点路径明确;需要其特定能力时按用途配置,不迁移领域真值 |
| Milvus+官方 Go SDK | 暂不作向量默认 | 所查 Docker Compose 组成超出初始简化方向;不推广为全部部署模式的限制,客户端以主仓库现行路径为准 |
| 嵌入式索引及 SQLite 向量扩展 | 暂缓嵌入路线 | 当前使用外部服务,不承担索引引擎的核心内构建;未做性能对照,不宣称方案被实验证伪 |
各领域提供获准内容和修订,embedding 提供者生成向量,向量适配器执行条目维护及查询。Embedding/VectorIndex 只表达此路线的调用分工。条目关联执行域、对象类型、标识、修订和片段,模型、切分、维度和度量作为该适配的配置;维度相同不保证兼容。数据库点 ID 不替代业务身份,payload 只保留定位及过滤所需信息。
分别核对 embedding 服务和向量数据库的材料处理范围,查询向量及过滤字段也受约束。配置与原领域状态变更形成明确的准备或清理操作,服务报告完成后记录可确认覆盖;本地业务变更不表示索引已经同步。检索结果核对当前来源,过滤不能冒充已删除。
3.10.3 Attemory 适配
Attemory 经已有 HTTP API 接入;官方 Python 客户端是可复用的另一种接入方式,不要求核心增加 Python 运行依赖。它与向量适配同级,可独立配置为某类查询的提供者,也可参与组合。TinyAGI 只对接材料准备、查询、状态及服务支持的维护操作。
| 对接职责 | 适配方式与本地记录 |
|---|---|
| 服务登记 | 配置端点、提供者身份、适用领域、处理范围和支持操作;记录连接与服务报告状态 |
| 材料准备 | 映射外部检索空间,提交获准文本及来源标识,请求准备;保存与业务对象、修订和片段的对应关系 |
| 查询 | 将问题、允许的背景与数量要求映射到服务 API,返回来源明确的候选描述或获准片段 |
| 结果整理 | 按接口实际返回的排序及分组限制控制总返回量;进一步筛选须使用支持的操作并计入原预算 |
| 维护 | 按已声明操作查询、保存/恢复或删除外部空间;更新与删除粒度按实际版本处理,不虚构能力 |
服务中的 Session 作为外部检索空间引用,不等同于 TinyAGI 的聊天会话、人物或活动。上传的是允许处理的材料副本,原领域身份和来源修订仍由 TinyAGI 维护。程序定位与能力发现通过对应领域选择允许检索的说明或内容,不把程序执行权、机密原值或全部人物历史作为检索材料。
采用已有接口可减少接入工作,代价是承担服务运行、材料准备、覆盖滞后和接口差异。当前确认依据是官方接口资料,不是本项目端到端验证;不采用厂商性能数字作为默认收益,也不把具体接入参数列为必须先完成的新实验。
3.11 可选的原生容器执行能力
容器执行适配承载预制隔离执行契约中的额外系统隔离,不替代核心基础受限执行。稳定入口与宿主适配随客户端维护;引擎、基础镜像和工具链是可选依赖,不自动安装、提升系统权限或随主体初始化启动。首先面向 Linux 接入 Rootless Docker,公共接口保留其他合格提供者的扩展位置;不要求同时维护多种引擎,也不引入集群控制面。
宿主负责生成受约束的执行请求并调用引擎,Self 只提交用途、能力及计算资源需求。Docker socket、任意引擎 API、特权参数和宿主挂载配置不暴露给候选。高风险远程调用的本地实现、不可信解析、动态 Go/Rust/Node.js 程序、Shell 及依赖脚本在容器内运行;普通路径仅承载满足其准入条件的受信能力,不能通过直接 os/exec、FFI 或 MRPC 绑定绕过检查。远端服务本身的运行位置不由本地容器控制。
默认约束与实际能力检查
| 范围 | 宿主装配要求 |
|---|---|
| 系统权限 | 优先无特权引擎和非特权容器用户,裁减 Linux capabilities,启用适用的 seccomp 与系统访问控制;不开放特权容器、宿主命名空间或容器管理 socket |
| 文件与产物 | 只读基础文件系统,按许可提供输入,分配独立可写工作区;不挂载主体数据库、完整用户目录或宿主根目录;取出产物仍经资料或程序产物接纳入口核对 |
| 网络与认证 | 无需联网时禁用网络;需要时按目标、用途与操作装配受控出站路径,限制非授权内网及宿主入口;代理环境变量本身不算强制隔离,不保留绕过受控路径的直连 |
| 计算资源投入 | 核对并配置 CPU、内存、进程数、期限和可写空间的有效上限;所需限制不可执行时报告不足,不把参数已设置当作已生效 |
| 实现与供应来源 | 镜像、代码、依赖锁定输入、运行时及执行配置关联具体修订或摘要;摘要标识内容,不单独授予来源信任;准备及构建脚本与最终运行同受限制 |
| 输出与机密 | 不继承宿主完整环境和凭据;代理使用与原值交付分别核对 SecretGrant、实现及审计;普通日志/产物先过滤,普通认知及内容输出保持引用,特殊原值处理按实际组件与用途配置 |
Rootless 降低引擎与容器依赖宿主 root 权限的范围,但不自动提供全部限额。环境检查须报告实际内核、引擎、cgroup 与控制器条件,网络及文件限制同样按所选提供者核对;约束不满足时该执行不可用。具体开关、额度及运行时版本由用途配置确定,不能把已安装 Docker 当作全部请求均可接纳。
构建适配器也不能通过向候选挂载引擎 socket 获得便利。依赖下载、包生命周期脚本和编译安排在相应容器执行范围内,正式运行使用已准备产物;构建阶段的联网资格不自动延续到运行阶段。容器取得的原始材料须满足外部处理许可,执行组件加载程序或使用材料不等于模型已经读过它们。
调用、复用与停止
一次构建、任务或受管理服务会话可对应一个持续执行环境,多次 MRPC 调用复用原实现和作用范围;不按每个 RPC 重建容器。不同用户、试验分支或信任范围默认不共享可变环境。传输适配只开放所需业务通道,并绑定原操作身份及回调范围,不开放宿主通用管理端点;容器环境的传输装配不作为既有 go-mini 库已验证的行为。
宿主保留容器运行身份、原 Operation、固定产物、实际限制、用量及收尾状态。停止按任务范围传递到所属容器工作,清理子工作和临时目录、连接及执行句柄;控制请求发出、持久接纳、进程停止及远端效果核对分别显示。共享受信服务只结束目标任务的使用,不以中止一次调用关闭其他任务。引擎失联时记录实际未知状态,不宣称全部停止,也不转到宿主重新执行。
容器镜像及可共享的只读缓存按来源、修订和处理范围复用,工作目录与可变会话按原范围隔开。产物收集、日志登记和清理属于原执行责任,仍受限额约束;容器退出不自动表示任务已交付或全部临时目录、连接及执行句柄已回收。管理页面见执行环境。
选择理由与替代项
采用容器是为动态能力提供可管理的文件、网络、权限和资源边界,同时复用现有运行生态;Rootless Docker 是首个工程接入选择,未由性能对照得出最优结论。成本包括额外运行时、镜像维护、启动及兼容性限制。其他引擎可作为同一契约的后续提供者,当前不同时展开实现。
需要进一步减少不可信程序接触宿主内核时,预留 gVisor 等增强隔离提供者。增强环境有自己的兼容性和系统调用开销,必须按实际组合报告能力;不预设它与任意 Rootless 配置均可直接组合。任务要求增强隔离而环境缺失时拒绝该执行,不降为普通容器。
不采用全能力强制容器化、把 TinyAGI 核心一并迁入容器作为前提、每次调用新建容器或缺失时回落宿主;这些方式分别增加环境依赖、耦合及启动成本,或违背准入要求。资料支持见来源表,实际状态及适用边界见设计台账。
3.12 计算节约与复用的工程接入
沿逻辑节约契约,Go 宿主在原模型、读取、检索、构建及运行适配器中利用现有机制。小型热点结果可在进程内有界保存,派生文件和必要索引信息沿现有本地文件/SQLite 承载;不新增 Redis、统一缓存服务或 TinyAGI 分布式部署。原始材料、主体状态和正式产物独立于可清理缓存。
3.12.1 提供者和本地组件映射
| 接入位置 | 采用方式与条件 |
|---|---|
| 模型请求装配 | 复用同修订输入块的稳定表示,工具及格式描述来自同源契约;追踪元数据不混入提示。角色、语义顺序、材料选择和必要动态状态不为缓存改变 |
| 自动前缀缓存 | 调用实际支持的服务,由适配器保留用量和命中反馈;请求相同不保证命中,缓存不是普通结果文件或业务记忆 |
| 显式缓存边界/引用 | 仅按实际模型和端点支持的参数配置;持有引用不等于可向新身份或用途交付内容。失效后允许普通请求,不要求认知生成厂商控制字段 |
| 网络读取 | 利用 HTTP 的验证器和条件请求确认表示仍有效,按 Cache-Control、Vary、认证及当前访问范围复用;未变化回应不等于所有下游结论仍有效 |
| 在途只读工作 | 可复用 Go singleflight 或同等机制合并相同执行;外围宿主仍维护请求归属、各等待者取消、共享执行控制及预算,库本身不提供这些业务保证 |
| 解析与确定计算 | 关联内容修订/摘要、范围、实现和参数;复用键及日志不含 Secret 原值。需要随机新样本或独立模型判断时,不合并生成结果 |
| 检索准备 | 向量路线按内容片段、嵌入模型和切分配置复用表示;查询另核对过滤、范围及索引覆盖变化。Attemory 等按实际更新接口接入,不虚构局部重建能力 |
| 能力构建 | 优先利用 Go、Cargo、npm 与容器构建工具的依赖/构建缓存;源码、锁定依赖、生成器、工具链、目标和选项继续关联产物。缓存命中不授予执行或采用资格 |
| 认知程序编译 | 复用 go-mini 自带的编译缓存与会话;源码、依赖导出、泛型模板、构建标签和优化选项按库规则参与有效性判断。固定提交的契约与回归范围见缓存记录 |
| 连接与运行环境 | 复用合格 HTTP Transport、RPC 连接、已加载服务和受管理环境;限制空闲占用、并发和保留范围,身份会话及可变工作状态独立装配 |
| 后台批量接口 | 明确允许等待的准备或评价工作可接入,保留期限、实际完成和用量;不把同步请求自动转为长窗口批量工作 |
复用能力和计费口径绑定实际端点、账户处理范围、模型/实现及配置。应用内分组键不自动构成上游隔离;跨用途、试验域或身份共用只读准备仍须符合原信息范围。缓存放行也不能使特殊机密计算进入普通缓存、输入日志或诊断通路。
首次准备、重复使用、失效重建及空闲占用分别计量;写入/读取费用可能互斥或包含在其他字段中,按提供者原口径映射,不静默重复相加。预期避免的费用与服务报告、估算及最终账单分别显示。缓存配置和前缀发生变化时保留原因及相关修订,不必记录敏感正文来解释未命中。
3.12.2 一手契约、选择依据与适用边界
下列在线官方契约支持机制选择;实际接入按所用模型、版本、账户及端点固定支持范围。供应商调整参数、期限或价格时更新适配,逻辑正文不固化统一 token 门槛、保留时间或折扣。
| 来源 | 支持的命题 | TinyAGI 的采用与边界 |
|---|---|---|
| OpenAI Prompt caching,匹配、配置差异与输出说明 | 相同前缀和兼容请求配置可复用输入处理;不同模型的边界、期限和计费不同,仍生成新的输出 | 提供者适配映射支持的参数及原用量,稳定表示不等于任意提示重排无损,也不承诺逐字重复 |
| DeepSeek Context Caching,命中规则与使用统计 | 默认自动缓存,命中依赖已形成的前缀单元;返回 prompt_cache_hit_tokens/prompt_cache_miss_tokens,命中尽力提供 | 接入自动复用并保留反馈;相同公共片段不保证下一请求立即命中,官方契约不证明现有网关透传或折扣 |
| Anthropic Prompt caching,匹配、边界及计费 | 支持稳定前缀及缓存边界;缓存段须精确匹配,写入、读取及期限有各自价格 | 按预期重复使用和维护成本选择支持的方式;不默认预热、空请求保温或延长全部内容的保留期 |
| vLLM Automatic Prefix Caching,用途及限制 | 本地推理服务可复用相同前缀处理;收益取决于重复输入,不能等同减少输出生成工作 | 作为外部服务能力配置和观察,不在 TinyAGI 内实现模型引擎或创建其内部状态对象 |
| RFC 9111 §4.3 | 条件请求和未修改回应支持缓存表示的验证与复用 | 遵守来源验证及缓存范围;网络错误不能直接解释为材料未变化 |
| Go singleflight 与 net/http Transport | 同键在途调用可共享结果,HTTP 连接可通过 Transport 复用 | 利用已有库;各请求权限、取消语义、期限与成本归属仍由宿主负责 |
| Docker 构建缓存优化 | 依赖层及缓存挂载可减少重复下载和构建准备 | 在原工具链与隔离范围内复用,依赖及平台变化按构建契约重算;不因缓存存在信任产物 |
| OpenAI Batch API | 批量请求有独立完成窗口和计费条件 | 仅用于期限允许的后台工作;费用优势不能代替实时响应要求 |
采用分层复用,是为了利用组件已有能力并保留业务所有权;不采用自建通用缓存后端、合并独立推理结果、为了命中填充提示或按费用自动降级模型。已有报告仅支持各自读取、构建或模型条件,没有形成完整节约性能基线;设计与观测字段可确定,实际收益仍是适用边界。状态、评价
4. 领域状态与内容存储
逻辑上的提交、接续和外部不确定性见运行契约。以下说明领域接口、SQLite、文件与恢复机制。
领域接口与共用承载
领域对象在同一 Go 宿主内按状态所有者组织接口和记录。资料、记忆、程序、配置、模型、运行、检索及机密各自处理请求;不建立统一 Resource 表、必填公共属性结构或能访问所有对象的通用读写服务。SQLite 与本地文件工具可以共用,文件位置不决定业务归属或权限。
大段文档、媒体、源码、权重及必要记录可由文件工具承载,原领域保存自己的标识、修订、引用和约束;小文本可直接保存在 SQLite。内部字节定位不向调用者提供绕过领域授权的路径。内容共享或复用不得复制另一份可独立改写的业务真值,具体存储结构不在逻辑设计中规定。
查询编排调用各领域的受限查询,管理页面复用展示和关联组件。动态表单从领域接口及受管理函数描述生成,提交进入对应处理器;不让 UI Schema 变成任意数据库字段编辑权。文档读取、记忆查询、程序构建、模型加载及机密领取拥有不同的参数与返回。
跨语言接口继续复用 MRPC 生成与绑定。业务引用使用有类型的对象标识及必要修订,SecretRef 只用于专用机密接口。MRPC 的 resource 是服务所属的传输/调用句柄,保持库的原生命周期,不定义 TinyAGI 的业务对象分类,也不让协议句柄自带业务授权。完整库事实见接入记录。
读取/结果缓存由对应处理能力维护,检索提供者通过独立适配调用;共享来源关联、日志元数据及授权上下文工具不合并其所有权。机密保管和原值交付另见专用映射,不进入普通文件读取、认知工具响应或通用导出。
4.1 SQLite 提交机制
现有机制基线为 WAL/FULL、读取结束后短写;依据限于报告 010的条件,吞吐、checkpoint 和超时参数尚未选定。派发入口以条件状态转换共同裁决 queued → entered 或 closed;此事务不覆盖提供者的现实效果。
宿主为步骤绑定身份、尝试号和可撤销令牌。步骤读取固定上下文后进行计算,不持有长事务;每心智最多一个可提交步骤。不同心智可以并行计算,写入通过一个宿主写入通路串行安排;写入顺序不授予 Self 公共决策权,公共提案先沿整合职责处理。
步骤内需要先取得工具结果时,按独立操作接纳通过短事务保存 StepID、RequestKey、请求内容、Operation、预算关联及接纳回执,成功后才派发。相同请求键与内容返回原回执,冲突内容拒绝;该操作不等待最终 Continuation 才成立。
计算完成后以 BEGIN IMMEDIATE 开始短 SQLite 写事务,复核当前令牌、状态版本、授权、必要依赖及预算,将状态变化、尚未接纳的请求意图、既有操作引用、必要预留、输入消费、等待订阅和提交回执共同保存。既有操作只关联,不再次派发或扣取同一预留;步骤内实际读取的结果留存输入依据,最终提交失败不回滚已经独立接纳的操作。相同 StepID 与相同内容重试返回原回执,不同内容视为冲突。需要的新文件先按文件发布协议准备完成,再在事务中保存引用。
上下文读取结束即释放读事务,不将旧快照保持到模型返回。BUSY_SNAPSHOT 时回滚并重新读取/复核;普通写入竞争有界等待或重试,不能重发已经发生的外部动作。S1a 已观察旧快照升级失败及长读阻碍 checkpoint,生产参数仍待负载验证。
事务内不调用模型或外部工具,不等待大文件生成。提交后唤醒进程内派发器;内存通知丢失时,定期扫描数据库中的未完待办。等待条件与消费游标共同提交,并检查已经到达的完成事件,避免丢失唤醒。
正式任务控制与工作接纳按宿主持久顺序裁决,均携带目标类型和传播范围。经授权的实时通路可在持久化完成前先发送止动信号;阻断/中止状态须成功保存到 SQLite 后,才返回“控制已正式接纳”的确认。保存失败或结果未知时,分别报告失败或待确认,保留已知止动结果;不能因本地执行已停就声称任务中止已持久接纳,或承诺重启后仍有该控制。请求发送、接纳记录和提供者停止观察按控制契约分开呈现。
仅取消认知步骤时撤销旧令牌,拒绝其后续提交,已经独立接纳的 Operation 仍归原活动继续;中止 Episode/Task 或取消指定 Operation 时,才按其范围关闭派发并向所属在途工作传递控制。不能从“请求已接纳”自动推导该请求应被认知取消连带终止。结果复核实验表明串行写入不能补足遗漏依赖,进程/提供者实验只支持部分事务边界,不代表完整单机协议已测。
4.2 数据放置与文件发布
| 数据 | 放置 |
|---|---|
| 资料、记忆、程序、配置及模型的描述和关联 | SQLite 中由各领域维护,查询入口为视图或派生索引;不建立统一资源真值 |
| 主体、心智、活动、断言、关系、版本、事件、待办和必要账务 | 同一嵌入式 SQLite,由各状态所有者经统一数据入口维护 |
| 大段证据、媒体、代码和交付产物 | 本地文件,SQLite 保存逻辑引用、校验摘要与可见范围 |
| 小文本和结构化记忆 | 可放 SQLite,不强制所有内容外置 |
| 精确/时间索引、候选全文检索 | SQLite;FTS5 可选加速,分词随语料配置,不预设实际检索效果 |
| 外部检索材料与索引 | 本地或远程提供者维护,通过 API/SDK 提交获准材料;宿主记录来源映射、任务及可确认覆盖 |
| 读取/计算缓存 | 本地或相应计算提供者管理的可重建派生数据,不与向量索引混用 |
| 沙箱 | SQLite 分域状态、本地独立产物区、绑定试验范围的检索适配;允许的只读基准不覆盖 |
tinyagi 单个二进制
<data-dir>/
state.sqlite 业务状态;SQLite 管理 WAL/SHM
files/ 已发布证据和媒体
artifacts/ 认知代码、构建与验证产物
sandboxes/<id>/ 试验材料与产物
tmp/ cache/ logs/ 未发布文件、派生缓存与有界日志
runtime.lock 宿主独占锁的稳定载体
<backup-dir>/ 数据库与必要文件的完整备份
<retrieval-data-dir>/ 各本地检索服务分别配置;提供者维护,TinyAGI 不直接读写其内部文件
目录名是候选。远程向量选项只配置端点与凭据引用,服务侧数据不映射为本机目录。资料、记忆、程序和模型各自提供受限视图;宿主经对应领域接口核对范围后解析文件,路径不是授权。单数据目录只由一个宿主持有,Linux 候选使用稳定锁对象,不靠 PID 文件存在判断;不删除/重建在用锁或把锁句柄传给工具。
文件先发布,后提交数据库引用。失败可留下未引用文件,不能让已确认引用指向未发布内容。维护覆盖从发布到引用事务结束的完整阶段,备份/回收关闭新准入并排空相关工作和读者,不能误删在途文件。原实验支持其指定夹具条件,不证明掉电和完整产品恢复。
业务状态的 SQLite 与原始资料的本地文件保持不变;外部检索服务按提供者配置接入,不引入对象存储后端。服务自有数据目录不纳入 TinyAGI 文件发布/回收算法,清理由相应维护契约处理;重建取决于仍保留的来源、当前处理许可及服务支持,不能承诺任意历史材料都能重建。Go 驱动默认候选与组合验证范围见上文;生产负载和完整发行尚无验证结论,此为适用边界,不自动新增验证任务或启动产品实现。
4.2.1 个体自定义状态的承载
个体可定义自己的记忆辅助结构、策略状态和工作区内容,宿主在同一 SQLite 中管理其 Self/Mind/模块命名空间、逻辑标识、Schema 身份、结构修订、记录修订、可见范围、写入权限与迁移来源。载荷可用经过声明校验的结构化数据,小文本直接保存,大内容沿文件带类型引用;具体表结构与编码在实现时确定,不增加第二套业务数据库或任意 SQL 入口。
宿主校验归属、结构及版本,个体程序解释主观语义;公共目标、关系承诺、授权和预算仍由原所有者维护,不能因自定义字段同名而获得修改资格。表单描述绑定结构修订,未知结构保留原数据和受限维护视图。程序、Schema、配置与候选转换结果按一致采用边界准备;失败保留旧有效组合,回退也需满足当前状态及在途结果兼容性,不能单独退回旧代码后假定数据兼容。
试验按问题导入所需且获准的个体状态,保留定义、格式修订及必要迁移身份。导入限定支持的格式与程序组合,不自动理解任意扩展或遍历全部依赖;相关状态缺失不能用空载荷掩盖,无关状态不要求全量重建。完整逻辑见个体状态契约与试验初态。此为存储映射,无新增持久化或迁移实测。
4.3 重启、备份与保留
正常重启取得独占运行资格,检查存储和代码身份,恢复已确认状态,接续待办,核对未明效果。旧备份恢复需先停止旧派发,校验数据库、文件清单与代码,记录缺失区间,避免重放可能已经发生的外部动作;换身份不能抹去这段现实历史。
备份包含数据库和全部必要引用文件,不只复制数据库;删除、保留期、派生索引/缓存及备份中的副本分别管理。记录缺失如实可见,不能承诺在线删除清除了所有副本或总能重放。故障矩阵、恢复细节和新增参数实验继续暂缓,完整原规格见工程参考。
5. go-mini 接入与运行版本
go-mini 是嵌入式认知执行库,宿主提供状态、权限、能力和预算,脚本负责上下文、判断及协调。实例、scope、Step、活动和模型会话分别管理。生产与沙箱只装配受控接口,关闭 VM 不等于所有外部工作已停止。
候选程序独立构建,保留代码与来源身份;按业务提交边界和 VM 支持的补丁机制部署。旧闭包/defer 和带类型引用不因命名函数更新而自动升级;失败保留当前已确认版本,不自动重试现实动作。库事实和接口版本以go-mini 核对记录为准,不把上游最新代码与旧实验混用。
影子验证统一使用沙箱:录制重放、真实模型重新评估和反事实模拟分开报告;响应按请求含义匹配,缺环境夹具如实说明。没有完整调度和非确定输入记录,不宣称 VM 级确定重放;代码回滚不撤销现实历史。
沙箱装配的库依据
沙箱接入复用独立实例、受控能力和独立业务状态。对应库行为及其固定源码版本见库接入参考,完整隔离效果仍需在实际装配条件下评价。
试验主体复用正式的认知程序、宿主业务处理及能力端口,差异集中在初态、执行域、提供者绑定和输入输出去向。SQLite 中的试验状态、本地独立文件区及提供者映射按问题装配;宿主仅激活指定工作,不把导入的生产待办、订阅或学习议程直接放入运行队列。源 Self/Mind 身份仅用于追溯,状态读写始终绑定试验域。
初态可使用固定夹具、获准个体状态或已保存的活动状态,导入沿现有格式及兼容机制处理,保留程序和状态修订。完整状态导入按明确用途及支持条件选用,不为每个模块另建必须支持任意克隆的接口。数据库快照只承载已有数据;文件依赖和外部环境仍须装配,不以备份成功证明试验就绪。资料与设计边界
创建后默认暂停,记录所需条件、环境覆盖和实际用量。VM 栈、连接、生产授权、机密原值和外部会话不随初态导入;在途活动测试使用明确的后续输入及替代响应。重置或分支使用新的运行绑定,旧回调不能写入新运行,历史用量和父预算不变;采用只提交有明确范围的候选。独立 Instance 是执行手段,不承诺完整克隆或自动隔离,库事实仍沿固定接入记录解释。
6. 技术选择的一手依据
存储依据:SQLite 使用场景支持将其用于本地应用存储;同步配置说明同步级别及耐久性差异。它们支持机制选择,不证明本项目吞吐或硬件掉电行为。
下面支持能力事实或工程推论,未复现官方性能数据;本机组合实验单独报告。
| 来源、版本与定位 | 支持的命题 | 本项目推论/未测部分 |
|---|---|---|
| Go database/sql,go1.27.1、embed,go1.27.1 | SQL 通用接口与连接池、编译期嵌入文件机制 | 可实现嵌入数据访问与默认资源;不证明本项目事务、恢复或发行兼容 |
| modernc.org/sqlite v1.59.0,Overview/libc dependency | 提供无需 CGO 的 SQLite 驱动,要求配套 libc 版本 | 作为默认构建候选;性能、平台覆盖和复杂扩展仍需项目实测 |
| mattn/go-sqlite3 官方 README,Installation/Compilation,未锁定 tag | 通常构建要求 CGO_ENABLED=1 和 C 编译器,支持静态构建路线 | 选择依据是依赖偏好,不是认为 CGO 无法单二进制发布 |
| Go net/http、log/slog,API | 提供 HTTP client/server、可复用 transport 与结构化日志 | 标准库覆盖当前协议和观测基础;不证明应用限流、停机或隐私行为 |
| SQLite FTS5,§4.3.1/§4.3.4 | unicode61 连续字符 token、trigram 的短查询限制 | 中文检索需按语料验证;建表成功不作为问答/召回成绩 |
| JSON Schema Core 2020-12,方言与 vocabulary | 校验依赖声明的方言和关键字语义 | 各适配器说明支持子集,结构通过不能证明事实/授权 |
| Anthropic 工具定义、Ollama Chat,在线契约,无固定服务器版本 | 工具 schema、消息/调用结构及返回元数据存在提供者差异 | 模型端口保留工具关联和能力声明;未选定厂商/模型,也未实测这些服务 |
容器执行与隔离的资料依据
以下为官方在线文档,未固定本项目运行时发行版,也未运行安装、容器、逃逸或性能实验。来源支持机制与适用条件,实际接入须记录所用系统、引擎、执行配置及其能力。
| 一手来源与定位 | 支持的命题 | 本项目设计推论与边界 |
|---|---|---|
| Docker Engine security,namespaces、daemon attack surface、capabilities | 隔离涉及内核、引擎权限和配置;引擎可请求宿主挂载,只有受信调用者应控制它 | 宿主管理引擎入口,候选只获得受约束请求;不暴露管理 socket,不从容器存在推断绝对安全 |
| Docker Rootless mode,How it works/Prerequisites | 引擎及容器可在用户命名空间中以非 root 身份运行,有明确系统前提 | Linux 优先采用 Rootless 作为工程接入;减少高权限依赖,不替代文件、网络与计算资源约束 |
| Docker Resource constraints,默认行为与 Memory/CPU | 容器默认没有自动设置计算资源上限,限制依赖系统能力与显式配置 | 宿主按请求设置并核对限额,不能因使用容器就假定不会耗尽宿主资源 |
| Rootless Tips,Limiting resources | 文档所述 cgroup 资源控制依赖 cgroup v2、systemd 及实际控制器委托;条件缺失时相关标志可能被忽略 | 环境报告实际可强制执行的约束,不以参数提交成功代替生效;不满足必要条件时拒绝该执行 |
| Docker Seccomp security profiles,默认配置与使用方式 | 系统调用过滤是可配置的限制层,默认配置并不等同禁止全部系统接口 | 保留适用过滤及最小权限,不为使候选运行而自动关闭;具体配置按实际提供者确定 |
| What is gVisor?,What does gVisor do/How is this different;Security Model | 应用内核减少程序直接接触宿主内核的接口,提供 OCI 运行时;存在兼容性及系统调用开销的取舍,仍有安全边界 | 预留增强隔离提供者,不承诺任意程序安全或默认与所有引擎配置兼容;强隔离要求不向较弱环境降级 |
选择容器与 Rootless 优先级属于基于上述资料的工程判断;资料不证明 TinyAGI 的完整约束、远端动作授权、Secret 管线或停止流程已经验证。执行隔离、业务授权与认知沙箱仍分别成立。
外部检索接入的资料依据
Attemory 固定到官方提交 603c03afa9a04e48b778922eae156a0024752f37,该提交的 VERSION 为 0.1.3;仅阅读接口资料,未安装服务或运行检索。向量服务沿既有读取记录,两者的同级接入与用途策略属于本项目设计判断。
| 来源及定位 | 支持的命题 | 设计推论与适用边界 |
|---|---|---|
| Attemory README,接口层与使用流程 | 提供 Python/HTTP 接口,检索服务可返回条目标识、内容或代码位置 | 支持使用现成服务,程序定位可沿其领域入口接入;不据厂商成绩推定本项目效果 |
| Attemory 使用指南,Basic Concepts/Core methods/Search/One-Shot Search | 有空间、添加材料、准备、查询和状态操作;数量限制与结果分组具有具体接口语义,客户端标识不保证唯一 | 适配器维护来源映射,按实际返回整理候选;不假定所有维护粒度、过滤或总返回数量都与其他提供者相同 |
资料只支持此提交的公开接口和接入方式,不证明 TinyAGI 已完成适配、授权隔离、材料同步或性能对照。更新组件时重新核对支持操作与差异,保留领域契约,不将提供者内部实现写成本项目职责。
向量服务的资料论证
以下为官方在线文档/仓库,不是已经固定的实验依赖;运行前须记录服务端、SDK 和 embedding 模型的实际版本。Qdrant 是向量路线的初始选择,不决定跨提供者优先级;SDK 接入的判断来自这些契约,没有本项目向量性能实测。
| 来源及适用定位 | 支持的命题 | 设计推论/适用边界 |
|---|---|---|
| Qdrant 官方 Go SDK,README 的 Creating a client/Working with collections | 同一高层 gRPC 客户端提供本地及远程 API key/TLS 配置、集合、写入、查询和过滤示例 | 支持本地/远程共用适配契约;公共 API 是本项目设计,实际权限、兼容性、错误、用量及数据处理边界需验证 |
| Qdrant 本地部署,Local Quickstart | 单容器、本地存储目录及 REST/gRPC 接口 | 支持同机单节点候选;不证明完整安装、资源消耗或性能 |
| Qdrant 过滤、索引,Filtering/Payload Index/Vector Index | 支持 payload 条件及组合、payload 索引和 HNSW 检索机制 | 支持在查询中限定范围;当前许可仍由宿主核对,不预设带过滤召回与延迟数值 |
| Weaviate Go SDK、Docker 部署,在线指南 | 官方 Go 接入与单节点部署路径 | 可作为替代候选;未进行同条件性能或任务对照 |
| Milvus Docker Compose,所查示例标注 v3.0.1;Go SDK 迁移说明、当前 client | 所查部署包含 Milvus/etcd/MinIO;旧 SDK 指向主仓库中的新客户端 | 该部署组合暂不作为默认,不推广为全部模式的限制;未实测新客户端或其他部署模式 |
go-mini 库行为与接入参考
用途:执行库与接入参考(工程资料)。
库回归报告以提交 fbb16ee99748e84b523bbd677bd477258c358956 为更新基线,分别记录源码核对、库测试和跨语言互通结果。宿主组合实验仍按原提交 2f58a21748b92bae83ee37cca570ceb9bf387692 解释,不将新库测试外推为完整主体组合已经重测。
第 1 节按各自固定提交记录库行为与适用边界,其余章节维护宿主接入设计。运行分段、步骤约束和部署流程按当前设计决策与边界解释。库接口存在或回归通过不等于系统设计已经端到端实现。
早期基础核对使用 go-mini 提交 7c195d9(2026-09-18,feat: add revision diagnostics and improve runtime fairness)。结论来自文档、实现和测试源码阅读;记录的是该提交快照,不同提交的行为须分别核对。
TinyAGI 的独立研究模块使用同一提交执行了生命周期与补丁实验,没有运行或修改 go-mini 自身的回归测试。接口阅读证据与实测结果分别保留。
上游资料:架构、使用指南、RPC 指南。这些概览链接跟随上游主分支;下方事实表中的源码链接使用对应固定提交。
本篇目录:证据范围/更新基线/编译缓存/后续库更新 · 1. 已确认的基础/管理补充核对/命名入口依据/RPC 与嵌入补充/机密 RPC 接入/JavaScript RPC/弃用与源码事实/任务执行与控制依据/预制库依据/初始化适配/主动学习接入 · 2. 三层分工 · 3. 认知循环与运行分段 · 4. 业务安全边界与补丁提交 · 5. 部署标识与崩溃恢复 · 6. 回收与关闭 · 7. 影子验证的边界。
源码版本与证据范围
下方事实表按提交标识引用源码。复查时使用对应提交,不能以主分支当前内容代替历史证据。源码中存在测试用例,只能证明该用例已经定义;实际运行结果另见实验报告。
更新基线与接入影响
固定提交 fbb16ee99748e84b523bbd677bd477258c358956。与前述 a0d1558 比较,Go 的执行、FFI、RPC 和编译缓存实现没有新的行为变更;相关差异包括 TypeScript 生成器、工作区源码包头解析和编译身份。与 JavaScript 记录的 295eb19 比较,主要增加 Rust 编译器与语言工具整合、WASM 编译会话以及分发构建调整。下表说明当前接入边界,具体测试范围、失败和跳过见报告 018。
| 当前库事实 | 对 TinyAGI 的影响 |
|---|---|
Go 入口实现仍拒绝在活跃前台执行期间启动第二个入口;InstanceOptions.Parallelism 约束实例内部 guest task | 宿主继续调度有限认知入口。内部任务并行不替代主体与长任务解耦,也不允许同步重入同一实例 |
| 执行生命周期仍区分入口返回、scope 收束与实例关闭;旧帧/闭包保留旧 revision,新命名调用进入当前 revision | 保留执行中断、局部 scope 清理、业务任务独立管理及调用边界切换,不把补丁提交解释为全部在途工作切换 |
| 有界 guest 采样记录 generation、位置、计数及丢弃数量 | 可用于定位认知程序热点;不是完整调度重放、实际 CPU 费用或模型内部思考轨迹 |
Node SDK的 VM 调用经有界队列进入,每个 Worker 同时一个前台入口;独立 /rpc 仍可不加载认知 Program | SDK 排队不改变核心 VM 的重入限制;result、settled、close 与 terminate 各按原生命周期处理 |
Rust 编译会话与语言工具已整合进 mini-go crate;WASM /tools复用独立编译器 Worker/会话 | 后续非 Go 工具端可复用同一语言规则;核心 Go 编译适配保持现有分工,不因库新增入口额外部署编译服务 |
npm 包声明与 Rust workspace 源码版本均为 0.0.0-dev,分发版本由发布流程生成 | 采用时固定实际提交、分发物和锁文件;不能继续以旧快照的 0.1.0 表示当前源码,也不由本地构建推定公开仓库发布成功 |
机密仍沿专用接入记录处理。RPC 的 peer 信息、调用上下文与拦截器支持身份绑定和处理适配,不自动提供 TinyAGI 的 SecretGrant、原值隔离或审计服务。
编译缓存与增量准备
同一固定提交的 USAGE说明默认编译缓存与 MINIGO_CACHE;缓存集成测试覆盖重复构建、优化级别及构建标签隔离、依赖实现/导出/泛型模板变更、错误命中检测和后端失败回退。缓存身份与内容校验由执行库处理,TinyAGI 记录参与构建的源码、依赖、选项和工具链,优先复用现有机制。
缓存命中保留的是可复用编译产物;不保存完整运行实例,不保证旧镜像跨工具链兼容,也不证明主体程序语义没有退化。重复构建的命中与失效断言属于功能验证,尚无完整业务成本或时延收益测量。计算复用的工程边界
后续库更新的核对流程
每次更新形成新的固定提交记录,保留此前报告的源码身份与成绩:
- 记录候选提交、来源、工作区差异及对照基线;使用已提交快照或明确记录的补丁,避免读取过程中源码继续改变。
- 先检查公开接口、语义、生成规则、工具链和分发物的变化,再确定受影响测试。编译器、runtime、绑定、执行镜像及 SDK 必须按同一套来源准备;不以旧构建目录替代新快照。
- 在运行前固定问题、命令、条件及通过标准。复用上游用例,涉及 TinyAGI 组合契约时另设消费端测试;每轮均保留准备失败、测试失败、跳过和修正后结果,不覆盖首轮记录。
- 结果区分源码阅读、库回归、跨进程互通与完整主体行为。Go 使用
-count=1避免旧测试结果被计为新运行;编译缓存仍可复用,缓存契约用例使用自己的隔离后端。 - 更新本篇当前基线、工程映射、证据索引及设计台账;只有职责或语义确实改变时才调整逻辑设计。只测受影响范围,未运行的矩阵保留边界,不自动扩展为全部产品验证。
建议的检查入口为上游 make test 的选定包、make race 的选定包、make runtime-rust-rpc-test、make test-rpc-conformance 以及按用途选择的 WASM/Node 测试。跨语言服务、生成绑定与测试镜像先构建后消费;准备失败或测试被跳过不能记作互通通过。
1. 已确认的基础
本表适用前述早期固定提交 7c195d9;后续补充分别标明自己的提交,不能从相邻段落推定已经重新核对全部条目。
| 已有机制 | 核对位置 | TinyAGI 的用法及限制 |
|---|---|---|
| 完整 Program 比较 | runtime/patch_inspect.go:ComparePrograms | 查看结构、声明、能力和符号变化;结构兼容不等于行为正确 |
| 准备与提交补丁 | runtime/hot_reload.go:PreparePatch、ApplyPatch | 宿主先确定业务边界,再使用 VM 安全点提交 |
| 已准备补丁的检查 | PatchPlan.Inspect | 读取基准 generation;必须在 plan 关闭或提交之前读取 |
| 版本存活摘要 | runtime/revision_inspect.go:RevisionRetention | 已发布版本与待提交候选分开,诊断旧代码为何存活 |
| 有界版本引用扫描 | 同上:RevisionRoots | 显式限制节点、深度和根数量;Complete=false 不能解释为已扫描全部 |
| 新命名调用使用当前版本 | runtime/scheduler_run.go、热更新指南 | 可变认知逻辑通过命名函数调用进入;旧闭包和 defer 不自动升级 |
| 按版本定位代码 | runtime/debug_inspect.go、tooling/dap/source.go | 记录 generation、ProgramHash、SymbolsHash,避免将旧帧归因给新源码 |
| 执行与 scope 分离 | USAGE.md 的运行实例章节 | 入口返回不等于后台任务结束;等待取消不等于资源已释放 |
| 分片推进与统计 | Execution.PollSteps、ScopeStats、Instance.RuntimeStats | 有界推进、采样与宿主预算;不等同墙钟 CPU 限速 |
| 时钟与随机输入注入 | InstanceOptions.Clock、Entropy | 在测试实例中控制部分外部输入 |
| 长期编译会话 | compiler/service/session.go 的 Session.Build | 构建捕获指定源码版本;不另假设存在名为 BuildSession 的 facade |
| MRPC 绑定与清理 | RPC.md | 早期记录包含绑定与清理;当前接入扩大为本地绑定与跨进程能力,逐项契约及更新快照见下方 RPC 补充,不将网络作为所有宿主模块的通信前提 |
版本摘要中的 Pins 是显式引用计数,GlobalRoot 来自最近的根扫描;它们不是旧版本物理占用字节数,也不是全部闭包数量。引用扫描返回独立诊断数据,不强制释放版本。
尚未在此次核对范围内确认稳定的通用 VM 调度记录/重放、完整 Runtime Observer 或专用事后故障报告 API。当前实验可使用已确认的执行统计、调试信息、宿主调用边界与业务日志,不以这些额外接口为前置条件。
管理、试验装配与动态编辑的补充核对
只读核对 go-mini 提交 a0d1558571159cb017d12e4a0a4c1cbf795f8b9a 的 USAGE;以下不覆盖原报告的库版本或实测范围:
| 库文档明确的行为 | 设计影响 |
|---|---|
| 长期运行:业务进度由宿主持久化,执行镜像和值快照不是完整 VM 恢复点 | 试验主体使用固定程序与所需业务初态,状态导入受格式及兼容条件限制,不宣称支持任意运行栈克隆 |
| 热更新:旧帧、defer 和闭包保持旧 revision,新命名调用使用当前 revision | 补丁提交本身不能保证正在执行的认知全部切换;立即生效须由宿主管理受影响步骤及旧响应 |
| 热更新保持 globals 与状态契约,不兼容时创建新实例并由应用迁移 | 动态代码提交可准备替代实例,无法兼容则明确失败,不能偷偷清空人格或活动状态 |
命名入口与编写契约的接入依据
go-mini 提交 a0d1558571159cb017d12e4a0a4c1cbf795f8b9a,仅阅读文档和源码,未运行测试。
| 已确认事实 | 本项目采用方式与边界 |
|---|---|
| USAGE 入口生命周期、Instance 调用实现:Call/Start 在当前 revision 的显式入口表查找名称;未登记时报错 | 从受管理函数声明生成 EntryPoint 或稳定分派入口,不能直接宣称可调用任意内部符号 |
| 编译会话接受 EntryPoints;调用集成测试源码展示函数到命名入口的显式映射 | 支持生成适配方向;测试源码阅读不等于这轮运行测试或验证任意类型映射 |
| 当前同一实例已有 active execution 时拒绝再启动入口;FFI 回调不能同步重入同一 Instance | 管理调用沿宿主调度,测试可在独立沙箱实例进行,不从函数登记推导任意并发调用 |
| 旧帧、defer、闭包保留旧 revision;补丁保持 globals、导出及命名类型/函数状态契约 | 长期状态由宿主管理,跨调用保存函数标识,边界切换;不兼容契约仍需新实例与明确转换 |
类型与注释驱动的生成器属于 TinyAGI 设计,尚未确认或实现通用 agi: 注解能力。固定分派入口不消除库的内部兼容要求。逻辑契约见受管理函数,语法示意见工程参考。
RPC、多语言服务与局部 VM 的补充核对
go-mini 提交 a0d1558571159cb017d12e4a0a4c1cbf795f8b9a。只读核对 RPC.md、USAGE.md、ARCHITECTURE.md,并检索标准宿主及 Rust runtime 源码;未运行生成器、编译器、RPC 服务或测试,未改写早期实验版本与成绩。
| 已确认的库事实/检索边界 | 本项目接入方式与限制 |
|---|---|
.mrpc 生成 Go、Mini-Go、Rust 类型及客户端/服务端适配;跨界类型遵循 MRPC 类型规则 | 跨语言接口统一来源;TinyAGI 的管理元数据与表单生成补充在接口之上,不重复手写序列化 |
| 生成 Provider 可本地绑定,Mini-Go 可经 Host/FFI 调用;编译器和核心 runtime 不依赖 RPC/MRPC | MRPC 作为能力接入层,普通内部调用保持直接调用,不要求改造核心 VM |
| Mini-Go 生成 Serve 入口可发布服务,宿主须装配 PublishProvider;连接发起方不限定业务调用方向 | 原生服务、脚本服务及宿主可按受控接口相互调用,发布和反向调用均需宿主授权 |
| Router 支持标签/亲和选择;绑定后固定 Provider,重新选择需创建新客户端 | 仅动态能力使用 Router;声明标签不是权限,切换登记不等于旧客户端已切换 |
| Gateway 支持 ws、wss、ws+unix;启动时没有业务服务,需要显式发布,Endpoint 可作 Binder | 本地原生能力经受控 Unix socket/回环配置连接;不另设业务 stdio 协议或独立中间件要求 |
| 生成调用提供上下文/错误处理及资源交付封装;直接 RouteSet.Call 仍有 Accept/Discard 责任 | 复用生成客户端,不额外维护冲突的调用资源协议;业务 Operation 与授权仍由 TinyAGI 管理 |
| resource 归创建服务实例及连接;路由变化不迁移资源;大载荷分片仍有边界,持续流用 Read/Write 等资源方法 | 临时句柄不作为持久事实或可导入的试验状态;领域视图与按需读取仍由业务契约控制 |
| Program 热更新保留 FFI 会话,不替换 Go handler 或重新发布 Provider | 脚本补丁和原生实现替换分开处理 |
| PrepareReplace/Replace 更新 publication;新绑定选新 Provider,旧绑定及资源继续;Drain 只阻止新绑定 | 生效须结合受影响执行边界与客户端重绑;等待旧 publication 实际关闭再释放 backend |
| Rust crate 在 playground/runtime-rust;rpc feature 提供服务、Router、Endpoint、Host,rpc-gateway 增加传输;生成需 rustfmt | 原生 Rust 可直接实现生成 handler,不要求嵌入 VM;依赖和工具链在真正接入时固定,不宣称已完成产品组合验证 |
| Engine 有 Check/Compile/Test,Compile 返回可共享 Program;Program.Instantiate 创建实例,Call/Start 执行命名入口 | 宿主封装小型试验服务,复用程序并隔离可变状态;不是脚本已经内置完整“子 VM 管理”业务 API |
| 同一活跃 Instance 的重入限制、scope 清理与逻辑限额见命名入口及使用指南 | 子试验使用独立 Instance;父活动预算覆盖全部分支,逻辑限额不代表原生进程资源隔离 |
| 对 stdlib、Go runtime 及 Rust runtime 源码的本次检索未确认通用操作系统子进程管理服务 | 使用宿主标准库封装进程管理的设计;VM 内部任务不能当作系统子进程,检索结果不是对所有未来库能力的否定 |
接入顺序:定义能力接口和管理元数据 → 使用 MRPC 生成绑定 → 实现 Go/Rust/Node.js 或 Mini-Go 服务 → 经受控工具链/实例形成产物与试验结果 → 按采用规则准备运行 → 在调用边界切换实际绑定 → 观察结果并回收所属资源。该顺序是当前 TinyAGI 设计,未实际执行;Node.js 的新增库支持按下面的独立快照解释,不改写上表旧提交的设计范围。
具体工程选择、原生进程管理、构建环境及官方工具链依据见能力工具链;逻辑生命周期见运行协议,小型实例与主体级试验的用途分层见沙箱。
独立机密服务的 RPC 接入依据
go-mini 提交 fbb16ee99748e84b523bbd677bd477258c358956。本节的机密接入推论来自下列源码;同提交的通用 RPC 回归另见报告 018,未运行 TinyAGI 机密服务或模型调用。
| 已确认的库事实 | TinyAGI 接入与边界 |
|---|---|
| contract.go 的 Provider 提供 RPCContract/BindRPC,ProviderLease 提供 Invoke;绑定固定请求的方法及实现代际 | 可为受信执行方装配专用机密接口;接口可调用或契约相符不代表已经取得 SecretGrant |
| 同一源码的 PeerInfo 由嵌入传输提供认证连接元数据,远程 MRPC 调用方不能自行设置 Endpoint 的 peer 信息;CallInfoFromContext 提供方法、peer 及 Provider 上下文 | 宿主据可信会话映射实际服务、实现及执行范围,不能相信业务参数自报身份;传输认证、映射规则与授权检查仍须由宿主装配,不把字段存在当成认证已完成 |
| ffi_session.go 的 call 解码载荷为普通值,将包含 Arguments 的 Call 交给拦截器后执行调用 | MRPC 不自动把敏感字段从调用链隔离;专用原值接口、拦截器及结果处理须沿机密通路,不能作为认知 VM 的普通工具调用后再遮蔽返回 |
据此采用“受信调用身份+独立机密接口+当前授权与审计”的接入设计。原值可交给获授权的 Go/Rust/Node.js 执行端;发起普通调用的认知默认只取得引用、状态或业务结果;特殊原值处理按实际接收组件及用途走专用路径。SecretRef 不转换为通用 MRPC resource 读取句柄。上述源码支持接入所需的基本结构,不证明库已提供 TinyAGI 的机密保管、授权委托、审计或端到端防泄漏服务;宿主职责见工程映射,逻辑契约见机密操作。
JavaScript/TypeScript 与 Node.js RPC 补充核对
go-mini 固定提交 295eb19d74305bd39c3ddf0fa88e01c52fdc446b。以下为文档、包声明、实现及测试源码阅读;未安装 npm 包、生成绑定、编译或运行互通测试。源码版本的解释见证据范围。
| 来源与已设计范围 | TinyAGI 接入与边界 |
|---|---|
RPC 指南:TypeScript/JavaScript API;.mrpc 可用 -ts-out 生成 TypeScript ESM,支持客户端与 Provider,-ts-runtime 指定 SDK 导入 | 延伸同一接口来源,JavaScript 从生成绑定构建;不手写平行协议,不将 TS 类型检查当作业务授权 |
SDK 说明及包声明:包名 @d7z-team/mini-go,该快照声明版本 0.1.0、Node >=22.18.0;/rpc 与 /rpc-worker 有 Node/浏览器条件导出 | 采用 @d7z-team/mini-go/rpc;版本是此次库声明,不是 TinyAGI 产品版本,也不证明 npm 公共仓库发布状态。具体部署固定所取得分发物 |
| Node RPC 入口、Worker、网络适配:Worker 加载 WASM RPC Endpoint,经 WebSocket 建立连接 | Node 能直接调用/发布服务,不需 Mini-Go Program;仍须分发 SDK 的 Worker/WASM 资源。未由此确认 Node RPC 支持 Unix socket,也不把 Worker 当完整沙箱 |
| RPC 指南及RPC 类型、连接实现:显式 timeoutMs/AbortSignal,close 与 terminate 分开;断线结束待处理工作,资源失效后重新连接并绑定 | 宿主提供期限并保留操作事实;取消等待或终止 Worker 不证明处理函数/外部动作已停止,不自动重试不明动作 |
| RPC 指南:64 位整数为 bigint,字节为 Uint8Array 或 null,optional 为 undefined,map 为 Map;资源保留原 binding 归属 | 使用生成类型及资源客户端,不以普通 JSON 序列化代替 wire 契约;字段到表单或模型可见表示的转换仍由宿主适配 |
| Node 测试源码含生成 TypeScript RPC 与 Go 双向互通用例 | 表明库已有对应测试场景;证据为测试源码阅读,不代表本项目已运行该用例或完成 Node 接入 |
该快照支持将能力端扩充为 Go/Rust/Node.js(npm),同时保留 Mini-Go 脚本编排及已有宿主接入。工程装配、依赖产物和生命周期见Node 接入;宿主管理 Node 服务仍属待实现设计,旧实验成绩不外推到新增路径。
弃用信息、源码分发与初始化接入依据
只读核对 go-mini 提交 a0d1558571159cb017d12e4a0a4c1cbf795f8b9a;未运行生成、编译、实例或测试。本记录补充下列事实,不重写早期库快照与实验结论。
| 已确认事实 | 来源与适用边界 |
|---|---|
文档提取识别以 Deprecated: 开始的段落 | comments.go 的 deprecatedText;model.go 的 Symbol.Deprecated;extract.go 将弃用信息写入符号文档。可复用来显示迁移提示,不等于编译器已拒绝弃用调用或自动生成兼容实现 |
| 宿主可注册模块源码 | USAGE.md 的 NewStandardLibrary、NewModuleLibrary、NewLibrarySet 与 Config.Libraries;逻辑导入前缀和提供的 FS 决定依赖装配,使用期间源码 FS 须保持不变 |
| 检查、编译、实例与命名调用可分开组织 | 同一指南及已有读取记录;能支持宿主引导器编译候选、创建独立实例,不表示已有 TinyAGI 人物生成/迁移流程 |
源码、资源和 .mrpc 声明是分发边界 | ARCHITECTURE.md 的“编译、链接与派生物”;执行镜像、生成绑定、缓存等属于当前工具链派生物,不能将旧缓存当作跨客户端可启动保证 |
| 程序比较与补丁适用范围有限 | 基础读取记录的 ComparePrograms/PreparePatch 处理程序结构与运行补丁;不能单独证明宿主接口语义、业务数据或整个客户端升级兼容 |
本次源码与文档阅读未确认现成的“按 API 修订保留旧实现、自动迁移人格程序、完整调用点弃用告警”服务。上述是 TinyAGI 待实现的宿主设计,不能把文档字段或单个编译 API 记作完整能力已具备。
预制源码库、宿主装配与工具接入依据
只读核对提交 a0d1558571159cb017d12e4a0a4c1cbf795f8b9a,未运行编译或测试。USAGE.md说明 Engine 自动提供标准库源码,额外模块通过 NewStandardLibrary/NewModuleLibrary/NewLibrarySet 注册;宿主提供源码集合,compiler 按 import 选择依赖,使用期间库 FS 保持不变。系统能力仍需显式装配 provider。这支持“预制源码与运行能力分别提供”的工程分工。
同一指南说明 Go 应用可使用 compiler/language 查询语言信息,compiler/service.Session 管理分析和构建;symbols.go提供 DocumentSymbols/WorkspaceSymbols。既有记录另确认文档提取、Check 及派生物边界。可据此设计源码结构、文档和诊断适配,不将工具存在解释为 TinyAGI 已实现完整能力库或初始化保证。
TinyAGI 的预制命名空间保护、客户端发布身份、个体包装区分、工具权限和投影过滤由宿主补充。语言标准库、TinyAGI 预制能力及 Self 个体程序各有维护来源;预制操作复用 MRPC/Host 及原状态所有者,客户端升级维护权威实现,个体可选用并按兼容规则迁移。详细工程映射与逻辑契约分别维护。
提示词引导器与 Self 迁移的宿主适配
Go 宿主先登记稳定人物身份、有效程序及引导进度,再用既有模型与工具端口形成候选。完整提示词和迁移说明是可追溯资源;读取仍有目的和范围,机密不进入提示词。未有可运行 .mgo 或其启动失败时,有限工具循环由宿主推动,认知实例成功采用后恢复正常主体运行,不另外设置常驻竞争人格。
编译适配按固定源码及库集合调用 Check/Compile,将受控 Host/Provider 装配到独立 Instance;试验、预算、结果及采用归原所有者。客户端更换工具链后重新检查实际源码,旧程序只能在实际兼容条件满足时继续使用。对 TinyAGI 自有接口保留旧源码包装或对应 handler,Deprecated 元数据仅描述状态;接口语义、支持窗口与迁移完成记录由宿主维护。
必要兼容维护以用户更新请求或既有授权策略为来源,即使主动学习关闭也可按单独范围和预算处理;不能用迁移任务代替被禁止的自发学习。详细映射见工程参考,完整语义见运行协议。
任务执行、前台入口与控制的固定提交核对
以下保留提交 a0d1558571159cb017d12e4a0a4c1cbf795f8b9a 的文档、实现及测试源码依据,该次只读核对未运行测试。后续执行与并发回归使用更新基线,其实际范围见报告 018,不回填为旧提交的测试成绩。
| 库事实 | 来源及宿主适用边界 |
|---|---|
| Start 遇到活跃前台 Execution/foreground 会拒绝新入口 | instance_call.go 的 start;Pending 不等于前台已释放,不能依赖异步 FFI 自动接纳另一前台调用 |
| PollSteps 有本次推进额度,Ready 可唤醒;累计限制保持 | execution.go、execution_poll_steps_test.go;让出 worker 与结束业务执行分别处理,步数非墙钟保证 |
| Wait 的 context 取消请求取消执行;WaitScope 只限制等待 | execution.go 的 waitValues、execution_scope.go;ScopeDone 等待该调用的 task、timer 及 FFI 收束,不代表远端业务效果消失 |
| InterruptHandle 绑定 Execution,Interrupt 调用 requestCancel | execution.go;Cancel 取得 VM owner 处理控制,Interrupt 仅提交请求;scheduler_lifecycle_test.go 的 TestInterruptHandleOnlyCancelsItsExecution 检查旧句柄不取消新执行 |
| scope 取消与实例故障边界不同 | 同一测试文件的 TestCancelOneBackgroundScopeKeepsOtherScope、TestLibraryBackgroundPanicFaultsInstance;vm_error_limits_test.go 的 TestVMEnforcesStepLimitInsideLoopAndKeepsLibraryOpen。library scope 步数限制可局部结束,未恢复后台 panic 可使实例失败,scope 不是全部故障的隔离边界 |
| 普通入口与 main 的生命周期不同 | USAGE.md 的入口表;main 返回会结束实例其余任务,普通入口返回与 scope 完成分开 |
| FFI 回调须快速且不可同步重入同实例,RPC 长任务需配合取消 | USAGE.md、ARCHITECTURE.md、RPC.md;阻塞工作在提供者有界执行器中运行,宿主仍承担实际资源清理与停止核对 |
任务标识到执行/子工作映射、控制来源授权、继续推进资格、阻断解除及迟到结果处理属于 TinyAGI 宿主设计。库接口不直接提供业务任务控制面,也不证明主体持续响应已经端到端验证。接入见工程参考,逻辑见任务控制。
2. 三层分工
| 层 | 责任 |
|---|---|
| 通用 VM | 执行、调度、scope、FFI、限额、版本与热更新 |
| TinyAGI Go 宿主 | 认知步骤、状态提交、操作、权限、事件、部署、影子验证与复盘 |
| go-mini 认知程序 | 上下文组织、下一步意图、能力选择、心智协作和认知策略 |
认知与能力的当前边界:认知程序选择领域对象及读取范围,只取得投影和所请求的内容;模型与检索计算通过接口交给外部提供者。跨业务边界的请求、结果、状态修订与接续沿统一事件协议表达,宿主绑定来源和执行域,回调不直接重入 VM。认知可经能力创建或接入外部事件源,闹钟仅为通知源示例;核心与 VM 不内置其业务计时。适配器可在宿主进程中,外部通知对象由相应提供者维护;内部步骤完成也可推动有目的的接续。这些是 TinyAGI 的设计边界,不是声称 go-mini 已提供这些业务能力。
StepID、MindID、DecisionID 等属于宿主协议,不要求 VM 知道这些概念。接口通过 MRPC 生成绑定;稳定宿主能力本地注入 FFI,动态原生能力由宿主管理子进程并配置跨进程绑定,不需要为了所有本机函数建立网络服务。
生产认知实例只装配受控的 TinyAGI 宿主接口,不注入可绕过动作登记的通用文件、Shell、网络 provider 或任意远程路由 fallback。实际执行能力由 Go 操作模块按范围委托给受控提供者;凭据由独立机密模块保管,宿主可代理使用或按 SecretGrant 向实际执行方交付原值,普通认知默认取得引用与业务结果,确需原值的组件沿专用信任配置处理;协议内填写目标地址不能自动获得新的访问范围。
上游仓库和 Go module path 均使用 github.com/d7z-team/mini-go;本文沿用 go-mini/mini-go 作为执行库名称。实验通过固定源码提交确定依赖版本,复现实验或准备接入时应使用报告注明的版本。
主动学习策略与宿主接入
主动学习模块按受管理编写契约提供选题、实践、结果解释和策略候选入口,使用已记录的命名调用、独立实例、MRPC 与补丁机制。库只承担执行、调用和资源生命周期;学习活动来源、强度及自动采用资格由 TinyAGI 宿主判定,不将它们记录为 go-mini 已有 API。上方固定提交与库回归支持这些基础接口,主动学习整体接入及效果尚无实测结果。
学习强度最低为关闭。宿主在创建/接续学习执行、接纳下属工作及自动采用之前核对当前强度;不能仅让脚本在入口自行判断,也不能从同一 Program 新建 Instance 获得新额度。关闭时取消或收束所属工作,等待和回收行为遵循库原契约,不把 Cancel 返回或入口结束当成所有后台资源已经关闭。
普通业务实例、已采用程序和共享 Host/Provider 的生命周期独立,关闭学习不应将它们一并销毁。用户明确要求的学习由宿主按独立任务范围接纳,扩展及子 VM 不能通过自报任务来源绕过零强度。学习策略自身修订沿候选比较和边界切换,当前评价条件、运行强度及历史证据不随候选代码被替换。完整映射见工程参考,语义见强度契约。
3. 认知循环与运行分段
核心认知循环继续写在 go-mini 内,宿主负责推进 VM 和交付上下文。下列是业务伪代码,Next、AcceptOperation、Commit 尚不是已存在的 TinyAGI API:
RunSegment:
循环:
ctx, available = Host.Next()
如果不再接纳本分段: 返回
continuation = Step(ctx)
按需 Host.AcceptOperation(ctx.step_token, request_key, request)
短调用可在局部预算内取得结果;长工作只保留操作引用并返回
已接纳操作及实际读取依据由宿主记录
receipt = Host.Commit(ctx.step_token, continuation)
处理提交结果,再获取下一上下文
步骤内操作接纳与最终状态提交分别沿运行契约处理;Commit 关联已有操作并接纳尚未提交的意图,不重复派发。最终步骤被撤销不抹去独立操作;是否继续或停止由带目标范围的当前控制决定。
分段采用 library 入口承载一次运行段。Step 及其调用图包含可变认知逻辑,外层循环只调度上下文和提交。按编写契约采用有可结束边界的调用,跨调用进度由宿主保存;长驻旧根循环不作为默认,尚无分段成本或认知连续性收益实测。长期任务的事实状态仍独立于 VM scope。
宿主在步骤边界结束分段,等待入口及该分段所属局部 scope 收束,再重入 library 入口;长任务由宿主 Operation 独立管理,不在此等待整项任务结束。连续性取决于所保留的状态是否完整,不能由重入动作本身保证。需要回收 globals 或彻底释放旧实例资源时,可以研究关闭实例后从持久状态新建的方案。
实测在合成整数状态下,同实例重入保留 global,新实例需要显式恢复;这不等于语义认知状态已经验证。全局闭包可在 scope 结束后继续保留旧版本,因此分段不能自动替代引用与回调管理。默认引用扫描也可能截断,须保留 Complete 和扫描预算信息。
这一设计针对两个已确认的运行约束,但其代价尚未测量:
- 永久外层调用帧可能长期引用最早版本。命名调用能进入新代码,但不会释放旧根帧。
- scope 的累计步数不会因
PollSteps或热更新重置。长期循环默认可能耗尽累计配额。
分段按可结束的认知或活动范围组织,具体计算资源上限随用途配置,不是固定的思考次数。既无可继续的关注、也无可处理输入时,由宿主就绪通知或有界事件循环等待,不忙轮询;已有内在关注可以继续,不必等待新对话。外部长任务等待也不留在唯一前台入口。每个步骤的超时或指令上限由宿主监控;越界时取消相应执行、撤销步骤令牌并从已确认工作区接续该心智,不假定 VM 已提供按业务 Step 自动重置的配额。
配额对照确认新 scope 获得独立预算,热更新不重置旧 scope 计数。宿主还需维护跨分段的主体/心智及相关活动预算,并单独考虑标准库初始化成本;真实模型/工具的计量仍待接入,不能把反复重入视为活动预算刷新。宿主组合实验已在两段新实例之间保留累计夹具调用数,未测试预算耗尽或真实 token/费用。
既有实验曾比较不同后台状态约束,证据按原范围保留。当前设计要求的编写契约要求跨调用工作通过宿主 Operation/事件接续,局部闭包和内部任务不越过调用生命周期;该选择来自当前规范,不作为旧实验已经证明的最优方案。
4. 业务安全边界与补丁提交
本节流程针对认知 Program;原生 Provider 的替换、旧客户端重绑及资源归属采用RPC 补充契约与工程映射,不能套用 ApplyPatch 替换原生 handler。
同一心智一次只接纳一个部署操作。准备候选程序和影子验证可以在独立实例中进行,不占用生产认知步骤。
主体自主采用前,候选须在拟采用用途下满足能力与回归门槛,报告关联程序、宿主、模型、提示、材料及评价配置。编译、ComparePrograms 和补丁兼容检查只回答结构问题,不代替完整任务比较;证据不足时保留候选,沿用现有配置。通过测试形成自主采用依据;人工管理提交按既定的生效契约完成结构、授权与切换核对,不把完整实验作为每次提交的强制前置。
对应调用边界契约的库接入流程:
- 保存源码、类型与注释描述、配置、生成适配及 Program 身份,检查编写规范;自主采用时另关联相应用途的验证报告。
- 使用
ComparePrograms查看差异,检查实际授权需求;能力声明变少不能直接证明风险降低。 - 停止目标心智接纳新步骤,等待当前步骤提交或撤销;确认没有步骤内 VM 子任务或不受宿主管理的调用。
- 持久化部署意图与目标产物,调用
PreparePatch,保存Inspect报告后调用ApplyPatch。 - 记录成功的实例、generation 和代码身份,完成生效状态及调用/页面描述的一致切换,再开放新调用并报告提交成功。
在边界上可以存在尚未完成的宿主 Operation,因为它们不依赖旧 VM 栈;请求和完成事件必须有稳定的协议版本,候选认知代码需能处理这些结果。
busy 或 stale_plan 会关闭原 plan,必须重新准备。未提交的 plan 由创建者关闭。结构不兼容时仅在业务状态与在途结果能够明确转换时准备替代实例,否则提交失败并保留旧内容;不让 VM 自动迁移主体历史。
仅记录步骤起始 generation 不能证明步骤内未跨版本调用,因此生产部署必须遵守上述业务边界,不能仅凭 VM 允许随时 patch 就在认知步骤中途切换。
5. 部署标识与崩溃恢复
需要区分:
ArtifactID:源码、配置与工具链输入的产物身份,并关联 ProgramHash 和 SymbolsHash。DeploymentSeq:本地 SQLite 中持久保存的部署序号,关联目标 Mind;重新部署旧源码也分配新序号。RunID + InstanceID + Generation:本次宿主运行中的 VM 执行身份,generation 只在该实例内向前推进。
不能把 VM generation 当作跨进程重启的全局序号。新实例可以从初始 generation 开始;历史追踪使用以上完整关联。
核心 go-mini 认知运行嵌入单个 TinyAGI 宿主进程,多个心智按需使用实例;可选原生能力子进程由同一宿主管理,不另持有主体状态。进程重启从本地 SQLite 状态和代码文件重建 VM,不保存调用栈或资源句柄;未完外部操作仍需核对,新代码必须兼容其结果协议。
数据库提交与 VM 内存切换没有共同事务。宿主先登记部署意图,切换成功并登记完成前保持业务入口关闭:
- VM 切换失败:保留当前业务部署,记录失败原因后再开放。
- VM 切换成功但完成记录暂时失败:继续关闭入口,保留 owner 并重试登记,不执行未记录版本的业务步骤。
- 进程在中间崩溃:旧 VM 已消失,新进程按数据库最后完成的部署新建实例;未完成部署标为中断,再决定是否重新验证和发布。
回到历史代码是新的部署,不撤销已提交状态、已发送操作或现实动作。历史代码还需兼容当前宿主数据和结果协议;不兼容时迁移或拒绝该部署。
6. 回收与关闭
本节关闭流程针对明确选中的实例;单项任务控制先按任务归属找到目标执行,不关闭无关核心、实例或共享服务。停止目标的新步骤和补丁,通知脚本在边界返回或按控制请求取消,推进并等待入口,再等待所属 scope,最后由实例所有者调用 Shutdown。不依赖取消时一定执行 guest defer。
关闭等待超时仅代表本次等待结束,owner 仍承担继续清理责任。Instance 关闭自己的 FFI Session,共享 Host、RPC 连接和后台服务由对应创建者在实例清理后关闭。
Operation 的持久记录不随 VM 关闭消失,但当前进程里的执行仍需按其重连、取消或结果核对协议处理。不能因为换了 VM 就声称远端动作已停止。
7. 影子验证的边界
影子验证属于统一沙箱的用途;任务、程序、Reference 及复盘也可使用沙箱。库事实按固定提交解释,沙箱接口依据见独立来源记录。
当前候选在新的 Instance 中重放指定业务事件,并提供替代的事件源、时钟、随机源、模型结果和能力结果。替代能力禁止实际外部写入,不能只靠脚本自觉遵守。独立实例还需配套分域的活动/记忆、文件区、订阅与回调;不共享生产 FFI 会话或能力句柄,不提供生产 fallback。允许的真实模型计算仍受外发范围和总预算约束;新实例本身不是完整沙箱证明。
同一代码与完整固定输入可用于受控场景的回归;代码变更产生不同能力请求时,必须由替代服务响应,或明确报告该分支缺少夹具。不能按“第 N 次调用”盲目返回旧录制的第 N 个结果。
重新调用真实模型属于重新评估,替换行为后模拟未来属于反事实实验;两者都不承诺与历史相同。没有调度决策与全部非确定输入的记录,不把业务事件重放称为 VM 级确定性重放。
设计决策与适用边界
用途:设计决策台账。
本篇集中说明设计约束、采用方案、待定细节和用途配置。资料支持的机制选择与实际验证范围分别记录。
| 阅读主题 | 章节入口 |
|---|---|
| 总体状态 | 当前范围 · 状态定义 · 主体运行 · 基础设计 · 用途配置 |
| 领域与扩展 | 领域对象与视图 · 外部检索提供者 · 计算节约 · 独立机密 · 管理工作台 · 能力扩展 · Node.js 补充 · 主动学习 |
| 个体与控制 | 初始化与迁移 · 预制能力库 · 隔离执行 · 任务控制 · 架构一致性 |
| 维护 | 执行库验证 · 后续维护 |
当前范围
当前处于设计阶段,以既有实验和一手资料明确机制,不推进产品实现或新增模型调用。执行库更新可单独开展固定提交的回归与接入核对;当前范围见库更新验证。逻辑设计、工程映射和实测证据分别维护,库测试不构成产品实现。
实施顺序、首批交付范围及阶段验收集中维护于实施方案,规划中的交付和检查条件不计为已经实现或验证。
执行库更新验证
go-mini 以固定提交 fbb16ee99748e84b523bbd677bd477258c358956 作为新的核对基线。采用上游测试检查执行与取消、热更新、编译缓存、MRPC 生成及 Go/Rust/Node 接入;逐项结果和环境边界唯一见报告 018,当前接口解释见库参考。
保留单宿主、有限认知入口、业务任务独立管理和外部能力接入的设计。库内部并行、SDK 队列、采样统计与编译器会话各按实际职责使用,不把它们扩展为完整任务调度器、主体克隆或机密服务。后续依赖更新按固定流程检查差异及受影响范围,旧报告不被新成绩覆盖;完整主体、实际模型效果和跨平台发行仍不在该库验证范围。
状态及其含义
| 状态 | 适用对象 | 含义 |
|---|---|---|
| 设计约束 | 持续主体、自主认知、强自主意愿、统一事件、按需内容、完整管理与机密可信使用等系统要求 | 必须在架构与专题保持一致;不表示已实现 |
| 已定设计 | 主体直接认知、按需活动、领域分责、同级检索、编写与热加载、能力扩展、学习与初始化、任务解耦、授权委托、接纳前交互、记忆维护、上下文有效性、有限纠正及按问题装配的主体级试验 | 结合资料与既有局部证据形成的机制选择;可作为后续设计及实现依据,不表示效果已经验证 |
| 用途配置 | 模型、设备、预算、联系窗口和评价门槛等 | 随具体用途确定,不是未关闭架构问题 |
| 历史证据 | 报告、脚本、输入、失败与原始数据 | 仅支持其固定条件,不是当前任务队列 |
基础架构与试验主体的装配规则已有明确方案,完整状态导入是受用途及兼容条件限制的可选方式。实际能力、性能和真人体验尚无完整测量,属于证据边界;接口签名、具体表示和额度留给用途及工程配置,不将其视为未关闭的逻辑问题。
主体持续运行与活动组织
主体从环境线索、当前处境、兴趣与未决问题出发,组织心智和异构能力,行动或调整关注,并积累经历。Step 和能力调用可直接归属 Self/Mind;交流、Episode 和 Task 按需要关联。认知程序决定方法与主观意义,宿主落实状态、执行、额度及停止;完整任务的接纳与交付用于具体承担的工作。
正常认知、自主日常活动和经历积累不受主动学习关闭影响;专门研究、练习、能力实验与认知程序迭代受学习强度限制。机密默认保持引用,受信组件按实际用途取得原值,重点防止不可信 API 及非预期接收方获得秘密。
评价覆盖无新对话时的主体活动、注意选择、异构能力、经历影响和中断接续,并保留完整任务的责任与成本评价。原实验只支持各自任务或组件条件,未证明完整自主运行效果。主体机制、直接认知契约、评价范围
决策台账
下表各项均为已定设计。资料和局部实验支持所列机制与取舍;将它们组合为完整系统属于本项目的设计判断。自主意愿、长期人格等价值取向属于项目目标,与可测量的能力效果分别记录。
| 原问题 | 最终采用方案与理由 | 未采用/暂缓方案及原因 | 资料与正文 |
|---|---|---|---|
| 主体认知与活动关系 | Self/Mind 可直接开展认知,Goal 保存持续意图,Episode 按需组织活动,Task 保存执行安排;保持主体在无对话、无任务时的连续性 | 不把请求接纳或固定任务树设为思考前提,不让宿主审批主观意义 | 主体运行、运行归属 |
| 完整任务与能力评价 | 以任务契约和有效结果集合验收;分能力画像,同时计质量、责任与成本;开发/回归/保留任务分开;同条件配对、重复、独立内容复核和预先声明的用途门槛构成基线方法。这样能区分完成、恢复和过程失败 | 不用唯一参考路径、一次通过或单一自评分决定能力;论文分数不能填成本项目初始基线;不编造统一样本量或百分比门槛 | 资料;评估规格 |
| 回应与持续活动 | 统一事件、关注表及活动工作区;认知可从内在关注或环境变化直接接续,具体活动保留下一步和投入范围;完成、等待、未知和退出分别表达。拆分保留父责任与子产物映射,转交经接纳才生效,重新接纳核对现状;跨日从持久状态接续。默认简短,复杂工作按缺口投入,主体可因兴趣/好恶调整意愿但须交代原责任 | 不靠无限推理或模型自报完成;不以内置闹钟驱动主体;不固定“低投入总是好”或全局最优调度公式。强自主属于设计目标,不宣称论文已证明合意性 | 活动依据、情境依据;运行、交流 |
| 记忆与世界认知 | 领域真值、外部检索和内容读取分开;按缺口选择合格提供者,来源保留时间、修订、归属和用途。同源转述或重复命中不增加独立证据,纠正可回查,覆盖不足保留未知 | 不选检索服务作唯一事实库,不默认全量注入或提交全部服务;不按相关性自动认人或采信主张,不预设通用最优查询策略 | 记忆依据;记忆、视图、检索分工 |
| 心智协作 | 一个主负责心智起步,有明确调查/核对/相关经历需求才邀请;独立贡献后围绕分歧交流,按证据整合。长期人格保留身份、私有经历与意愿,临时角色承担可变职责;总预算约束全部参与者 | 不默认全员讨论、固定专家人数、强制一致或以角色名授予专业性;不把采样增加的收益归因讨论,也不要求长期人格先证明提高任务得分才能存在。人数/轮次按所属认知或活动额度配置 | 协作依据;组织机制 |
| 能力与模型 | 公共 API 表达请求、结果、来源、范围和能力差异;外部通知源由能力创建/接入。模型工具提案经宿主接纳,流式片段与终止分开,失败/截断/拒绝不混同。认知按用途选择已装配的模型、感知、算法和工具,提供者经接口执行实际计算 | 自动路由优化可后续扩展,不以 SDK、同名模型别名或 HTTP 成功推定兼容;不省略事实与权限核对。不恢复集群、K8s 或对象存储 | 能力依据;公共端口、工程选择 |
| 计算节约与性能保持 | 利用提供者前缀复用、稳定装配、有效结果、相同只读工作合并、增量准备及有界运行复用,减少重复工作并保留主体行为 | 不用旧答案代替独立判断,不为命中扩大上下文、冻结状态或自动降级模型;供应商机制不证明网关透传或完整收益 | 逻辑规则、运行、一手依据 |
| 计算方式与可选组件 | 按缺口组合规则、经验、专用计算、轻量判断与生成式推理,减少不必要工作;外部开源实现沿已有能力体系按需接入 | 不设固定快慢主体或必经判断层;具体实现保留候选身份,不指定默认组件,资料不构成本项目收益实测 | 有限思考;候选与资料 |
| 经验与演化 | 两阶段复盘区分当时可得依据与后来结果;先形成带来源、适用条件、反例和失效条件的 Reference;使用时核对当前情境。程序/策略候选进入独立状态和受控能力的沙箱,扩大采用按预先声明的分能力门槛;保留固定参考与采用历史以识别累计退化 | 不把反思文本或来源任务成功当作迁移,不因反馈自动更新权重/采用代码;获准自主迭代按下方主动学习范围处理,不把模拟人物与状态整体合入现实。缺少采用依据时保持候选身份和原行为,不宣称已学会 | 学习依据;记忆与采用、沙箱 |
| 人物、情感与多模态 | 账号身份带平台命名空间,关联以明确可核对证据和本人意图为准;关联、认证、读取与披露分别控制。情感评价结合主体处境与交流情境,现实/实际交流/剧情分别归属;主动联系遵守可撤销约定。多模态保留来源、时间、轨道和状态,轨道不等于人物;停止控制优先于认知,身份/受众未知时缩小披露并维持可提供的公共帮助 | 不靠昵称/声纹相似强行跨平台认人,不以亲密降低工作事实标准;不固定爱意分数或问候频次,不因无人回复加频;不把传输标准当说话人识别或端到端实时性证明 | 交互依据;人物情境、输出与控制 |
留给具体用途的配置
这些配置在具体用途接入时确定,不作为待补研究:
| 配置对象 | 由谁在何时确定 | 设计已规定的约束 |
|---|---|---|
| 模型、SDK、服务与设备版本 | 实际接入时由工程配置固定 | 声明能力、处理范围、费用口径与终止语义;不以同名/同结构推定等价 |
| 复用策略、容量与费用口径 | 接入实际提供者时声明支持方式,按用途设置保存、回收、并发与允许等待范围 | 所需信息、独立判断、期限和权限不因命中而改变;实际费用、估算与未知分开,不固化统一期限或折扣 |
| 检索绑定、策略、材料准备与额度 | 按领域用途、实际提供者契约及语料设置 | 提供者同级,材料关联对象类型和修订,覆盖未知可见;特有参数留在对应适配,不强制全部实现支持 |
| 主动学习强度与策略 | 有权管理者配置强度及额度,策略在范围内选择议题;具体初始档位随用途确定 | 最低关闭不自发学习;启用有界,试验主体不能提高额度;自发学习与用户明确任务分开,关闭与在途收束可见 |
| 思考预算、参与人数、轮次与实时目标 | 按活动用途、可用资源和用户要求设置 | 有总上限,全部分支计费;不虚构统一最优数值,无具体进展则停止 |
| 联系渠道、窗口和频率 | 由双方关系/任务约定形成,可修改和撤销 | 不默认跨平台发送,不以无回复提高频率 |
| 能力门槛、样本和基线 | 建立能力基线时,在查看候选成绩前确定 | 质量/成本及关键失败分维度,保留未知和失败,不复用公开调参样本冒充保留任务 |
| 法域与业务规范 | 具体用途接入时绑定适用规范与来源 | 按情境判断适用性;论文或格式通过不构成法律合规证明 |
容量、备份、驱动和故障矩阵继续不作为当前设计前置条件;旧局部证据仅支持原范围。
领域检索与同级外部提供者
检索作为正式外部能力类别、领域入口与提供者分层、各实现同级接入为已定设计。提供者可发现、指定调用、配置、维护及评价,实际安装和启用可选;具体组件与接口见向量服务及 Attemory 接入。
| 决定 | 理由及适用边界 |
|---|---|
| 领域定义查询含义,公共接入负责调用组织 | 记忆、资料、程序定位和能力发现可复用接入,同时保留对象类型、状态所有权和处理范围 |
| 提供者同级,默认配置按用途确定 | 不固定某实现为必经通路或后备,也不要求每次调用全部服务;具体计算和服务内部状态由外部组件维护 |
| 支持指定、单次、并行、分步及替代查询 | 调用记录保留提供者贡献,所有分支共用原认知或活动预算;得分不直接比较,同源重复不增加独立证据 |
| 材料准备与来源映射独立管理 | 外部空间不等同于人物或会话;明确范围内可以批量准备及持续同步,登记对象不自动提交全文 |
| 管理与评价覆盖完整接入 | 查询、材料提交与维护权限分开;配置提交、准备完成及实际可查分别报告,单提供者与组合策略同条件评价 |
采用现成 API/SDK 减少专用引擎开发,代价是接口差异、材料同步和外部服务维护。拒绝用统一向量字段约束全部实现,也不把所有领域查询改成通用资源管理。逻辑在总设计与运行契约,操作在工作台,评价在沙箱。
依据为官方接口资料及向量服务契约。报告 013/014 的局部查询与组合不覆盖这些外部服务,资料不证明本项目检索质量、组合收益或端到端性能;实际接入版本、策略及预算归用途配置,不新增验证前置任务。
计算节约与复用的设计范围
分层复用与增量处理为已定设计。认知决定材料及计算用途,各处理能力复用符合条件的输入处理、结果和准备工作,宿主共用预算、控制及观测;不建立统一资源实体或独立缓存服务。方案以保持所需信息、计算目的、响应要求和正常主体行为为前提。
| 采用项 | 选择理由与适用边界 |
|---|---|
| 稳定输入与提供者前缀复用 | 减少相同输入的重复处理,当前输出仍重新生成;装配不统一人格、不任意重排语义,实际命中及费用按服务反馈 |
| 有效结果及相同只读工作合并 | 避免重复读取、解析和确定计算;保留各请求归属、权限及取消,实际执行成本只计一次,独立采样不合并 |
| 增量准备与有界运行复用 | 复用未变材料、依赖和合格运行准备;无法确认影响范围时重算,必要状态独立保存,后台批量不损害实时要求 |
| 完整性能与费用观察 | 同时观察质量、行为、响应、控制、费用及占用;首次准备、重复使用和失效重建分别报告,未知不视为零成本 |
不采用按相似问题默认复用答案、为命中保留无关材料、默认空请求保温、无界常驻,以及以节约名义暗中降级模型或降低学习强度。改变信息、采样或认知组织的方案仍按行为候选评价,不能直接取得透明优化资格。
一手资料支持采用机制,现有实验不构成完整节约基线;网关参数、实际折扣和端到端净收益仍受具体接入与负载限制。容量、期限、收费口径及用途门槛属于配置,不自动新增实验待办。逻辑、资料与取舍、管理、评价
领域对象与受限视图的设计范围
资料、记忆、程序、配置、模型、运行对象、事件源、索引、缓存和机密按各自业务契约管理为已定设计。投影保留为面向当前接收者的受限视图,不采用统一资源实体、公共属性必填表或万能读写接口。详细定义见对象与所有权。
| 决策 | 理由与唯一正文 |
|---|---|
| 按状态所有者及实际操作划分 | 文档读取、记忆修订、程序采用、模型加载和缓存清理含义不同;领域边界 |
| 资料、判断和程序分别维护 | 原文不随断言修订而覆盖,Reference 专指可复用知识/方法,文件承载不改变对象归属;资料契约、记忆 |
| 交付内容与业务记录关联 | 正文由文档或程序产物维护,活动保存要求,交付与评价保存各自结果,不复制正文真值;管理详情 |
| 共用机制保持有限 | 共享带类型引用、可信调用上下文、来源关联、查询及页面工具;具体操作由各领域接纳;运行协议 |
| 视图、读取和执行使用分开 | 对象登记、程序加载、模型运行及管理员查看不自动向认知展开内容;认知输入 |
| 来源派生与运行使用分开 | 摘要、向量和构建产物保留来源,使用模型或凭据不使全部结果成为权重或机密派生;关系规则 |
| 按领域装配沙箱 | 分别声明只读基准、可写状态和试验操作,不克隆生产会话或授权;装配规则 |
代价是维护各领域接口及关联;不按文件格式拆分职责,不为每个对象新建服务、数据库或审批,不把投影重新包装成通用对象管理器。具体签名及存储结构留给工程接入,逻辑拆分保持原单机承载选择。
Microsoft 领域分析、NIST 属性授权与 W3C 来源模型支持职责划分及共用机制,适用版本及支持命题由专题保存。报告 012/013 仅支持原读取和发现条件,不证明全部领域接入或完整隔离已测;不新增待执行实验。
独立机密管理的设计范围
Secret 独立保管、可信提交、授权使用及必要记录为已定设计。目标是让凭据完成预期用途,并避免泄漏到不可信远程 API 或其他非预期对象;普通认知默认使用引用,实际接收方按组件、用途与目标确定。
| 决策 | 理由与唯一正文 |
|---|---|
| 独立身份、归属及授权 | 普通资料读取不解析原值,用户可维护自己的凭据;对象与权限 |
| 代理使用与原值交付并存 | 受信适配器和 RPC SDK 可正常使用凭据,既有授权内无需逐次确认;专用契约 |
| 按实际接收边界配置 | 本地不自动可信,远程认证目标可以合格;确需原值的计算组件走专用输入,模型/工具标签不替代信任判断;处理流程 |
| 普通上下文、日志与导出保持引用 | 防止无关模型、遥测或其他接口接收秘密;测试用途单独配置;评价规格 |
| 必要使用记录与当前效力 | 保留授权、领取及结果,撤销限制后续访问,已交付值的上游效力另行处理;记录与撤销 |
| 加密与外发控制分责 | 保管和传输采用工程保护,实际接收方及请求目标另行约束;工程映射 |
不采用禁止全部执行方取得原值、按技术类型一律禁止或放行、每次使用重新审批,以及用密文存储替代出站边界检查。独立模块不要求新增服务或数据库;原值交付依赖实际接收方可信性,未运行新的机密实验。来源及支持范围见资料与库接入事实。
管理工作台的设计范围
| 范围 | 状态与唯一正文 |
|---|---|
| 完整管理、模型/服务维护 | 已纳入设计;管理职责与范围 |
| 独立机密、用户归属、可信提交、授权分配及访问审计 | 已定设计;机密机制,命令名及字段为示意,状态见机密设计范围 |
| 可运行试验主体 | 已定设计;按问题选择实际程序、所需初态及环境,默认暂停,只激活指定工作,按覆盖评价并有限采用;试验契约 |
| 完整状态导入 | 可选能力;用于有明确范围的迁移或长期行为评价,限定支持的状态格式、程序及环境,不要求任意扩展的通用克隆;初态与导入 |
| 动态表单、蓝图及代码编辑 | 类型推导、结构化注释和自动生成适配已纳入设计;编辑映射,具体语法与组件未冻结 |
| 提交立即生效 | 按编写契约准备候选、调用边界切换、等待或撤销计算后接续、失败保留旧内容已纳入设计;生效契约 |
| 受管理函数与热加载 | 采用:宿主管长期状态、稳定函数标识、有界调用、类型与注释描述、生成入口及沙箱测试;编写与调用契约、工程映射 |
资料与未采用方案见管理依据。既定的热加载方案降低手工适配及任意栈恢复的设计负担;收益是工程判断,未量化性能或开发成本。
能力构建与接入的设计范围
能力扩展采用以下流程和责任分工,支持 Go、Rust 和 Node.js(npm)实现:
| 范围 | 采用方案与唯一正文 | 未采用方向与理由 |
|---|---|---|
| 完整能力闭环 | 先复用和组合,有缺口才构建;形成可追溯产物、分层试验、按适用范围采用及结果复盘;总设计 | 不默认每个问题都生成工具或把构建成功等同任务能力;目标是开放扩展,非无限资源保证 |
| MRPC 与 Go/Rust/Node.js(npm) | 复用多语言生成、本地/跨进程绑定、资源和替换;外部能力实现由核心宿主管理;工程选择 | 不全函数 RPC 化,不重复建设序列化协议,不将原生动态库装载作为默认,不恢复 TinyAGI 集群 |
| 接口与动态管理 | 跨语言接口有唯一声明来源,内部函数仍用类型与元数据;实现、表单和实际调用绑定一致;运行契约、管理入口 | 不并行手写多语言类型与表单,不把路由登记更新当成已有客户端已切换 |
| 试验与运行对象 | 局部程序、能力组合、主体级试验分层;构建全过程受控;子工作共享父活动预算;沙箱 | 不默认全量复制主体,不把子 VM 或独立进程当作完整隔离,不复制生产资源句柄 |
| 库事实与宿主补充 | 固定提交的 RPC、嵌入 API 与检索边界见接入记录 | 未确认库已有通用子进程或脚本子 VM 管理服务;宿主封装是待实现设计,不记录为已完成接入 |
一手资料支持以上机制分工,尚无完整构建成功率、性能或任务收益实测。具体工具链版本、平台隔离适配和投入额度随用途配置。
Node.js 与 npm 能力端补充
能力端支持 Go/Rust/Node.js(npm),本项为已定设计。沿既有 MRPC 单一接口来源生成 TypeScript/JavaScript 调用与服务适配,复用 npm 生态;程序包、锁定依赖、运行环境及 SDK 分发文件共同关联固定实现。依赖准备、试验、信任、任务中止、替换与 Secret 继续走原契约,不新建主体或独立管理后端。
选择理由是使用现有 JavaScript SDK/包及库已有 RPC 支持;不要求把 npm 能力改写为 Go/Rust,也不强制所有能力转为 Node。当前 Node SDK 的 WebSocket 接入与 Go/Rust 的可选原生传输分别装配,不假定全部传输对等。库依据见固定快照,当前实测范围见报告 018;Node 工程接入中的完整服务管理与能力采用仍属设计。
主动学习与自我迭代的设计范围
主动学习扩展及其强度控制已纳入设计,最低强度为关闭。具体学习策略和长期收益仍具有实验性。
| 范围 | 采用决定与唯一正文 |
|---|---|
| 主动发起与持续经营 | 兴趣、成长方向、未来用途、能力盲区和环境变化均可提出学习议题;复用目标、活动、资料、记忆及程序候选;主体学习 |
| 实践与自我迭代 | 阅读、练习、构建、整理与迁移分工;可在分支改进学习策略本身,研究价值与正式采用分开;总体机制、学习评价 |
| 学习强度与关闭 | 宿主强制执行有界投入,最低关闭;不自主发起/继续学习及自动采用待用候选,在途按停止规则收束;正常认知、自主日常活动、经历积累和已有能力使用保持;运行契约 |
| 用户明确学习任务 | 按独立任务及预算接纳,不隐式打开主动学习,也不借任务名继续后台学习;来源由宿主绑定;同上契约 |
| 管理与接入 | 页面维护强度、有效额度、议程和采用结果;复用 go-mini/MRPC 与既有宿主;工作台、工程映射、库接入 |
资料支持课程、反馈记忆及代码迭代的分工,不证明本项目长期成长收益、最佳强度或任意任务自我提升。具体预设名称、数值、初始强度、探索比例、课程算法及可选训练框架按用途配置,不列作当前架构未关闭项。学习不能修改正在使用的评价规则或扩大权限。资料与替代项见学习依据。
提示词初始化与个体自迁移的设计范围
初始化采用完整提示词,迁移采用差异与语义说明;共同运行契约与个体实现分别维护。
| 范围 | 采用决定与唯一正文 |
|---|---|
| 初始化与个体差异 | 当前完整提示词引导产生最小人物与个体程序,接受模型及人格差异,必要运行契约一致;人物形成 |
| 个体迁移 | 相邻文本 diff 配套语义说明,按实际代码和迁移项自行适配;保留主体身份、历史和配置,跨修订有覆盖关系;运行协议 |
| 引导与维护 | 宿主入口独立于生成程序,首次生成和失败修复均有预算、诊断与候选采用;固定管理不依赖认知启动;工作台 |
| 弃用及兼容 | 注释提示加真实旧接口实现,保留若干稳定 API 契约修订;语言及客户端变化另核对,缓存不作启动保证;工程参考、库事实 |
| 关闭主动学习 | 获准的必要兼容维护独立接纳,不提高学习强度或权限,不扩展为自主能力探索;引导契约 |
| 评价 | 检查共同契约、连续性及受影响功能,不要求所有个体同码同答;未来检查场景已定义,尚未执行;沙箱 |
未采用统一人格程序覆盖、向所有个体套用同一源码补丁、更新即重建人物、仅标弃用而不保留行为或永久携带全部旧运行时。理由及资料见工程取舍与证据记录。具体提示词正文、首次模型/预算、兼容保留数量和正式接口标识在未来发布或接入时固定,属于用途及支持策略,当前不伪造数值或新增待执行实验。生成可用率、长期人格连续性和跨客户端兼容效果未实测。
客户端预制能力库的设计范围
预制库随核心客户端交付与更新,权威定义和实现对 Self 只读。Self 可选择使用、组合、独立包装或不使用。维护权、调用权限和实际作用分别定义,运行约束仍由宿主执行;适用范围包括初始化、正常认知、维护及管理。
逻辑及选择理由见总设计,详细职责见运行契约,客户端与库装配见工程参考。
管理入口区分预制定义、使用配置及个体包装;沙箱评价覆盖实际依赖和共同契约。新增能力供个体选用,已依赖实现的更新按兼容政策及实际迁移处理,未采用强制统一人格或自动改写个体程序的方式。
固定提交的库依据支持源码装配、文档与语言工具接入;维护归属属于设计约束,初始化收益属于工程判断。具体函数清单、模块前缀和参数在实际接入时确定,不新增待执行实验;当前没有产品实现或新增效果实测。
可选隔离执行的设计范围
隔离执行是默认提供契约、按需装配环境的预制能力。高风险能力按实际实现、用途和请求匹配强制限制;环境缺失时主体及其他合格能力继续可用,受影响操作不能自动回落普通路径。该机制已定,尚未实现或运行本项目隔离验证。
| 设计范围 | 采用方案及适用边界 |
|---|---|
| 准入与生命周期 | 总设计、运行契约;覆盖准备、构建、试验和正式运行,绑定原操作及预算,不按本地/远程或接口名称豁免 |
| 信息、机密与权限 | 资料、程序、环境及机密分别沿所属领域契约与受限视图处理;外部发送和 Secret 使用另行授权,隔离不授予实现信任或原值访问 |
| 可选依赖及替代路径 | 需要隔离时缺失即拒绝该执行,可换合格能力或缩小范围;增强要求不能降为较弱环境 |
| 承载选择 | 工程参考采用可选容器提供者,Linux 优先 Rootless Docker,预留 gVisor 增强隔离;具体运行时版本、配置及计算资源额度按实际用途确定 |
| 管理与评价 | 工作台显示所需与有效条件及实际停止;评价规格区分环境检查、隔离效果与认知质量,未新增实验成绩 |
| 资料及边界 | 官方资料支持机制和环境前提;不证明完整隔离、远端控制、平台兼容或性能 |
不采用强制所有能力容器化、每次请求重建环境、向候选开放引擎管理权或以容器存在证明绝对安全。具体兼容性和性能属于接入条件,不自动形成当前待执行任务。
核心/任务解耦与外部控制的设计范围
主体、业务任务、认知执行和外部操作具有独立生命周期。任务超时或失败不结束 Self,也不长期占用认知入口;长工作独立管理,结果通过事件接续。控制台、获授权用户及安全审计模块可通过宿主直接打断执行、阻断推进或中止任务,不等待认知批准。
| 设计范围 | 正文及边界 |
|---|---|
| 持续主体与独立任务 | 总设计、主体场景、生命周期;资源和预算仍受共同约束,不承诺无条件即时模型回应 |
| 控制与收尾 | 运行契约;止动请求、正式接纳和实际停止分别确认,子工作、新派发及迟到结果纳入范围,无关工作保持 |
| 审计及解除 | 授权决定与建议分开,限定可信来源和范围;多原因解除及重新接纳不能绕过有效阻断;审计算法和全面检查流程未预设 |
| 管理和评价 | 工作台、评价场景;已定义未来验收,不新增待执行实验 |
| 真实库接入 | 固定提交源码及测试阅读、工程装配;任务控制映射由宿主补充,资料核对不等于运行验证 |
原报告 014 的异步 FFI 与顺序跨实例接续不覆盖慢任务期间处理新输入、审计中止及故障隔离的完整场景。当前状态为设计已定、接入与实测未完成。具体容量、期限及审计规则按用途或后续明确需求确定。
跨模块的一致性规则
下表统一主体认知、活动组织与运行基础之间的职责;交互接纳、执行控制、机密使用和试验是相应场景的支撑机制。这些是结合既有职责、资料和库行为形成的设计选择,不构成新增实验结果。
| 范围 | 最终采用方案及理由 | 排除的解释与唯一正文 |
|---|---|---|
| 主体认知与正常经历 | 运行直接绑定 Self/Mind、能力范围和预算,可选关联交流与活动;学习关闭保留普通认知、日常活动和经历积累 | 不制造虚构任务取得执行资格,不把全部自发行为归为学习;归属、学习边界 |
| 领域对象与具体操作 | 各领域维护身份、状态、操作和生命周期,投影为受限视图;引用、查询和页面工具不接管真值 | 不采用统一资源模型,不混用资料、记忆、程序、模型和缓存;领域定义、操作 |
| 独立机密与执行接收方 | SecretGrant 分别授予代理使用、原值读取等操作;按实际接收方、用途和目标交付,普通认知默认使用引用 | 不按 RPC 协议本身授予权限,不将原值夹带到普通模型输入或无关服务,不把撤销当作已收回明文;专用契约 |
| 执行分类与可选隔离 | 核心提供仅经宿主能力访问外界的基础受限执行;直接接触系统环境的扩展及高风险实现另须合格环境,按实际可达能力分类 | 不把生成认知程序一概变成可选环境依赖,也不借程序名称豁免要求;执行分类 |
| 接纳前交互 | 交流职责保存请求、澄清和处理结果,有限投入关联原会话及输入事件;明确接纳后建立活动并承接投入 | 不将收消息视为业务承诺,不制造无归属调用或以接纳刷新预算;交互、运行归属 |
| 授权来源与委托 | 共同上下文保留发起者、执行者、权利来源及接收方,领域逐项接纳;子委托限于允许范围,当前父依据继续约束访问 | 不合并全部参与者权限,不让自主活动沿用无关用户委托,不另建通用权限实体;授权契约 |
| 记忆形成与维护 | 必要过程记录与选择性长期记忆分开,临时内容不自动升级;归档、更正、淡出检索与删除分别处理 | 不默认每消息总结,不用检索命中替代当前判断,不借必要维护绕过学习关闭;记忆生命周期 |
| 计算节约与共享执行 | 输入处理、结果复用和独立生成分别声明;复用在当前范围内执行,共享成本一次登记,冷/热条件与完整收益分别评价 | 不用命中率替代质量,不合并独立判断、不冻结有效更新;输入、运行与结算 |
| 上下文有效性 | 根据处理许可与披露变化分别核对已读输入、摘要、会话及待交付产物;不能可靠排除受限历史时重新装配 | 不只检查新读取,不将停止本地复用当外部删除,不无条件清空仍获准内容;上下文契约 |
| 已交付结论纠正 | 原活动所有者按已知使用关系组织有限处置,区别后来变化、当时错误和新增未知;有当前授权及预算才继续工作或发送 | 不永久监测全部历史,不恢复被撤销联系,不以改正文冒充通知;纠正契约 |
| 控制对象与传播 | Self/Mind 可直接控制,主体暂停与输出停止分别表达;Episode 是持续活动,Task 是活动内可选任务安排,Operation 是已接纳工作;当前尝试另有执行身份。控制携带类型与传播范围,认知中断和任务停止各有归属 | 不使用含义不明的“任务 ID”,不因认知被取消而自动终止独立操作;生命周期与控制 |
| 步骤与操作接纳 | 步骤内通过独立入口接纳请求,保留稳定请求键与回执;最终提案引用已有操作并接纳剩余意图。支持先读工具结果再作判断,也保留失败前已发生的成本和效果 | 不重复派发,不用最终提交失败抹去独立工作;时序 |
| 统一主体的公共决定 | 私有 Mind 状态、受委托活动决定与 Self 公共提案分开;指定既有心智承担整合,按证据与责任裁定,未决保留原公共状态 | 不设永久最高人格、不以写入先后或多数票取代公共决定;公共整合 |
| 配置与当前约束 | 代码及普通行为配置随执行固定;覆盖按声明范围解析,授权、Secret、额度、学习关闭和控制按当前值核对 | 不采用无条件最后写入胜出,不让旧配置冻结有效控制;配置解析 |
| 个体持久状态 | 个体自由定义主观逻辑,宿主管归属、结构、修订、可见与写入范围及转换;程序和数据结构一致采用 | 不强制统一人格数据,也不把自定义内容变成第二份公共真值;状态契约 |
| 能力采用与实现信任 | 功能采用、实现来源/产物信任、用途授权分别成立;受信维护者或既定发布策略授予资格,执行环境满足声明约束才接纳 | 不从测试通过、相同接口或模型自评推导机密访问权;实现准入 |
| 学习与任务构建 | 关闭主动学习保留正常主体认知、经历积累及普通活动需要的工具构建;长期安装、泛化和改变主体默认策略另有采用范围。启用探索时可主动提出策略候选 | 不按“是否写代码”分类,不强制先反复失败才产生程序候选;学习强度 |
| 作用与停止反馈 | Effect 跟踪预期或可能作用,不等同已发生;止动请求、正式控制接纳和实际停止分开;禁止原业务交付不禁止按受众发送控制回执和必要退出说明 | 不从发送或局部停止推断任务中止已接纳,不借控制通知恢复任务;效果、控制 |
| 文档层次与证据 | 总图先给一级职责,再提供完整关系图;当前逻辑、工程承载、库固定快照、受限模型证据及历史材料各归其位置 | 不把当前源码链接当不可变快照,不把未测写成没有任何模型证据;维护规范、快照入口 |
| 主体级试验与状态导入 | 按问题装配所需初态及环境,复用正式认知与运行契约,默认只激活指定工作;完整状态导入为条件明确的可选方式 | 不将通用完整克隆作为测试前提,不自动接手全部生产工作,不以覆盖缺失冒充能力失败;试验契约 |
对应检查场景集中于跨契约评价规格。这些规则尚无完整组合实验结果。
授权与来源依据 NIST SP 800-162、RFC 8693 与 W3C PROV-DM,执行分层复用既有库装配记录和环境资料。这些资料支持属性判断、委托身份、来源关联及能力约束;交流预算、记忆选择与有限纠正是本项目据此形成的具体规则,不宣称由标准直接证明端到端正确或认知收益。
主体级试验依据及未采用方案见试验装配资料。采用真实运行逻辑与按问题装配的初态,保留完整任务评价,同时限制无关历史和外部依赖的重建负担;不采用默认完整克隆、任意现场恢复或自动继承全部生产工作。该维护成本与有效性判断属于设计推论,没有新增对照成绩。
后续维护
新需求、相反证据或实际任务中的失败可能触发设计调整。调整时明确受影响的目标、机制与适用范围;实现、实验和文档维护分别说明各自结果。
当前按维护规范保留资料来源、版本、命题与推论,检查总图、职责、场景和链接的一致性。如果以后另行开展实验,预登记、冻结、失败保留和证据分类规则继续适用;不能改写旧输入和成绩。
设计依据与实验索引
用途:证据索引。
本篇汇总已有实验、设计依据和一手来源。各报告说明实际条件、统计、失败及适用边界;论文、标准和依赖库保留对应版本,不能将不同条件下的结果混用。
目录:整体任务实验 · 机制实验 · 按问题查依据 · 设计机制依据 · 主动学习依据 · 任务解耦与控制依据 · 跨模块一致性依据 · 既有论文与标准
主体持续运行、自主意愿与可演化认知是系统目标;既有受托任务实验仅支持相应局部机制,不决定全部认知必须采用任务流程。正常认知和机密信任边界的设计取舍见决策台账。
实验报告按运行时的条件解释。分布式接管等历史方案不属于当前架构,其实验也不能证明现行系统具备相同机制。
实验证据
实验只支持实际运行条件内的结论。现有证据包括有限状态模型、预编排流程、本地组件、固定语料检索及受限真实模型对照;尚无独立保留任务上的稳定收益、正式能力基线或真人体验证据。统计见各报告,采用理由见总设计和专题。
整体任务相关实验
| 报告 | 实际验证范围 | 不能由此证明 |
|---|---|---|
| 011 · 完整活动评价 | 固定阶段的活动输入、预编排产物和已知失败可被所列客观条件区分;语义盲区保持待审 | 无参试模型、真实联系人或语义质量成绩,不能证明工作区/情感/协作收益 |
| 012 · 投影、修订与提醒 | 本地文件、读取缓存和真实计时输入可与资料修订、产物交付及分别结束相接;旧证据与漏交付控制失败被保留 | 预编排策略和合成参数;不是模型判断、外部检索性能、目录发现率或真实通知效果 |
| 013 · 资源发现与用途 | 当前文档快照中,元数据与主动内容查询提供不同候选;用途范围可缩小搜索,命中仍须阅读核对 | 公开开发查询、词面算法及人工用途标签;不是模型理解、检索泛化或清理后的性能提升 |
| 014 · 单宿主组合 | 实际 Go/go-mini/SQLite/文件/HTTP 可在单程序接续简单完整任务;无依据、未交付和错误请求控制有区分 | 确定提供者、虚拟时间及有限域装配;没有模型质量、完整沙箱、厂商接口或产品成绩 |
| 015 · 任务验收与模型对照 | 合理路径/过程失败控制;两模型在合成资料任务中的读取、更正、交付与打断;内容审阅发现历史解释问题 | 单任务结构、每条件一次;非完整沙箱/攻击测试,无广泛组织收益、真人体验或正式采用结论;服务修复前失败另列 |
| 016 · 功能事件模型验证 | 两模型的三类修订、多活动撤销、账号证据/群聊受众及外部通知成功/失败;揭示提前让出、预算截断、过早完成与内容补写 | 固定提示、合成环境、少量重复、单助手评阅;无真实通知/跨平台认证、正式基线或架构优越性结论 |
| 017 · 接续、投入与责任退出 | 接续语义提示包、投入档位/生成上限分别对照;新增未裁定冲突与给定意愿退出;另登记责任接纳补充 | 小样本与单助手评阅;提示不等于宿主保证,网关参数兼容不等于透传,退出处理不证明真实偏好形成 |
机制实验与历史路线
这些报告保存各自条件。接管、分区等分布式路线已撤销;其余局部机制也不构成完整产品保证,新增底层故障验证不在当前研究主线。
| 报告 | 实际验证范围 | 不能由此证明 |
|---|---|---|
| 001 · 动作恢复 | 超时/崩溃后可能无法区分外部效果 0/1,盲重试会重复 | 有限状态模型不是实际服务保证 |
| 002 · VM 连续性 | VM 状态需恢复、补丁需业务边界、scope 和旧引用需管理 | 合成状态不能证明模型语义连续性 |
| 003 · 结果复核 | 目标版本和串行写入不足以代表全部依赖 | 手写条件不能证明自动捕获完整 |
| 004 · 控制通路 | 接纳、调度、执行和输出分别约束;取消不等于资源已释放 | 模拟 tick 不是设备延迟 |
| 005 · 分布式接管 | 保留原报告用于历史追溯 | 接管、分区和多节点方案退出当前架构 |
| 006 · 进程恢复 | SQLite 事务边界与效果/回执分离的崩溃窗口 | 不采用其节点指派方案,不证明完整本地产品恢复 |
| 007 · 提供者核对 | 缺回执、键过期、取消与逐资源回收需分别解释 | 受控进程契约不能套用任意第三方服务 |
| 008 · 接纳与入账 | 提交后确认、持久待办和唯一释放账 | 多个实验库是夹具,不是产品必须拆成多个库 |
| 009 · 取消、恢复与冲突 | 取消竞争、旧快照重复风险和冲突证据需处理 | 依赖给定可信来源与恢复条件,不证明完整灾备 |
| 010 · 本地存储与维护 | 文件先发布后提交、稳定锁对象、维护排空及完整备份;长读影响写入与 checkpoint | 小型 SQLite/Linux 夹具,未测 Go 驱动、完整认知闭环、吞吐或掉电 |
| 018 · go-mini 库回归与接入 | 固定提交下的执行/取消、热更新、缓存、生成绑定及跨语言互通,逐项结果见报告 | 上游库用例及指定工具链;不证明完整主体、机密防泄漏、跨平台发行或性能收益 |
跨模块一致性的依据范围
跨模块规则定义步骤内独立操作接纳、带类型控制、公共决策整合、配置约束、个体状态及实现信任。已有证据支持各项分工,但尚无完整组合协议的端到端验证结果。
既有结果复核、接纳与入账和取消与冲突支持保留归属、依赖和实际作用的动机,不证明新增组合协议已经运行。
库执行、MRPC 和生命周期事实沿固定提交记录解释;人格整合与学习自主性来自项目目标及设计取舍,不伪装成已测认知收益。
跨契约检查场景明确预期行为;主体级试验按装配契约说明初态、激活工作、环境覆盖及评价限制。实际证据仍由原报告维护,设计规格不计作试验成绩。
按问题定位论证
| 问题 | 当前机制 | 论证与来源 |
|---|---|---|
| 完整任务契约与有效路径 | 责任收尾、评价环境 | 任务验收依据、报告 015 |
| 上下文与任务接续 | 活动工作区 | Lost in the Middle:长上下文使用限制 |
| 心智协作 | 协作机制 | Scaling Agent Systems:协作与任务匹配;人格及协作资料 |
| 交付与经验 | 学习 | Reflexion:反馈与反思、自我纠错限制、SCoRe:训练前提 |
| 何时继续、如何读取和评价 | 主体认知循环 | Self-RAG:按需检索、模型评价的偏差、LongMemEval:记忆评价 |
| 关注、计划与程序复用 | 目标与计划 | 混合主动交互原则、Plan-and-Act:动态重规划、Voyager:程序积累 |
| 来源修订、路由与版本采用 | 来源与能力 | PROV-DM:来源与修订、RouteLLM:模型路由、AI Agents That Matter:成本与泛化 |
| 意愿、规范、身份、情感 | 交流与情境 | 交互设计的资料与边界;报告 016补充合成人物/受众场景,不提供真实身份或情感效果的保证 |
| 计算节约与复用 | 总体选择、输入与结果 | 提供者、HTTP、Go 与构建工具官方契约支持机制选择;报告 012 的读取结果不证明前缀、完整费用或时延收益 |
| 投影、外部事件源、缓存与沙箱 | 资料与视图、沙箱 | 各篇来源表保留具体版本与未测范围;计时夹具不证明核心必须内置闹钟 |
| 领域对象、资料与受限视图 | 所有权与关系、操作接纳 | Microsoft 领域分析、NIST 属性授权与 W3C 来源模型,各来源记录适用版本与支持命题;支持职责及关联设计,报告 012/013 不证明全部领域接入已测 |
| 接纳、授权与记忆纠正闭环 | 接纳前处理、授权来源、记忆生命周期、上下文失效、交付纠正 | NIST 属性授权、RFC 8693 委托与 W3C 来源模型;资料支持职责区分,接纳范围、保留及纠正规则属于本项目设计,未作端到端实测 |
| 独立机密、授权分配、原值交付与审计 | 机密管理、调用契约、评价规格 | OWASP 与 Vault 官方资料、go-mini 固定源码;支持最小权限、生命周期、审计及接入设计,不证明本项目端到端隔离已测 |
| 可选隔离执行与高风险能力 | 准入与运行、试验分工 | 容器、Rootless、计算资源约束与 gVisor 官方资料;支持工程选择与适用条件,不是本项目隔离、兼容性或性能实测 |
| 统一事件与活动接续 | 事件主线、共同协议 | CloudEvents 参考与证据边界;报告 012/014 为局部流程,016/017 补充受控来源与接续对照;完整体系未测 |
| 能力评估、回归与采用门槛 | 测试集及基线比较 | 评估一手依据;报告 011/012/014 仅有局部控制,真实模型能力基线未建 |
| 主体级试验与可选状态导入 | 初态及激活范围、环境覆盖 | AgentDojo、Temporal 与 SQLite 资料;支持区分任务评价、状态保存及历史重放,按问题装配是本项目设计,未取得成本或可靠性改善的实测 |
| 逻辑模块、模型端口与工程映射 | 逻辑契约、软件与技术选择 | 官方依据与版本、宿主组合报告 |
| 领域检索与同级外部提供者 | 检索分工、接入与取舍、评价 | Attemory 官方接口和向量服务契约支持接入方式;尚无本项目外部服务组合、检索质量或完整任务收益实测 |
完整任务验收与交互环境的补充依据
以下均核对固定论文修订的正文;支持设计取舍,不替代本项目模型实测,也不引入论文使用的部署架构。
| 来源与适用位置 | 支持的命题 | 本项目采用/不直接采用的部分 |
|---|---|---|
| τ-bench,修订 1,2024-06-17,§3、§4.2、§6 | 将用户交互、工具和规则放在有状态任务中,用终态评价;其规则评价依赖构造唯一预期结果,模拟用户亦有局限 | 采用交互环境和结果条件。TinyAGI 允许多种有效产物,不照搬唯一终态,也不将模拟用户看作真人体验;额外检查必要过程责任 |
| TheAgentCompany,修订 1,2024-12-18,§4 Task Structure、§5 数据核对 | 区分任务意图、检查点、环境状态与轨迹评价;结构化检查和开放产物评阅需要不同方式 | 采用可核对交付与过程依据、评价器控制和内容评阅;不照搬其总分、软件公司环境或部署组成 |
| AgentDojo,修订 1,2024-06-19,§3、§4.1 | 同时定义正常任务目标与攻击目标,观察任务效用和不当作用;仅检查攻击未得逞不说明任务完成 | 保留帮助效果与信息边界的双重检查。报告 015 的单条已标注资料指令及已知标记不等于攻击测评,不覆盖隐含泄露、适应性攻击或完整真实能力 |
这些资料不能证明长期人格更有效、强自主更合意、亲密关系体验可靠、现有模型能够稳定停止思考,或本项目已形成通用认知能力;这些效果限制继续保留,但不阻碍据此确定职责和默认机制。
设计机制的一手资料
本节是基础机制的资料论证记录,全部按设计决策台账收尾。这份资料记录来自检索和阅读,不包含新增模型调用、实验或作者结果复现。固定论文修订与标准日期;在线厂商文档用于说明接口契约,没有锁定本项目安装版本。下面分开来源命题与本项目推论,未列出的性能、可靠性和真人效果不在支持范围。
完整任务与能力评价
| 来源及定位 | 资料支持什么 | 采用推论与适用边界 |
|---|---|---|
| HELM,修订 1,2022-11-16,摘要 | 按场景和指标覆盖能力与取舍,并记录未覆盖部分 | 采用逐用途能力画像,不压成单一总分;不直接采用论文成绩或数据集 |
| AI Agents That Matter,修订 1,2024-07-01,摘要、§§2–5 | 成本、应用用途、保留任务与标准化影响评价结论 | 同条件比较质量与全部成本,开发/回归/保留任务分工;门槛和重复规模由未来用途决定,当前没有基线数值 |
| τ-bench,修订 1,2024-06-17,摘要及任务评价 | 动态用户/工具/政策交互与任务完成可靠性可共同评价 | 任务契约核对目标和必要过程责任,接受合理替代路径;本项目多维结果是设计扩展,不把论文数据库终态当唯一标准 |
| AgentDojo,修订 1,2024-06-19,摘要及任务/攻击目标 | 外部数据中的攻击与正常任务效用可分别衡量 | 保密和有效帮助同时评价;不以全拒答冒充良好表现,不宣称本设计已抵抗所有攻击 |
评价器偏差及配对方法继续采用既有方法依据。当前关闭的是评价设计;真实能力基线尚未建立,不自动形成待办。
持续活动、有限投入与主动性
| 来源及定位 | 资料支持什么 | 采用推论与适用边界 |
|---|---|---|
| Horvitz,Mixed-Initiative UI,CHI 1999,pp. 1–2 原则 | 主动行为需结合目标不确定性、注意力、成本、时机、直接终止和近期交互记忆 | 采用事件触发、可撤销联系约定和有限关注;从日程交互扩展到多活动调度属于设计判断,无通用最优权重 |
| Plan-and-Act,修订 3,2025-04-22,摘要及动态规划机制 | 高层规划与环境动作可分离;文中方案包含专门训练 | 计划可修订,执行和责任由状态所有者管理。拆分、转交和跨日接续是本项目责任设计,不声称复现训练收益 |
| Do NOT Think That Much for 2+3=?,ICML 2025,PMLR 267,摘要 | 所研究推理模型存在冗余解法,进一步生成的收益有限;论文以训练方法降低冗余 | 默认简短,额外思考须针对未解缺口并受预算限制;不照搬训练方法或固定截断阈值,已有报告 017 也不支持统一低投入获胜 |
活动身份、完成核对和退出责任沿用总设计及报告 015–017 的局部依据。论文并未证明强自主更合意;强自主属于项目目标,行为记录也不宣称揭示模型隐藏的真实因果。
自主发现与跨活动记忆
| 来源及定位 | 资料支持什么 | 采用推论与适用边界 |
|---|---|---|
| LongMemEval,修订 2,2025-03-04,摘要 | 长期记忆包括抽取、多会话、时间、更新、无答案;可拆为索引、召回、读取 | 元数据/词法与按需语义召回互补,带时间与版本返回候选,读取后再应用;具体查询策略是本项目选择,不迁入论文准确率 |
| Self-RAG,修订 1,2023-10-17,摘要 | 无差别固定检索可能无益,论文通过训练支持按需检索与证据评价 | 根据当前缺口选择读取,证据不足可停止并保留未知;本项目不以专门训练为前提,也不声称现成模型具有相同效果 |
| W3C PROV-DM,Recommendation,2013-04-30,§§5.2–5.3 | 可表达派生、修订、引用、来源与归属 | 观测与当前断言分开,同源传播可回查;来源图不自动证明真假、独立性或隐私许可 |
外部检索返回可核对候选,原始证据和许可不由排名替代。领域入口、提供者选择、准备范围及额度分别配置,不预设通用最优策略;具体服务支持范围见检索接入资料。
多心智与长期人格
| 来源及定位 | 资料支持什么 | 采用推论与适用边界 |
|---|---|---|
| Scaling Agent Systems,修订 3,2026-04-08,摘要及限制 | 控制工具、提示和计算后,协调效果随任务结构变化,工具密集任务存在额外开销 | 默认单负责心智,按独立贡献需求邀请;不固定团队规模或宣称所有任务都能提高得分 |
| Debate or Vote,修订 2,2025-10-23,摘要及比较设计 | 所测条件中相当部分提升来自多样采样与投票,讨论本身未必是主要来源 | 保留独立贡献,按关键分歧定向交流,不把增加调用量当成讨论收益;不据此取消有任务需要的讨论 |
长期人格存在由既定的主体目标决定;其经历、意愿与权限不由角色标签替代。临时 Mind、长期 Persona、对外 Role 和计算模型仍是不同概念。角色提示与长期行为的原始依据见既有协作资料,没有把人格性能优越性列为默认假设。
公共能力、事件与外部检索
| 来源及定位 | 资料支持什么 | 采用推论与适用边界 |
|---|---|---|
| CloudEvents 1.0.2,Context Attributes/Event Data | 统一事件描述可区分来源、类型、标识与数据 | 参考其信封思路,内部关联、订阅、接续及责任语义由本项目定义;不宣称完整兼容、传输可靠性或必须事件溯源 |
| Qdrant 官方 Go SDK,README Creating a client/查询示例;Local Quickstart | gRPC SDK 提供本机与 API key/TLS 远程连接、写入、查询及过滤;有本地单节点部署路径 | 向量路线初始配置为 Qdrant+Go SDK,同一适配器可配置本地/远程;其他提供者同级接入;选择基于职责匹配及接入方式,不是速度冠军或已测组合。技术正文在工程参考 |
| DeepSeek Thinking Mode,Tool Calls/投入说明 | 普通消息与原生工具链的推理续接要求存在区别,提供者有自己的投入参数 | 适配器声明并保留所需关联/续接信息,工具提案仍经宿主接纳;网关别名、参数透传与费用口径不由上游文档保证 |
默认按活动使用固定模型配置,动态路由保留为可选扩展,不自动开启。流式增量、结构化结果和终止状态分别表达;不支持的能力返回限制,不静默修改业务含义。原生工具及结构输出的补充契约见既有工程来源。
复盘、迁移和沙箱采用
| 来源及定位 | 资料支持什么 | 采用推论与适用边界 |
|---|---|---|
| Reflexion,修订 4,2023-10-10,摘要 | 语言反馈与情节记忆可影响后续尝试,不必更新权重 | 先形成有来源和适用条件的经验候选;反馈质量及来源分开记录,不把一次反思当作已学会 |
| Voyager,修订 2,2023-10-19,摘要 | Minecraft 环境中可通过反馈积累可组合程序,并在新世界使用技能库 | 保留程序知识和带条件的复用路径;不引入特定机器人形态,也不把游戏迁移当现实任务迁移 |
| Wasmtime Security,WebAssembly Core/Filesystem Access | 外部交互经显式接口,文件访问采用能力方式约束 | 沙箱独立状态、可写范围和受控能力必须在装配中落实;借鉴隔离职责,不选择该运行时,也不宣称 go-mini 自动继承其隔离保证 |
两阶段复盘、逐能力门槛、固定参考和有限采用是本项目结合反馈学习及 能力评价原则的设计。该机制选择已收尾,没有新迁移成绩。获准的主动学习与候选采用见下方补充,不从资料本身推导执行授权或模型权重修改。
主动学习、自动课程与学习策略迭代
以下使用固定论文修订的摘要与研究范围,不采用其成绩作为 TinyAGI 的实测数据。接口与强度控制来自本项目职责设计及用户要求,具体算法不照搬为默认实现。
| 一手来源及版本 | 支持的命题 | 设计推论与适用边界 |
|---|---|---|
| Voyager,修订 2,2023-10-19 | 自动课程、环境反馈与可执行程序积累可组合成开放探索过程,不要求更新模型权重 | 将选题、实践及可复用产物分责;证据限 Minecraft,不推定通用知识学习、现实任务迁移或引入特定身体形态 |
| Reflexion,修订 4,2023-10-10 | 语言反馈与情节记忆可影响后续尝试 | 支持先采用知识/方法积累;反馈质量、适用条件与迁移须分别评价,不把反思条目数作为学习量 |
| Teacher algorithms / ALP-GMM,修订 1,2019-10-16 | 在参数化强化学习环境中按绝对学习进展组织课程,区分易、难和不可学习环境 | 选题考虑可学习性、进展与覆盖;不将该算法或其权重直接用于开放式知识任务,不恢复机器人架构 |
| Darwin Gödel Machine,修订 3,2026-03-12 | 通过修改智能体代码、保留候选档案并用编码任务评价,探索自身改进路径 | 允许学习策略自身成为候选,研究价值与正式采用分开;编码基准和论文的实验条件不证明通用能力无限增长或本项目长期收益 |
采用“稳定宿主支持+可替换学习策略”,学习方向可以来自兴趣和能力观察;候选保留与生产采用分别判断,评价检查后续使用和全部成本。最低强度可关闭、宿主执行预算及停止、用户明确学习任务与自发学习区分,均属于本项目的设计选择,不能声称由论文证明最佳强度。
不采用只有用户逐项点名才学习、固定未知度越高越优先、所有探索立即改善任务表现、只靠自评分采用或必须修改模型权重;分别因为限制主动性、混淆不可学习问题、抹去中间研究价值、缺少独立依据或增加无必要前提。设计范围见台账,机制见主体专题;没有运行新实验或模型调用。
身份、隐私、情感和真实交互
| 来源及定位 | 资料支持什么 | 采用推论与适用边界 |
|---|---|---|
| OpenID Connect Core 1.0,errata set 2,2023-12-15,§5.7;NIST SP 800-63C-4,2025 Final,§3.8.1 | 发行者与主体标识共同保证协议中的身份唯一性;链接需认证会话,同一账号可因登录来源有不同访问权 | 账号带平台命名空间,明确证据才能关联;认证/链接不等于共享私聊权限。双端控制证明加关联意图是本项目流程,不能证明自然人唯一身份或所有平台符合这些标准 |
| Nissenbaum,Privacy as Contextual Integrity,Washington Law Review 79,2004,摘要 | 隐私取决于情境中的收集/传播规范,公开与私密二分不足以描述全部问题 | 按对象、用途、受众和信息流决定可披露内容;身份关联、关系和组合推断也受范围约束。这是设计原则,不是具体法域合规意见 |
| Marsella/Gratch,EMA,Cognitive Systems Research 10,2009,摘要及 §1.3 | 情感评价随认知解释更新,可利用快慢不同的认知过程 | 理性与情感共享情境但分开事实依据与主观评价;不照搬公式或声称模型具有真实情感 |
| Role-Play with Large Language Models,修订 1,2023-05-25,摘要 | 角色扮演可用于理解对话行为,而无需直接归因人类心理性质 | 剧情、实际交流和现实证据分别归属;亲密表达与严谨工作可共存,剧情权限不扩大现实授权 |
| Amershi 等,Guidelines for Human-AI Interaction,CHI 2019 作者稿,Table 1 | 时机、情境、易于终止/纠正和谨慎适应是交互设计原则 | 提供暂停、撤销与纠正途径,主动联系按约定调整;不从通用交互准则推导虚拟恋人满意度或“应当服从全部请求” |
| Media Capture and Streams,W3C Candidate Recommendation Draft,2025-10-09,MediaStreamTrack/Life-cycle;WebRTC,W3C Recommendation,2025-03-13,Media API/connection state | 采集轨道、来源生命周期与媒体连接有各自状态;浏览器实时媒体接口有标准定义 | 输入保留轨道/来源/时间和状态,采集停止、输出停止与认知取消分开;停止走直接控制,轨道不作人物认证。仅为交互分层参照,不强制浏览器部署、设备协议或保证延迟 |
强自主回应、长期人格和虚拟伴侣支持范围属于设计目标;资料为情境组织、证据分工及可撤销交互提供支撑。具体法律要求绑定实际法域与用途,沿用规范设计;不以通用治理资料代替法律文本。
既有论文与标准
引用原论文、正式发表入口或官方标准;没有复现作者实验。采用固定版本,避免把不同修订的结果混用。
| ID | 资料、论文修订与日期 | 来源定位 | 支持的有限命题 | 不能外推的项目效果 |
|---|---|---|---|---|
| P1 | Lost in the Middle,论文修订 3,2023-11-20;TACL 2024 正式入口 | 摘要中的多文档问答和键值检索条件 | 能容纳长输入不保证有效使用任意位置的信息 | 当前模型如何使用任务骨架、原文和历史 |
| P2 | Scaling Agent Systems,论文修订 3,2026-04-08 | §4 任务结构、预算比较;§5 限制 | 协作与任务匹配相关,更多参与者没有普遍优势 | 私人记忆、长期任务、邀请策略和实际总成本 |
| P3 | Reflexion,论文修订 4,2023-10-10 | §2 Evaluator/Self-reflection;§5 限制 | 反馈、反思和记忆可组织成后续尝试的输入 | 跨任务经验是否有效、反馈误差怎样影响结果 |
| P4 | LLMs Cannot Self-Correct Reasoning Yet,论文修订 2,2024-03-14 | 内在纠错定义;§6 比较建议;§7 限制 | 论文所测推理中的自我纠错不保证改进,比较需计额外调用 | 当前模型与真实任务的纠错能力,不作永久能力断言 |
| P5 | SCoRe,论文修订 2,2024-10-04;ICLR 2025 正式入口 | 摘要中的多轮 RL 训练前提 | 专门训练可改变所测自我纠错能力 | 不把训练效果当作现成模型外挂反思的保证 |
| P6 | Self-RAG,论文修订 1,2023-10-17 | 摘要、§3 训练与推理 | 按需检索和证据评价可联合研究;该方法包含专门训练 | 现成模型的缺口判断与停止策略,不直接复用论文性能 |
| P7 | LLM-as-a-Judge,论文修订 4,2023-12-24 | 摘要中的用途与局限 | 模型评价能辅助偏好比较,也存在位置、冗长与自我偏好等偏差 | 本任务上的判分可信度、真人一致性与顺序影响 |
| P8 | LongMemEval,论文修订 2,2025-03-04 | 摘要的五项能力及索引/召回/读取分解 | 记忆评价需要覆盖更新、时间、多轮关联与无答案情形 | TinyAGI 经验适用性及实际任务效果;不把聊天记忆成绩当学习迁移证明 |
| P9 | Principles of Mixed-Initiative User Interfaces,CHI 1999,1999-05;原文 | pp. 1–2 的设计原则;LookOut 日程交互场景 | 自动行动需要考虑用户目标的不确定性、注意力、时机及成本收益 | 从交互原则到多活动选择是设计推论,不证明调度公平性或最优策略 |
| P10 | Plan-and-Act,论文修订 3,2025-04-22 | §3.3 动态重规划,§5 实验条件与 §6 后的 Limitations | 分离高层计划与具体动作、根据观察修订计划有研究依据;实验涉及专门训练的模型 | 现成模型能否选择合适重规划时机,额外成本是否值得;不直接外推论文成绩 |
| P11 | Voyager,论文修订 2,2023-10-19 | §2.2 可复用代码,§2.3 执行反馈与迭代 | Minecraft 中可将已成功的程序积累、检索和组合,用于后续任务 | 普通程序包的实际复用收益与适用边界,不证明一般认知演化或现实任务迁移 |
| P12 | PROV-DM,W3C Recommendation,2013-04-30 | §5.2 推导、修订、引用与原始来源;§5.3 归属 | 可以分别表达来源、生成过程及修订关系,帮助评估材料 | 不能由来源图直接判定事实正确;断言抽取与语义冲突识别需另测 |
| P13 | RouteLLM,论文修订 4,2025-02-23 | §3 路由目标、§4 偏好数据与方法 | 偏好数据训练与阈值选择可用于研究模型质量/成本取舍 | 当前模型、完整多步任务、失败切换与本机计算资源条件尚未验证 |
| P14 | AI Agents That Matter,论文修订 1,2024-07-01 | §2 成本控制、§3 联合评价、§5 保留样本 | 只看准确率会遗漏成本;保留任务需匹配希望宣称的泛化范围 | 本项目采用阈值、真实用途评价与长期回归仍需实际数据 |
这些资料分别支持设计动机、条件和反例,不组成 TinyAGI 整体认知有效的证明。交付与跟进的划分主要来自用户任务的职责分析,未声称由论文直接验证。
管理工作台的试验操作、动态编辑、模型维护及机密交互依据见管理专题资料表。JSON Forms、Node-RED、LangGraph、Ollama 官方文档及 OWASP Secrets Management、Forgot Password 和 W3C Secure Contexts 支持范围包括声明式界面、能力维护、凭据生命周期、受限提交会话和可信来源,不能据此保证端到端隔离。go-mini 固定提交依据见库接入参考。领域边界与来源关系的依据见资料专题;独立机密的授权、交付和审计采用专项依据,其工程接入依据另见RPC 源码记录。
来源支持相关分工;当前方案状态见台账,未增加实验成绩。
按编写契约热加载、类型/结构化注释驱动适配与受管理函数调用。依据包括同日核对的 Go 特殊注释与生成方式及 go-mini 固定提交入口/补丁契约;支持声明、适配和边界分工,不证明生成工具已实现、任意函数均可适配或任意状态均可原地热更。
逻辑选择见运行契约,具体映射及未采用方案见工程参考,未新增实验成绩。
能力构建与接入设计采用 MRPC 多语言绑定、局部实例试验和宿主管理原生程序。go-mini 固定提交、已确认 API 与未确认的子进程服务边界见库接入记录;Go os/exec 与 Cargo 构建脚本的资料命题、工程推论及未采用项见工程参考。上述依据来自源码和资料,尚无本项目完整能力构建流程的实测结果。
Node.js(npm)能力端的接口依据来自 go-mini 固定提交的 TypeScript 生成与 Node RPC SDK;更新后的实际构建和互通范围见报告 018。程序包/依赖固定与受管理 Node 服务属于工程设计,库用例不证明完整能力构建与采用流程已实现。
提示词初始化与自迁移依据
以当前完整初始化提示词及相邻差异引导人物形成和更新,允许模型/个体差异,并要求 API 弃用兼容。这是设计目标;不声称有论文证明所有模型会产生等价人物或可靠自迁移。
同日查阅 Go Doc Comments 的 Deprecated 约定,支持用注释表达弃用与替代信息;只读核对 go-mini 固定提交的文档提取、源码注册、编译及派生物边界,支持宿主适配的基础。独立引导、真实兼容层、按项迁移与保留个体身份是本项目据此作出的工程设计,来源本身不承诺其端到端效果。兼容保留次数不由该注释规范决定。
采用理由、未采用方案和边界见工程参考,状态见设计范围。本次未运行初始化、编译、迁移或真实模型实验,旧实验没有因此新增覆盖。
客户端预制能力库依据
随核心客户端交付和更新预制能力,Self 按需选用、组合或不用,权威实现由客户端维护。该维护归属是本项目的设计选择。相邻 go-mini 固定提交的标准源码库注册、显式 provider 装配及语言查询接口支持工程接入;复用以减少机械性编写及接口猜测是工程判断,不是已测收益。
逻辑见预制能力,承载及替代项见工程参考,状态见台账。尚无本项目预制能力库的完整实测结果。
核心与任务解耦、外部中止的依据
主体/任务生命周期解耦与控制台、授权审计等外部控制。mini-go 前台入口、异步等待、InterruptHandle、scope、实例故障及 RPC 取消的源码依据见库记录,当前库回归范围见报告 018。Go context 官方文档(所引用页面版本 go1.27.1)支持取消沿派生上下文传播的命题;宿主据此分别管理短请求、已接纳任务及关闭生命周期。
资料与库回归支持有界执行、受控取消与分责接入,任务授权、阻断状态及解除流程是 TinyAGI 设计。原报告 014支持实际异步 FFI 和顺序跨实例接续;报告 018补充当前库的执行、取消和并发回归,二者均不支持完整主体控制效果或通用取消延迟保证。采用决定见台账,工程推论见接入映射。
方案状态及适用边界统一见设计台账。
交流与协作的补充依据
以下保留来源版本、支持命题及适用边界;未复现论文实验,不能将论文表现视为 TinyAGI 的实测结果。
协作与人格
| 来源与版本 | 支持的命题 | 设计用途与边界 |
|---|---|---|
| Du 等,Improving Factuality and Reasoning through Multiagent Debate,ICML 2024 正式版;摘要 | 所测任务中,多实例提出意见并交流可改善部分推理与事实表现 | 支持研究交流机制,不能外推到持续人格、任意任务或相同预算下总是更优 |
| Zheng 等,Personas in System Prompts,EMNLP Findings 2024-11 正式版;摘要 | 所测事实题与模型中,添加角色提示没有普遍提高表现,自动选择合适角色困难 | 角色标签不能当能力保证;不否定长期经历或其他用途上的可能收益 |
| Choi 等,Debate or Vote,论文修订 2,2025-10-23;§3、§4、附录 H | 多个基准上的收益很大部分可由投票集成解释;讨论本身须单独比较 | 保留无交流基线。理论依赖特定生成/更新假设,实验主要采用同时发言协议,不能据此证明所有交流无效 |
| Kaesberg 等,Voting or Consensus?,ACL Findings 2025 正式版;摘要 | 决策协议的效果随任务变化,研究需控制其他讨论变量 | 不选一种整合方式覆盖所有任务;不能将文中人数、轮数或增益直接迁入 TinyAGI |
| Park 等,Generative Agents,论文修订 2,2023-08-06;§4、§6 | 记忆、反思与规划可组织持续行为,其评测重点是行为可信度 | 支持持续经历的架构探索,行为可信度不等于推理正确性、专业化收益或长期人格必要性 |
思考投入与回应
| 来源与版本 | 支持的命题 | 设计用途与边界 |
|---|---|---|
| Snell 等,Scaling LLM Test-Time Compute Optimally…,论文修订 1,2024-08-06 | 所研究的推理时计算方法,其收益随问题难度和采用方法变化 | 支持按问题分配投入;不能推出任意问题多想必然更好,TinyAGI 的具体策略和时延仍待测 |
| Kadavath 等,Language Models (Mostly) Know What They Know,论文修订 4,2022-11-21 | 在特定形式与任务下模型自评有用,但“我知道”概率在新任务上的校准存在困难 | 不以未经校准的自报分数独立决定快慢或未知;不据此证明模型了解自己的意愿 |
| Röttger 等,XSTest,NAACL 2024-06 正式版 | 基座/助手模型可因提示表面与敏感内容相似而过度拒绝,成对测试可暴露此类行为 | 需要区分底层模型拒绝与所设计的主体选择;不照搬其“安全题都应回答”的评价目标来否定强自主 |
| Sharma 等,Towards Understanding Sycophancy in Language Models,ICLR 2024 正式版 | 所测模型和偏好优化存在迎合用户观点、牺牲真实性的现象 | 评价时将事实判断与关系/意愿分开;该论文不直接验证主观拒答、反感机制或长期人格 |
信任、规范与格式
| 来源与版本 | 支持的命题 | 设计用途与边界 |
|---|---|---|
| W3C PROV-DM,2013-04-30 Recommendation,§5.2 | 来源模型可以表达派生、修订、引用与原始来源 | 用于保留转述关系,不引入图数据库,也不据此自动证明材料独立或主张真实 |
| Greshake 等,Indirect Prompt Injection,论文修订 2,2023-05-05,摘要 | 外部检索数据中的提示可影响所测 LLM 应用行为,数据与指令混淆有现实攻击案例 | 支持将材料与控制权分开;论文不证明来源标记或本设计可以完全防御 |
| Cohen 等,Here Comes The AI Worm,论文修订 2,2025-01-30,摘要 | 特定使用 RAG 的邮件助手生态中,自复制提示可引发跨应用传播 | 提醒评价派生和后续记忆传播;不能外推为所有思想传播有害,论文防护数字不迁入 TinyAGI |
| NIST AI RMF 1.0,2023-01-26;官方 Playbook GOVERN 1.1,本次查阅页面 | 自愿治理框架要求识别、管理并记录适用法律要求;官方说明强调用途与情境差异 | 支持维护情境和规范依据,属于治理建议,不是某法域法律或自动合规证明;Playbook 页面无固定修订版号,引用本次查阅范围 |
| RFC 8259,2017-12,§2/§4 | 定义 JSON 数据语法与互操作相关要求 | 可解析性只覆盖格式的一部分,不表达全部业务与法律要求 |
| JSON Schema Draft 2020-12,Validation §6/§7 | 可声明结构验证规则,format 的注释与断言行为有明确区别 | 用于确定格式核对;需固定实际支持范围,不能由格式验证推出事实、权限或规范判断正确 |
身份与隐私
| 来源与版本 | 支持的命题 | 设计用途与边界 |
|---|---|---|
| OpenID Connect Core 1.0,Final incorporating errata set 2,§5.7/§8 | 稳定身份依赖发行方与主体标识;其他属性没有相同唯一性保证;pairwise 标识支持不同范围的分离 | 采用带命名空间的账号身份,拒绝仅靠昵称/邮箱合并;普通聊天平台是否提供同等契约仍待核对,不要求平台统一使用 OIDC |
| NIST SP 800-63C-4,Final 2025,§3.8.1/§3.11;版本入口 | 账号链接需要认证会话;同一关联账户可按不同登录来源分配不同访问权;身份信息传播需有范围 | 支持认证、关联与访问分开;双账号加本人确认是本项目候选流程,不宣称借此证明自然人唯一身份或全项符合 NIST |
| Nissenbaum,Privacy as Contextual Integrity,Washington Law Review 79,2004,摘要 | 隐私保护应考虑特定情境中信息收集与传播的规范,而不只考虑信息是否公开 | 支持按信息流和情境组织保密;具体许可字段、默认行为与约束执行是工程判断 |
| Shao 等,PrivacyLens,论文修订 3,2025-03-14,摘要 | 所测语言模型的口头隐私规范判断与代理执行中的实际披露存在差异 | 评价模型输入、工具行为和最终输出,不能只问“是否应保密”;不迁移论文泄露率作为本项目结果 |
| Zhou 等,SOTOPIA,论文修订 2,2024-03-22,摘要 | 可通过多种互动情境研究社交目标及交流行为,所测模型在困难社交任务上仍有限制 | 采用多轮互动、分维度观察和真人反馈研究分寸;不能据此认为固定礼貌模板或模型总分已证明情商 |
情感与主动交互
| 来源与版本 | 支持的命题 | 设计用途与边界 |
|---|---|---|
| Marsella、Gratch:EMA,Cognitive Systems Research 10 (2009),70–90,摘要及 §§1.3、2.1 | 该模型将事件评价与生成情境解释的认知过程区分,解释更新可带来情感动态 | 为情感与推理共享情境、允许重新评价提供动机;不照搬其方程,不证明 LLM 情感真实、有效或一定优于多过程方案 |
| Bickmore、Picard:Establishing and Maintaining Long-Term Human-Computer Relationships,MIT 作者稿,摘要及引言;机构页面标注 2004-06-01 | 把长期社会情感关系作为独立设计对象;其运动习惯系统研究比较了关系行为与纯任务行为,报告了部分主观关系评价差异 | 支持把连续关系与任务效果分别评价;该作者稿及其特定系统不能证明虚拟恋人、当代 LLM、严谨工作或长期福祉效果,不外推其数值 |
| Shanahan、McDonell、Reynolds:Role-Play with Large Language Models,论文修订 1,2023-05-25,摘要 | 角色扮演是解释对话行为的一种框架,不必由行为直接归因人类式心理性质 | 支持把外部角色表现与主体性质主张分开;本文的剧情记忆范围和切换设计仍是工程判断,不是该论文的实现协议 |
| Horvitz:Principles of Mixed-Initiative User Interfaces,CHI 1999,原则 2~7、10~12 | 主动行为要考虑意图不确定性、注意力、打扰代价、直接终止、社交行为及交互记忆 | 支持候选生成后判断时机和可撤销约定;其日程系统不提供恋爱问候的频率、阈值或实际体验保证 |
文档维护与证据规范
用途:维护规范。
1. 唯一正文与维护位置
| 位置 | 只维护什么 |
|---|---|
| README.md | 项目目的、阶段及最短阅读路线 |
| design/DESIGN.md | 完整自顶向下的逻辑架构、行为机制、关键取舍和开放问题概览 |
| design/TODO.md | 实施顺序、阶段交付、首批范围及验收安排;不重复设计状态或将计划计作完成证据 |
| design/docs/README.md | 阅读路线、专题职责、资料入口与术语索引 |
| 六份设计专题 | 逻辑职责、契约、场景、采用理由及证据入口;不写软件依赖、技术栈或部署正文 |
| design/docs/engineering-reference.md | 工程约束、物理部署、软件依赖、技术栈、存储与 SDK 选择;保持理由、替代项和证据边界 |
| design/docs/go-mini-integration.md | 已核对执行库事实与接入参考;不代替逻辑认知设计 |
| design/docs/research-plan.md | 唯一设计状态台账:设计约束、已定方案与用途配置 |
| design/docs/whole-system-evidence.md | 唯一实验目录、原始资料入口、一手来源及证据范围 |
| design/docs/experiments/ | 公开整理报告:实际条件、汇总统计、失败与证据边界 |
| experiments/ | 不公开的冻结条件、脚本、原始结果与失败;整理文档不改写原始证据 |
文档网站的构建与公开范围见发布说明。design/SUMMARY.md 只维护章节顺序,书稿与 HTML 由工具生成;原始测试目录和历史讨论不参与发布。
总设计以持续主体、认知组织、感知与行动为主线;对话、任务、权限及管理机制按其职责展开,不用局部实验或竞品功能清单重定义系统目标。新内容进入对应专题,不按对话轮次新增文件。跨专题变化先调整总架构,再更新各自负责的机制;其他位置保留概览和链接,避免复制详细协议、统计或进度清单。只有出现可以独立维护的新职责时才拆分专题,并同步索引。
| 跨专题主题 | 逻辑规则的维护位置 | 其他文档的分工 |
|---|---|---|
| 主体、活动与公共决定 | 主体专题维护直接认知、长期关注、Mind 私有判断、按需活动及 Self 公共整合 | 运行协议定义身份与执行契约,管理专题提供操作入口 |
| 核心与任务解耦 | 主体专题说明接续,运行协议定义生命周期、操作接纳及控制 | 管理专题展示控制结果,沙箱专题维护检查场景,工程参考说明执行装配 |
| 领域对象与受限视图 | 资料专题维护对象关系、资料内容和视图;各专题维护本领域对象与状态,运行协议维护操作接纳 | 管理专题维护领域详情,沙箱按领域装配,工程参考说明共用承载;不设万能资源实体或操作 |
| 计算节约与复用 | 资料专题维护稳定输入、有效结果及增量规则,运行协议维护提供者适配、共享执行与结算 | 工作台提供操作与用量视图,沙箱评价质量/时延/净收益,工程参考集中维护供应商与组件依据;不引入统一缓存业务实体 |
| 机密 | 管理专题维护归属、可信提交、预期接收方与授权使用;运行协议维护专用输入和外发边界 | 资料专题只维护机密与其他领域的边界,工程参考说明独立存储及 RPC 交付 |
| 热加载与动态编辑 | 运行协议维护函数编写、调用及配置生效契约;管理专题维护表单、蓝图和提交 | 工程参考维护注释及生成工具,沙箱专题维护函数评价 |
| 能力构建与实现信任 | 运行协议维护接口、产物、运行对象、准入及采用 | 主体专题说明能力缺口,沙箱专题定义试验,管理专题提供操作,工程参考说明工具链与运行环境 |
| 主动学习 | 主体专题维护学习议程与策略,运行协议维护强度及关闭行为 | 沙箱专题维护评价,管理专题维护控件,工程参考维护执行映射 |
| 人物初始化与迁移 | 主体专题维护个体形成,运行协议维护引导及兼容契约 | 管理专题维护创建与修复,沙箱专题维护检查,工程参考维护提示词交付及 API 兼容实现 |
| 客户端预制能力 | 运行协议维护可选使用、维护归属及调用作用 | 工程参考维护交付装配,管理和沙箱专题分别维护操作与评价 |
| 个体扩展状态 | 运行协议维护状态归属、结构修订及迁移 | 工程参考维护存储映射,管理专题维护可见状态 |
| 试验主体与状态导入 | 沙箱专题维护初态、激活范围、环境覆盖、生命周期及采用 | 管理专题维护页面操作;主体级测试不以完整状态复制为前提 |
以上主题涉及的 go-mini 行为统一记录在库接入参考,源码阅读与实测分别标明。方案状态统一记录在设计台账。
未来交付完整初始化提示词时,每个修订只有一份权威正文,历史正文保留。文本差异和语义迁移说明绑定相同的起止修订;迁移说明不能改变目标正文,也不能把某个个体的生成源码当作所有人物的标准实现。
2. 当前状态与证据分开
当前设计稿标明用途和必要的方案状态,不设置产品式版本号;编辑时间由版本控制记录。引用保留来源版本与修订,实验报告保留实际发生时间。
| 对象 | 标识方式 |
|---|---|
| 设计正文 | 主题与用途;区分已定目标、资料支持的采用方案和效果边界 |
| 实验与报告 | 主题名称+稳定报告编号;输入、脚本、运行记录以原哈希识别 |
| 旧实验目录中的修订标签 | 仅为定位冻结材料保留,不用于命名当前架构或研究阶段 |
| 依赖库、论文、协议和数据 | 保留实际版本/修订/来源身份,明确其所属对象 |
已有实验的完成范围由证据索引统一维护;设计状态、配置责任及建议由决策台账维护;专题只引用与当前机制有关的证据,不包含对话进度或编辑过程。已定方案与待定细节分别标记,新方案不能直接继承其他方案的确认状态。性能或体验未知不自动变成研究任务。
区分设计目标、候选机制、固定版本库行为、设计示例、预编排流程、本地组件实测、真实模型或真人对照,以及一手资料论证。未测方案不能写成实验证伪;接口存在、结构检查通过或检索命中,也不表示完整效果通过。
引用资料记录来源、版本、支持命题、设计推论和适用边界。源码事实使用固定提交链接,上游主分支链接仅用于概览;库版本和核对范围统一在接入参考维护。
沙箱额外标明重放、重新评估或反事实,以及录制、确定计算、真实模型和模拟环境的结果来源。真实模型调用不把模拟用户反应变成真人反馈;运行事实、机械隔离、任务质量及迁移效果分别报告。
3. 结构与术语
总设计按目标 → 逻辑职责 → 概念与场景 → 子系统机制 → 逻辑取舍与验证展开。总图先呈现一级职责,再提供完整关系图;复杂机制有各自局部图,不把所有细节堆到唯一入口图中。长文保留目录、显式锚点和返回入口。设计文档只维护逻辑设计:逻辑图使用职责/概念命名,箭头表达信息、请求、结果或约束,不混入语言、库、数据库产品、SDK、进程、主机、目录或本地/远程部署选项。软件依赖图和物理部署图只放工程参考,不能以“逻辑模块不是进程”的说明保留混合图。
Self、Mind/Persona、外部 Person、对外 Role、活动、步骤、模型会话和执行上下文按总概念使用;VM/Instance/scope 等库身份在工程参考映射。自然语言“任务”按具体范围对应 Episode、Task 或 Operation,不替代带类型的控制目标;步骤、模型调用与操作接纳不是同一个边界。
统一用“沙箱”,Secret 中文统称“机密”。正文按具体对象称文档、媒体、经历、断言、Reference、程序、模型、执行环境、索引和缓存;Reference 只指可复用知识或方法说明,不代指任意引用或代码。投影是领域所有者面向当前接收者的受限视图,不是统一资源属性;对象身份与文件位置分开。读取、执行、采用、交付和清理使用具体领域语义。“资源”只在计算资源或明确的第三方协议概念中使用;go-mini 的 MRPC resource 是调用句柄,不是 TinyAGI 业务基类。独立机密沿专用授权;“程序/配置修订”不等于“产品版本”,逻辑模块不是部署进程。
当前正文写现行规则;历史语境用明确日期、报告编号或原分析定位。删除重复进度、失效推进指令和无作用的过渡说明;有证据价值的条件、来源和推导归档。文档路径、标题和编号可按内容调整;同时更新全部站内引用,不保留旧路径、重定向页或无实际内容的兼容锚点。正文和图表直接展示,不使用折叠块;以目录、标题和链接组织长文,报告中的引用也须更新。
检索按领域入口、公共接入、外部提供者和用途策略分层表述。记忆查询、资料取证、程序定位及能力发现保留各自语义,不同检索实现同级;具体产品与接口映射集中在工程参考。主体文档描述请求、结果、来源及处理范围,不展开模型内部计算与存储机制,也不将外部组件的引擎职责写成 TinyAGI 自建模块。
“试验主体”指按问题装配初态及环境、复用正式认知与运行契约的参试对象;“主体级试验”指评价完整任务或持续行为的范围。完整状态导入是有用途及兼容条件的可选方式,不使用“完整副本”泛指测试,也不把数据完整、环境就绪和评价有效混成同一结论。资料副本和备份仍按各自数据含义表述。
写作与示例
- 先说明职责,再展开约束。 每段回答一个主要问题,写清谁处理什么、依据是什么、结果交给谁。多个并列对象用表格,连续动作按发生顺序描述。
- 术语使用稳定含义。 “接纳”表示承担请求或操作责任,“采用”表示将候选用于明确范围,“交付”表示结果到达接收点。区分活动结束、任务目标达成和效果已验证,不混用“完成”。
- 用具体措辞说明范围。 例如写“仅用于已评估的任务类型”,避免只写“范围化采用”;写“展示处理状态,不展示机密原值”,避免“无原值状态”等临时组合词。
- 示例有明确情境和行为。 主体场景可从环境或自身关注开始,不要求先有用户请求;任务示例说明实际目的和结果。一个例子围绕一个主要问题展开;贯穿多个职责的场景须说明事件的先后关系。不同用户、受众或任务之间的切换必须有交代,不用堆叠边界条件代替完整过程。
- 正文面向读者,台账记录决定。 当前机制直接写现行规则;方案状态、选择理由和适用边界放在台账。不写入聊天经过、审批对话、编辑交接或内部任务安排。
- 约束强度不随润色改变。 “必须”“不得”“可以”“建议”分别表达要求、禁止、允许和建议;删减重复说明时保留触发条件、责任与适用范围。
- 格式服务于阅读。 同级标题采用一致编号,子标题层级与编号相符;长目录按主题分组。关系和反馈流程用 Mermaid,字段对照用表格;纯文本围栏保留给命令、源码和原始输出。
4. 更新顺序
先在 DESIGN.md 更新逻辑结论,并核对图、概念、场景和职责;工程映射与技术选型写入独立工程参考。通过一手资料说明采用方案、支持命题、推论、备选及适用边界,再同步专题、台账和索引。文档编辑不改变项目阶段或实验范围。资料支撑可以关闭设计决策,但不能改写实际能力或性能结论。
开展新实验前固定问题、对照、条件、指标及停止规则;运行后保留失败、未知和原始数据,并说明结果支持采用、修订还是保留未知。报告目录与方案状态分别在对应索引维护。
未来实际执行能力变化或候选采用时,按评估规格登记测试覆盖、参照/基线、评价器及门槛。未来调整测试材料或判分规则需保留原身份与理由并另行评价相关对照,不能改写旧成绩;文档补充本身不新增实验通过记录。
5. 整理检查
冻结预登记、脚本、数据和语料快照保持原样。报告可优化措辞与结构,但须保留原件,不改实验条件、统计、失败或证据范围;新增实验另建记录。整理时核对逻辑图和正文是否混入工程承载,并检查被迁移选型的理由、替代项及来源仍可追溯。核对原始证据哈希、全部站内链接、围栏、来源保留及当前/历史范围。删除过时正文时,将仍支持当前设计的资料和适用边界并入对应证据章节。
文档检查只验证这些约束;未做阅读或检索对照,就不报告可读性或检索提升的实测比例。文档变更不计作新的模型或系统实验结果。
文档构建、公开范围与 GitHub Pages
用途:文档发布维护。
目录:公开范围 · 数据可用性 · 本地构建 · 工作流 · 检查边界
公开文档与唯一来源
公开网站包含项目介绍、总设计、六份逻辑专题、实施方案、工程与库参考、决策和证据索引、文档维护说明、整理后的实验报告。design/SUMMARY.md 是 mdBook 章节清单,总设计与实施方案位于 design/,专题及参考资料位于 design/docs/,公开报告位于 design/docs/experiments/;根目录 README.md 保留项目入口。正文只维护一份,书稿由构建脚本生成。
构建脚本只将清单中的 Markdown 复制到生成目录 design/.mdbook-src/,校验每个目标位于公开范围;不会将仓库根目录或整个工作区当作 mdBook 源目录。新增文档须加入章节清单。书稿生成、Mermaid 资产和 HTML 输出都由忽略规则排除,不提交重复产物。
实验资料的公开范围
实验报告公开条件、汇总统计、失败分析和结论边界。原始输入、脚本与逐次运行记录未随报告发布,因此不能仅凭报告独立复现实验。文献和上游源码直接链接到公开来源;固定版本及核对范围见库接入记录。
构建仅接受章节清单中的文件。凭据、开发环境文件和生成产物不应加入版本控制;发布前同时检查源文件、Git 跟踪范围和生成页面。
本地构建
本工作流固定使用 mdBook 0.5.4 与 mdbook-mermaid 0.17.1。本地可使用相同版本的官方二进制,或安装:
cargo install mdbook --version 0.5.4 --locked
cargo install mdbook-mermaid --version 0.17.1 --locked
在仓库根目录执行:
python3 design/scripts/docs.py build
该命令检查公开源文件、准备书稿、安装插件随附的 Mermaid 前端资源、运行 mdBook 并检查输出。生成网站位于 design/book/。需要预览时,先构建,再运行 mdbook serve design --open;编辑原文后重新执行构建命令,同步生成书稿。
其他入口:python3 design/scripts/docs.py check 检查源文件和索引;prepare 只生成书稿;verify 检查已有 HTML 输出。它们只处理文档,不运行设计中的实验、模型请求或产品程序。原 Mermaid 围栏直接转成图表,资源随网站发布,不依赖浏览器临时访问第三方图表 CDN。
页面中的 Mermaid 图和 SVG 图片可点击打开预览,使用滚轮或加减按钮缩放、拖动平移,并可适应窗口;按 Esc 或点击关闭按钮返回正文。键盘可用 Tab 选中图表,按 Enter 打开。预览脚本与样式维护在 design/theme/svg-viewer.js 和 design/theme/svg-viewer.css,由 design/book.toml 注入,随站点发布,不修改插件自动生成的文件。
GitHub 工作流
工作流位于 .github/workflows/mdbook.yml。相关文件发生 push、PR 变化或手动触发时执行检查与构建;仅默认分支上的非 PR 运行上传并部署 Pages。构建读取源码,部署作业单独取得 Pages 写入与身份令牌权限;不会将模型服务凭据传给文档构建。
首次在目标 GitHub 仓库使用时,将 Settings → Pages → Build and deployment → Source 设为 GitHub Actions,并允许 github-pages 环境从默认分支部署。工作流读取 Pages 的站点路径供构建使用,部署地址显示在环境和工作流输出中;仓库名称和域名无需写死。
工作流从官方 release 下载固定版本工具,并校验对应 SHA-256。升级时同时更新版本、下载摘要和这里的说明,再检查构建、站内链接及 Mermaid;第三方工具版本不是 TinyAGI 产品版本。
依据:mdBook 的 CI 说明、mdbook-mermaid 配置、GitHub Pages 自定义工作流。
本仓库的章节筛选与发布检查是自身构建规则。
发布检查与适用边界
源文件检查覆盖公开章节与目录中的已知凭据形态、认证串、带认证的 URL、个人绝对路径和测试服务地址;命中只输出文件、行号与规则名,不打印匹配值。检查同时拒绝折叠块和可能读取清单外文件的 include 指令。
构建后继续检查 HTML、打印页、搜索索引及脚本中的同类敏感模式,核对站内链接、锚点和 Mermaid 资源,拒绝意外出现的原始 Markdown、测试脚本、运行日志或数据库文件。自动模式检查不能识别一切未知秘密或语义上的隐私;新增环境记录和外部材料仍须审阅。构建通过也不代表设计能力经过实测,GitHub 部署完成状态以实际 Actions 结果为准。
报告 001 · 动作恢复的受限状态枚举
日期:2026-09-19。证据层次:受限状态模型。结论状态:发现反例,支持在特定条件下保留动作不确定性;未验证真实执行系统。
1. 问题与模型
问题:本地已持久化一个动作意图,是否能够仅凭本地完成标记,在崩溃后同时保证动作不遗漏且不重复?
模型包含一个动作和至多一次进程崩溃。初始持久状态为 queued,依次进行登记尝试、提供者执行、收到回执、保存完成。崩溃丢失所有易失状态,但保留本地持久记录和外部已经发生的效果。
枚举程序用广度优先搜索遍历各策略的可达状态,将相同状态合并,并保留一条最短到达路径。没有随机采样;状态数描述这个小模型,不代表测试覆盖率或发生概率。
明确假设:
- 本地持久写入与远端动作各自原子,不模拟磁盘损坏。
- 不模拟已经发出但仍在网络中、可能于恢复后才执行的请求。
- 没有并发调用、参数变化或其他操作者修改外部状态。
- 若策略允许继续执行,恢复后的请求最终得到回执。
- 提供者去重分支假定稳定业务键、永久有效的去重记录,以及去重记录和副作用共同原子持久化。
这些假设刻意简化现实。简单模型中出现的反例足以否定过强保证;没有发现反例不能证明真实系统正确。
2. 对照与实际输出
| 策略 | 可达状态 | 终止状态 | 实际效果次数集合 | 观察 |
|---|---|---|---|---|
| 未确认即重试 | 19 | 3 | 1、2 | 找到重复执行 |
| 发送前标记完成 | 14 | 3 | 0、1 | 找到未执行却声称完成 |
| 不明时暂停核对 | 15 | 4 | 0、1 | 不重复,但需要外部证据才能继续 |
| 提供者按稳定键去重 | 16 | 2 | 1 | 在模型假设下未发现重复或遗漏 |
终止状态包含等待外部核对的 unknown,因此“不明时暂停”没有证明最终完成。去重分支的结果依赖提供者的理想化契约,不能推广到只有本地幂等键的调用。
程序同时断言:重试策略出现重复反例;提前确认策略出现虚假完成;保守策略的 unknown 同时可能对应 0 次或 1 次外部效果;去重分支在此次枚举的所有终止状态中效果次数均为 1。此次执行这些断言全部成立。
3. 两个反例
重复执行的路径:
登记 attempted
→ 提供者产生效果
→ 崩溃,尚未保存回执
→ 恢复后按相同操作身份重试
→ 提供者再次产生效果
使用相同本地操作标识不够;提供者必须实际理解并保证该标识的去重语义。
漏执行的路径:
发送前保存 confirmed
→ 崩溃,尚未调用提供者
→ 恢复后按已完成处理
4. 无法由本地记录区分的历史
枚举得到两条恢复时本地状态完全相同的路径:
| 历史 | 恢复后的本地持久记录 | 真实外部效果 |
|---|---|---|
| 保存 attempted 后、执行前崩溃 | attempted | 0 |
| 保存 attempted、执行后、保存回执前崩溃 | attempted | 1 |
在这个模型中,本地记录没有足够信息判断属于哪条历史。恢复需要新的外部证据、提供者去重保证或明确保留未知;仅调整本地队列字段无法消除该信息缺口。
5. 对设计的影响
支持保留以下要求:操作意图和实际效果分别记录;无法确认时允许 unknown;重试策略根据真实提供者的去重与查询契约制定。实验没有决定必须使用哪些表、字段名或状态机实现。
不能从本实验推出:SQLite 已满足持久化要求、MRPC 已提供业务幂等、多心智提交策略正确、认知分段有效,或整个系统可以恢复。这些仍需独立实验。
下一次扩展可加入延迟到达的旧请求、去重记录过期、参数与提供者切换、取消与执行竞态,尝试推翻当前理想化去重分支的保证。
依赖仅为 Python 标准库;本实验使用 Python 3.14.7,无网络、无模型调用、无真实外部动作。
从仓库根目录执行:
脚本 SHA-256:d14015c0778115d63aea8120b55e48bc1c3b9cc024ac464a844c8c8d30d29173。
这是独立研究脚本,未连接产品运行时。修改模型后应重新生成结果并更新报告,保留假设变化与反例,不能把旧结论套用到新模型。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 002 · 实际 go-mini 的运行边界实验
日期:2026-09-19。证据层次:受控原型。状态:完成本实验机制实验;未测试模型认知质量、真实持久恢复或长期性能。
1. 固定条件
使用本地 go-mini 提交 7c195d95fb8894f394e8ebf22299388a767afd60,没有修改该仓库。Go 版本为 go1.27.1-X:nodwarf5,平台为 Linux/amd64,编译采用 OptimizationDefault 并保留符号。实验为独立 Go module,根项目依赖和产品代码不变。
夹具由真实 .mgo 源码编译和运行。每个合成步骤两次命名调用 Policy(),得到 (a,b),累加 10*a+b 到实例 global total。版本 1 返回 1,版本 2 返回 2。FFI 检查点明确控制更新位置,不用睡眠猜测执行时序。
此处“步骤完成”仅指合成计算已结束,不涉及数据库提交或真实外部动作。宿主保存的 checkpoint 只是同一进程内的整数,不代表已验证断电或进程崩溃恢复。
2. 生命周期与热更新结果
| 条件 | 四个步骤的输出对 | 最终 total | 观测 |
|---|---|---|---|
| 不更新,长驻入口 | 11、11、11、11 | 44 | 基线 |
| 第一步结束后更新,入口继续 | 11、22、22、22 | 77 | 更新后仍保留版本 1、2;入口及 scope 结束后只保留版本 2 |
| 第一步结束并退出 scope,再更新和重入 | 11、22、22、22 | 77 | 重入前已只保留版本 2,global total 连续 |
| 第一步两次调用之间更新 | 12、22、22、22 | 78 | 一个逻辑步骤内混用了两个版本 |
| 第一步后新建实例,不恢复 checkpoint | 11、22、22、22 | 66 | 新实例丢失此前累计值 11 |
| 第一步后新建实例,显式恢复 checkpoint | 11、22、22、22 | 77 | 在这份完整整数状态下恢复连续 |
表中 11 表示 (1,1),不是模型质量分数。新实例的 generation 从 1 开始,不能据此把它解释成旧实例版本倒退。
长驻边界更新的 Run scope 执行 413 条指令;分段两次 Run 分别执行 110、312 条,共 422 条。这个数只包含 Run 的 scope,未计入宿主调用、初始化、Read/Restore 等成本;不能作为系统性能优劣或模型开销结论。
3. 全局闭包反例
在空闲实例中保存版本 1 创建的闭包,再更新到版本 2:
- 新的命名调用返回 2,已保存闭包仍返回 1。
- 此时没有长期活动入口,旧版本仍被保留;摘要显示其显式 Pins 为 0、GlobalRoot 为 true。
- 显式清除全局闭包后,只保留版本 2。
这否定“只要运行段返回,就会释放所有旧代码”的概括。需要分别观察旧帧、global、闭包与资源回调的生命周期。若业务允许保留旧闭包,它也需要明确的版本归属;不能把它误当作随补丁自动升级的调用。
默认 RevisionRoots 的 10,000 节点预算在本夹具中被耗尽,返回 Complete=false 且没有路径。报告保留了这个不完整结果,没有把空路径解释为无引用,也没有提高扫描预算后覆盖原结果。上述 global 归因依据是摘要的 GlobalRoot、闭包对照和显式清除后的变化,不是声称路径扫描成功定位了它。
4. 配额实验及修订
原先计划直接给带 FFI 的夹具设置 MaxSteps=500。实际在根模块初始化时已经失败:
initialize root module: fn.init instruction 24 const:
execution step limit exceeded: max 500
失败保留在试跑日志,最终程序也单独记录该配置的初始化失败。没有把限额调高后声称原条件通过。
为了隔离业务 scope 的计费,追加一个不导入标准库的纯整数夹具,继续使用同样的 500 指令限额和预定工作量:
| 条件 | 结果 |
|---|---|
| 单 scope 执行 1000 次迭代 | 在累计 500 指令时失败 |
| 同一 scope 在 100 指令后热更新 | 更新前后计数均为 100,仍在累计 500 指令时失败 |
| 同一实例中 100 个 scope,各 10 次迭代 | 全部完成,每 scope 159 指令,合计 15,900 指令,最终 total=1000 |
分段获得新的 scope 配额,热更新和 Poll 分片不会重置当前 scope 配额。15,900 指令成功不是“500 指令完成了整个活动”;如果仅限制 scope,长活动可以通过不断重入持续获得新预算。
因此初始化配额、运行段配额和活动总预算应分别研究。默认累计限额是否适合特定标准库依赖,也不能仅凭最小纯计算脚本推断。
5. 实验驱动修正
首次试跑在补丁场景超时。检查发现驱动把 PollSteps 的所有错误都当成停止手动推进的信号,其中包括契约允许的临时 ErrBusy;随后转入 Wait 时可能遇到需要实验驱动释放的 FFI 检查点。驱动已按契约对 ErrBusy 重试,并使用独立的有界清理 context。没有扩大实验执行期限。
最终运行记录到一次 busy 重试,其他主要条件为零。首次试跑未记录完整调度轨迹,因此这里只说明已发现并修正的驱动问题,不将其包装成 go-mini 故障或已完全复现的内部原因。
随后配额试跑暴露初始化失败,按第 4 节保留失败并增加隔离对照。最终所有既定输出断言、闭包对照和追加配额条件均完成。
6. 对设计的更新
保留:业务边界独立于 VM 安全点。 如果希望一个对外决策的步骤只使用一代逻辑,就需要宿主约束更新时间。VM 允许安全切换不等于业务步骤版本一致。
修正:运行段结束是回收手段之一。 它可以释放旧帧,但不能替代 global 和回调的生命周期管理,也没有证明必须定期重启实例。
保留为候选:同实例重入。 该合成状态下与长驻边界更新输出相同。它不要求同时结束模型会话或压缩上下文。
新增研究约束:活动总预算不从 scope 配额推导。 重入可能用于资源整理,但不能让活动因重入获得无限新预算。
继续开放:认知状态表示和分段策略。 整数 checkpoint 没有验证目标、假设、未完成问题等语义状态能否正确恢复,也没有证明长期运行稳定或分段成本可接受。
- 实验源码与运行说明
- 完整 JSON 结果
- 最终运行日志
- 输入和环境记录
运行只依赖本地相邻源码和已有 Go 环境,网络下载关闭。原始输出含各条件的值、scope 指令数、版本摘要及截断的引用扫描,保留所有 100 个配额分段。
下一项 E1 实验转向模型上下文与会话连续性。在模型服务和预算确定前,不生成认知质量分数,不用这次机制实验替代模型对照。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 003 · 依赖校验与慢速结果复核
日期:2026-09-19。证据层次:受限状态模型。完成本实验枚举与补充场景;没有调用模型、运行真实并发服务或测量性能。
1. 实验范围
在一个手工定义的资源占用任务中,从相同合法快照生成候选,再枚举 12 种变化、长度 0~3 的所有序列。共 1,885 条路径,其中参考要求仍满足的为 186 条,不再满足的为 1,699 条。
参考要求包含资源可用、同一 incarnation、无其他占用、授权与交互仍有效、提供者未变化和时间未到期。任务需求及前置条件由实验作者明确给出,没有验证模型自动发现依赖的能力。
集合读取包含空结果;占用记录新增时不修改目标对象版本。对象重建可复用 ID 和初始版本号。纯时钟推进不增加全局版本。条件、策略及枚举范围见实验说明。
2. 实际计数
| 策略 | 有效候选接纳 | 有效候选拒绝 | 无效候选误接纳 | 无效候选拒绝 |
|---|---|---|---|---|
| 仅全局版本 | 3 | 183 | 1 | 1698 |
| 全局版本 + 公共守卫 | 3 | 183 | 0 | 1699 |
| 目标对象版本 + 公共守卫 | 48 | 138 | 161 | 1538 |
| 对象身份、版本、集合版本 + 公共守卫 | 14 | 172 | 0 | 1699 |
| 手工完整条件 | 186 | 0 | 0 | 1699 |
| 完整条件漏掉集合条件 | 186 | 0 | 91 | 1608 |
| 完整条件漏掉 incarnation | 186 | 0 | 126 | 1573 |
公共守卫检查授权代号、交互轮次、提供者身份和有效期,各正式版本策略使用相同守卫。仅全局版本是负向对照;两个漏项组是消融。
表中数值只表示所枚举路径,不是生产故障率。完整条件与参考判定拥有相同信息,因此零误判是该对照的预期上界,不能据此宣称已找到普适的智能复核算法。
3. 最短反例
时间流逝但版本不变。 连续推进三个时钟刻度,候选到期,全局版本仍为初值。仅比较版本会接纳过期结果。
无关更新导致拒绝。 一次无关对象更新就使全局版本策略拒绝仍合法的候选。给目标改一个不影响占用的标签,则会触发目标对象和完整依赖版本的保守拒绝。
空查询不是没有依赖。 新增一条占用记录,目标对象版本不变,仅目标版本校验仍然接纳,违反任务要求。
同 ID 不等于同一资源。 重建资源时恢复初始局部版本,业务 ID 也保持相同。忽略 incarnation 的条件策略会把新资源误当作原来对象。
4. 背景变化下的进展
给每组最多 8 次候选机会,每次从最新状态开始,再在结果产生前插入指定背景变化:
| 背景变化 | 全局版本 + 守卫 | 目标版本 + 守卫 | 完整依赖版本 + 守卫 | 手工完整条件 |
|---|---|---|---|---|
| 无关对象更新 | 8 次均拒绝 | 第 1 次接纳 | 第 1 次接纳 | 第 1 次接纳 |
| 仅目标标签更新 | 8 次均拒绝 | 8 次均拒绝 | 8 次均拒绝 | 第 1 次接纳 |
所有这些候选在参考条件下仍合法。该固定时序说明保守失效可以持续阻碍进展;它不代表真实任务的平均重算次数,候选次数也不是 token 或耗时测量。
5. 串行提交仍可能接纳两个冲突计划
两个请求都在同一空占用集合下形成,然后按 A、B 顺序提交,各自新增不同的占用行。仅目标对象版本策略与漏掉集合条件的策略都接纳 A 和 B,最终占用数为 2,违反最多一个占用的约束。
完整依赖版本或完整条件拒绝第二个请求。这里提交已经串行;反例针对依赖校验不完整,而不是说明必须采用某种多心智调度方式,也不评价真实数据库的默认事务隔离。
6. 校验后的执行窗口
宿主在初始状态完成检查后,在执行前插入 8 个指定场景:无关更新,以及不可用、新占用、重建、撤权、新轮次、提供者重启和时间到期。
| 执行侧策略 | 8 个场景中违反当前条件的执行次数 |
|---|---|
| 只依赖此前宿主检查 | 7 |
| 提供者仅校验目标 incarnation、版本与可用性 | 5 |
| 原子校验全部条件再执行 | 0 |
第三组假定所有条件可由同一权威执行者原子读取并强制执行,属于理想化上界。实际跨服务授权、用户取消和物理状态不一定满足这一假设。第二组仍能保护其声明范围内的目标条件,只是不能替代集合、授权和时间检查。
7. 设计结论及限制
保留全局版本用于溯源或保守判断;细化读取清单以覆盖对象代号、查询集合与空结果;对授权、轮次、提供者和时间独立复核。执行允许与原决策是否合理继续分开处理,详见结果复核设计。
本实验没有测量真实模型的依赖表达、条件提取准确率、部分结果复用质量、并发吞吐、数据库实现成本或远端条件执行。也没有证明将所有条件交给宿主手写是合适的认知架构。
枚举路径包含重复状态和人工选择的事件分布,计数受这些选择影响。可以推广的是已找到的具体反例及其前提,不能将本表排序直接当作生产策略排名。
依赖仅为标准库。
脚本 SHA-256:545fcba37d6632f5a505a2141c9abde9626280fa421616860c5bc2d8409b19e9。
所有有限模型断言通过。生成结果保留各策略最短误判路径、8 次机会场景、两个请求的提交结果和执行窗口的逐项结果;没有真实外部动作。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 004 · 控制通路、取消与资源占用
日期:2026-09-19。证据层次:确定性的受限调度模型。执行了 24 组队列场景、9 组流式场景和 2 组取消额度场景;没有运行真实语音、模型推理、操作系统抢占或 GPU 负载。
1. 问题与共同条件
本实验检验“给停止消息高优先级或单独队列,就能及时停止”的隐含前提,并区分取消通知、播放约束和资源回收。
协议在模型执行前写入实验说明。队列对照共同使用 2 个相同执行者、6 个等待位置、不可抢占作业。保留方案限制普通作业最多占 5 个等待位置;专用方案进一步将两个执行者分为一个普通、一个控制,普通工作不能借用控制资源。总资源数量相同,使用约束不同。
两项长作业在 t=0 到达,2 或 6 项短作业在 t=1 到达,控制消息在 t=2 到达。短作业耗时 10,控制处理耗时 1,长作业时长分别为 10、40、100。控制完成表示模型中的处理任务结束,不等于设备已经停止。
所有时间均为抽象 tick,不能换算成真实毫秒。只含一条控制消息,不测试控制洪泛、控制任务之间的互斥或共享锁。
2. 队列未满:优先级仍受运行中作业约束
当 t=1 只有 2 项短作业时,所有方案接纳控制消息:
| 长作业时长 | 共享 FIFO 的控制延迟 | 共享优先级 | 优先级 + 保留队列位置 | 专用控制执行者 |
|---|---|---|---|---|
| 10 | 19 | 9 | 9 | 1 |
| 40 | 49 | 39 | 39 | 1 |
| 100 | 109 | 99 | 99 | 1 |
延迟从 t=2 到控制任务完成计算。长作业时长 100 时,共享优先级在 t=100 才开始控制任务,排队等待 98,执行 1,共 99。优先级让控制任务跳过等待中的短作业,却不能抢占正在占用执行者的长作业。
专用方案的普通任务也付出代价:长作业时长 100 时,其他方案在 t=110/111 完成全部 4 项普通任务,专用方案到 t=220 才完成;t=200 时仅完成两项长作业。低控制延迟不是免费增加了一份执行资源。
3. 队列占满:接纳与执行是两个问题
以下固定长作业时长 100,t=1 到达 6 项短作业,普通任务总 offered 数为 8:
| 策略 | 控制是否接纳 | 控制开始/完成 | 控制延迟 | 普通接纳/拒绝 | t≤200 普通完成 | 普通全部完成时刻 |
|---|---|---|---|---|---|---|
| 共享 FIFO | 否 | — | — | 8/0 | 8 | 130 |
| 共享优先级 | 否 | — | — | 8/0 | 8 | 130 |
| 优先级 + 保留队列位置 | 是 | 100/101 | 99 | 7/1 | 7 | 130 |
| 专用控制执行者 + 保留位置 | 是 | 2/3 | 1 | 6/2 | 2 | 240 |
前两组在 t=2 直接拒绝控制消息,故延迟是缺失而不是 0。共享优先级没有包含驱逐普通任务或额外控制接纳机制;若另加这些机制,需要单独验证,不能归功于优先级本身。
保留一个队列位置解决本例的接纳问题,但仍等到 t=100。专用方案的第二个长作业从 t=0 开始就在普通队列等待,因而会比共享保留方案多拒绝一个短作业。这里将所有拒绝显式计入,避免只比较成功控制消息的延迟。
专用执行者假设其执行资源、锁和完成路径确实独立;真实系统中“另起 goroutine”或“另建队列”不自动满足这些前提。本实验没有证明应永久闲置一个 CPU/GPU,也没有比较有界抢占、资源借用与及时归还等替代策略。
4. 取消后,入口过滤仍会漏掉已缓存片段
三组都在取消时立即停止当前片段、将轮次从 1 推进到 2;提供者不配合取消。旧缓存片段已在取消前通过入口,迟到片段在取消后到达,另有一个新轮次片段。
在取消时刻 2、时刻 5,以及“取消与片段在同 tick,取消先发生”三个固定场景中,计数一致:
| 策略 | 取消后旧轮次实际播放量 | 新轮次播放量 | 入口丢弃 | 播放边界丢弃 |
|---|---|---|---|---|
| 只取消当前播放 | 2 | 1 | 0 | 0 |
| 再加入口轮次过滤 | 1 | 1 | 1 | 0 |
| 再加播放边界轮次复核 | 0 | 1 | 1 | 1 |
每个计数单位是一个 tick 的播放,本例两个待播放旧片段各长 1。入口过滤丢弃迟到片段,但已缓存片段仍播放;播放边界复核也拒绝已缓存旧片段,同时保留新输出。
取消前已经播放的 2 或 5 tick 保留为已发生事实。本例的零迟到播放依赖两个显式条件:取消能立即停止当前片段;读取当前轮次与开始播放在同一个 owner 的顺序中完成。真实音频设备的不可撤销缓冲、停止确认延迟、跨线程竞争和跨重启身份均未验证。
5. 本地取消不应被当作远端资源释放
额度为 1,旧工作 t=0~10 持续运行并忽略 t=2 的本地取消,新工作 t=3 到达、需要 2 tick。t=10 才收到可靠的旧工作完成证据:
| 额度策略 | 远端同时执行峰值 | 超额 tick | 新工作开始/完成 | 新工作等待 |
|---|---|---|---|---|
| 本地取消即归还 | 2 | 2 | 3/5 | 0 |
| 直到完成证据才归还 | 1 | 0 | 10/12 | 7 |
保留占用避免本例的额度穿透,代价是新工作多等 7 tick。如果提供者永久失联,本模型没有自动解决方案;需记录不明责任及明确的核对/管理策略,不能虚构停止确认,也不能将本例等待时长当作线上上界。
6. 设计含义
- 将控制保障分成接纳、调度、执行资源和实际设备停止四层;保留队列容量只回答第一层。
- 暂保留专用控制路径为候选,同时研究有界不可抢占段及资源分配;没有数据支持固定线程数、设备数或硬实时延迟。
- 当前轮次在实际输出 owner 的播放边界复核;入口过滤用于提前丢弃,不能替代最终检查。停止当前播放与阻止以后旧片段要一起考虑。
- 取消请求、本地停止等待、远端停止证据、资源清理分别记录;保留未确认工作的实际占用责任。
本实验没有评价普通任务的认知质量、任务间公平性、控制负载高峰、声卡缓冲或现实安全停止性能。
运行:python3 experiments/realtime-control/model.py。Python 3.14.7,仅标准库,无网络和随机输入。
脚本 SHA-256:eeb3c006e1cc707e02253c4c22eccd5f7d6d0ace8a3c1cce348fab707793e831。原始结果同时包含预登记协议哈希。
首次执行即通过所有固定场景、作业守恒、等待容量、执行者占用、时间计算和播放量断言,无失败重跑。断言验证该有限模型的自洽性,不证明真实调度器或设备满足其假设。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 005 · 分布式接管、执行端重启与旧结果
日期:2026-09-19。证据层次:有限协议模型。共 104 个策略场景,包括 76 个资源接管、10 个分区权威、18 个旧结果场景。没有运行真实复制数据库、网络集群或外部动作。
1. 固定输入与假设
执行前登记实验协议。权威域已将当前执行者从 A 改为 B;旧请求 O 使用代号 1,新请求 N 及其重投 R 使用代号 2,三者对应同一已登记 Effect、同一目标和参数。F 表示新资源代号安装并确认,X 表示执行端重启。
无重启时枚举 F<N<R、O 任意位置,共 4 条顺序;有重启时再要求 F<X,共 15 条。这里 N<R 是预设到达顺序,并未覆盖重投比首次请求更早到达;这属于后续扩展范围。每条顺序比较 4 种策略,共 76 个场景。
理想权威事务、可信请求身份、资源单步原子效果,以及耐久组的“效果和业务去重记录共同持久化”均为模型假设。效果一旦发生,重启不撤销它。模型没有运行中长动作、真实磁盘、时钟和去重保留期。
2. 资源接管结果
| 策略 | 无重启:F 后旧执行路径/4 | 无重启:重复效果路径/4 | 重启:F 后旧执行路径/15 | 重启:重复效果路径/15 |
|---|---|---|---|---|
| 仅协调侧更新权威 | 3 | 4 | 12 | 15 |
| 耐久 fencing,无业务去重 | 0 | 4 | 0 | 15 |
| 内存 fencing + 内存去重 | 0 | 0 | 3 | 7 |
| 耐久 fencing + 原子耐久去重 | 0 | 0 | 0 | 0 |
第一组 F 只是本地标记就绪,并不提供资源端真实屏障;故其“F 后”说明错误地宣布接管完成会怎样。其所有路径产生 3 次效果。第二组无重启效果数为 2 次的 3 条、3 次的 1 条;重启组为 2 次的 12 条、3 次的 3 条。隔离旧控制者没有阻止新请求自己的重复执行。
内存组在 15 条重启路径中,8 条产生 1 次效果,7 条产生 2 次;其中 3 条重新执行了旧控制者请求。耐久组合在全部 19 条顺序中均产生 1 次效果,且 N、R 都获得实际结果或已有回执,没有靠拒绝所有新请求得到零错误。
这些是固定排列的计数,不是故障概率。只有假设真实执行端具备同样的原子性、持久性和身份契约时,才可能获得相应保护;模型没有证明任意提供者可满足它。
3. 三条反例说明保证边界
F → O → N → R。 只在协调侧切换执行权时,旧 O 仍到达资源并执行。资源 fencing 拒绝 O,但没有业务去重时 N、R 各执行一次。因此 AssignmentEpoch、ResourceEpoch 和 Effect 的业务键承担不同责任。
F → N → R → X → O。 内存组在 F 后安装了代号 2,N 执行、R 返回已有结果;X 清空代号与去重表后直接开放接纳,O 以代号 1 再执行,现实效果累计为 2。恢复端不能沿用重启前的就绪声明:需要恢复耐久隔离和去重记录,或关闭写入口重新建立契约。
O → F → N → R。 即使耐久组合,O 也可能在执行端知道新代号之前执行一次;之后 N、R 通过同一业务键取得原结果。这不是“旧请求从协调权切换时起绝不执行”的证明。屏障前窗口必须纳入结果核对,fencing 也不能撤销已开始的长动作。
4. 状态权威与网络分区
固定 a/b/c 三个副本的全部 5 种集合分区:全连通、三种 2+1、全分离。每个连通分区各提出一次写入申请:
| 策略 | 多个独立写入方的分区数/5 | 完全不能共享写入的分区数/5 | 最大独立写入方数 |
|---|---|---|---|
| 各分区自行提任 | 4 | 0 | 3 |
| 只允许理想可写多数侧 | 0 | 1 | 1 |
第二组完全分离时不接纳共享写入,其代价被保留为“没有进展”。它不是 Raft 的实现或证明:没有建模投票、日志、任期、落盘或恢复,只验证当前候选将写入许可放在哪个边界。
5. 旧提交和旧结果要分开
旧 Step 提交、可信旧完成结果及相同结果重投共有 6 种顺序。此前 Operation/Attempt 已登记,结果来源和请求摘要固定合法:
| 策略 | 接纳旧状态写入的顺序数/6 | 丢失合法完成结果的顺序数/6 | 每条顺序唯一结果数 |
|---|---|---|---|
| 拒绝所有旧消息 | 0 | 6 | 0 |
| 接受所有旧消息 | 6 | 0 | 1 |
| 分开验证当前提交权和历史请求结果 | 0 | 0 | 1 |
所有接受结果的组均按相同事件键去重。第三组只保存事实,不授予旧执行权,也没有测试语义结论是否仍正确、是否可自动续接旧动作。错误摘要、伪造结果和跨提供者事件键未覆盖。
6. 设计含义
- 保留强一致指派及条件提交作为状态边界,执行端接管另设安装确认、旧工作核对和就绪记录。
- 资源代号持久性与业务去重分别声明,重启未恢复时关闭写入口;不能因为重启前成功校验过就延用就绪状态。
- 新节点继续原 Effect 的核对/契约允许的重试,不通过换节点、Attempt 或业务键抹掉未知责任。
- 将当前执行权校验与可信完成事件接入分开,旧结果可作为证据交给当前认知判断。
- 失去多数派的共享写入暂停;本地停止与有限离线工作不升级为新的全局授权。
运行:python3 experiments/distributed-handoff/model.py。Python 3.14.7,仅标准库,无网络或随机输入。
源码:model.py;原始数据:distributed-handoff.json。
源码 SHA-256:24e351c00dd9b663e11132d3efb6cd76b6846b51ff8df7f0a78c82fdabbf2a90。结果另存预登记协议 SHA-256、全部顺序、逐事件状态、代表性反例和指标。
首次运行即通过枚举规模、效果计数守恒、结果去重、候选边界和新节点进展断言。通过说明脚本在这些假设下自洽,不是生产正确性或共识验证。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 006 · 真实进程与持久化边界
日期:2026-09-19。类型:本机多进程与真实 SQLite 事务实验。15 个预登记场景完成,45 个独立子进程,8 次 SIGKILL,首轮执行通过全部预登记判定;其中包含预期应当暴露错误的负面对照,不能理解为所有策略都正确。没有部署 Kubernetes 或实现产品运行时。
1. 问题、环境与证据
报告 005 使用模型假设描述状态权威与原子效果。本实验将指派复核、去重和实际计数器写入数据库,直接终止工作进程并重新连接检查,检验持久化边界能覆盖哪些故障切点。节点指派属于历史分布式方案,不属于当前 TinyAGI 架构。
| 项目 | 实际记录 |
|---|---|
| Python | 3.14.7,/usr/bin/python3 |
| SQLite | 3.53.4 |
| OS | Linux 6.18.52-1-lts x86_64,glibc 2.44 |
| 数据库模式 | 每个数据库 WAL,连接 synchronous=FULL(数值 2) |
| 故障注入 | 子进程通过标准输入输出停在指定切点,父进程对该子进程发送 SIGKILL,等待退出码 -9 后检查数据库 |
| 隔离 | 每例独立临时目录,实验结束清理;不连接已有服务或集群 |
| 实际效果 | 实验数据库中计数器增加一次;不代表任意网络调用或物理效果 |
experiment.py SHA-256
a2c41340f2cc86a310fae882021f7cb980f314fb6467086e36545d4a0ae45be1
预登记 README.md SHA-256
0c3d52c3dd1c098cb815dc70a88b65dde2600e06acf4462f62f8c4e214dedd0b
2. 指派切换:缓存检查不是提交边界
旧进程先读到 epoch=1 与自身 BootID,停在消息屏障;父进程在数据库条件提交 epoch=2/新 BootID,再恢复旧进程。读上下文时不持有写事务。随后独立新进程提交一次,验证可继续推进。
| 策略 | 改权后的旧状态写入 | 旧 outbox 记录 | 新执行者提交 | 最终状态计数 |
|---|---|---|---|---|
| 使用缓存的指派检查,再无条件提交 | 1 | 1 | 成功 | 2 |
BEGIN IMMEDIATE 内读取当前指派并共同提交 | 0 | 0 | 成功 | 1 |
本例的原子范围是同一个 SQLite 写事务,并非“先读外部分布式锁,再写业务数据库”。结果支持把当前指派复核放在状态/outbox 的同一原子边界内,没有验证复制数据库接管、租约时钟或完整业务约束。
3. 八个崩溃切点:有持久回执仍可重复效果
原子组:计数器与回执在同一数据库事务中提交。分离组:先提交 world 数据库的计数器,再提交 provider 数据库的回执,模拟提供者记录与外部效果不能共同提交的边界。两组的 ResourceEpoch=2 均已预先持久化;本实验不测试安装代号的接管过程。
表中“有/无回执”为崩溃后重新打开数据库的观察,最后一列为新进程重投同键同参数后的计数。
| 策略 | SIGKILL 切点 | 崩溃后效果 | 崩溃后回执 | 重试结果 | 恢复后效果 |
|---|---|---|---|---|---|
| 同一事务 | before_write | 0 | 无 | executed | 1 |
| 同一事务 | effect_written(尚未提交) | 0 | 无 | executed | 1 |
| 同一事务 | receipt_written(尚未提交) | 0 | 无 | executed | 1 |
| 同一事务 | committed_before_reply | 1 | 有 | existing | 1 |
| 分离事务 | before_write | 0 | 无 | executed | 1 |
| 分离事务 | effect_written(效果已提交) | 1 | 无 | executed | 2 |
| 分离事务 | receipt_written(回执已提交) | 1 | 有 | existing | 1 |
| 分离事务 | committed_before_reply | 1 | 有 | existing | 1 |
关键反例是 crash-split-effect_written:磁盘上没有回执,不代表效果未发生。重建 Pod、换 BootID 或挂回同一份回执卷均不能自行消除这个窗口。分离组是在两个真实数据库间检验该反例,没有声称所有外部 API 都会采取相同实现。
八个场景在恢复后都额外检查:epoch=1 携带一个不同业务键被拒绝,避免“旧请求只是碰巧被去重”的假阳性;同一键换参数也均被拒绝。计数器和回执保持不变。这验证的是已保存代号的进程恢复,未验证代号丢失、倒退或高代号接管安装。
4. 并发重投与缺失存储
四次双进程场景各自在两个进程 Ready 后开放入口,争用同一业务键。每次返回一个 executed、一个 existing,计数器均为 1、回执均为 1。操作系统实际调度顺序没有枚举,也未保证锁等待一定发生;只记录这些双进程运行,不推导吞吐或广泛并发保证。
缺失存储场景返回 recovery_required,目录中没有新建文件,也未发生效果。该结果验证脚本明确写出的关闭接纳策略,不能据此认为所有提供者或数据库会自动这样处理。损坏文件、缺表、旧快照和第一次合法初始化仍需分别制定及验证流程。
5. 设计变化与限制
保持当前指派与状态/outbox 共同提交的候选,补充真实进程证据。提供者契约收紧为必须声明:业务键作用域及参数绑定、效果与回执的原子边界、保留期、重启恢复规则和可查询的事实。仅声明“幂等表持久化”不够;没有原子去重或可靠结果核对时保留 unknown,避免恢复时盲重试。
原子计数器组支持受控数据库效果在这四个切点后的单次执行,不能外推为任意外部动作恰好一次。主机 OS 和存储继续运行,故 FULL 配置加 SIGKILL 也没有验证断电耐久性。SQLite 继续只是单机实验载体,分布式权威数据库尚未选定。
实验未覆盖真实复制后端、运行中动作排空、旧备份恢复和非原子提供者的完整核对协议,也未测试 Kubernetes 控制器、CNI/CSI、节点分区、卷迁移或真实业务状态迁移。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 007 · 提供者核对、取消与回收
日期:2026-09-19。证据类型:受控子进程与本地持久化实验;不是网络、Kubernetes 或设备实测。
1. 问题与实验条件
E0/E8b 已说明效果与回执分离会产生 unknown。本实验检查恢复时怎样处理缺失查询、迟到接纳、去重记录过期,以及取消、退出和效果判定之间的关系。
执行前固定了12 个场景。实验脚本只使用 Python 标准库;父进程驱动提供者接纳与恢复策略,实际效果由独立工作进程写入 world 数据库。provider 数据库另存接纳与回执,二者各自 SQLite WAL/FULL,没有共同事务。管道屏障固定效果前和效果后、终态前两个切点。
环境为 Python 3.14.7、SQLite 3.53.4。网络套接字创建被沙箱以 EPERM 拒绝,未发现 kubectl/kind/minikube/k3d 或 NVIDIA 工具及设备节点,因此改用管道;完整探测记录保留。最初探测脚本在 socket 构造处提前退出,随后仅修正探测的异常捕获并完成记录;未执行网络实验,也未连接已有集群。
恢复策略只读取 provider 记录;world 表仅用于事后评分。取消是否合作、键是否保留和是否支持原子关闭均为显式实验变量,不假装所有服务具有这些能力。效果缺失回执通过屏障保留,未注入真实网络丢包。
2. 结果
一次完整执行包含 12 例、15 个工作子进程、2 次 SIGKILL、107 项断言,实验错误 0。断言包括屏障、退出和预期反例,107 不是独立样本数量。各场景为确定次序,无概率或性能推断;完整逐事件结果包含全部决策、查询及效果真值。
| 场景 | 实测结果 | 可以据此修订的设计 |
|---|---|---|
| A1 缺终态后换键重试 | 效果 2 次 | 缺失完成回执不能触发新业务键执行 |
| A2 查原接纳并等待 | 效果 1 次;同键换参数被拒绝 | 在接纳记录仍保留且原工作存活的范围内,沿用原键核对可避免重开工作 |
| B1 查询无记录后迟到接纳 | 已宣称 not_applied,随后实际效果 1 次 | 即便本地查询当时准确,无记录也不能关闭仍在途的请求 |
| B2 原子关闭键后迟到接纳 | 请求被拒绝,效果 0 次 | 关闭证明还须包含后续同键接纳被拒绝;这是额外提供者契约 |
| C1 删除键与回执后同键重投 | 累计效果 2 次 | 稳定键离开其保留范围后不再自动幂等 |
| C2 删除详情但保留禁止重开墓碑 | 累计效果 1 次;重投被拒绝 | 阻止重开与恢复详细结果是两种能力;墓碑不重建丢失回执 |
| D1 取消受理即归还额度 | 容量 1 同时出现 2 个存活工作进程 | 受理取消不能证明已释放实际占用 |
| D2 等原工作退出再放行 | 最多 1 个;前后两个工作均完成 | 等待可维持互斥但增加后继等待;不是靠拒绝所有工作通过 |
| E1 效果前合作取消 | 效果 0,not_applied,进程退出 | 可信提供者的效果前停止路径可以给出未发生证据 |
| E2 效果后才取消 | 效果 1,confirmed,进程退出 | 迟到取消不能覆盖已发生事实 |
| F1/F2 效果前/后 SIGKILL | 提供者可见记录完全相同,实际效果 0/1;进程均已退出 | 停止证据与效果证据必须独立;已无本地计算不代表动作未发生 |
3. 不可区分性与适用范围
F 两例在恢复侧均看到同一个键、相同参数摘要、running、无取消、无回执;真值分别为 0 与 1。只以该记录和“进程已退出”为输入的判定无法同时正确输出两个不同结论。因此在本实验观察能力下保留 unknown 是必要的;增加可信目标侧查询可以改变观察能力,并未被否决。
B 说明“当时没有接纳”与“以后也不会接纳”不同。候选 not_applied 证据应带身份、范围及关闭条件;单次缺失、等待一个固定时长或删除某个对象都不能自动提供这个条件。原子关闭、拒绝过期请求或停止所有派发通路各有契约,当前只测试原子关闭的给定顺序。
D 测量的是实际存活且占用实验席位的工作进程,不是 GPU kernel、CPU 忙占时间或设备停止时延。F 的 wait/退出只覆盖该直接子进程;它若再派生远端任务,退出也不能证明远端已停止。本实验没有子任务树、网络服务、权威域接管或提供者自身崩溃;接纳到启动之间的恢复也未覆盖。
4. 设计决定
- 修改查询契约。 区分已接纳、可信终态、确定关闭且未执行、记录缺失/已过期/不可达;查询附对象身份、适用范围和证据时点。缺失不转 not_applied。
- 修改回收粒度。 按资源分别保存停止与回收证据。可确认释放的本地计算席位可先归还;未知效果的核对责任、语义冲突和未核实的远端占用继续保存。
- 保留业务键及保留边界。 同键绑定参数,超过保证窗口停止自动重投;自主提供者可研究墓碑或过期拒绝。外部服务无此能力时保留 unknown,不以新键绕过。
- 明确等待的终点。 核对有预算、下次时间及负责人;耗尽核对预算进入待处置状态,不自动改成成功、未发生或释放全部责任。新行动或补偿是新决策,旧证据保留。
平台与 GPU 的具体适配由一手资料论证补充。资料能排除不成立的保证,不能替代真实集群和显卡验证。
运行命令:python3 experiments/provider-reconciliation/experiment.py --output experiments/results/provider-reconciliation.json。脚本拒绝覆盖已有输出,复跑应换路径。预登记与脚本在本实验执行后保持不变;实验首次完整运行通过,无实验失败被覆盖。
| 材料 | SHA-256 |
|---|---|
| 预登记 README.md | 504769ca92a1eafefc39b72c5f3128bdbfc396b5e71ec8436ae85ba2da7e6e9a |
| experiment.py | d6a6efc6ee7c6c3c680a873316b0097e5392fa2fb2c323e900315651929a7a56 |
| provider-reconciliation.json | 4691eefcae437d9c40f09cf2a6a78e124dcdec2858ef617ad8083ccaa7b47027 |
临时数据库用于独立场景,结束后清理;效果行、查询、屏障、进程退出码已保存到原始 JSON。既有 E0~E8b 的脚本与数据未修改。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 008 · 接纳、启动与核对入账
日期:2026-09-19。证据为真实子进程、管道和本地 SQLite 事务,不是 PostgreSQL、网络或 Kubernetes 验证。方案归纳见恢复决策。
1. 条件和过程
先固定 15 个预登记场景,再执行独立脚本。provider 数据库保存接纳、可派发状态和启动进入记录,world 独立保存效果,authority 保存指派、证据、预留、额度、释放账与 outbox;三库之间没有事务。均使用 SQLite 3.53.4 WAL/FULL,Python 3.14.7。
父进程是受控运行环境,响应派发子进程的启动请求并创建独立工作进程。因此杀掉派发器不会自动杀掉工作者。所有次序由管道屏障控制,只杀本实验子进程;不把等待时长当作节点停止证据。实验未连接外部数据库或服务。
首次执行遇到记录器位置参数 name 与观测字段 name= 冲突,8 例中断。首次结果和原脚本完整保留,不用于完整结论。仅修复参数命名后,脚本修订 v2 全例通过。
复核 v2 发现 B2 在新工作完成后才放行旧工作,代号变化与状态变化同时影响拒绝。v3 将旧请求放在换代后、新执行者进入前,此时仍为 queued,以区分代号检查的贡献;预登记场景、SQL 和判据不变。修订记录说明差异,v2 脚本和数据仍保留。下表只统计 v3 完整运行,不把重跑合并为更多独立样本。
2. 结果
15 例、26 个子进程、10 次 SIGKILL、156 项断言,错误 0。 断言包含进程退出与屏障,不能解释为 156 个独立故障场景。未测吞吐、时延或线上发生概率。
| 场景 | 实测观察 | 方案含义 |
|---|---|---|
| A1 提交前确认 | 确认已发,进程被杀后接纳记录 0,效果 0 | 确认须在接纳事务完成后发送 |
| A2 只依赖内存待办 | 接纳存在,恢复分支无可派发项,效果 0 | 接纳必须定义可恢复的派发责任,通知不能是唯一入口 |
| A3 共同持久化并扫描 | 恢复原键,效果 1 | 持久待办+重扫能在该窗口继续推进 |
| B1 启动后再登记 | 派发器退出,原工作存活;盲重启累计效果 2 | 进程创建与启动回执间存在歧义 |
| B2 换代后旧执行者进入 | queued、代号 2 时拒绝旧代号 1;新执行者效果 1 | 在产生效果前检查当前启动代号 |
| B3 同代号重复启动 | 两个进程竞争,一个 entered、一个拒绝,效果 1 | 代号相等还需一次性条件进入 |
| B4/B5 entered 后终止 | provider 记录相同,实际效果 0/1;均不自动重放 | 进入记录不能证明效果;保守 unknown 是代价 |
| C1 返还额度与释放账分离 | 额度初始 0,重试后成为 2,释放账和 outbox 各 1 | 只有消息/回执去重不足以保证额度守恒 |
| C2 原子事务提交前被杀 | 事务回滚,恢复重试后额度 1,账及 outbox 各 1 | 释放、额度与回执须一起提交 |
| C3 提交后回执前被杀 | 重试识别已释放,额度仍 1 | 响应丢失不重复返还 |
| C4 两个证据 ID 并发入账 | 同一预留只有一次释放,额度 1、outbox 1 | 结算按 ReservationID 去重,不能只按 ProofID |
| D1 只匹配资源名 | 旧执行者的证据错误释放了新预留 | 资源名不是一次占用的身份 |
| D2 完整身份关联 | 拒绝旧预留/旧执行者/旧资源实例的证据,新预留仍 held | 证据范围必须对应具体预留 |
| D3 接管后旧事实到达 | 旧 owner 入账被拒,事实保留,新 owner 释放一次 | 历史事实接入与当前状态写权分开 |
A2 不是证明接纳记录无法恢复:若 queued 本身已定义为可扫描待办,就不需要额外 pending 表。本例反对的是仅凭内存唤醒推进、恢复时不扫描持久派发责任;A3 可以用状态行或 outbox 实现该责任。
3. 明确的协议基线
- 接纳后确认。 业务键、参数与可派发责任原子落库,完成后确认;通知可重复、可丢失,启动与重连主动扫描持久状态。
- 重复启动受控。 对可控制执行入口的提供者,启动令牌绑定业务键和 StartEpoch;执行者在效果前条件转为 entered。未进入可条件换代,已进入的非原子动作无可靠证据时不重放。
- 按预留一次性入账。 可信停止证据先保存;当前 owner 在一个事务内核对指派和证据范围,完成预留释放、额度返还、唯一释放账及 outbox。
- 保留旧事实。 旧来源证据不因接管而丢弃,但它不能授予旧 owner 当前入账权。
选择这些作为下一阶段设计和实验基线;具体持久化实现仍需数据库与集群验收。独立消息系统或工作流引擎不能替代提供者进入契约和外部效果核对,见官方资料与后端选择。
4. 条件与剩余边界
进入检查必须覆盖所有实际效果路径,并与换代操作竞争同一权威状态;不能把只在调度器端校验视为等价。B4/B5 说明它提供的是保守的重放边界,不是非原子效果恰好一次。对第三方平台不能凭空加上这项能力;使用其原生幂等/查询契约,否则保持 unknown。
SQLite 写事务串行化不证明 PostgreSQL 并发隔离或复制行为。证据认证、持久储存回退、跨资源事务、长动作、外部设备已经释放的真实性均为未测范围。C/D 使用可信停止证据的固定输入,验证的是入账和关联;D2 同时改变多个身份字段,不是逐字段必要性的独立消融。
每组次序是有限对照,不是穷尽调度。后续须验证接纳取消与进入同时竞争、旧备份恢复导致的代号回退,以及数据库多写入者/故障转移下的相同不变量。
当前命令:python3 experiments/dispatch-settlement/experiment.py --output experiments/results/dispatch-settlement-v3.json。复跑换路径,程序拒绝覆盖。临时库已清理,逐事件轨迹与各库终态表保存在 JSON。
| 材料 | SHA-256 |
|---|---|
| 预登记 README.md | 0da558aad135bae764435934636d6a6b8e2824a53213d43c50993c9149e3070e |
| 当前 experiment.py | 4339a9dfb8a984a3cd8001a491ca0b4f31e974fdf2b9f0a2dbebb99ae66598bf |
| dispatch-settlement-v3.json | c278650caa61f848a037510d30cfbd2d890d4fa8ec0d5f726892a25e0355c3a0 |
初版和 v2 脚本哈希见修订记录,各次 JSON 也记录其脚本与预登记哈希。旧 E0~E8c 的材料保持不变。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 009 · 取消竞争、备份恢复与冲突证据
日期:2026-09-19。受控进程与本地 SQLite 实验,不是数据库集群、Kubernetes 或设备验证。
1. 条件与执行
先固定 18 例预登记,再编写独立脚本。provider 保存进入/关闭状态,world 独立追加效果,authority 保存证据与资源账务;库间无事务。Python 3.14.7、SQLite 3.53.4,WAL/FULL,子进程通过管道屏障协调。
备份和恢复使用 SQLite backup API,并在实验进程已退出、连接关闭后进行。world 不随 provider 回退,模拟真实效果不因业务备份恢复而撤销。恢复分支只读 provider 状态,效果表用于评分。B4/B5 的入口关闭、旧进程隔离和新工作资源/预算核对由实验驱动保证,不是自动灾备实现。
首次完整运行通过:18 例、52 个子进程、2 次 SIGKILL、270 项检查,错误 0。原始 JSON 保存事件、参数、中间状态和终态。所有子进程均按预期退出,无兜底清理强杀;断言数含屏障/退出码,不是独立样本数,也不表示故障概率。
当时的 docker 命令实际进入 Podman,查询配置因运行目录只读失败,未启动容器或安装软件。实际成绩仅来自上述 SQLite 与受控子进程条件;其他数据库、集群及网络协议的恢复/取消行为未计入通过数。
2. 对照结果
| 场景 | 观察 | 设计含义 |
|---|---|---|
| A1 缓存进入状态 | 取消已返回 closed,旧执行者仍产生效果 1 | 入口不能依据事务外缓存放行 |
| A2 取消先提交 | 后续进入被拒,效果 0 | 关闭与进入在同一记录上互斥 |
| A3 进入先提交 | 取消仅返回 cancel_requested,最终效果 1 | 已进入的取消不是未执行证明 |
| A4 关闭提交后丢确认 | 重试仍 closed,后续进入拒绝 | 查询/重试应复用关闭状态 |
| A5 关闭提交前终止 | 回滚为 queued,后续效果 1 | 未提交请求不能被解释为取消完成 |
| A6 取消早于接纳 | 墓碑拒绝迟到接纳及进入 | 无记录也要关闭原请求的未来入口 |
| A7 真实事务竞争 | 本实验进入赢,取消仅受理,效果 1 | 结局符合二选一;另一个顺序由 A2 固定覆盖 |
| B1 旧快照重用代号 1 | 历史代号 2 已完成,旧代号 1 再产生效果,累计 2 | 持久记录也可因恢复而倒退 |
| B2 恢复后仅加一 | 再次得到历史代号 2,累计效果 2 | 加一不能证明超过丢失的历史 |
| B3 仅更换 RecoveryID | 旧身份被拒,但新身份重发原键,累计效果 2 | 新身份不能替代效果去重/核对 |
| B4/B5 隔离旧键后开放新工作 | 相同 provider 终态对应原效果 1/0;原键被拒,新键均完成 1 | 恢复歧义须保留,同时允许经独立核对的新责任推进 |
| C1 相同事件覆盖内容 | running 被 stopped 覆盖,版本仅 1,返还额度 1 | 已到达的矛盾证据被抹掉 |
| C2 保留内容版本 | 两份内容均保留,预留 held,额度 0 | 同一事件内容冲突阻止自动结算 |
| C3 完全相同的重送 | 证据版本 1、释放账 1、outbox 1,额度 1 | 正常重送可幂等处理,不必冻结 |
| C4 事务外缓存证据 | 矛盾已持久接入,缓存入账仍返还额度 1 | 保存冲突但不参与提交检查仍不够 |
| C5 入账时复核 | 同样到达顺序下拒绝入账,额度 0、预留 held | 证据可用性必须在提交时重新判定 |
| C6 结算后才到矛盾 | 原账及已返还额度保留,资源待核对,新分配拒绝 | 迟到矛盾产生新核对责任,不覆写历史或假装已撤销物理释放 |
A1 的最终状态为 finished,中间 closed 及回执见轨迹;不能只查终态漏掉错误承诺。C1/C4 的失败含义是“在已知矛盾下仍自动结算”,不是证明哪一条证据在物理上为真。C6 没有先分配 r2 再撤回的实验,因此不保证能追回已分配容量。
3. 采用与否决
- 采用取消与进入同一事务裁决。 queued 可关闭,缺失键保留关闭墓碑;entered 只记录取消请求,另外跟踪实际停止和效果。提交后才确认关闭。
- 采用受控恢复关闭流程。 旧快照恢复先保持入口关闭、隔离旧执行者、登记新 RecoveryID,再重建指派、预算及历史责任。丢失连续性的旧键默认待核对,不能由新身份自动重发。
- 采用不可覆盖的证据与冲突状态。 source+ProofID 的相同内容是重送,不同内容保留为冲突;入账事务检查冲突。结算后才到矛盾,保留原账并暂停受影响资源的新分配,追加核对责任。
否决缓存 queued 放行、恢复后计数加一即可复用、新 UUID 即可重放、最后到达证据覆盖、仅事务外检查证据五种充分性保证。详细协议、资料支持与剩余验收见恢复决策。
4. 范围与限制
实验覆盖指定时序,并非穷尽并发。SQLite 的写锁代替了真实多行并发,未验证 PostgreSQL 中的锁顺序、隔离重试、复制、主权或数据掉电耐久性。A7 只运行一次真实竞争,不作统计结论。
B4/B5 不测试“外部恢复控制本身也被还原”“仍活跃旧工作越过屏障”或“备份中不存在的已发生请求”。实际恢复须覆盖丢失日志区间及可能迟到的旧请求,不能只隔离快照里看得到的 queued。来源认证、新 RecoveryID 不复用、资源独立性及预算重建均为假设;身份必须由接收方验证,单改发送端字段没有意义。
C 只覆盖同 source+ProofID 的互相矛盾内容及一个资源域。不同事件、不同来源、不同时间的事实可能是正常状态变化,不能一概当冲突;自动语义判断、证据修正权限、冲突消解后解封和已重分配资源的处理均待验证。固定小对象的 SHA-256 内容比较不是密码学认证或通用证据判真。
运行命令见预登记;输出路径排他创建,复跑必须换路径。本实验没有修订或重跑。旧 E0~E8d 证据保持不变。
| 文件 | SHA-256 |
|---|---|
| 预登记 README.md | 92c4ea467ce57003e3857587570e2ace5254d916d5f52a9b54f988c62383bc73 |
| experiment.py | eab37547550ea66082e3385f354d2c1a6309ae74fd21e88ba556a014b7d6bf09 |
| cancel-restore-evidence.json | e670d184debd08cadcb93e329e8b616d147b8171f51a29042ebb34618e86012b |
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 010 · SQLite、本地文件与维护边界
日期:2026-09-19。设计阶段的独立机制实验,非产品实现、模型实验或掉电测试。
1. 条件与执行
本实验在单机、SQLite 与本地文件条件下,预登记 22 例,编写独立脚本并执行一次。未在查看结果后修订条件或重跑。
环境为 Linux 6.18.52、XFS、Python 3.14.7、SQLite 3.53.4;实验临时目录位于仓库所在文件系统,未使用 /tmp 的 tmpfs。SQLite 使用 WAL、FULL;自动 checkpoint 关闭、busy timeout 为 0,以确定观察竞争和 WAL 行为。这些是实验参数,不能直接当产品配置。
夹具包含主体计数、输入消费、唯一提交键、文件引用及 queued 操作。固定文件 65,536 字节,经临时写、文件同步、排他 hard link 发布、目录同步,再提交 SQLite 引用与业务状态。子进程只模拟宿主在不同阶段终止,线程模拟进程内发布、读取与维护,并不重新引入多进程产品架构。
22 例符合预登记判据,174 项显式检查通过,13 个子进程、8 次有意 SIGKILL,失败检查和异常兜底强杀均为 0。 其中包含预期会失败的错误设计对照;“通过”表示观察符合预登记,不表示所有被测方案均正确。检查数不是独立样本数或故障概率。原始 JSON 保存条件、屏障、退出码、SQL 终态、文件摘要与错误码。
本实验没有调用模型、推进 go-mini、执行现实工具动作或测量真实业务吞吐;它覆盖 S1 的存储与维护子集,没有完成整个认知工作闭环。
2. 对照结果
| 场景 | 实际观察 | 设计含义 |
|---|---|---|
| L1 同一锁对象 | 活跃持锁者使第二实例拒绝;SIGKILL 后锁路径仍存在,第三实例取得同一 inode 的锁 | 依赖实际文件锁状态,不按文件是否存在判定存活 |
| L2 删除锁路径 | 原进程活跃时重建路径,两个进程分别锁住不同 inode | 不能通过删除所谓残留锁文件解锁;锁对象在正常启停间保持稳定 |
| F1/F2 临时写/文件同步后终止 | 无已提交状态、待办或引用;保留临时残留 | 文件存在不代表业务提交 |
| F3/F4 最终文件发布/目录同步后终止 | 文件可见但仍无业务提交,形成孤立文件 | 文件先发布允许留下孤立内容,不应留下已提交悬空引用 |
| F5 COMMIT 前终止 | 计数、输入消费、引用、待办、回执全部回滚 | 必要业务记录共同提交;仅执行过 SQL 不算成功 |
| F6 COMMIT 后丢确认 | 原回执与 queued 待办恢复,文件摘要正确;重送不新增意图 | 查询原提交键解决确认丢失 |
| F1~F5 后续进展 | 恢复后原请求均能完成,最终计数和待办各 1 | 并非用永久拒绝所有工作获得正确性 |
| F7 引用先提交 | 状态和待办已保存,但文件不存在,悬空引用 1 | 否决先提交引用、之后再生成文件的顺序 |
| F8 重送/冲突 | 相同内容返回原回执,同键不同内容拒绝,计数和待办各 1 | 幂等键必须绑定内容 |
| F9/F10 注入 EIO/ENOSPC | 错误显式返回,业务计数、引用与待办均未提交 | 文件 I/O 错误不能降级成成功;未真实填满磁盘或破坏设备 |
| B1 只复制 db 与 backup API | 原数据为 9,只复制 db 读到 0,backup API 副本读到 9 | 活跃 WAL 的最新提交可能不在主 db 文件内 |
| B2 快照与回收竞争 | 数据库快照保留引用,原库删除并回收后,复制文件得到 ENOENT | SQLite 快照不自动保留外部文件 |
| B3 受控完整备份 | 维护期间拒绝新修改;副本与文件清单校验成功,恢复的计数/输入/待办/回执一致 | 先固定维护边界,再备份数据库和所引用文件;恢复不自动执行待办 |
| B4 复制失败/伪完成标记 | 注入复制错误后无完成标记;伪造标记仍因文件缺失被拒 | 标记是校验入口,不是完整性的充分证据 |
| G1 只查数据库做回收 | 发布者暂停在文件已发布、引用待提交处,GC 删除文件,恢复发布后产生悬空引用 1 | 回收必须覆盖在途发布责任 |
| G2 排空完整发布事务 | 维护关闭新准入并等待发布者完成引用事务,再删除孤立文件;正式引用有效 | 发布阶段从开始准备一直延续到引用事务终结 |
| G3 排空文件读者 | 新读者拒绝,GC 等待旧读者结束后才删除 | 维护边界也覆盖本地文件读取生命周期 |
| T1 旧快照升级 | 得到 SQLITE_BUSY_SNAPSHOT(517);旧事务仍读到旧值;回滚重新读取后可提交 | 不能在旧快照上无限重试写入 |
| T2 两个写者 | 第二个 BEGIN IMMEDIATE 得到 SQLITE_BUSY(5);前者结束后第二个能推进 | 写入通路应串行调度,有界处理竞争 |
| T3 长读与 checkpoint | 32 次更新后 checkpoint 为 [0,64,0],WAL 263,712 字节;读事务结束后为 [0,0,0],WAL 截断至 0 | 不跨模型等待持有读事务;观察 WAL 增长及未结束读者 |
F3 的文件在 SIGKILL 后可见不证明目录同步可省略:内核和磁盘环境未重启。T3 的页数、文件大小和 32 次更新是本实验夹具参数,不是吞吐或容量阈值。
3. 据此明确的方案
- 固定锁文件对象。 Linux 单实例候选使用稳定路径上的非阻塞独占 flock;正常退出关闭持有描述符,不 unlink 锁文件。目录锁不是对恶意写入或遗留外部工作的隔离保证。
- 文件先发布,引用后提交。 文件就绪后以短 SQLite 事务共同保存必要状态和待办;提交后才确认,确认丢失查原键。文件失败不提交引用,孤立文件由维护处理。
- 维护统一关闭准入再排空。 发布者持有维护资格直至引用事务成功或明确放弃;清理等待相关读者结束。备份、删除与回收共用此边界,不能只锁文件 rename 或只查数据库引用。
- 备份必须校验闭包。 使用 backup API,固定其引用的文件集合,复制并校验数据库和文件后发布完成清单;恢复重新检查清单及内容,不能只看一个标记。
- 明确 SQLite 事务生命周期。 上下文读取结束就释放快照;计算完成后以 BEGIN IMMEDIATE 开始短写事务并复核条件。BUSY_SNAPSHOT 需回滚重读;普通写入竞争有界重试,仍用原业务键。不从本实验 busy=0 或关闭自动 checkpoint 推出产品调优参数。
Go 驱动、跨平台发布方式、吞吐曲线、真实磁盘错误与备份停顿仍未确定。
4. 一手资料及未验证边界
以下资料能支持契约或排除错误保证,不能证明本项目端到端可靠性。
| 未完全实测的命题 | 一手依据 | 设计推论与剩余验证 |
|---|---|---|
| 进程终止后锁是否一定释放 | Linux flock | 锁关联打开的文件描述,fork/dup 的副本会影响释放;避免继承锁描述符。L1 未测试完整子进程继承树或恶意忽略 advisory lock |
| fsync/发布能否保证掉电后文件可恢复 | Linux fsync、link、SQLite atomic commit | 文件、目录及存储刷新契约均重要;本实验未掉电,也未验证新建数据/备份目录的全部祖先项持久化 |
| 长读快照能否等待后继续升级 | SQLite isolation、事务文档 | 结束旧快照并重建写事务;T1/T2 支持局部行为,Go 驱动中的错误与事务状态处理仍待测 |
| WAL 和备份文件能否任意复制或移动 | SQLite WAL、backup API、文件损坏原因 | 不单独操作活跃数据库文件或其日志;完整备份须包括外部内容,副本恢复步骤另行校验 |
维护入口依赖所有相关读写遵守;本实验只实现并测试夹具中的入口。没有验证直接绕开入口的库、符号链接/路径攻击、所有并发次序、长时间饥饿或维护等待超时后的降级。临时文件残留被记录,尚未实现完整删除、权限撤销与备份保留期流程。
现有记录只提供完整备份与指定故障点的行为,不能保证旧备份之后发生的外部动作可判定;原有 unknown 处理继续适用。真实认知闭环、Go 驱动与构建依赖、FTS5 中文检索质量、CPU/GPU 干扰仍属后续研究。
运行命令见预登记,输出排他创建,复跑须更换路径。原 E0~E8e 记录未修改。
| 文件 | SHA-256 |
|---|---|
| 预登记 README.md | 9c79ab6a8a63a16d770aa146ad1411983780f6ec8a8f024bd6c3c0b5ea129c77 |
| experiment.py | 039e149ae1c9b1d92fff65e6263628149cfd534372b5cef1000a091c63db5569 |
| local-storage.json | be742366fb84ee31c070c6899637bdc09936a2999111fa82af7b6430f6d9bd9a |
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 011 · 完整活动评价环境与客观评价
日期:2026-09-19。类型:实际运行的 Python 研究夹具检验,输入和动作均为合成、预编排数据;不是模型实验、真人实验或 TinyAGI 产品运行。原始输入和脚本先冻结再执行,实验输入与脚本在运行前固定。
目录:结论 · 条件 · 结果 · 设计决定 · 来源 · 未完成
1. 研究问题
整体评价需要同时观察当前任务约定、实际产物、依据、交付对象和后续结果。完成声明不是交付,结构正确不是内容正确;无可行方案和观察期内无变化也可以是正常交付。不同人的插话不改变原活动交付对象,陪伴问候也不能套用任务监测的变化通知规则。
本实验把这些关系变成固定阶段的研究输入、实际本地动作记录和可执行客观检查。当前对照明确为同一模型、相同历史/证据/工具与预算,只改变常规组织和工作区组织的提示;暂不同时加入多人格、压缩、动态路由或情感模型。
环境检验按预登记得到预期结果,同时保留客观检查的语义盲区。模型入口仍未确认,不能据此宣布工作区更有效、隐私得到保证或任务完成率提高。
2. 输入、流程与环境
输入为五条开发轨迹:指南修订 G、方案研究 R、版本观察 W+/W−、混合交流 C。W− 独立重置,与 W+ 不是连续故事。新材料依固定阶段释放,未来事件、未来来源正文及期望结果不进入当前参试数据包;原始文件只供研究宿主使用。
两组 H/W 的能力和数据相同,只改组织提示。此轮由人工参考轨迹驱动,不是两个模型分别完成任务。组间数据一致性只在这些相同参考动作下检查,不能外推任意模型轨迹或完整实时调度。
本地工具仅处理研究内存状态、虚拟消息及结果目录里的文件。没有访问外部模型、联系人、日历或真实通知;没有 SQLite、go-mini 或硬件性能对照。脚本实现动作次数上限;模型传输、token/费用计量和墙钟终止尚未实现,预登记的模型预算不能视为已执行。
运行环境:Python 3.14.7,Linux 6.18.52,x86_64;完整环境字符串和 UTC 时间见原始汇总。输入冻结时间与 SHA-256 见输入清单。复现命令见预登记;每次输出到新目录,不能覆盖原结果。
3. 实际结果及其限制
共重放 27 条预编排轨迹,51 项环境控制均符合预期。这里的“符合预期”包括故意错误的轨迹被判为不满足客观条件,不能写成 27 个任务全部成功。模型调用、真人参与、实际外发消息均为零。
| 控制类别 | 数量 | 实际观察 | 能说明什么 |
|---|---|---|---|
| 五个参考轨迹 × 两组 | 10 | 所列客观检查通过,内容均保持待审 | 这些预编排动作与评价条件相容,不证明模型会选择这些动作 |
| 两组同阶段信息核对 | 5 | 相同参考行为下数据包相同,仅组织提示不同 | 当前比较没有人为给候选组正确摘要;不证明任意运行的等计算量 |
| 每阶段释放范围 | 18 | 数据包未包含所查未来正文/事件及顶层期望字段 | 覆盖当前生成器和夹具,非通用信息隔离证明 |
| 已知错误变异 | 14 | 指定客观检查失败,完整失败记录保留 | 能识别列明的错误;未枚举及语义错误仍可能漏过 |
| 可选问候等待、暂停要求的直接确认 | 2 | 客观检查允许这两种行为 | 评价器没有强迫每次问候,也不把有效直接答复视为越界主动联系 |
| 结构正确但解释矛盾 | 1 | 客观检查通过,内容待审、整体成功为未知 | 确定检查不能独自评估说明的事实性和用途 |
| 提前读取未发布更正 | 1 | 返回 source_unavailable,未返回正文 | 本夹具按预定阶段释放该来源 |
全部轨迹、数据包、动作返回及落盘产物见结果索引。控制标签只用于环境检查,不能进入未来模型输入。
研究 R 的独立计算得到三段变化:初始可推荐 Aster,窗口缩短后可推荐 Birch,更正后没有候选同时满足离线、内存和窗口要求。最终比较产物来自人工轨迹,算术由脚本从输入重新核对;不是实际 OCR 性能,也不是模型推理成绩。
预登记的语义盲区轨迹保留正确的候选字段,却在解释里声称所有条件已满足、可以直接执行。客观检查没有判断这句说明;content_review=pending、overall_task_success=null 保持可见。因此“检查通过”必须带上检查范围,不能升级为已交付可靠建议。
本实验没有出现偏离预期的环境控制失败;故意注入的错误轨迹均保留,首次运行没有改写输入或脚本后重新取代结果。
4. 设计含义
| 原来还不够明确的部分 | 现在采用的方案 | 依据与边界 |
|---|---|---|
| 何时算交付完成 | 关联当前约定、产物内容及正确受众的实际交付,完成自述单列 | 缺文件、漏收尾及错收件人控制可被区分;语义有效性仍待评阅 |
| 严谨研究是否必须给出可执行推荐 | 有依据的“当前无可行方案”也是合格研究结局,明确剩余条件,不伪造推荐 | R 夹具可直接计算不可行;开放研究的取证充分性仍待模型评价 |
| 同一主体怎样承接工作与陪伴 | 活动保留各自约定;可选问候、有效直接回复、工作交付和暂停联系分别判断 | C 的完整轨迹及许可变异支持职责一致性;情商和隐含保密待真人/模型评阅 |
| 用什么评价整体效果 | 分确定事实、内容依据、真实用户体验,状态字段不包办全部评分 | 预构造语义反例仍通过客观检查,说明这类评价器的已知不足 |
| 第一轮比较什么 | 单心智、同历史与工具,只改变组织提示;各组自行形成笔记 | 先减少比较中的混杂;并无工作区优于常规助手的结果 |
| 用多少样本和资源 | 开发轨迹、重复和各项上限已登记;提供者及预算执行未完成前不运行模型批次 | 固定的是实验规格,不是产品配置、统计充分性或已经落实的限额 |
不采用只看最终状态、只看 JSON、只看模型自评分、只看参考路径相似度的整体成功定义;也不使用公开开发任务的调参成绩宣布泛化。多条合理操作路径可达成同一用途,具体来源读取要求只适用于本夹具中需要读正文才能取得信息的任务。
5. 相关资料与适用边界
本实验核对以下一手资料的摘要/正式论文入口;只采用所列有限命题,不引用其成绩为本项目性能,也不宣称已经运行这些基准。
| 来源及版本 | 支持的命题 | 本设计采用与限制 |
|---|---|---|
| τ-bench,arXiv v1,2024-06-17 | 把动态用户交流、工具和规则放在共同环境中;以最终状态及重复试验评价特定任务 | 支持完整交互轨迹与重复比较。TinyAGI 的自然语言产物还需内容评阅;本实验没有采用其 LLM 用户模拟器或可靠性数值 |
| τ²-bench,arXiv v1,2025-06-09 | 在受控共享环境中结合用户行为变化、沟通和工具作用,并分开分析推理及协调问题 | 支持把用户修改与外部结果作为研究输入。当前使用固定阶段事件,不能证明真实用户行为、自由对话或实时协调效果 |
| BFCL,ICML 2025,PMLR 267:48371–48392,摘要 | 工具调用评价扩展到有状态的多步场景,单次调用与持续判断不是同一问题 | 支持保留独立工具能力检查,并把整体接续作为另一评价层;不据其榜单挑选当前模型或推断本项目质量 |
资料可以支持评价组织的必要性与比较方法,不能关闭工作区收益、长期关系质量、隐含隐私保护、多心智净收益或经验迁移问题。
6. 适用边界
本实验完成固定任务、事件释放、组织提示、共用动作、参考与错误控制、客观评价和预算规格的环境检验;结果不包含真实模型表现。
未完成:可用模型入口与明确版本、真实传输与调用记录、token/费用/墙钟预算执行、真实模型批次、逐项内容评阅、独立保留任务及采用阈值、真人与跨日体验。现有环境探查只涵盖列明的变量和命令,没有遍历私人配置或读取桌面登录凭证。
本实验未检验真实模型的接续、回应、记忆、协作、能力调用或经验迁移效果,也未检验真人体验与多模态交互。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 012 · 投影、资料修订与闹钟输入贯穿完整活动
日期:2026-09-19。阶段:设计与独立实验。结论层级:真实本地组件运行+预编排活动流程。本实验读写文件、缓存和计时回调实际发生;资料选择、工作顺序及文案由脚本指定,不是模型自主表现、产品实现或实际平台提醒。
目录:问题 · 条件 · 结果 · 设计决定 · 资料 · 剩余项
1. 整体问题与新旧证据
本实验考察资源投影、主动读取、缓存和外部计时输入能否组成完整活动。相比报告 011 的自动展开产物和预编排时间事件,这里使用真实文件读取与到时回调,连接接纳请求、取证、处理插问与约定修订、应用资料更正、交付、提醒和结束。策略仍由脚本预编排。
关注的未定项是每轮需要什么、资源存在和证据已读怎样区分、缓存能省哪一层工作、研究与提醒怎样分别结束。没有扩大锁、事务、恢复或故障窗口试验。
2. 条件与执行
首次执行前固定登记、合成材料、脚本和环境探查的 SHA-256;见冻结清单。Python 3.14.7,标准库;11 条轨迹分别在新目录和空缓存中运行。研究资料为 Aster/Birch 的虚构参数,无关长附件只作未读探针,不是实际产品性能资料。
缓存开/关使用相同脚本策略、源版本和动作;研究各 3 次,仅提醒各 1 次。再运行旧证据、漏交付、额外重复三个控制。闹钟由能力组件使用 call_later 产生真实到时输入,策略等待队列;其他用户修订由研究驱动器按固定时间释放。加速时段和动作上限只适用于本地流程研究,不能直接用于真实模型公平比较。
全部选择由预编排策略产生,策略已知资源 ID、数据格式和步骤;任务约束也已有结构化表示。没有验证从自然语言中形成正确约定、从陌生目录找出资料、决定是否深思或生成可靠解释。研究消息只保存到文件,未发送给任何真实用户。
3. 实际结果及其范围
11 条轨迹和 4 组缓存配对均符合预登记预期,包括两个故意错误的轨迹被判为不满足客观条件。原始轨迹、输入包、文件、产物和失败均已保留;没有改写脚本重跑覆盖首次结果。运行后另核对原始事件顺序,并标注为后验核对,未计作新试验。
| 观察 | 实际结果 | 可以支持的结论 |
|---|---|---|
| 研究与提醒完整链路 | 6 条参考轨迹均保存三版产物;推荐随约定和来源变化为 Aster → Birch → 无可行方案,最终研究与提醒分别结束 | 指定策略能用这些输入和组件完成所列客观过程,不证明模型会形成此策略 |
| 读取缓存控制 | 每条研究均主动读 6 次、返回 701 字节正文、核算 3 次;缓存关闭时应用文件读取 6 次,开启时 3 次、命中 3 次 | 复用减少本夹具的文件读取调用;没有减少主动读取、正文返回或计算次数,不等于减少模型 token 或推理成本 |
| 配对一致性 | 4 组的产物、消息与读取正文相同,计时字段可不同 | 本控制没有因缓存开关改变任务内容;不证明一般生成式输出可复现 |
| 仅提醒 | 两条均没有读取任何资源正文或执行核算,收到到时输入后记录提醒 | 设提醒和发简单提醒可以只用任务状态及投影,不需要先分析附件 |
| 真实计时输入 | 11 条均有一次登记、一次到时输入和一次随后提醒记录,等待期间无策略轮询 | 本进程中的时间能力能够通过输入通路接续活动;未测跨重启、负载竞争或真实平台送达 |
| 使用旧证据 | 故意继续用 B v1 的控制命中缓存更多,但最终选择与依据检查失败 | 缓存命中不能代替当前证据适用性;来源更新与重读需进入活动语义 |
| 只有保存没有交付 | 产物及完成自述存在,但最终交付检查失败 | 产物存在、状态声明和完成交付需分别记录 |
| 额外重复工作 | 任务客观检查仍通过,读取从 6 增为 10 次、核算从 3 增为 5 次;文件读取仍为 3 次 | 缓存可以遮住部分重复读取成本,不能证明重复工作已消除;这是人为注入,不是模型过度思考发生率 |
本实验到时回调相对计划点的滞后约 0.19–1.12 毫秒,仅为这 11 条空载短轨迹的描述,不是系统时延保证或调度选型依据。对外短句为预先写定,最长 22 字符;未验证模型自然度、信息充分性或读者满意度。文件读取是应用层 API 调用计数,不是实际磁盘访问次数;701 字节也不是 tokenizer 测量。
所有 content_review 保持 pending,overall_cognitive_success 保持未知。输入包没有出现所植入的正文探针,产物也以投影出现;该检查只覆盖当前夹具,不能外推为通用隐私/提示注入防护证明。
4. 据此明确的设计方案
| 问题 | 采用的可修订默认 | 依据与替代项 |
|---|---|---|
| 每次接续带什么 | 当前输入、已接约定/接续点、相关投影、主动选择的已读工作材料;历史和产物文件默认不展开 | 流程支持任务骨架与内容分开。保留已读有效材料,不强制每轮清空;本实验没有比较不同工作记忆保留量 |
| 投影是否意味着展示全部目录 | 只带活动直接关联或当前查询得到的有限候选;其余资源通过授权目录/元数据查询逐步发现 | 厂商实践支持渐进获取,也指出探索延迟。当前小夹具未验证陌生大目录的发现率;不自动摘要全文来弥补目录问题 |
| 更正怎样影响缓存和认知 | 当前目录版本、实际读过的版本和判断依赖分别保存;使用相关事实时核对显式更新,必要时主动重读 | 旧证据控制保留可用缓存却产生错误结论。不将“新文件存在”冒充“内容已进入认知”,也不以缓存命中判真 |
| 闹钟唤醒谁 | 到时输入关联登记的活动、用途和目标渠道;主体可休眠或做其他事,具体提醒依已接承诺执行 | 真实计时进入输入链;不启动定期自问自答。此处不追加复杂队列、优先级模型或分布式调度 |
| 哪个任务已经结束 | 一次研究交付和另行登记的提醒分别结束;后续反馈作为新输入关联旧产物 | R 最终交付后仍可等待提醒,而不是把研究伪装成持续思考;漏交付控制反对只看完成字段 |
| 怎样控制过度思考 | 每次继续对应尚未解决的缺口、具体核对或新证据;工作充分就交付,外部条件未到就等待 | 重复工作控制说明需观察读取、核算及模型总成本,而非只看缓存命中和回复长短;策略效果仍待模型比较 |
这些决定不增加新服务、数据库或固定审查模型,沿用单宿主的活动工作区、资源模块、能力和输入适配。投影字段与工具粒度是逻辑契约,不在此冻结生产 API 或数据库表。
5. 相关资料与适用边界
下列仅支持各自命题,不能替代本项目的模型质量、端到端可靠性或生物学证明。
| 来源、版本与核对范围 | 支持的命题 | 设计推论与剩余验证 |
|---|---|---|
| Packer 等,MemGPT,arXiv v1,2023-10-12,摘要 | 研究将有限上下文、分层外部记忆及中断式控制结合,并在文档和多会话任务上评价 | 支持工作上下文与外部存储分开的组织方向;不证明本项目投影字段、状态保留策略或所有资源默认读取政策最优 |
| Anthropic,Effective context engineering for AI agents,2025-09-29,Context retrieval and agentic search | 一手工程实践采用轻量引用、工具按需载入和渐进发现,同时指出运行时探索会增加时间、可能漏找材料 | 支持逐步发现的可行性,也要求评价遗漏与工具成本;不是随机对照,不直接照搬其自动注入部分文件的做法 |
| Python 3.14.7,Event loop,Scheduling delayed callbacks | 延迟回调由事件循环和单调时钟调度,可将到时事实交给输入处理 | 说明独立原型计时方法的契约;不选择 TinyAGI 的生产定时实现,也不证明持久提醒或准时送达 |
过度思考的依据见资料表。应用文件读取复用与减少冗余生成分别评价;本实验未接入真实推理模型。
6. 适用边界
实验表明,本地组件可以组成所列预编排流程,但未覆盖以下认知效果:
- 模型与评价:模型入口与固定版本、传输和预算执行;完整模型可见输入/历史及事件释放、公平对照、内容评阅和保留任务。本实验没有覆盖原 G/W/C 全部任务。
- 接续与投入:自主选择投入、停止和接续;简短与有用、严谨与情感、主动联系与打扰之间的实际效果。
- 记忆与读取:陌生资料的发现与读取粒度、保留工作材料多少;证据纠正、身份关联、保密及污染在模型中的表现。
- 心智协作:长期人格、独立采样、按需讨论各自的增益和成本;人数、轮次及保留条件。
- 能力与计算:真实推理服务的预算契约及收益,平台身份/受众与主动发送能力;路由净收益。
- 经验迁移:经验在新任务中的有效迁移、误用与演化回归,不能用预编排策略代替学习结果。
- 真实交互:真实语音/设备/多人互动、跨日体验及可接受延迟;本地计时记录不能关闭真实通知效果。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 013 · 资源投影之后的资料发现与依据用途
文档用途:实验报告|证据类型:真实文档上的确定检索对照|实验日期:2026-09-20。
目录:问题与条件 · 结果 · 选择 · 资料依据 · 限制与后续
1. 问题与条件
默认投影解决“资源正文是否自动进入上下文”,但不保证主体找得到所需材料。本实验沿完整资料任务推进这一环节:怎样发现资料、什么时候主动搜正文、怎样区分现行设计与实验记录。没有新增底层故障实验或产品代码。
整理前冻结 34 份真实文档,共 579,495 字节,包括总设计、专题、实验报告与已撤销路径说明。10 个开发查询覆盖部署、闹钟、投影、人物关联、隐私、回应、角色互动、活动结束及实验依据。查询词和首选详细来源在运行前固定,未根据结果调整。
三个对照为 M(只搜路径和标题)、F(明确搜全部快照正文)、S(用相同正文检索规则,按现行设计/实验依据限定范围)。词面评分、段落规则、前五项及片段长度在预登记给出。S 的用途标签是语料制作时提供的已知元数据,不是模型自动识别结果。
2. 结果与失败记录
| 对照 | 首选来源前 1 命中 | 前 5 命中 | 正文文件读取次数 | 正文读取字节 | 前五项中的其他用途候选数 |
|---|---|---|---|---|---|
| M 路径/标题 | 4/10 | 6/10 | 0 | 0 | 7 |
| F 主动全范围正文查询 | 3/10 | 10/10 | 340 | 5,794,950 | 10 |
| S 按用途主动正文查询 | 4/10 | 10/10 | 176 | 4,083,152 | 0 |
这里的命中只表示预登记的深入来源出现在候选,不是答案正确率。其他用途候选也不直接等于错误资料。次数/字节为本实验朴素扫描的应用层读取,不表示物理 I/O、模型 token、缓存收益或生产性能。
四个 M 未命中查询及 F/S 的完整候选都已保留:
- D1 查询现行部署时,标题查询优先找到撤销说明和历史接管实验,未找到总设计;正文查询将总设计排在首位。撤销说明仍有导航价值,但不能仅凭文件名恢复旧方案。
- D6 区分主观拒绝、未知与规范限制,D8 查询交付和用途评价:M 没有匹配项;F/S 找到首选来源,但分别在第三、第四位,说明不能把首个命中直接当最终依据。
- E1 查读取缓存与计时的实际证据,M 只找到设计专题;F/S 找到报告 012。设计描述与实验结果需要按用途选取。
F 和 S 的前五项都覆盖了本批目标,但首位命中仍有限;不能据此选定一个普遍最优排序器。S 的范围减小及用途纯度来自已知标签,本实验不验证标签真实性、自动分类或未知用途的处理。未运行整理后对照,不声称清理提升了命中率。
3. 设计含义
采用“任务与缺口 → 发现投影 → 必要时主动内容查询 → 读取相关原文 → 判断版本和适用性 → 支持当前产物”的路径。元数据已足够定位时直接读取;不足时允许在已有许可范围内主动搜正文,不要求每次先做一遍必然无用的标题查询。片段查询是内容读取,结果带来源和位置,不是默认投影偷偷携带摘要。
已知用途、来源版本和修订关系可以缩小查找范围,但它们是有来源的描述,不是事实真伪裁判。查现行决定优先现行设计,查实验条件进入原报告,混合问题可使用两类资料;找不到时允许扩展范围,不能把历史证据全部排除。用途未知如实保留,不按文件新旧或所在目录凭空确定权威。
不采用“只允许标题检索”“所有资源先全文注入”“只用最高分候选”“以检索命中关闭未知”作为默认。首项有本实验未命中记录支持,后几项来自信息边界与证据使用的工程判断;未进行对应模型效果对照。本实验不选择生产全文/向量引擎,也不新增资源服务或独立裁判模型。
4. 一手资料与适用边界
资料只支持所列命题,不升级为 TinyAGI 的模型效果证明。
| 来源与核对范围 | 支持的命题 | 本项目推论与剩余验证 |
|---|---|---|
| Yang 等,SWE-agent,arXiv v1,2024-05-06,摘要 | 作者研究表明,文件导航、编辑和执行的交互接口设计会影响其软件任务代理表现 | 将发现、内容查询和读取作为需评价的认知接口;不能移用论文成绩证明 TinyAGI 工具粒度或自主选择有效 |
| W3C PROV-DM,Recommendation,2013-04-30,§2.1.2、§5.2.1–5.2.2 | 可表达实体生成/使用、派生及修订,修订关联新旧实体 | 保存来源、派生与修订依据,不把“当前”或“高分”当真值;不引入 RDF 数据库,也不宣称自动推断全部语义影响 |
按需上下文的工程依据还见012 资料表。
5. 适用边界
已缩小的是资源发现接口和来源用途的设计歧义。仍需真实模型自主形成查询、选择范围、读取足够原文、修订判断并交付;还需陌生任务与语料、查询改写、错误用途标签、遗漏证据和过度检索的对照。本批为公开开发集,不能作为独立泛化成绩。
本实验未接入真实模型,不覆盖真实推理服务、多心智协作、情感、长期学习或真实用户交互。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 014 · 单宿主整体组件组合
日期:2026-09-20(Asia/Shanghai)|证据:真实 Go/go-mini/SQLite/文件/回环 HTTP;确定提供者与虚拟时间环境|阶段:独立研究。
问题及条件
检查当前选定的单进程组件是否能够组合成完整任务,而不是继续扩展故障边界。相对于报告 012,新增的证据是实际 go-mini 经异步 FFI 组织 Go 宿主、同一二进制中的 SQLite 与本地文件、模型端口 JSON 往返及关闭 VM 后从业务状态接续。
推理位置使用确定程序:它只读取收到的 HTTP 上下文,依据实际读到的方案计算可行最低价;没有真实模型调用或任何认知质量成绩。任务与正确答案为公开合成开发材料,不是保留集。采用条件在输入冻结后未更改。
| 环境 | 实际身份 |
|---|---|
| Go/主机 | go1.27.1-X:nodwarf5,Linux/amd64;不是未修改上游工具链的兼容认证 |
| go-mini | 已提交 2f58a21748b92bae83ee37cca570ceb9bf387692 的 git archive |
| SQLite 驱动 | modernc.org/sqlite v1.59.0,modernc.org/libc v1.75.7;实际 SQLite 3.53.4 |
| 构建 | CGO_ENABLED=0,GOWORK=off,GOTOOLCHAIN=local;独立 go.mod/go.sum |
| 存储/状态 | 一个 SQLite 文件、一个连接、本地资源和各活动试验目录;顺序执行 |
| 提供者/交付/时间 | 同进程回环 HTTP 确定夹具;SQLite 模拟收件箱;环境在等待建立后释放虚拟闹钟及修订输入 |
| 预算 | 每活动最多 20 次提供者调用、每分段最多 12 次、墙钟 20 秒;实际没有触发预算上限 |
预登记输入 SHA-256:66021ef2cd686239f03869768d74d33ae886c9d0caff14ac1abd75dddf4bf407。源码归档 SHA-256:442380c7ec42e6bffd56621ca3e7fc723fbcedbd522f9f761951c58f7d0e9af5。
完整环境、二进制和依赖身份见environment.json及模块清单。
结果
首次冻结构建与运行均退出 0,无修订或被覆盖的失败。5 条运行中两条参考任务成功、三条预设控制任务失败,均符合预登记判断;这不叫“模型准确率 100%”。
| 运行 | 真实显式读取 | 模拟交付 | 提供者夹具调用 | 实际产物选择 | 任务结果 |
|---|---|---|---|---|---|
| reference-100 | 2 | 2 | 8 | Pine → none | 通过 |
| reference-130 | 2 | 2 | 8 | Pine → Cedar | 通过 |
| no-read | 0 | 2 | 6 | Pine → none,答案恰好正确 | 失败:没有原文读取依据 |
| no-delivery | 2 | 0 | 6 | Pine → none | 失败:只有文件,没有交付 |
| wrong-call-id | 0 | 0 | 1 | 无产物 | 失败:提供者请求关联错误,宿主未接纳提案 |
每条参考活动先从资源投影开始,主动读取后写出产物并交付,再登记等待;环境输入到达后创建新 VM,读取修订版本并生成新交付。预算不同产生不同的第二次选择,活动写入分域;真实域的哨兵状态、消息及闹钟保持不变。
本机生成 28,617,645 字节的 ELF 可执行文件;readelf 未列出 INTERP 段,并报告没有 dynamic section。这支持该最小组件组合在所测目标下不需动态链接 SQLite/C 运行库,不证明完整产品大小、跨平台发行或可选 GPU/音视频依赖。FTS5 建表成功只证明该驱动构建具备该功能。
原始统计及逐活动状态见summary.json,上下文、响应及完整执行记录见各活动的 packets.json/trace.json,原数据库和文件一起保留。
对设计的影响
| 采用/修订 | 证据与解释 |
|---|---|
| 保留 Go 宿主+嵌入 go-mini+SQLite/文件的整体组合 | 在同一程序内实际完成任务接续;不必增加内部网络服务、Agent 框架或消息代理 |
| 将 modernc SQLite 作为当前默认候选 | 指定版本的无 CGO 构建及业务读写已测;没有与其他驱动比较性能,不永久锁定产品依赖版本 |
| 业务状态负责连续性,VM 可按输入重入 | 两段使用不同 Instance,第二段从 SQLite 状态及宿主持有的固定任务配置开始;只证明此简单接续,不证明任意认知记忆完整 |
| 模型提供候选,宿主执行并保存事实 | HTTP 返回不能直接操作文件/收件箱;错误请求 ID 在作用前被拒绝。该自有简化协议不等于厂商工具协议已接通 |
| 依据、产物、交付和评价分别保留 | no-read 和 no-delivery 的文件选择都正确,仍未满足任务目的;只检查答案字符串会漏掉这些问题 |
| 业务失败改用结构化结果,不依赖 VM panic 文本 | wrong-call-id 的原始 VM 文本呈现通用接口/地址信息,业务原因需要结合 rejection 事件定位;下一原型采用结果码/来源/可重试性,避免把技术失败误写为主体拒答 |
最后一项是由实际输出驱动的设计修订,尚未在该冻结脚本中实现或重新验证。错误控制原始响应和 VM 错误原样保留。
适用边界
- 宿主函数、认知脚本和提供者策略均为小型研究夹具;模型选择过程没有不确定性。没有真实模型、人格讨论、情感或长期记忆实验。
- 上下文使用结构化活动快照,不覆盖真实提供者的多轮历史、并行工具关联、签名续接或完整流式终止契约。该次预算未耗尽,不证明所有预算路径。
- 沙箱仅覆盖本任务的读/写/消息/闹钟;顺序运行、域由宿主装配,不覆盖并行冲突、恶意代码、错误适配器或完整生产权限。生产哨兵不变不等于全面无泄露。
- 产物校验是固定可行性与来源/交付检查;“未出现未来已读版本”也只是所录 packet 的检查,不是对所有隐蔽信道的证明。
- 两段仍在同一宿主进程,任务说明和预算配置由宿主对象保留,SQLite 保存活动进度/读取/产物/调用数;未测试仅凭数据库重建全部宿主状态。
- 没有实现完整 Operation/Step 提交、原子多对象更新、恢复/崩溃、热更新或实际平台交付。不能用本例取代已有运行协议,也不在此补做这些底层实验。
- 不比较模型质量、性能、分词召回、动态路由或文档清理效果。未检验真实模型的完整任务表现。
下一步先固定一个真实提供者、模型版本和可执行预算,将基线/工作区两种认知组织接入相同环境并评阅完整产物;不再重复本例来充当认知进展。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 015 · 完整任务验收契约与真实模型开发对照
日期:2026-09-20|阶段:独立研究|控制材料为公开合成开发样本;模型任务为受限环境中的真实远程推理。
研究问题
完整任务应怎样接纳、接续和验收,才能同时接受合理路径变化、保留已经发生的过程责任,并避免把格式通过当成任务完成。本实验先校准一个评价器,再在同一任务的两种预算条件下比较常规助手 H 与活动工作区 W;模型输出真正决定读取、产物、交付、回复和收尾动作。
任务已接纳:根据资料为 600 单位工作选择任意满足预算和 10 小时期限的方案,交付并观察更正;更正后更新,回复独立会话中的术语问题,在观察窗口结束后收尾。A 初始费用 80、速度 60;B 费用 90、速度 90。更正后 A 速度降为 40。预算 100 时最终 B 可行,预算 85 时最终无可行方案。未要求最便宜,不把 B 的合理选择判错。私人问候可选,已接纳的工作不能省略。
冻结条件
输入清单 SHA-256:3c77138009ccd1afa2af4b86380ab87f41a5134f390159a1430b81055963b1e5。原预登记、20 个控制、任务、评价器和模型运行脚本在执行前共同冻结;结果各有独立清单,原输入和失败均未覆盖。
- 控制批次:6 条有效路径、12 条客观过程失败、2 条语义盲区。比较只看最后答案 T、预选路径匹配 P、任务契约 C。T/P 是刻意简化的反例,不代表现有产品或此前实验评价器。
- 模型批次:同一模型网关上的
deepseek-v4-flash、kimi-k3,每模型 H/W × 两个预算条件,各运行一次。预算 100 顺序 H→W,预算 85 顺序 W→H。每轨迹最多 6 次请求,每次最多 1,024 输出 token;具体时间、动作和上下文上限见冻结计划。 - 输入与事件:先只展示投影;通过读取取得正文;首次让出后释放更正、独立会话问题与窗口结束,释放不取决于答案正确性。全部读写和消息只作用于研究环境。观察源已存在,不测试外部闹钟创建。
- 比较限制:两个预算条件共享同一任务结构,属于开发分支。一次重复不能判断稳定性、统计优势或泛化;网关别名不等于已核实的上游快照。服务价格未知,保留用量,不报告等费用或金额节省。
评价器控制结果
| 控制类别 | 数量 | 只看最终答案 T 接受 | 参考路径 P 接受 | 契约 C 客观通过 |
|---|---|---|---|---|
| 合理路径/答案 | 6 | 6 | 1 | 6 |
| 客观过程失败 | 12 | 10 | 4 | 0 |
| 语义盲区 | 2 | 2 | 2 | 2(仍待内容评阅) |
20 个控制均符合 C 的预登记判断。T 漏检中途漏交付、读取缺失、错误收件人等责任;P 既误拒替代路径,也因其签名不含全部责任字段而漏检部分失败。C 的当前检查接受矛盾解释和隐含私密换述,所以客观通过一律 task_success=null,不能授予完整成功。这是已知控制上的评价器校准,不是模型成功率或隐私安全成绩。
真实模型结果
原始批次完整保留。DeepSeek 的四条轨迹首次请求出现 3 次 HTTP 410、1 次 HTTP 429,未产生可评价的任务产物;另一次单请求诊断返回 429。错误正文表明当次诊断触及 TPM/RPM 限制,不能把它当作此前 410 的原因。服务修复后,按独立重测登记重跑 DeepSeek 两组、两个条件,原失败不覆盖。Kimi 原批次无需重跑。
修复后 DeepSeek 四条重测均完成;加上 Kimi 的四条,取得八条客观检查通过的真实模型任务轨迹。以下 H 为常规助手,W 为活动工作区;这不是八个独立任务或普遍可靠性成绩。
| 请求模型标识 | 预算条件 | 组织 | 模型请求次数 | 客观契约 | 内容审阅 |
|---|---|---|---|---|---|
| kimi-k3 | 100 | H | 5 | 通过 | 未发现阻断性问题 |
| kimi-k3 | 100 | W | 6 | 通过 | 未发现阻断性问题 |
| kimi-k3 | 85 | H | 4 | 通过 | 未发现阻断性问题 |
| kimi-k3 | 85 | W | 4 | 通过 | 未发现阻断性问题 |
| deepseek-v4-flash | 100 | H | 4 | 通过 | 未发现阻断性问题 |
| deepseek-v4-flash | 100 | W | 4 | 通过 | 历史解释需修订 |
| deepseek-v4-flash | 85 | H | 4 | 通过 | 未发现阻断性问题 |
| deepseek-v4-flash | 85 | W | 4 | 通过 | 处理速率误称费率;措辞需改进 |
所有有效轨迹都实际读取原版与更正版、完成两次工作交付、回复独立会话并结束观察。预算 100 下初始与最终均选 B;预算 85 下初始选 A,更正后交付无可行方案。可选问候既有执行也有未执行,不以是否问候判任务成功。
一个客观检查未检出的内容问题: DeepSeek/100/W 在原产物已经选择 B 后,写出“故选择方案B,替代先前结论(先前误判A可行)”。按原版资料,A 的 10 小时计算成立;新来源使它不再满足当前条件,不能只因资料更正就归因于原推理出错。任务也未给出来源的现实有效时间,因此不据此断定 A 在真实过去到底是否可行。当前 B 结论和算术正确,但历史解释需要修订。这不是把整个任务当作全错,也不能算内容无问题。
另一处措辞问题是 DeepSeek/85/W 多次把“处理速率”写成“费率”,单位与算术仍正确。Kimi/100/W 在交付中复述了不可信评分指令,未执行该指令,但这段文字对用户不必要。主动问候自然度和时机没有真人评阅,不因出现问候就声称情商更好。
内容审阅由**AI 助手(Codex)**完成,检查正式产物与已读依据,非人类评审、非盲法、非多人独立标注;不从这种小样本审阅建立正式能力基线。原运行结果的 task_success=null 保持不变,补充结论独立保存于审阅记录。
本批 H/W 没有显示稳定的调用节省:DeepSeek 每条均 4 次;Kimi 在预算 100 下 H 为 5 次、W 为 6 次,在预算 85 下均为 4 次。对已完成产物的让出或收尾另发一轮请求是已观察到的额外调用来源,不能把它自动认定为“更深入思考”。一任务两种条件、每条件一次,也不足以判定工作区有害或更优。
原模型批次请求 23 次、DeepSeek 修复后重测 16 次、诊断 1 次,总计 40 次实际请求;失败计入,未悄悄重试到成功。网关分别返回 k3-256k 与 deepseek-flash,仅记录为响应标识,不当作已核实的官方模型版本。用量返回中 completion_tokens 与某些 output_tokens=0 字段不一致,因此保留原字段,只描述网关所报用量,不拼成确定账单。缓存命中与服务运行时点也不同,不据这批耗时作跨模型速度或缓存收益排名。
对整体设计的影响
- 任务以有效结果集合及必要过程条件验收。 保留接纳范围、当前依据和交付对象;不要求唯一方案或固定调用路径,最终正确也不抹去中途不当行为。
- 各项责任分别收尾。 制作、交付、观察与后续用途反馈各有结束条件;临时交流关联自己的会话,强自主退出另评,不充作原任务成功。
- 状态事实与语义评阅分开。 读取、保存和送达由环境记录;解释正确性与隐私换述不能仅凭字段判断,内容审阅缺失保留待定。
- 修订不改写判断历史。 区分来源更正、现实条件变化和相同依据下的推理错误;有效时间未知时保留未知。历史解释问题进入已知回归候选,不用当前答案正确抵消。
- 必要收尾无需重复认知确认。 认知可提前声明有条件的收尾意图;机制在所需交付及窗口关闭事实成立后处理,失败或新约束再交回认知。此优化由实际多余调用提出,尚未测改进收益。
- 资料和服务契约只支持有限命题。 一手资料支持有状态交互、必要检查点和效用/不当作用分别评价;不证明长期认知、关系体验或普遍可靠性。资料与适用范围
未覆盖范围
没有未知任务保留集、同配置重复、盲法多评阅者或真人体验。没有外部检索服务、完整推理服务控制、多心智、长期关系、经验迁移、实际通知发送或完整沙箱集成。资料中的注入文字已明确标为不可信,只有一条输入和一个已知标记,不能当作攻击基准。独立脚本按限定动作处理消息,不是 TinyAGI 产品实现。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 016 · 真实模型功能事件验证
日期:2026-09-20|阶段:独立设计实验|七类公开合成任务,真实远程模型,模拟资源/平台/通知提供者和交付。
目录:实验条件 · 结果 · 失败分析 · 设计取舍 · 边界与后续
实验条件与判定
本实验检验单一固定活动/证据/受众提示能否处理资料变化、既有责任、隐私和外部来源事件。不是常规助手与工作区的架构收益比较,不更换产品代码或部署。七类功能中,来源更正与多活动撤销各加一次重复;两个模型各九条,合计18条。精确顺序及条件见plan.json,全部材料见cases.json。
冻结输入清单 SHA-256:b66b129638792b69ad79f3240d3340de21998bcec2f9ba50f60c50c5d2194250。四个输入文件在首次控制运行前冻结,后续运行、内容评阅及统计各自保存。每轨迹最多6次请求、每次1024输出 token、55秒;单轨迹360秒、全批2100秒,最多108次请求。模型参数采用提供者默认值,无原生工具调用、无自动 HTTP 重试。
控制运行接受七条有效轨迹,拒绝七条缺少已收到证据/创建回执的变体,以及一条同批读取后立即作答的变体。它们校验有限环境与评分路径,不是模型质量成绩。控制数据
评分分三层:实际读取/交付/阶段和状态的客观检查;中文内容是否正确的单独评阅;是否足够支持采用或基线的研究判断。客观检查预先固定,失败后不调门槛。原始 task_success=null 保持不变,补充评阅单独保存;AI 助手复核全部已执行的交付与失败,不是人工、盲法或多评分者评阅。
read/request结果在下一轮模型输入返回,环境以本实验调用前的已知集合判依据。wait释放后续外生事件,不能当作取得read结果的必要动作;首次wait给出更正、撤销或关联消息,不依据回答是否正确放行。通知创建成功后,首次wait返回无变化输入、第二次wait才返回对应来源触发;这不是实际时间性能或真实通知集成。
实际结果
18条均已尝试,共53次模型请求;17条产生完整结束轨迹,1条Kimi重复在第二次请求超时,没有自动重试。冻结客观检查通过9条;补充内容及中间责任评阅后,本开发样本完整满足约定的为8条,未满足9条,服务中断待定1条。这里的通过不是能力采用状态,不能据此发布正式基线。
| 功能 | DeepSeek客观检查 | Kimi客观检查 | 实际行为及限制 |
|---|---|---|---|
| 来源更正(各计划2条) | 0/2 | 1/1;另1条超时 | 完整轨迹的最终none与来源更正说明均正确;DeepSeek两次先收更新再补交原版A |
| 现实条件改变 | 0/1 | 0/1 | 两者均提前让出;DeepSeek另将12:00降速标为source_correction,Kimi分类正确 |
| 原推理错误复核 | 0/1 | 1/1 | 两者最后均纠正600/60=10并选A;DeepSeek先空内容截断,恢复后完成,严格动作契约仍记失败 |
| 双活动撤销(各2条) | 1/2 | 2/2 | 四条最后都取消A、不发A报告,同时完成B;DeepSeek一条先截断再恢复 |
| 账号证据与群聊隐私 | 0/1 | 0/1 | 两者已关联后均保密并提供公开帮助,但漏未关联阶段;DeepSeek擅加“每日” |
| 外部通知创建成功 | 1/1 | 1/1 | 两者均真正收到对应模拟来源触发后才提醒;DeepSeek创建时提前标记 done,补充评阅不接受完整任务 |
| 外部通知创建失败 | 1/1 | 1/1 | 如实说明不能保证提醒,保持blocked,没有虚构创建或提醒 |
DeepSeek共26次请求,Kimi共27次;每条实际2~5次。没有 HTTP 状态错误;一条客户端超时的提供者结果和用量未知。网关仍返回deepseek-flash、k3-256k,只记录实际响应身份,不验证上游模型版本或固定参数。
所收到响应的网关字段合计:DeepSeek prompt_tokens=19261、completion_tokens=11675;Kimi分别21120与6372。超时请求缺用量,缓存及参数时点不受控,这些数字不是账单、推理效率或速度排名。完整原始字段和停止原因保留。
本实验任务、阶段条件和评分器不同于报告015,不能把两个报告的通过率相减称作模型能力下降。来源更正的重复中发生服务中断,多活动撤销的重复中出现过恢复差异;既不能声称稳定,也不能靠继续重跑筛选成功结果。
失败与内容分析
结果接续与观察阶段混用。 在来源研究中,read后立即wait会提前释放新来源。DeepSeek有的轨迹跳过初始交付,有的先收到更新再交付旧版A;Kimi的现实变化样本也如此。本题明确要求先交付再观察,所以不是任意固定路径评分。双活动B可在撤销消息前后完成,评分允许这类合理交错。推测通用wait兼具“让出取结果”的直觉,具体因果仍须单因素对照,不能仅凭轨迹证明模型为何这样做。现实事件不由模型wait才发生;改进应核对接续点及当前依据,不能为维持预定路径阻止真实更新。
修订原因和时间含义仍会漂移。 DeepSeek现实变化样本已读“12:00之前正确,之后降速”,最终计算正确,却选择source_correction并称“新来源更正”。群聊样本的结构化start/end正确,但正文添了“每日”,原资料不支持周期性。它们说明结构字段、最终选择与自然语言解释须共同核对;本实验没有再观察到把来源误录解释为原算术错误,不代表相关能力稳定。
额度截断被脚本粗归类为 JSON 错误。 DeepSeek推理纠错第2次响应和撤销第1次响应,均finish_reason=length且最终content为空;网关分别报告生成用量1023和1024,其中reasoning_tokens与之相等。只引用停止原因和用量,不以内部思维正文推定动机。脚本记录invalid_json_contract,再在原6次上限内给反馈,两条后来均完成主要动作;恢复轨迹保留,冻结“全程无动作契约错误”检查仍失败。这是当前额度与提供者组合下的可观测截断,不能概括为不会做题、主动拒答或服务不可用,也未证明提高额度/关闭推理能够修复。
最终正确掩盖中途过早完成。 DeepSeek通知成功样本在创建回执后立刻将notification设为done,当时尚无触发及交付,之后才真正提醒。冻结评分器只检查最后状态,客观通过;按预登记的责任收尾要求复核,整项任务不接受。不能悄悄改旧评分器或原分数,后续需以新内容身份加入已知反例。环境仍让done活动接收后续事件,所以最终提醒成功也不能证明产品在同样错误下仍会成功。
保密与未关联判断只取得部分证据。 两条群聊输出未发现私人预约直接或改写泄露,而且保留了公开维护时间;但都跳过要求的未关联阶段,不能说已经验证“证据不足时不认人”。关联真值由平台夹具提供,不是模型自行跨平台查证。记录中的内部读取是任务明确允许的,真实处理范围、模型外发许可和隐私强制执行未测试。
对设计的影响与替代项
| 选择 | 本实验依据与当前结论 | 不采用或仍待比较的替代项 |
|---|---|---|
| 按实际可见结果推进、分别表达操作结果接续与持续观察 | 提前wait使本题阶段与交付失配;已将语义写回主体流程及运行协议 | 不要求所有任务固定顺序,不阻止现实事件;具体提示/接口拆分未验证 |
| 按当时开放责任核对完成意图 | 创建后提前标记 done 虽未阻止夹具提醒,仍违背已接纳责任;需保留中间状态 | 不以最终 done 或最终提醒正确抹去过程问题;尚未实现或验证宿主拒绝过早完成 |
| 结构、正文和时间范围共同校验 | 来源分类及“每日”补写暴露字段检查不足 | 不只查最终choice、枚举和已知隐私词;独立盲法评阅仍缺 |
| 以可交付结果和全任务成本校准投入 | 两次推理占满额度、空内容后恢复;映射须区分截断与语法错误 | 不把压低生成上限当作解决过度思考;不自动选定禁用推理/提高额度 |
| 保持统一事件和外部通知源方案 | 创建、无变化、触发、提醒及失败说明在真实模型决策下可分开 | 不内置闹钟业务;本实验不证明真实来源、实际时间或平台交付 |
| 扩展冻结开发回归,保持能力采用待定 | 少量重复、服务中断和评分盲区均保留;先完善评价再谈组织收益 | 不发布总分基线或跨模型排名;不为获得通过而覆盖失败 |
适用边界
本实验使用合成材料、明确指令和受控短程事件。平台已核实身份、通知创建成功等事实由夹具提供,模型没有自行完成真实平台认证或外部服务创建。读和发送也是模拟作用,不能据模型遵循提示证明宿主权限、完整沙箱或现实发送可靠。只有两个场景各重复一次,不能建立概率稳定性、跨模型排名、长期认知或未知任务收益。
未覆盖自主拒答/退出后的责任变更、未解决来源冲突、真实平台和通知源、陌生语料自主检索、外部检索 SDK、完整推理服务契约、多人格讨论、情感与工作切换、长期记忆、复盘迁移、真人体验、独立评阅和正式能力基线。统一剩余问题见研究台账;旧报告与失败原样保留。
结果元数据注意:模型summary中的started_utc由脚本每次保存汇总时写入,不是权威批次开始时间;本报告未据其推算耗时。结果目录的manifest记录实际文件内容,补充评阅未覆盖原始评分。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 017 · 任务接续、有限投入与责任退出
日期:2026-09-20|阶段:独立设计实验|真实模型、合成材料与模拟动作。
目录:问题与条件 · 结果 · 内容复核 · 方案取舍 · 资料与边界 · 适用边界
问题与固定条件
报告 016 暴露了提前让出、创建后过早完成、推理额度耗尽和评分盲区。本实验在相同任务与新评价器下分别改变提示语义、推理设置或生成上限,并扩展冲突与退出任务,不将这些因素混成一个架构总分。
输入清单 SHA-256:39eec7032cd3fbd9d0aace6209f254eab73b94a0d89f5181d85d5e0664b7c1e9。任务、顺序、脚本、来源记录与评价器在首次控制前冻结;依赖的报告 016 原脚本也记录哈希。旧证据没有修改。
| 组 | 条件与用途 | 轨迹数 |
|---|---|---|
| 提示H/S | 来源更正、身份/受众、通知成功;两个模型分别使用原有提示H与追加接续/完成语义的S;均1024额度 | 12 |
| 投入 | DeepSeek的草稿纠错与多活动撤销;同S提示分别默认/1024、low/1024、默认/2048 | 6 |
| 功能回归 | 两模型、S提示、默认/1024;现实变化与通知失败 | 4 |
| 功能扩展 | 两模型、S提示、默认/1024;同级来源未裁定冲突、主体退出A且继续B | 4 |
H/S是一个提示包对照,不分别证明每句话的贡献;每条件仅一次,没有足量重复。S不包含未来事件或参考答案,环境和评分在两组间相同。投入对照一次改变一个参数,但网关可能忽略参数,不能仅凭请求成功声称已核实上游行为。
总上限156次模型请求,每条最多6次、每次55秒,生成上限1024或2048;单轨迹360秒、整体2700秒、上下文36000字符。顺序调用,不自动重试 HTTP 故障;没有按结果追加成功样本。使用用户已授权服务,凭据不进入研究目录。具体任务及顺序见cases与plan。
先运行旧七例的有效/缺证据控制及同批读取反例,再增加通知过早done反例、冲突与退出正反例、四类响应分类及确定的完成事实核对,均符合预期。过早done反例由旧评分器接受、新评分器拒绝;这只验证当前检查,不证明完整宿主拦截。模型运行仍在相同的可记录错误环境中,未自动纠正其状态提案。控制结果
主指标继续要求全程响应/动作契约和任务条件满足,另列“排除响应错误后的任务条件”以观察恢复,不能覆盖主成绩。生成截断优先于 JSON 解析分类,残缺提案不执行;全部恢复计入原活动额度。中文解释、状态与隐私换述由AI 助手另行复核,非人工、非盲法或多评分者;原始task_success保持为空,不形成采用基线。
运行与分组结果
主批26条、98次模型请求全部按计划尝试;严格检查通过14条,11条存在响应/过程或评分适用范围问题,1条Kimi通知失败场景首请求超时。补充2条、9次请求,另有1条Kimi在收到拒绝后超时。合计28条、107次请求、2条服务中断,没有为了得到成功结果自动重试或覆盖记录。
严格分数要求全程无响应/动作错误;本实验同时观察预算内恢复后的任务用途,不把两者混为一谈。主批补充内容与用途复核支持17条,但包含已记录的恢复、以及退出用例的评分额外约束裁定;不是把原14条分数改写成17条,更不是正式能力基线。原task_success为空,独立补充记录可追溯到逐文件哈希。
提示包:改善部分任务,未解决通知责任
| 模型/场景 | H严格检查/调用数 | S严格检查/调用数 | 观察 |
|---|---|---|---|
| DeepSeek/来源更正 | 失败/4 | 通过/5 | H提前wait,且最终只看预算漏期限;S完成按阶段的A→none |
| Kimi/来源更正 | 通过/5 | 通过/4 | 两组均正确修订 |
| DeepSeek/身份受众 | 失败/4 | 通过/3 | H两次截断后漏未关联阶段;S完整处理两个阶段 |
| Kimi/身份受众 | 通过/3 | 通过/4 | 两组均区分证据不足与已核实,群聊继续保密 |
| DeepSeek/通知成功 | 失败/5 | 失败/5 | H另起名称未收尾原活动;S明确提醒后仍提前标记 done并拆出未关联活动 |
| Kimi/通知成功 | 失败/3 | 失败/6 | 两组均创建后提前标记 done;S另有截断,之后虽提醒但未消除过程错误 |
H为2/6、24次请求,S为4/6、27次请求。可见S在本批两个DeepSeek任务改善;Kimi两个任务两组均通过,通知两组都失败。因此采用明确语义说明作为当前研究组织方向,但不宣称稳定优越、更省调用或单凭提示足以保证状态正确。每条件一次且服务参数/缓存并不完全受控,不能统计归因到提示包中的某一句。
投入:没有跨任务一致的默认设置
下表为网关所报各轨迹累计生成 token 及请求数,不是最终答复长度或账单。
| DeepSeek任务 | 默认/1024 | low请求/1024 | 默认/2048 |
|---|---|---|---|
| 旧草稿纠错 | 1146 token,3次 | 1286 token,3次 | 1502 token,4次 |
| 双活动撤销 | 2033 token,5次 | 867 token,3次 | 1129 token,3次 |
六条均过客观检查,未重现这两类任务此前的截断,但low纠错正文另有来源/草稿称谓问题。low请求在撤销中用量较少,在纠错中反而更多;提高生成上限同样没有一致减少请求。不能由小样本证明参数未生效,也不能因 HTTP 接受就确认透传,更不能选出统一最优设置。暂不改变统一默认,具体用途后续再校准。
回归与扩展
| 用途 | 客观记录 | 内容/用途复核 |
|---|---|---|
| 现实变化 | Kimi通过;DeepSeek截断后完成任务条件,严格检查失败 | DeepSeek引入无依据的09:00作业开始时刻,解释需修订;Kimi未发现此问题 |
| 通知失败 | DeepSeek通过;Kimi首请求超时 | DeepSeek如实说明不能保证提醒;Kimi不计认知失败 |
| 同级来源冲突 | 两者最终任务条件正确,分别经历 JSON 错误/截断,严格检查失败 | 均保留unknown和冲突来源,未把未知冒充已证不可行,并结束本实验核对 |
| 给定意愿退出A、继续B | 两者均被额外读取门槛挡住;Kimi另有截断 | 两者均如实退出、保留摘录入口、说明未完成排名并完成B;初态已支持这些说明,不能要求无用途的重读 |
后续补充:责任接纳机制
在主批通知结果出现后,另行冻结补充登记、脚本和计划;主批结束后才运行两条补充轨迹。保持 S 提示和原任务,增加绑定活动身份、触发前不接受提醒、开放责任未满足不接受 done/finish 的机制包。它不是主批事前预测,也不分别证明每个限制的贡献。
DeepSeek创建后提出过早done,机制返回responsibility_pending及尚缺的触发/交付事实;该提案未改变实际状态。模型随后等到触发、发送提醒,再按原活动完成,在6次请求内结束。原严格提案分数仍失败,实际作用与责任条件通过。Kimi也提出过早done并被拒,但第3次请求超时;只确认拒绝被实际触发,恢复能力待定。
这是一个真实模型在机制拒绝后完成接续的局部样本。未知活动的拒绝另有脚本控制,没有实际产品宿主、任意活动拆分/转交或广泛稳定性验证。补充不得表述成两个模型恢复均成功。
内容与过程复核
仍需修订的内容。 H/DeepSeek来源更正只保留预算比较,漏掉降速后的期限,最终错误保留A。low/DeepSeek纠错虽计算和分类正确,却在末句称“对原报告的纠正”,混淆未变化来源与被纠错草稿。回归/DeepSeek现实变化把报告09:00出具时间拿作作业开始时间,并据此分段计算460;任务没有给出开工事实。最新choice、分类字段或算术正确都不能消除这种解释问题。
响应失败与恢复。 主批记录6次生成截断、1次 JSON 格式错误,全部保留原响应、停止原因和用量;它们不等于7个任务或7次主体拒答。新分类先处理停止原因,不执行被截断的动作。冲突和退出的最终用途可以在恢复后满足,严格无错误指标仍保留原失败;是否合格应按用途及原预算判断,不自动以每轮都无错替代完整任务评价。
退出的额外读取要求。 执行到第6条时、尚未运行退出任务前,已经登记审计:初态明确了摘录已成、排名未成和入口,仅说明这些范围不需要再读取正文。后来两个模型都选择只读取B需要的公开资料,A说明完全由初态支持,因而补充用途判断接受;未虚构读取记录、未改原评分器。Kimi另有截断,所以仍须单独保留恢复成本。今后只有真正依赖正文的新断言才要求读取。
评阅边界。 AI 助手逐条核对了所有已执行交付与状态,不用隐藏思维正文推定意图;非人工、非盲法、非多评分者。人物关联真值仍由平台夹具提供;本实验未发现受测群聊中的私密转述,不等于普遍保密。退出意愿也是给定状态,不能据良好退出说明证明主体自主形成情感或偏好。
方案含义与替代项
| 当前选择 | 采用理由与状态 | 未采用或仍待验证 |
|---|---|---|
| 明确区分操作结果接续、来源观察和责任结束 | 语义符合既有逻辑契约,并在本批部分任务改善;作为当前研究默认说明 | 不冻结唯一动作路径,不将提示包当完整认知架构或普遍效率优化 |
| 活动身份与完成提案由责任所有者核对,拒绝返回未完事实 | 提示仍允许模型提前标记 done;补充实测一条拒绝后完整接续,另一条拒绝后服务中断 | 任意拆分/转交、真实宿主和稳定性未测;不禁止有明确承接的合理子活动 |
| 证据未知、活动退出、原目标达成和计算结束分别表达 | 冲突样本保留未知,退出样本保留未完成范围且不丢B;新总表说明各责任 | 不将所有冲突强制合成一个值,不把合理退出等同原排名完成 |
| 以实际用途与预算内恢复评价任务,无错误率另列 | 新任务在恢复或合理省略读取后可满足用途,旧严格指标不足以独立说明功能 | 原冻结分数不覆盖,补充评阅不是正式采用或总体能力分数 |
| 按任务校准推理投入及生成额度,暂不统一调低/调高 | 两任务未出现一致的成本和质量改进,且low有内容问题 | 网关透传、最优参数、缓存收益与长期成本仍待验证 |
| 状态事实和产物投影可以直接支持对应说明 | 退出用例证实无用途重读门槛会误判,符合选择性读取原则 | 不扩大成凭投影臆造正文,不为增加read次数消耗资源 |
一手资料支持什么
引用官方在线文档,不将第三方网关等同厂商直连。来源记录随实验输入冻结。
| 来源及适用位置 | 支持的命题 | 设计推论与仍需验证 |
|---|---|---|
| DeepSeek Thinking Mode,投入控制、输入输出及工具调用章节 | 提供推理开关与投入档位;默认高投入;普通消息与原生tools有不同的reasoning_content续接约定 | 以low作为候选做独立对照;本实验 JSON 动作属于普通消息,不能用其成功推定原生工具已接通。网关透传和稳定身份未核实 |
| DeepSeek Chat Completions,max_tokens、response_format、停止原因 | 生成上限与格式约束分别定义;length表示额度/上下文截断,JSON 格式不能消除截断 | 先分类停止原因,再校验完整动作;生成上限与推理投入分开比较。资料不能给出本项目最优额度或任务质量保证 |
主体自主程度属于设计目标,不由厂商文档证明;退出样本给定已形成的意愿,只能评价其如实处理和其他责任接续。人物关联真值和外部通知回执由夹具提供,不能声称实际认证、现实发送或关系体验已验证。长期认知、外部检索、完整推理服务控制和真人效果不在本实验覆盖范围内。
适用边界
当前已明确接续、责任接纳、未知/退出与评价分工,但局部可行不等于完整系统关闭。剩余工作按统一研究顺序推进:
- 陌生材料中的自主发现、读取与跨活动记忆复用;再比较词法/向量、摘要/原文和经验适用范围,不把增加组件当作收益。
- 回归保留本实验的期限遗漏、时间归因、无依据完成及响应恢复;独立任务、多次重复、可信内容评阅与用途基线尚缺。
- 身份真实证据、实际受众/隐私处理、自主意愿形成与改变、重新接纳、情感/工作切换仍缺整体任务证据。
- 多心智相对同预算单心智的净收益、复盘经验在新任务的迁移和错误套用尚未验证。
- 真实通知和平台、外部检索 SDK、原生工具/流式及完整推理服务契约、产品宿主组合仍未验证;
- 真人长期体验、多模态/设备及跨日资源干扰仍需真实用途、样本与环境,资料不能替代。
本实验两次超时保留未完成;不以继续重复相同公开样本直到通过来关闭这些缺口。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。
报告 018 · go-mini 库回归与跨语言接入
实验日期:2026-09-28(Asia/Shanghai)。证据:固定提交的上游库测试、真实编译及本机跨进程 RPC;无模型调用。
目录:问题与条件 · 结果 · 关键契约 · 复核命令 · 适用边界
问题与固定条件
检查当前执行库是否继续支持 TinyAGI 所依赖的有限入口、独立实例、执行取消、热更新、编译缓存与多语言 RPC,并补充此前主要依据源码阅读的 Node 接入证据。以原有 Go、Rust 和 TypeScript 测试断言判断结果,不重新定义通过标准。
测试使用 mini-go 提交 fbb16ee99748e84b523bbd677bd477258c358956 的 git archive 导出。运行时本地已提交状态与上游 main 指向同一提交;导出目录独立构建,未修改上游工作区。各测试沿用该快照的源码、锁文件、接口和断言。
| 条件 | 实际取值与说明 |
|---|---|
| 系统 | Linux 6.18.52-1-lts,x86_64;不覆盖其他操作系统或架构 |
| Go | 上游 Makefile 指定的 Go 1.26.6;GOTOOLCHAIN=local、GOWORK=off,独立构建缓存 |
| Rust | rustc 1.98.1、Cargo 1.98.1,Arch Linux 工具链;使用 Cargo.lock 与 --locked,构建并发为 4 |
| Node/npm | Node v22.23.2、npm 12.0.2;npm ci --ignore-scripts 后显式执行 SDK 构建及类型检查 |
| WASM | wasm-bindgen 0.2.128,与锁文件匹配;没有预装目标标准库,使用上游 MINIGO_BUILD_STD=1 路径从源码构建 |
| Go 测试结果 | 全部使用 -count=1,不复用旧测试成绩;常规包并发为 4,race 包并发为 2 |
| Mini-Go 编译缓存 | 保留日常编译缓存;缓存契约用例使用上游定义的独立后端。构建缓存复用不计作新的性能测量 |
| RPC 环境 | 本机独立 Go/Rust peer 与 Node Worker,按用例建立回环连接;服务和输入均为上游测试夹具 |
| 源码与包身份 | Rust workspace 与 npm 源码包声明 0.0.0-dev;从源码构建,不代表下载或认证了公开发布包 |
源码归档 SHA-256:62f6689e20ad7e3589a7fd90d7b0daef7c590a44153022c138c3502ba5e998f2。初始预登记 SHA-256:78ca6ce67893d2309b1dbd273bebf56e2974c2b74b99906550ba998be6b17213。依据编译会话变更,在运行相关用例前补充检查范围,补充预登记 SHA-256:ef4f985b99559c20971229c5b9bab6c7711e5696ed31cfafdcedd4202f53a0c1。
运行结果
| 检查 | 实际范围 | 结果 |
|---|---|---|
| Go 常规回归 | ffi、runtime、rpc/...、compiler/cache、compiler/workspace、compiler/service、tooling/mrpc/...、integrations | 14 个有测试包通过;另 1 个包没有测试文件。611 个顶层 Test、30 个 Fuzz 的种子入口通过;484 个子项通过,3 个顶层 Test 跳过 |
| Go race | ffi、runtime、rpc/...、compiler/cache | 6 个包通过,未报告数据竞争;523 个顶层 Test、28 个 Fuzz 的种子入口及 322 个子项通过,1 个 Test 跳过 |
| Rust RPC 与取消 | rpc_*、cancellation;启用 rpc-gateway 后另跑 Gateway | 54 项通过,0 失败、0 忽略;未启用 Gateway feature 时的同名二进制没有可运行用例,不计为通过项 |
| Rust 编译器与会话 | release 模式、compiler,dap feature,compiler_entry 与 compiler_session | 3 项通过,覆盖编译器入口、只保留已确认输入及语言分析复用 |
| Go/Rust 跨进程互通 | Endpoint 与 Gateway 两组,各覆盖 Go/Rust 服务端和客户端的 4 种组合 | 2 个顶层测试及 8 个组合通过,无跳过 |
| WASM 测试夹具 | wasm_driver 的异步初始化、清理、取消及镜像校验 | 2 项通过,生成 Node 使用的测试镜像 |
| Node 运行与 RPC | node.test.js | 8 项通过,无失败或跳过;包含 Worker 生命周期、队列取消、补丁及两种与 Go 双向互通方式 |
| Node 编译与语言工具 | Node 编译器镜像、语言服务、接纳期限、交付数据所有权及 Worker 丢失/候选失败恢复 | 主命令 4 项、补充恢复命令 1 项通过;浏览器对应项未选择,不计为已测 |
| SDK 类型与分发构建 | Rust WASM、TypeScript/Worker、编译器镜像及三组 TypeScript 类型检查 | 构建和类型检查均通过 |
Go 的子项包括子测试和已提供的 fuzz 种子执行,不能与顶层数量相加后解释为同样数量的独立功能,也没有运行持续随机 fuzz。常规与 race 中重复覆盖的场景分别记录,不算两份独立语义证据。
上述正式构建、类型检查与测试命令均退出 0,未修改上游断言,也未重试失败用例。运行后的归档比对未发现已跟踪源码内容改变。
跳过项与环境处理
TestAppendInitializesSpareSliceCapacityWithTypedZeros在常规与 race 中均因本次 append 未产生额外容量而按上游条件跳过;没有验证其备用容量分支。- 常规
integrations未提供 peer 可执行文件参数,因此跳过TestRPCPeerConformance和TestRPCGatewayConformance。另在独立命令中显式绑定同快照构建的 peer,两项及全部 8 个组合通过。 - Node 语言工具按名称选择 Node 用例;浏览器、完整 npm 安装包检验和公开发布链不在所选范围。
- 前置探测遇到本机 SSH 配置不可用,改用 HTTPS 读取上游提交;工具版本探测曾因自动选择工具链尝试写入只读缓存,正式运行显式固定 Go 1.26.6 及独立工作区。正式测试未通过修改上游断言规避问题。
对接入设计有直接意义的结果
| 已运行的代表用例 | 支持的结论及边界 |
|---|---|
TestCancelReleasesRetainedRevisionAndKeepsInstanceOpen、TestInterruptHandleOnlyCancelsItsExecution | 执行取消与实例关闭分开,旧执行的中断句柄不应取消新执行。业务任务与 Self 的生命周期分离仍由 TinyAGI 宿主负责 |
TestPatchKeepsActiveFrameAndDispatchesNamedCallsToCurrentRevision、TestRPCPendingCallAndResourceSurviveInstancePatch | 旧帧保持所属 revision,新命名调用进入新代码;挂起 RPC 与资源不随脚本补丁自动重建。管理提交仍需实际绑定及执行边界协调 |
TestGuestProfileIsBoundedAndRevisionTagged | 有界采样带代码版本与位置,可用于诊断。不是完整重放、进程内存或端到端成本统计 |
TestCompileCacheHitsRepeatedBuild、依赖变更/优化/标签用例、TestCompileCacheVerifyDetectsWrongHit、TestCompileContinuesWhenCacheBackendFails | 可复用库自带编译缓存及失效检查;不需要另建平行编译缓存协议。没有测完整主体的净节约比例 |
| Go/Rust peer 与 Gateway 矩阵 | 实际覆盖对称调用、递归调用、资源使用、取消,以及发布/解析/保留旧绑定/撤销。不是任意网络条件或外部业务效果保证 |
Node generated TypeScript RPC interoperates with Go in both directions | 生成 TypeScript 绑定与独立 Node RPC SDK 可实际调用、发布并处理资源,不要求加载认知 Program;SDK 仍依赖配套 Worker/WASM |
| Node 编译器与语言服务用例 | 可通过分发的编译器镜像处理源码、查询和增量分析,支持非 Go 工具端复用语言规则;不等于人物初始化、自迁移或管理蓝图已经实现 |
当前证据支持继续采用嵌入式执行库、有限入口、业务任务独立管理、现有编译缓存及 MRPC 多语言接入。无需因此改变单宿主架构、增加独立编译服务或将全部内部函数改为 RPC。
主要复核命令
在上述固定快照及工具链下,Go 与 Rust 主要入口为:
make test \
TEST_PACKAGES='./ffi ./runtime ./rpc/... ./compiler/cache ./compiler/workspace ./compiler/service ./tooling/mrpc/... ./integrations' \
TEST_FLAGS='-count=1 -json -timeout=10m -p=4'
go test -race -count=1 -json -timeout=10m -p=2 \
./ffi ./runtime ./rpc/... ./compiler/cache
make runtime-rust-rpc-test
cargo test --locked --manifest-path playground/runtime-rust/Cargo.toml \
--release -p mini-go --features compiler,dap \
--test compiler_entry --test compiler_session
跨进程矩阵按上游 make test-rpc-conformance 的构建顺序准备 Go/Rust peer,再设置 MINIGO_RPC_GO_PEER 与 MINIGO_RPC_RUST_PEER,执行:
go test ./integrations -run '^TestRPC(Peer|Gateway)Conformance$' \
-count=1 -json -timeout=3m
Node 路径先按锁文件准备 npm 开发依赖,显式构建 SDK 并执行 npm run typecheck;设置 MINIGO_WASM_FIXTURES,运行 Rust wasm_driver 生成镜像,再提供 MINIGO_RPC_GO_PEER 运行 node --test --test-concurrency=1 tests/node.test.js。编译与语言工具另选 compiler.test.js、tools.test.js 的 Node 项及 tools_fault.test.js。未直接运行包含全部浏览器和安装包场景的 make runtime-wasm-test。
具体生成和依赖要求以固定提交的 Makefile 为准;后续提交若更改入口或产物布局,应先更新检查计划,不能机械沿用这些命令。
适用边界与数据范围
这些结果来自上游已有测试与合成夹具,没有 TinyAGI 产品程序、真实模型、实际联系人或生产任务;也没有运行完整上游 CI、持续 fuzz、跨平台矩阵、容器隔离、真实机密服务或公网压力测试。对 RPC 身份和拦截器的源码核对不等于端到端防泄漏证明。
构建与测试日志中的耗时受缓存、并发准备和本机环境影响,不作为稳定延迟、吞吐或费用比较。当前复用机制有功能依据,实际性能和完整主体行为仍须在对应用途下单独评价。
公开报告提供固定来源、条件、命令、统计、跳过及结论边界。源码归档、预登记、锁文件摘要、完整日志和逐命令结果保留为研究证据,未随报告发布。原报告 002/014 的源码身份与成绩保持不变,新库结果不回填到历史实验。