Keyboard shortcuts

Press ← or → to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

报告 013 · 资源投影之后的资料发现与依据用途

文档用途:实验报告|证据类型:真实文档上的确定检索对照|实验日期:2026-09-20。

文档索引 · 总设计

目录:问题与条件 · 结果 · 选择 · 资料依据 · 限制与后续

1. 问题与条件

默认投影解决“资源正文是否自动进入上下文”,但不保证主体找得到所需材料。本实验沿完整资料任务推进这一环节:怎样发现资料、什么时候主动搜正文、怎样区分现行设计与实验记录。没有新增底层故障实验或产品代码。

整理前冻结 34 份真实文档,共 579,495 字节,包括总设计、专题、实验报告与已撤销路径说明。10 个开发查询覆盖部署、闹钟、投影、人物关联、隐私、回应、角色互动、活动结束及实验依据。查询词和首选详细来源在运行前固定,未根据结果调整。

三个对照为 M(只搜路径和标题)、F(明确搜全部快照正文)、S(用相同正文检索规则,按现行设计/实验依据限定范围)。词面评分、段落规则、前五项及片段长度在预登记给出。S 的用途标签是语料制作时提供的已知元数据,不是模型自动识别结果。

2. 结果与失败记录

对照首选来源前 1 命中前 5 命中正文文件读取次数正文读取字节前五项中的其他用途候选数
M 路径/标题4/106/10007
F 主动全范围正文查询3/1010/103405,794,95010
S 按用途主动正文查询4/1010/101764,083,1520

这里的命中只表示预登记的深入来源出现在候选,不是答案正确率。其他用途候选也不直接等于错误资料。次数/字节为本实验朴素扫描的应用层读取,不表示物理 I/O、模型 token、缓存收益或生产性能。

四个 M 未命中查询及 F/S 的完整候选都已保留:

  • D1 查询现行部署时,标题查询优先找到撤销说明和历史接管实验,未找到总设计;正文查询将总设计排在首位。撤销说明仍有导航价值,但不能仅凭文件名恢复旧方案。
  • D6 区分主观拒绝、未知与规范限制,D8 查询交付和用途评价:M 没有匹配项;F/S 找到首选来源,但分别在第三、第四位,说明不能把首个命中直接当最终依据。
  • E1 查读取缓存与计时的实际证据,M 只找到设计专题;F/S 找到报告 012。设计描述与实验结果需要按用途选取。

F 和 S 的前五项都覆盖了本批目标,但首位命中仍有限;不能据此选定一个普遍最优排序器。S 的范围减小及用途纯度来自已知标签,本实验不验证标签真实性、自动分类或未知用途的处理。未运行整理后对照,不声称清理提升了命中率。

3. 设计含义

采用“任务与缺口 → 发现投影 → 必要时主动内容查询 → 读取相关原文 → 判断版本和适用性 → 支持当前产物”的路径。元数据已足够定位时直接读取;不足时允许在已有许可范围内主动搜正文,不要求每次先做一遍必然无用的标题查询。片段查询是内容读取,结果带来源和位置,不是默认投影偷偷携带摘要。

已知用途、来源版本和修订关系可以缩小查找范围,但它们是有来源的描述,不是事实真伪裁判。查现行决定优先现行设计,查实验条件进入原报告,混合问题可使用两类资料;找不到时允许扩展范围,不能把历史证据全部排除。用途未知如实保留,不按文件新旧或所在目录凭空确定权威。

不采用“只允许标题检索”“所有资源先全文注入”“只用最高分候选”“以检索命中关闭未知”作为默认。首项有本实验未命中记录支持,后几项来自信息边界与证据使用的工程判断;未进行对应模型效果对照。本实验不选择生产全文/向量引擎,也不新增资源服务或独立裁判模型。

4. 一手资料与适用边界

资料只支持所列命题,不升级为 TinyAGI 的模型效果证明。

来源与核对范围支持的命题本项目推论与剩余验证
Yang 等,SWE-agent,arXiv v1,2024-05-06,摘要作者研究表明,文件导航、编辑和执行的交互接口设计会影响其软件任务代理表现将发现、内容查询和读取作为需评价的认知接口;不能移用论文成绩证明 TinyAGI 工具粒度或自主选择有效
W3C PROV-DM,Recommendation,2013-04-30,§2.1.2、§5.2.1–5.2.2可表达实体生成/使用、派生及修订,修订关联新旧实体保存来源、派生与修订依据,不把“当前”或“高分”当真值;不引入 RDF 数据库,也不宣称自动推断全部语义影响

按需上下文的工程依据还见012 资料表。

5. 适用边界

已缩小的是资源发现接口和来源用途的设计歧义。仍需真实模型自主形成查询、选择范围、读取足够原文、修订判断并交付;还需陌生任务与语料、查询改写、错误用途标签、遗漏证据和过度检索的对照。本批为公开开发集,不能作为独立泛化成绩。

本实验未接入真实模型,不覆盖真实推理服务、多心智协作、情感、长期学习或真实用户交互。

数据可用性

本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。