报告 013 · 资源投影之后的资料发现与依据用途
文档用途:实验报告|证据类型:真实文档上的确定检索对照|实验日期:2026-09-20。
目录:问题与条件 · 结果 · 选择 · 资料依据 · 限制与后续
1. 问题与条件
默认投影解决“资源正文是否自动进入上下文”,但不保证主体找得到所需材料。本实验沿完整资料任务推进这一环节:怎样发现资料、什么时候主动搜正文、怎样区分现行设计与实验记录。没有新增底层故障实验或产品代码。
整理前冻结 34 份真实文档,共 579,495 字节,包括总设计、专题、实验报告与已撤销路径说明。10 个开发查询覆盖部署、闹钟、投影、人物关联、隐私、回应、角色互动、活动结束及实验依据。查询词和首选详细来源在运行前固定,未根据结果调整。
三个对照为 M(只搜路径和标题)、F(明确搜全部快照正文)、S(用相同正文检索规则,按现行设计/实验依据限定范围)。词面评分、段落规则、前五项及片段长度在预登记给出。S 的用途标签是语料制作时提供的已知元数据,不是模型自动识别结果。
2. 结果与失败记录
| 对照 | 首选来源前 1 命中 | 前 5 命中 | 正文文件读取次数 | 正文读取字节 | 前五项中的其他用途候选数 |
|---|---|---|---|---|---|
| M 路径/标题 | 4/10 | 6/10 | 0 | 0 | 7 |
| F 主动全范围正文查询 | 3/10 | 10/10 | 340 | 5,794,950 | 10 |
| S 按用途主动正文查询 | 4/10 | 10/10 | 176 | 4,083,152 | 0 |
这里的命中只表示预登记的深入来源出现在候选,不是答案正确率。其他用途候选也不直接等于错误资料。次数/字节为本实验朴素扫描的应用层读取,不表示物理 I/O、模型 token、缓存收益或生产性能。
四个 M 未命中查询及 F/S 的完整候选都已保留:
- D1 查询现行部署时,标题查询优先找到撤销说明和历史接管实验,未找到总设计;正文查询将总设计排在首位。撤销说明仍有导航价值,但不能仅凭文件名恢复旧方案。
- D6 区分主观拒绝、未知与规范限制,D8 查询交付和用途评价:M 没有匹配项;F/S 找到首选来源,但分别在第三、第四位,说明不能把首个命中直接当最终依据。
- E1 查读取缓存与计时的实际证据,M 只找到设计专题;F/S 找到报告 012。设计描述与实验结果需要按用途选取。
F 和 S 的前五项都覆盖了本批目标,但首位命中仍有限;不能据此选定一个普遍最优排序器。S 的范围减小及用途纯度来自已知标签,本实验不验证标签真实性、自动分类或未知用途的处理。未运行整理后对照,不声称清理提升了命中率。
3. 设计含义
采用“任务与缺口 → 发现投影 → 必要时主动内容查询 → 读取相关原文 → 判断版本和适用性 → 支持当前产物”的路径。元数据已足够定位时直接读取;不足时允许在已有许可范围内主动搜正文,不要求每次先做一遍必然无用的标题查询。片段查询是内容读取,结果带来源和位置,不是默认投影偷偷携带摘要。
已知用途、来源版本和修订关系可以缩小查找范围,但它们是有来源的描述,不是事实真伪裁判。查现行决定优先现行设计,查实验条件进入原报告,混合问题可使用两类资料;找不到时允许扩展范围,不能把历史证据全部排除。用途未知如实保留,不按文件新旧或所在目录凭空确定权威。
不采用“只允许标题检索”“所有资源先全文注入”“只用最高分候选”“以检索命中关闭未知”作为默认。首项有本实验未命中记录支持,后几项来自信息边界与证据使用的工程判断;未进行对应模型效果对照。本实验不选择生产全文/向量引擎,也不新增资源服务或独立裁判模型。
4. 一手资料与适用边界
资料只支持所列命题,不升级为 TinyAGI 的模型效果证明。
| 来源与核对范围 | 支持的命题 | 本项目推论与剩余验证 |
|---|---|---|
| Yang 等,SWE-agent,arXiv v1,2024-05-06,摘要 | 作者研究表明,文件导航、编辑和执行的交互接口设计会影响其软件任务代理表现 | 将发现、内容查询和读取作为需评价的认知接口;不能移用论文成绩证明 TinyAGI 工具粒度或自主选择有效 |
| W3C PROV-DM,Recommendation,2013-04-30,§2.1.2、§5.2.1–5.2.2 | 可表达实体生成/使用、派生及修订,修订关联新旧实体 | 保存来源、派生与修订依据,不把“当前”或“高分”当真值;不引入 RDF 数据库,也不宣称自动推断全部语义影响 |
按需上下文的工程依据还见012 资料表。
5. 适用边界
已缩小的是资源发现接口和来源用途的设计歧义。仍需真实模型自主形成查询、选择范围、读取足够原文、修订判断并交付;还需陌生任务与语料、查询改写、错误用途标签、遗漏证据和过度检索的对照。本批为公开开发集,不能作为独立泛化成绩。
本实验未接入真实模型,不覆盖真实推理服务、多心智协作、情感、长期学习或真实用户交互。
数据可用性
本报告公开实验条件、汇总统计和失败分析。原始输入、脚本及逐次运行记录未随报告发布,因此不能仅凭本文独立复现实验。