在 100 篇冻结 arXiv AI Agent 论文上的 cohort同代 Peer 组:一个 generation 内并行运行的多个 AI 研究工作者 闭环与 RAG 质量分层信号——一条不可伪造的研究证据链。
Agent 自己拼路径、自己写 summary、自己挑策略 → 不可复现、可伪造。
输出不是单个 code diff,是跨代继承的可审计证据链
100 篇 PDF + Markdown + 4,359 chunks + SHA-256 manifest用 SHA-256 哈希值登记每个文件内容的清单,任何改动都会让哈希变化,从而被检测。
Milvus collection 4,359 条,FLAT / COSINE 合同通过,embedding 维度 2,560 一致。
Trusted evaluator 服务化,Unix socket + HMAC key 部署完毕,Peer 隔离策略生效。
cohort-1g3p-20260806T1220
Runtime: deepseek
Result: 3/3 receipt 验签通过
耗时: ~107s
| Peer | 策略 | Receipt / Gate | nDCG@10 | Recall@10 | Evidence cov | P95 (ms) |
|---|---|---|---|---|---|---|
| gen0_peer0 | dense-baseline-v1 | SUCCEEDED / PASS | 0.4170 | 0.3795 | 0.875 | 5028 |
| gen0_peer1 | p1-context-expand-v1 | INCOMPLETE | 0.3013 | 0.3515 | 1.000 | 5349 |
| gen0_peer2 | p1-paper-diverse-v1 | INCOMPLETE | 0.2260 | 0.2314 | 0.750 | 5824 |
variant + output + strategy 经单一 run-local assignment manifest 注入 · 控制面耗时 ~107s
| 来源 | 日期 | nDCG@10 | Recall@10 | Evid cov |
|---|---|---|---|---|
| Agent control smoke | 2026-08-05 | 0.4170 | 0.3795 | 0.875 |
| QUICK_POC_PARALLEL | 2026-08-06 | 0.4170 | 0.3795 | 0.875 |
| Cohort 1G3P Agent 真实闭环 |
2026-08-06 | 0.4170 | 0.3795 | 0.875 |
variant + output_dir + strategy hash 预登记 → admission lease准入租约:评测前预登记的一次性许可,原子消费、daemon 重启后不会重新放行 原子消费
evaluator 用 HMAC key 对 variant + output + 指标签名,生成路径绑定 receipt
trusted publisher 验证 HMAC、key ID、路径后发布 finding;越权 / 伪造即 fail-closed
| 策略 | FP rate | 95% CI |
|---|---|---|
| P1 Dense | 0.2547 | — |
| P2 + DashScope rerank | 0.0718 | [-0.237, -0.131] |
指标 · hard-negative FP硬负例误召回率:被策略判为相关、实际标注为对抗性负例的 chunk 占比,越低越好 · paired bootstrap · 60 条 Dev
CI 整个区间在 0 以下 → 统计可信的确定收益。
rerank 在过滤"看似相关实则无关"的 chunk 上有真实效果——这正是 RAG 系统在生产中最常见的故障模式。
| 策略 | Evidence cov | nDCG@10 |
|---|---|---|
| P1 Dense baseline | 0.875 | 0.4170 |
| P1 Context-expand | 1.000 | 0.3013 |
指标 · EvidenceCoverage@40964,096 token 上下文窗口覆盖到全部答必证据 chunk 的比例
扩大上下文窗口能覆盖到 全部 答必证据——适合"召回优先 / 容忍精度下降"的下游场景。
代价:nDCG 略降,精度被稀释。在 slides 上明确呈现。
| 指标 | P1 | P2 | Δ | 95% CI |
|---|---|---|---|---|
| nDCG@10 | 0.3807 | 0.4289 | +0.041 | [-0.065, +0.149] |
| Recall@5 | 0.5294 | 0.5490 | +0.017 | — |
macro nDCG@10 · 60 条 Dev · paired bootstrap配对自助法:对同一组 query 的两个策略结果做配对重采样,估计指标差异的置信区间
点估计正向,方向正确。
当前 60 query 样本 CI 跨 0,未达统计显著。扩到 30/60 Dev 并跑 Blind 后,CI 收紧有望达标。
| 指标 | P1 Dense | P2 + rerank | Δ | 信号强度 |
|---|---|---|---|---|
| macro nDCG@10 | 0.3807 | 0.4289 | +0.041 | 方向正 / 待加强 |
| Recall@5 | 0.5294 | 0.5490 | +0.017 | 弱正 |
| Recall@10 | 0.5784 | 0.5490 | -0.025 | 略负 |
| hard-negative FP | 0.2547 | 0.0718 | -0.183 | 强 · CI 全负 |
| Evidence coverage | 0.706 | 0.647 | -0.050 | 略负 |
| P95 延迟 (P1) | 4472 ms | — | — | — |
| 60× embedding 成本 | $0.0000537 | — | — | — |
adjudicated2 generations × 3 peers,验证跨代 frontier 继承