VDR

STATUS

数字总览

VDR 状态

状态日期:2026-08-18。VDR 本轮已收敛:发布模型、官方复现、数据治理、EVIE 五档扫描与网站均已定版;当前无 VDR 训练、评测或上传进程。下一次训练归入新的 EVIE 阶段。

一、发布结果

发布模型:Evie-Preview-4.5Bv0_9_x_v0_8_soup_a060),4.54B 参数、128D 原生 token 向量。

官方 reproduce.py 口径 分数
ViDoRe V1 nDCG@5 91.73
ViDoRe V2 nDCG@5 70.87
ViDoRe V1+V2 nDCG@5 85.77
ViDoRe V3 public nDCG@10 / 768 token 64.56
ViDoRe V3 public nDCG@10 / 1,792 token 65.36
每页 visual token V3 public 向量/页 百万页 BF16 原始索引
768 64.56 751.62 179.2 GiB
1,792 65.36 1,763.58 420.5 GiB

两档使用同一份权重,不重训、不重新导出;页面预算调大后 8 个领域涨了 7 个。公开榜单与 10 个复杂页面检索样例见 项目网站

二、本轮收敛项

模块 结果
负样本治理 完成 1,191,752 条首轮判定与 206,481 条重挖负例判定;FULL 转正、PARTIAL 掩码
judged-positive 数据 完成 v0.7 / v0.8 三 seed 训练、融合与跨版本 soup
v0.9 完成 1,050,270 行全正例展开、group-aware 训练与三 seed 融合
发布选型 完成 alpha 0.1–0.9 扫描;V3-first 选择 a060
EVIE 五档 gamma 全部完成;g020 Avg4 0.780683,g030 V2@5 0.7224 / V1+V2 86.11
官方复现 a060 的 V1 / V2 / V3 两档全部完成
实验账本 82 个完整 run,标准评测均为 138/138、0 failed
EVIE-VDR v0.1 1,180 Query / 6,784 页面;标注、二审、仲裁、manifest 与 evaluator 已冻结

当前发布决策不变:EVIE 五档的 V3 均比 Parent 低 0.055–0.071pt,不替换 V3-first 的 a060。完整数值与统计检验见仓库内 docs/2_训练评测/训练与评测.md

三、VDR 数据集

索引 行数 mask 槽位 有效负例 多正例行 用途
queries_v0_7_judged_pos 596,340 223,877 968,803 175,137 v0.7 judged-positive
queries_v0_8_judged_pos 775,635 223,877 1,327,393 175,137 v0.8 主线与 EVIE 输入
queries_v0_9_all_pos 1,050,270 462,897 1,637,643 175,137 全部 Query-positive 关系展开

v0.9 按 1/positive_count 加权,并用 query_group_id 避免同组正例在 in-batch 内互罚。完整判定分布、连接键和训练规则见仓库内 docs/1_数据治理/负样本语义清洗方案.md

四、下一阶段交接

以下是下一阶段输入,不是当前运行任务:

  1. EVIE 继续优化 Query 侧后训练,是否扩展 gamma_max 作为新阶段单变量实验决定;
  2. 模型压缩:token 池化与 INT8,目标将百万页索引压进 100 GiB;
  3. EVIE-VDR v0.2:补充更难页面、扩充 qrel,将 Parent nDCG@10 从 0.9734 压到 0.75–0.90

五、文档分层

文档 唯一职责
docs/STATUS.md 对外状态、发布结果与阶段交接
docs/3_归档发布/VDR收敛记录.md 内部发布状态、清理清单、保留资产与未完成事项
docs/1_数据治理/负样本语义清洗方案.md 判定执行、数据统计与训练规则
docs/2_训练评测/训练与评测.md 全部实验分数账本
docs/2_训练评测/EVIE.md EVIE 方法、数学边界与实验结论
docs/2_训练评测/EVIE-VDR.md Benchmark 协议、标注、评分与困难化
源文件 docs/STATUS.md · 详细账本在仓库,不进网页