阅读笔记:DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth
这篇论文用 "MLLM 当 corrector、衡量 OCR 原始输出与校正后输出的差异" 的思路,提出一个无需人工标注的 OCR 引擎选择框架 DocOCR-Eval:对每个候选引擎的输出依次跑三阶段错误诊断(字符噪声 DcD_cDc/ 分词错误 DtD_tDt/ 语义一致性 DsD_sDs)并条件触发两个 MLLM 校正器(纯文本 CtC_tCt/ 带视觉裁剪重识别 CvC_vCv),再用校正后 ANLS 给引擎排名,多 MLLM 聚合缓解偏差。核心证据是 在校正排序与有标注排序的对齐度上,FUNSD NDCG 达 0.9752(完美匹配)、EPHOIE 0.9679、RXPAD...