用了最好的模型,为什么 AI 生成的报告数字还是错的?
去年 RAG 风头正盛。在一众开源框架的助力下,RAG 得以快速进入企业落地应用,成为AI实践的第一选择。慢慢地,大家不再满足于搭建"概率输出"的知识库了 —— 想用大模型完成更多工作。问题就出现了。最近陆续有几个客户和朋友来咨询 RAG 的问题。其中一个跟我们一样,也做长文档报告生成。下面是他为了让报告满足甲方的准确性要求做的事:升级过一次模型版本,重做了 OCR,调了十几版 prompt,chunk size 从 500 改到 2000 又改回 800,RAG 知识库重建过一遍。最后一版报告交付,客户自测数字一致性不足 50%。他问我们:到底是哪个环节出了问题?我们的回答是:哪个环节都没出...