您现在的位置是:首页 > 文章详情

三星推出评估 AI 模型生产力的平台 TrueBench

日期:2025-09-25点击:10

三星电子宣布推出 TRUEBench(可信真实世界使用评估基准),由三星研究院开发的用于评估 AI 生产力的专有基准。

“TRUEBench 的设计旨在通过不仅考虑答案的准确性,还考虑满足用户隐性需求的具体条件,从而实现切合实际的评估。”

 

公告称,TRUEBench 提供了一套全面的指标,用于衡量大语言模型 (LLM) 在实际工作效率应用中的表现。为了确保评估的真实性,它融合了多种对话场景和多语言条件。

TRUEBench 借鉴三星内部 AI 的生产力应用,评估 10 个类别和 46 个子类别中常用的企业任务,例如内容生成、数据分析、摘要和翻译。该基准测试基于由人类和人工智能共同设计和完善的标准,通过人工智能驱动的自动评估,确保评分的可靠性。

该公司表示,近年来随着企业采用 AI 来完成任务,衡量 LLM 生产力的需求越来越大。然而,现有的基准主要衡量整体表现,大多以英语为中心,仅限于单轮问答结构。

为了解决这些限制,TRUEBench 共包含 2,485 个测试集,涵盖 10 个类别和 12 种语言(包括韩语、英语、日语等),同时还支持跨语言场景。这些测试集检验了 AI 模型的实际解决问题能力,三星研究院使用的测试集长度范围从最短 8 个字符到超过 20,000 个字符,涵盖了从简单请求到冗长文档摘要的各种任务。

三星研究院通过人机协作验证评估项目。首先,人工注释员创建评估标准,然后人工智能对其进行审核,以检查是否存在错误、矛盾或不必要的约束。之后,人工注释员再次完善标准,并重复此过程以应用越来越精确的评估标准。基于这些交叉验证的标准,对人工智能模型进行自动评估,最大限度地减少主观偏见并确保一致性。此外,每次测试都必须满足所有条件,模型才能通过。这使得跨任务的评分更加详细和精确。

原文链接:https://www.oschina.net/news/374323
关注公众号

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。

持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

转载内容版权归作者及来源网站所有,本站原创内容转载请注明来源。

文章评论

共有0条评论来说两句吧...

文章二维码

扫描即可查看该文章

点击排行

推荐阅读

最新文章