GPT-4 评估百度文心大模型 3.5 生成内容质量更高
天津大学日前发布的首份《大模型评测报告》指出,GPT-4和百度文心一言相较于其他模型综合性能显著领先,两者得分相差不大,处于同一水平。
该报告基于对国内外主流的14个大语言模型进行的中文综合能力评测。具体包括GPT-4、ChatGPT gpt-3.5-turbo、Claude-instant、Sage gpt-3.5-turbo等国外大模型,以及百度文心一言、阿里通义千问、讯飞星火认知大模型、ChatGLM-6B、360智脑、MOSS-16B、MiniMax、baichuan-7B等国产大模型。
评测使用一套涵盖知识问答、语言表达、逻辑推理、常识问答、文本问答、机器翻译等不同领域知识、包含多种题型的中文综合性试题,通过多维度得分结果,清楚了解不同模型的擅长领域和综合能力优劣。
尤其值得关注的是,在此次评测中,天津大学引入GPT-4对参评模型的主观题回答进行了打分,结果显示,在GPT-4看来文心一言生成的中文内容质量更高。相比人工评价,在基于GPT-4的自动评测中,文心一言的总得分一举超过GPT-4,跃居榜首。
报告结果显示,国产大模型以文心一言为代表,在知识问答、语言表达、逻辑推理、常识问答等方面表现出色。相比其他国产大模型,文心一言更具优势,展示了更强大的综合能力。尤其在中文语言表达上,文心一言相比GPT-4和其他国内大语言模型明显更优质。此外,本次评测中,文心一言在计算机、医学、法律和教育等领域的得分率高,为大语言模型在相关行业的落地提供了技术基础。
天津机器学习重点实验室负责人、天津大学胡清华教授表示:
“基础智能模型有望重塑人工智能的发展模式,国内外大模型如雨后春笋般大量涌现。全面准确评价此类模型是推动和规范其健康发展的基础,为使用者在选择和应用大模型时提供参考。可以看到,百度文心一言在评测中展现了国产大模型的强大实力,中国的大语言模型在短期内取得巨大发展,正在逐步赶超国际类似的模型,甚至在某些指标上实现了局部超越。未来,期待国产大模型能够取得更大突破,可以赋能社会经济发展,助力我国科技高质量自立自强。”

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。
持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。
转载内容版权归作者及来源网站所有,本站原创内容转载请注明来源。
- 上一篇
新国标支持带来了哪些变化?一文读懂
在社区GBCharactersEncoding SIG组的主导下,openKylin 1.0版本实现了对中文编码字符集国家标准GB18030-2022的全面支持。 近期社区很多小伙伴反馈不太了解新版国标支持具体会带来什么变化以及与老版国标的兼容性问题,因此社区专门邀请了GBCharactersEncoding SIG来为大家做一期讲解! 一、GB18030-2022升级概述 GB18030-2022的升级内容分为两类。 1、一类是新增编码字符,属于非破坏性变动。包含以下方面: 新增了CJK统一汉字新增的66个汉字字符; 新增CJK统一汉字扩充C,D,E,F汉字字符; 新增了康熙部首。 上述新增字符对应的编码在2005版本国标中已经存在,这次新增实际上只是将编码的对应位置填上字形,理论上对兼容性没有影响。 2、另一类是修改删除编码字符,属于破坏性变动。包含以下方面: 修改了10个竖排标点,8个汉字构件对应Unicode编码。 删除了6个汉字构件。 删除了9个汉字。 使用了这部分字符的程序,由于2022新标准的变更,理论上有可能出现无法显示,无法搜索等兼容性问题。 二、升级说明 上述...
- 下一篇
谷歌将推出新搜索功能,支持边看边搜索
据9to5Google报道,谷歌近日对 SGE 的新功能进行测试,允许用户在浏览网页内容的同时进行搜索。 谷歌称这项功能为 SGE while browsing,目前正在Search Labs中进行早期测试。目标是测试生成式 AI 如何帮助用户在线浏览信息,并更快获得用户正在查找的核心内容。 在 Google 搜索结果中,SGE 支持将鼠标悬停在关键术语上,以显示带有定义的弹出窗口,包括图表或相关图像。与此同时,其“代码响应”功能可通过语法高亮进行颜色编码,因此可以更快、更轻松地识别关键字、注释和字符串等元素,帮助用户更好地理解一目了然的代码。” 据悉,这项功能正在安卓/iOS版谷歌 App 上进行测试,预计会在未来几天登陆 Chrome 桌面浏览器。
相关文章
文章评论
共有0条评论来说两句吧...