GPT-4 评估百度文心大模型 3.5 生成内容质量更高-低调大师

GPT-4 评估百度文心大模型 3.5 生成内容质量更高

2023-08-16 503

天津大学日前发布的首份《大模型评测报告》指出，GPT-4和百度文心一言相较于其他模型综合性能显著领先，两者得分相差不大，处于同一水平。

该报告基于对国内外主流的14个大语言模型进行的中文综合能力评测。具体包括GPT-4、ChatGPT gpt-3.5-turbo、Claude-instant、Sage gpt-3.5-turbo等国外大模型，以及百度文心一言、阿里通义千问、讯飞星火认知大模型、ChatGLM-6B、360智脑、MOSS-16B、MiniMax、baichuan-7B等国产大模型。

评测使用一套涵盖知识问答、语言表达、逻辑推理、常识问答、文本问答、机器翻译等不同领域知识、包含多种题型的中文综合性试题，通过多维度得分结果，清楚了解不同模型的擅长领域和综合能力优劣。

尤其值得关注的是，在此次评测中，天津大学引入GPT-4对参评模型的主观题回答进行了打分，结果显示，在GPT-4看来文心一言生成的中文内容质量更高。相比人工评价，在基于GPT-4的自动评测中，文心一言的总得分一举超过GPT-4，跃居榜首。

报告结果显示，国产大模型以文心一言为代表，在知识问答、语言表达、逻辑推理、常识问答等方面表现出色。相比其他国产大模型，文心一言更具优势，展示了更强大的综合能力。尤其在中文语言表达上，文心一言相比GPT-4和其他国内大语言模型明显更优质。此外，本次评测中，文心一言在计算机、医学、法律和教育等领域的得分率高，为大语言模型在相关行业的落地提供了技术基础。

天津机器学习重点实验室负责人、天津大学胡清华教授表示：

“基础智能模型有望重塑人工智能的发展模式，国内外大模型如雨后春笋般大量涌现。全面准确评价此类模型是推动和规范其健康发展的基础，为使用者在选择和应用大模型时提供参考。可以看到，百度文心一言在评测中展现了国产大模型的强大实力，中国的大语言模型在短期内取得巨大发展，正在逐步赶超国际类似的模型，甚至在某些指标上实现了局部超越。未来，期待国产大模型能够取得更大突破，可以赋能社会经济发展，助力我国科技高质量自立自强。”

微信关注我们

原文链接：https://www.oschina.net/news/253954

转载内容版权归作者及来源网站所有！

低调大师中文资讯倾力打造互联网数据资讯、行业资源、电子商务、移动互联网、网络营销平台。持续更新报道IT业界、互联网、市场资讯、驱动更新,是最及时权威的产业资讯及硬件资讯报道平台。

新国标支持带来了哪些变化？一文读懂

在社区GBCharactersEncoding SIG组的主导下，openKylin 1.0版本实现了对中文编码字符集国家标准GB18030-2022的全面支持。近期社区很多小伙伴反馈不太了解新版国标支持具体会带来什么变化以及与老版国标的兼容性问题，因此社区专门邀请了GBCharactersEncoding SIG来为大家做一期讲解！一、GB18030-2022升级概述 GB18030-2022的升级内容分为两类。 1、一类是新增编码字符，属于非破坏性变动。包含以下方面：新增了CJK统一汉字新增的66个汉字字符；新增CJK统一汉字扩充C，D，E，F汉字字符；新增了康熙部首。上述新增字符对应的编码在2005版本国标中已经存在，这次新增实际上只是将编码的对应位置填上字形，理论上对兼容性没有影响。 2、另一类是修改删除编码字符，属于破坏性变动。包含以下方面：修改了10个竖排标点，8个汉字构件对应Unicode编码。删除了6个汉字构件。删除了9个汉字。使用了这部分字符的程序，由于2022新标准的变更，理论上有可能出现无法显示，无法搜索等兼容性问题。二、升级说明上述...

2023-08-16

976

据9to5Google报道，谷歌近日对 SGE 的新功能进行测试，允许用户在浏览网页内容的同时进行搜索。谷歌称这项功能为 SGE while browsing，目前正在Search Labs中进行早期测试。目标是测试生成式 AI 如何帮助用户在线浏览信息，并更快获得用户正在查找的核心内容。在 Google 搜索结果中，SGE 支持将鼠标悬停在关键术语上，以显示带有定义的弹出窗口，包括图表或相关图像。与此同时，其“代码响应”功能可通过语法高亮进行颜色编码，因此可以更快、更轻松地识别关键字、注释和字符串等元素，帮助用户更好地理解一目了然的代码。” 据悉，这项功能正在安卓/iOS版谷歌 App 上进行测试，预计会在未来几天登陆 Chrome 桌面浏览器。

2023-08-16

409

资源下载

更多资源

Spring

Spring框架（Spring Framework）是由Rod Johnson于2002年提出的开源Java企业级应用框架，旨在通过使用JavaBean替代传统EJB实现方式降低企业级编程开发的复杂性。该框架基于简单性、可测试性和松耦合性设计理念，提供核心容器、应用上下文、数据访问集成等模块，支持整合Hibernate、Struts等第三方框架，其适用范围不仅限于服务器端开发，绝大多数Java应用均可从中受益。

Rocky Linux

Rocky Linux（中文名：洛基）是由Gregory Kurtzer于2020年12月发起的企业级Linux发行版，作为CentOS稳定版停止维护后与RHEL（Red Hat Enterprise Linux）完全兼容的开源替代方案，由社区拥有并管理，支持x86_64、aarch64等架构。其通过重新编译RHEL源代码提供长期稳定性，采用模块化包装和SELinux安全架构，默认包含GNOME桌面环境及XFS文件系统，支持十年生命周期更新。

Sublime Text

Sublime Text具有漂亮的用户界面和强大的功能，例如代码缩略图，Python的插件，代码段等。还可自定义键绑定，菜单和工具栏。Sublime Text 的主要功能包括：拼写检查，书签，完整的 Python API ， Goto 功能，即时项目切换，多选择，多窗口等等。Sublime Text 是一个跨平台的编辑器，同时支持Windows、Linux、Mac OS X等操作系统。

WebStorm

WebStorm 是jetbrains公司旗下一款JavaScript 开发工具。目前已经被广大中国JS开发者誉为“Web前端开发神器”、“最强大的HTML5编辑器”、“最智能的JavaScript IDE”等。与IntelliJ IDEA同源，继承了IntelliJ IDEA强大的JS部分的功能。