GPT-4 评估百度文心大模型 3.5 生成内容质量更高
天津大学日前发布的首份《大模型评测报告》指出,GPT-4和百度文心一言相较于其他模型综合性能显著领先,两者得分相差不大,处于同一水平。 该报告基于对国内外主流的14个大语言模型进行的中文综合能力评测。具体包括GPT-4、ChatGPT gpt-3.5-turbo、Claude-instant、Sage gpt-3.5-turbo等国外大模型,以及百度文心一言、阿里通义千问、讯飞星火认知大模型、ChatGLM-6B、360智脑、MOSS-16B、MiniMax、baichuan-7B等国产大模型。 评测使用一套涵盖知识问答、语言表达、逻辑推理、常识问答、文本问答、机器翻译等不同领域知识、包含多种题型的中文综合性试题,通过多维度得分结果,清楚了解不同模型的擅长领域和综合能力优劣。 尤其值得关注的是,在此次评测中,天津大学引入GPT-4对参评模型的主观题回答进行了打分,结果显示,在GPT-4看来文心一言生成的中文内容质量更高。相比人工评价,在基于GPT-4的自动评测中,文心一言的总得分一举超过GPT-4,跃居榜首。 报告结果显示,国产大模型以文心一言为代表,在知识问答、语言表达、逻辑推理、常...


