阿里开源端到端语音交互模型 Fun-Audio-Chat
通义大模型微信公众号发文宣布,推出新一代端到端语音交互模型 Fun-Audio-Chat。“不是简单的“能聊天”,而是听得懂你的话、感知你的情绪、还能帮你真正干活的AI语音搭子。” 目前开源了 Fun-Audio-Chat 8B,包括模型权重、推理代码、Function Call 接入示例。 技术表现: 端到端 S2S 架构:从语音输入直接生成语音输出,无需 ASR + LLM + TTS 多模块拼接,效率更高、延迟更低。 双分辨率设计:Shared LLM 层以 5Hz 帧率 高效处理,SRH 以 25Hz 帧率 生成高质量语音,GPU 计算开销降低近 50%。 百万小时多任务数据训练:覆盖音频理解、语音问答、情感识别、工具调用等真实场景,让模型更“接地气”。 高情商:像朋友一样的对话体验 你生气时,它会安慰你;你焦虑时,它会陪你深呼吸;你开心时,它会跟着你一起嗨。 哪怕你没直接说情绪,它也能从你的语气、语速、停顿里,猜出你的心情,然后给出恰到好处的回应。 易落地:它不仅能聊,还能“干实事” Speech Function Call:你只需用自然语音下达指令,它就能自动调用函数,完成...

