2026年,大模型智能体正快速走出实验室,广泛落地于办公、研发、个人助理等各类场景。而长期、稳定、可控的记忆能力,已然成为决定智能体实际使用体验与落地价值的核心关键。对于智能体而言,用户偏好、操作路径、常用模板等固定有效信息需要长效留存,但临时会话信息、隐私敏感内容、风险指令则需要精准过滤规避。记忆能力不足,每一次对话都要重新适配需求;记忆管控失衡,冗余、敏感信息长期留存,又会带来使用风险。
2026 上海开源软件应用创新大赛由开源中国主办,是落实《上海市加强开源体系建设实施方案》的重要赛事活动,旨在推动人工智能与软件产业深度融合,服务上海打造“全球开源之城”的战略目标。
在2026上海开源软件应用创新大赛正式开赛之际,OpenAtom openKylin(以下简称“openKylin”)社区重磅发布「开源 AI 工具赛道」专属赛事命题——《面向openKylin操作系统的智能体长期记忆自动化评测Benchmark设计》,面向全国开源开发者征集优质方案,为智能体长效记忆能力打造标准化、可落地的评测“标尺”。
目前 openKylin 里已支持 KylinBot、kylin-agent、OpenClaw、Hermes Agent 等多个智能体框架,需要一套与之配套的、系统级的自动化评测工具,对不同智能体在 openKylin 操作系统上的记忆能力进行量化比较,这也是本次命题的核心出发点。
命题深度解读:直击三大痛点,打造专业评测体系
命题目标
本次openKylin专属命题,精准聚焦当前大模型智能体记忆评测领域的三大痛点,针对性构建完整评测解决方案:
一是目前的评测往往依赖人工检查,难以规模化;二是简单问答式验证项无法覆盖真实使用中的冲突更新、相似干扰和行动复用;三是自动评分容易出现语义偏移,难以稳定判断模型到底是“记住了”“误记了”还是“不该记却记了”。
基于此,本命题这道题要求参赛者基于 openKylin 环境,设计一套自动化、低人工介入、可复现、可扩展的评测方案,把对话、记忆记录、行动轨迹、文件等统一组织为证据,自动评估智能体的长期记忆能力,重点覆盖长期保持、记忆调用、动态更新、相近区分、边界识别、任务复用六项能力。
交付要求
在成果交付层面,参赛团队需完整输出方案文档,写清测试目标、数据生成方式、验证用例设计和自动评分流程,数据集设计要给出可扩展的数据结构,自动评测要在少人工介入下输出可解释的评分原因;还要提供样例数据与结果、可复现材料(代码须在 openKylin 上编译运行),并将评测流程封装为一键运行的 CLI 工具,建议产出 .deb 软件包。演示要在 openKylin 桌面环境下,对至少两款智能体运行评测,产出多维对比雷达图的 3-5 分钟完整录屏。
评审维度
本次命题将依托大赛官方评审标准,从六大核心维度综合打分,全方位核验方案的专业性、创新性与落地性:
诚邀全国开发者参赛,共筑开源智能体评测生态
本次命题适配拥有LLM应用开发、智能体搭建、AI评测体系搭建相关经验的团队及个人,无论高校团队、科研机构、开源社区开发者还是企业技术团队,均可报名参赛。
赛事报名及作品提交截止时间为2026年10月11日,线下总决赛将于10月24日在上海举办。参赛团队不仅有机会角逐大赛百万级总奖金池、算力Token、大模型API等专属开发者资源,优秀项目还将纳入赛事官方项目库,获得产业对接、技术验证、投融资对接、政策咨询等配套服务,更有机会入选上海市开源项目培优工程,欢迎全国的开源技术爱好者报名参赛!
报名通道
扫描下方二维码↓,根据页面指引,即可报名参加 openKylin 赛题。
openKylin诚邀全国开源技术爱好者携手参赛,共同完善开源操作系统智能体评测体系,助力开源AI技术落地深耕!
也可点击“阅读原文”访问赛事官网了解更多详情:
https://www.oschina.net/os2026/