2026 年,大模型智能体正从实验室走进办公、研发和个人助理场景,能不能长期、稳定、可控地记住用户信息,成了影响智能体可用性的关键。偏好、路径、模板这类稳定信息要记住;临时信息、敏感信息、风险指令又得排除。记不住,每次对话都从头开始;记太死,不该留的信息又会一直留在系统里。
2026 上海开源软件应用创新大赛的「开源 AI 工具赛道」,openKylin 提出命题《面向 openKylin 操作系统的智能体长期记忆自动化评测 Benchmark 设计》,需要参赛选手给智能体的记忆能力装一把“标尺”。
OpenAtom openKylin(简称 openKylin)是由开放原子开源基金会孵化及运营的开源操作系统项目,由麒麟软件发起,联合基础软硬件企业、非营利组织、高校、科研机构与个人开发者共同创立。2026 年 6 月,国防科技大学、哈工大(深圳)、麒麟软件等单位共建的 AgentOS SIG 发布了基于 openKylin 的开源智能体操作系统。目前 openKylin 里已有 KylinBot、kylin-agent、OpenClaw、Hermes Agent 等多个智能体框架,需要一套与之配套的、系统级的自动化评测工具,对不同智能体在 openKylin 操作系统上的记忆能力进行量化比较。

命题解读:三个痛点,一道评测
该命题的背景来自三个现实的问题。
一是目前的评测往往依赖人工检查,难以规模化;二是简单问答式验证项无法覆盖真实使用中的冲突更新、相似干扰和行动复用;三是自动评分容易出现语义偏移,难以稳定判断模型到底是“记住了”“误记了”还是“不该记却记了”。
这道题要求参赛者基于 openKylin 环境,设计一套自动化、低人工介入、可复现、可扩展的评测方案,把对话、记忆记录、行动轨迹、文件等统一组织为证据,自动评估智能体的长期记忆能力,重点覆盖长期保持、记忆调用、动态更新、相近区分、边界识别、任务复用六项能力。
交付上,方案说明文档要写清测试目标、数据生成方式、验证用例设计和自动评分流程,数据集设计要给出可扩展的数据结构,自动评测要在少人工介入下输出可解释的评分原因;还要提供样例数据与结果、可复现材料(代码须在 openKylin 上编译运行),并将评测流程封装为一键运行的 CLI 工具,建议产出 .deb 软件包。演示要在 openKylin 桌面环境下,对至少两款智能体运行评测,产出多维对比雷达图的 3-5 分钟完整录屏。
评审按六项维度打分:
- (15%)任务定义与通用性,看能否面向不同智能体和证据来源评测、与 openKylin 架构良好集成
- (25%)自动评分能力,看能否减少人工审核、区分正确记忆与错误复用
谁适合投这道题
如果团队有做 LLM 应用、智能体或评测体系的经验,就可以挑战这道命题。
参赛报名截止 10 月 11 日,总决赛 10 月 24 日在上海举办。获奖项目可获得现金、算力与 Token、大模型 API 等资源奖励,还有机会入选上海市开源项目培优工程,欢迎全国的开源技术爱好者报名参赛。
详情查看大赛官网:https://www.oschina.net/os2026
