教育是智能体最容易被低估的落地场景。它看起来温和——没有产线设备、没有资金清算——但对智能体的要求其实相当苛刻:既要处理多学科知识的准确性,又要适配不同年龄段的表达与安全约束,还要在长周期里保持教学逻辑的连贯。9 月 8 日,在巴黎举行的 Digital Learning Week 2026 上,清华 OpenMAIC 作为走上联合国教科文组织舞台的中国教育智能体亮相,随之公开的三组运行数据,比「教育智能体」这个标签更值得细看。
三组数字,三个不同的信息维度
据公开报道,OpenMAIC v1.0 累计消耗 8830 亿 Token,近 30 天使用量环比增长 203%,单次任务平均调用模型 74.3 次。这三组数字指向三个不同的问题,值得分开解读。
8830 亿 Token 是规模维度。它说明这个系统已经跑过了相当长的真实使用周期,不是停留在演示阶段的样本。对教育类智能体来说,规模的意义不只是算力投入,更意味着它已经积累了足量的真实交互轨迹,这些轨迹是后续优化教学策略的基础原料。
203% 的环比增长是采用维度。近 30 天用量翻三倍,通常对应两种可能:一是接入的教育机构或用户量快速增长,二是单用户的使用深度显著提升。两者对产品含义不同——前者说明分发渠道打开,后者说明任务复杂度上升。仅凭公开信息无法区分,但无论哪种,都意味着系统正在承受远高于设计初期的负载,稳定性与成本控制会同步承压。
74.3 次模型调用是架构维度,也是三组数字里最有技术含量的一组。它意味着完成一次用户任务,平均要经历七十多次模型调用。这个量级说明系统不是「一次问答」,而是重编排、重验证的多步流程。
为什么教育场景的调用密度天然偏高
七十多次调用听起来冗余,但在教育场景里是有其逻辑的。其一,学科知识需要校验:一道数学题的解答要经过求解、代入验证与表述规范检查,单次生成很难同时保证正确性与教学价值。其二,教学需要分步:直接给答案对学习没有帮助,系统需要拆解思路、给出提示、在学生卡壳时提供分层引导,每一步都可能是一次独立调用。其三,表达需要适配:同一知识点面向不同学段,语言复杂度与举例方式要重新生成,这是内容改写而非简单检索。其四,安全与适龄约束需要复核:涉及未成年人使用时,输出内容通常要经过额外的合规检查环节。其五,多轮纠错不可避免:学生追问、答错、改口都会触发重新规划。
把这些环节加总,调用密度的量级就变得可以理解。它同时揭示了一个容易被忽略的成本结构:教育智能体的成本并不主要由单次模型调用的单价决定,而由「每完成一个教学任务需要多少次调用」决定。这也解释了为什么压缩调用次数、提升单次调用的信息密度,会成为这类系统的核心工程目标——它是一个编排效率问题,而不是模型选择问题。
从「会答题」到「会教学」:价值不在答案里
教育场景有一个反直觉之处:正确答案的边际价值很低。学生可以查到的答案,不需要智能体再讲一遍。真正稀缺的是「理解学生卡在哪里」以及「用他能接受的方式推一步」。这决定了好用的教育智能体必须持续维护一个关于学生的状态:已经掌握什么、在哪一步反复出错、偏好什么样的解释方式。这类状态与办公场景里的任务清单不同,它是跨会话、长周期、需要持续修正的。
这也是教育智能体与通用助手的核心分野。通用助手的优化目标是「给出一个好答案」,教育智能体的优化目标是「让学生自己走到答案」。目标不同,评估方式就不同:前者看答案质量,后者看学习增益。而学习增益的测量周期长、干扰因素多,这恰恰是教育智能体目前最难被证明的部分。
走上联合国教科文组织舞台意味着什么
Digital Learning Week 是联合国教科文组织在数字学习领域的年度活动,参与主体包括各国教育主管部门、研究机构与国际组织。一个教育智能体在这样的场合亮相,其意义更多在于「进入国际教育治理的讨论视野」,而非单纯的产品曝光。对教育类 AI 而言,国际组织关心的核心问题通常集中在三处:教育公平(技术是否加剧资源差距)、数据与未成年人保护、以及教学质量的评估标准。这些问题的答案,往往比模型能力更能决定一项技术能否被大规模引入课堂。
中立思辨
需要保持克制地看待这组数字。其一,Token 消耗与教学效果之间没有必然关系:消耗得多,也可能意味着流程冗余或重复调用,而非教学深度。其二,203% 的环比增长是使用侧指标,不能直接等同于用户满意度或留存,尤其在教育领域,短期热度与长期使用之间存在明显落差。其三,单次 74.3 次调用在成本上是可观的开销,若要支撑大规模普惠使用,成本结构能否随规模下降,是决定可持续性的关键问题。其四,教育智能体面对的是未成年人,数据采集范围、内容安全边界与家长知情机制都需要比一般场景更严格的设计,而这些恰恰是公开信息中最少涉及的部分。其五,教学效果的验证需要长期对照研究,短期内任何「提分」类结论都应谨慎对待。
此外,OpenMAIC 的具体技术架构、支持的学科与学段范围、以及教学效果的评测方法,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
趋势研判
短期,教育智能体的竞争会集中在「编排效率」与「成本结构」上,因为调用密度直接决定单位教学成本,而教育场景对价格的敏感度远高于企业办公场景;中期,评估标准会从「答对率」转向「过程可信」——能否解释为什么这样引导、能否给出可复核的教学依据,会成为进入学校采购的前置条件;长期,教育智能体的价值衡量会回归教育本身的尺度,也就是学习增益与教育公平,而不是模型跑分。
对关注这一方向的团队,一个务实的建议是:不要把「调用次数」当作技术实力的展示,而要把它当作需要被优化的成本项;同时尽早建立与教育研究者合作的评测机制,因为在教育场景里,一个无法被教育学界认可的评估方法,很难支撑真实的教学改进。教育是智能体最难被量化的落地场景之一,也正因如此,它比多数场景更值得慢一点、稳一点。