清华开源 OpenMAIC:把「讲课」变成一份可执行的乐谱
项目地址:github.com/THU-MAIC/OpenMAIC
2026 年 9 月初,清华大学 THU-MAIC 团队开源的 OpenMAIC(Open Multi-Agent Interactive Classroom,开放多智能体互动课堂)连续多日排在 GitHub Trending 榜首,单日 Star 增量一度接近 3000。截至 9 月 3 日,Star 数 30,513,而仓库创建至今不到半年。
它的用法一句话能说清:上传一份 PDF 或丢给一个主题,几分钟后拿到的不是总结、不是 PPT,而是一间 AI 教室。
教室构成:AI 老师、AI 同学,和你
OpenMAIC 官方对自身的定义是:
能够将任何主题或文档转化为丰富的互动学习体验……由 AI 教师和 AI 同学进行语音讲解、白板绘图,并与你展开实时讨论。
进入一间生成好的教室,能看到:
- AI 老师:讲解时配合语音、激光笔和聚光灯;讲方程时在共享白板上逐步推导,讲流程时当场画图。
- 几个 AI 同学:不同人设,包括爱追问的学霸和喜欢抬杠的「杠精」。他们会主动举手提问、发起讨论、组织圆桌辩论。
- 你:随时插话、答题、被点名。讲完知识点后有随堂测验,当场判分讲解。
支持四种课程场景:幻灯片讲解、互动测验、基于 HTML 的交互式模拟(物理仿真、流程图、小游戏)、以及需要选角色上手操作的项目制学习(PBL)。
为什么是「课堂」跑通了多智能体
多智能体的 demo 大多停在几个机器人互相聊天,看不出生产力。OpenMAIC 选了教学场景,原因是课堂天然需要角色分工:老师讲,学霸问出别人不敢问的问题,杠精逼着老师把话讲严谨。角色多、立场冲突,讨论才有信息量,学习者的注意力才不会被 40 分钟单向视频放空。
对应成果发在《Journal of Computer Science and Technology》(JCST 2026)上,论文标题即纲领:
From MOOC to MAIC: Reimagine Online Teaching and Learning through LLM-driven Agents
MOOC 是一个视频放给 N 个人看,节奏统一、无人打断;OpenMAIC 做的 MAIC(Massive AI-empowered Courses)反转了方向——N 个智能体,围着一个学习者转。
项目底子:5 个月、9 个版本、3 万 Star
容易被质疑是玩具?它有几条硬底子:
- 开源前已在清华大学真实课堂里跑了两两年多,覆盖 700 多名学生;
- 仓库 2026 年 3 月 11 日创建,3 月 26 日发布 v0.1.0,5 个月迭代 9 个版本,8 月 27 日放出 v1.0.0;
- v0.3.0(6 月 28 日)起许可证从 AGPL-3.0 换成 MIT——任何人都可以拿来商用,不必开源自己的代码。
版本节奏显示它从「演示型生成器」演化为「可持续运行的课程系统」:服务端持久化、增量保存、文档解析、音视频转写、编辑器内 AI 修改、MP4 视频导出,每个大版本都在往可用的产品方向挪。
工程拆解:为什么生成课堂比生成 PPT 难一个量级
生成 PPT 的工具输出一份静态文件就结束;OpenMAIC 输出的是一份能被「执行」的教案——谁在什么时刻开口、谁在白板上画哪一笔、激光笔指向哪里、测验何时弹出,都是按秒走的时序动作。
类比:普通 AI 写作生成的是「文稿」,读一遍就完;OpenMAIC 生成的是「乐谱」,要交给演奏者按拍子执行,才成其为音乐。
架构因此与普通 AI 写作工具不同:
- 两阶段生成流水线:先规划(把输入拆解成知识点,产出结构化课堂大纲),再生成(把大纲条目变成幻灯片/测验/交互场景)。先定结构、后填内容,而非一句提示词硬生成一整门课;
- LangGraph 状态机编排:管理多智能体谁在何时说话、上下文如何交接;
- 回放引擎 + 动作引擎:课堂运行时是状态机(idle → playing → live),动作引擎支持 28 种以上动作——语音、白板绘图/文字/形状/图表、聚光灯、激光笔等;
- 深度交互模式:v0.2.0 起可嵌入 3D 可视化、物理模拟、知识游戏、思维导图和在线编程环境,AI 老师可主动高亮页面区域引导注意力。
总结这套设计:把「讲课」这种依赖时序和临场感的事,变成了可编排、可回放、可修改的指令序列。
v1.0.0:课程从「一次生成」变成「可持续项目」
8 月 27 日的 v1.0.0 加入 Pro 工作台,使用范式发生变化:从「输一个 prompt,等一整门课出来,不满意重新来」,变为面对一个能对话的课程智能体——先确认课程目标、受众、页面规划,再逐页生成;「第 3 页改成先讲案例」这类修改就地完成,不必推倒重来。
支撑的机制有三个:
- 服务端持久化会话:课程构建过程保存在服务端,服务重启后可取消、恢复、继续。建课从「一次性 API 调用」变为「可跨天推进的项目」;
- 会话素材:可上传文档、音频、视频,也可让 Agent 联网搜索,基于提供的材料建课;
- 20 多种内置技能:覆盖幻灯片、测验、互动内容、PBL、图像、视频、语音,支持把已有 .pptx 导入重新加工。
本质是把「先规划、再执行;执行可检查、可纠偏」做成产品默认形态:不假设一句提示词能得到完美课程,而是默认你会和 AI 一起把课打磨出来。
插件式设计:换模型不用改架构
官方称其设计取向为「中立设计」(neutral by design)——模型、媒体服务、搜索、存储全部可插拔。
大模型支持 OpenAI、Anthropic、Google Gemini、DeepSeek,以及通义千问、Kimi、MiniMax、智谱 GLM、豆包、腾讯混元、小米 MiMo、Grok;本地部署可接 Ollama 和 Lemonade。语音合成、图像生成、语音识别、联网搜索、文档解析各环节均有多个服务商可换。存储后端抽象了接口,官方提供 PostgreSQL 参考实现。
结果就是换模型不换架构:今天用 Gemini,明天换 DeepSeek,改配置即可。自己部署门槛也低——Docker 一键起服务,官方为国内网络提供镜像加速参数。
项目还提供官方 Skill,可装进 OpenClaw、Codex、DeepSeek、WorkBuddy 等 Agent 工作台,能在飞书、Slack、Telegram 里直接说「帮我生成一节课」,Agent 自行完成搜索、整理和生成。