凌晨三点的告警谁来接:OpenOcta运维数字员工的7×24值班方案
凌晨三点手机突然响了,又是服务器告警。磁盘满了,日志堆积,服务快挂了。你爬起来 SSH 登录,查日志、清理文件、重启服务,忙完一套流程往往就睡不着了。半夜被叫醒、手动处理告警、反复执行巡检脚本,这些琐碎但关键的工作占掉了大量时间。AI Agent 火了很久,但通用框架解决不了运维的专业需求——告警要自动处理、危险命令需要审批、巡检要定时执行。
最近在 GitHub 刷到一个叫 OpenOcta 的项目,专门为运维场景打造。上线两个月,Star 数已经冲到 2.4K,累计下载超过 60K。
从通用到垂直
通用 AI Agent 框架虽然强大,但通用和专业之间隔着一道场景深度的鸿沟。OpenOcta 专门为运维场景深度定制,内置了 Prometheus 告警处理、定时巡检、运维专家 Skill、危险操作审批等运维专属能力。告警要能自动处理、危险命令必须审批、巡检要定时执行、token 成本要可控,这些都是运维专属的需求。
AI Agent 的竞争正在从谁的模型更强转向谁更懂用户的工作流。通用 Agent 解决的是能不能用的问题,垂直 Agent 解决的是好不好用的问题。
为什么选 Go 语言
OpenOcta 用 Go 重写了整个后端。运维环境服务器多、网络复杂、很多机器连桌面都没有,对稳定性要求极高。Go 编译出来就是一个二进制文件,没有运行时依赖,内存占用低,而且 Go 的并发模型天然适合运维场景——同时处理多个告警、并行执行巡检任务、高并发的消息推送。前端通过 go:embed 打包进二进制,一个文件就是全套,下载一个文件就能跑,对运维人来说太友好了。
国产大模型支持
OpenOcta 直接把国产大模型做了首要支持,像 MiniMax、火山方舟、阿里百炼、Kimi,开箱即用。不需要代理,API Key 填进去就能跑,数据全程不出内网。
数字员工:运维工程师的 AI 分身
OpenOcta 最大的亮点是数字员工(Digital Employee)设计。传统 AI 助手是"帮你做事",你问一句它答一句,但运维场景不一样,半夜三点服务器告警了你不可能随时在线,需要的是能"替你做事"的数字员工。
数字员工有三个关键特性:
- 专业分工,各司其职:你可以创建多个数字员工,每个员工有自己的专业领域。DBA 员工负责数据库巡检、慢查询分析;SRE 员工负责服务器监控、日志分析;Security 员工负责安全扫描、漏洞检测。v0.2.7 版本开始,定时巡检任务可以指定由哪个数字员工执行
- 7×24 小时待命:配置好告警接入和定时任务后,数字员工会一直在后台运行。凌晨 3 点刚好收到告警,它自动分析、生成处置建议并推送到你配置的企业微信群或飞书群。定时巡检也没问题,也能定时将结果推到群里面
- 持续学习,越用越懂你:数字员工会记住你的运维习惯和项目特点,哪些告警是误报、哪些操作需要审批、你的服务器架构和常用命令。这些知识会沉淀在 L2 项目持久记忆里,跨会话复用
运维场景深度适配
告警自动处理:OpenOcta 提供 /hooks/alert 接口,能直接接入 Prometheus。告警进来后,Agent 会自动解析内容、关联历史事件、生成处置建议,推送到飞书或微信群。
定时巡检:内置 Cron 调度,打开页面里配一下就行,每天自动跑,结果自动推到 IM 里。v0.2.7 还支持指定数字员工执行,数据库巡检用 DBA 员工,服务器巡检用 SRE 员工。
运维专家 Skill:官方提供了几十个现成的专家技能包,比如 MySQLOps 专门处理 MySQL 的事,安装直接把 zip 文件上传就行,常见运维操作都封装好了。
危险操作审批:OpenOcta 给危险操作加了人工审批,Agent 不能绕过这个机制,针对运维场景做了更严格的安全策略,保证关键操作运维能知道并确认。
Skylark 机制:省 token
运维场景的巡检任务需要密集执行,token 消耗会非常夸张。传统 Agent 每次对话都会把完整的 skill 列表、工具描述、历史对话一股脑塞给模型,一天跑几十次巡检每次都全量加载,一个月下来 token 成本比模型 API 本身还贵。
OpenOcta 的思路是 Skylark 机制:第一轮对话只加载最基础的能力,如果发现需要某个 skill,第二轮再按需加载。简单问题少加载,复杂问题多加载。
安装与上手
以 Windows 系统为例,先去官网或 GitHub 下载 Windows 的安装包,执行安装,不报错的话浏览器打开 http://127.0.0.1:18900 就能进控制台。
第一件事是配模型。如果你有火山方舟或阿里百炼的 API Key,在"模型"页面添加厂商填进去就行;没有的话 MiniMax 有免费额度可以先用。
配好模型之后,在对话界面输入"帮我检查一下本机的磁盘使用情况",Agent 会调用内置的 Shell 工具执行命令,把结果整理成易读的格式返回。
以前让通用 AI Agent 帮你做运维,它只能凭通用知识来猜,半夜告警来了它可能给你一堆理论分析,但不知道该执行什么命令。有了 OpenOcta,相当于给 AI 配了一套运维专用工具箱,它知道告警怎么处理、巡检怎么执行、危险命令要审批、token 成本要控制。数字员工设计让每个运维工程师都能拥有专业的 AI 分身,7×24 小时替你值班。
开源版本基于 GPLv3 协议开源。他们也有团队版,适用于中大型企业、多 BU、强合规场景,包含多租户/多组织管理、模型与 Token 级治理、资源市场生命周期管理。
项目地址:https://github.com/openocta/openocta