BeeX AI SRE 运维工程师方案
起步 ECS
2C4G
系统盘
80G ESSD
1 年成本
¥1,597.99
工作主体
Codex
1. 定位
它不是普通监控服务, 而是可信任的 AI 运维工程师。
BeeX AI SRE 是一台长期在线的 AI 运维工作站。Codex/Claude Code 是主体, 自检脚本负责兜底, Runbook 固化做事方式, 飞书负责任务入口和汇报。
BeeX AI SRE = Codex 常驻运维工作站 + 自检守护脚本 + Runbook + 飞书汇报 + 阿里云/云效/Git/业务系统操作能力
| 目标 | 说明 |
|---|---|
| 7x24 巡检 | 持续检查 BeeX 测试/生产环境状态。 |
| 自动定位和修复 | 发现故障后按 Runbook 查日志、查监控、执行修复、验证恢复。 |
| 发布和回滚 | 触发云效流水线、检查健康状态、失败时回滚。 |
| 活动预演 | 活动前验证 ALB、双实例、worker 抢锁、webhook 幂等、订单和钱包链路。 |
| 知识沉淀 | 自动维护运维文档、事故复盘和 SOP。 |
2. 基础配置与成本
当前阶段不跑本地模型, 不长期跑 Docker 镜像, 不作为业务服务承载用户流量。它主要运行 Codex/Claude Code、Git、阿里云 CLI、云效 API、飞书通知、巡检脚本和少量日志。
| 项目 | 配置 |
|---|---|
| 地域 | 印尼 ap-southeast-5 |
| 实例规格 | ecs.e-c1m2.large |
| CPU / 内存 | 2C4G |
| 系统盘 | 80G ESSD PL0 |
| 系统 | Ubuntu 22.04 LTS |
| 公网 | EIP, 按流量计费, 峰值 10Mbps |
| 部署方式 | tmux + systemd timer + shell/python 脚本 |
| 购买周期 | 先买 1 年 |
| 规格 | 月付 | 买 1 年 | 按量小时 |
|---|---|---|---|
ecs.e-c1m2.large 2C4G + 80G | ¥156.66/月 | ¥1,597.99/年 | ¥0.31458/小时 |
ecs.u1-c1m2.large 2C4G + 80G | ¥297.13/月 | ¥2,139.34/年 | ¥0.58538/小时 |
推荐购买
ecs.e-c1m2.large + 80G ESSD + 公网按流量计费 + 买 1 年。预计服务器基础成本约 ¥1,597.99/年。公网流量另算, 正常不会高。
| 升级信号 | 动作 |
|---|---|
| 内存长期超过 80% | 升 4C8G。 |
| CPU 长期超过 60% | 升 4C8G。 |
| 多仓库构建/测试明显卡顿 | 升 4C8G 或增加数据盘。 |
| 磁盘超过 75% | 清理缓存; 若仍增长, 挂 100G/200G 数据盘。 |
3. 工作边界
AI SRE 拥有最高权限, 但工作方式要像高级工程师: 改之前理解上下文, 改的时候留痕, 改完验证, 出问题能回滚。
可以直接执行
查询监控和日志、重启服务、刷新 CDN、恢复 H5 离线包、重跑 worker 任务、触发发布、回滚版本、扩缩容、更新文档、飞书通知。
工程动作顺序
改配置前保存旧配置; 改数据库前备份或导出影响范围; 发布前记录当前版本; 回滚前记录失败原因; 释放资源前确认无流量/无绑定/无数据。
4. 总体架构
图 1 · AI SRE 工作站架构
flowchart TD User["团队成员 / zwp"] --> Codex["Codex / Claude Code
AI SRE 主体"] Feishu["飞书群 / 飞书应用"] --> Codex subgraph ECS["AI SRE ECS 2C4G"] Codex Tmux["tmux 会话
codex / claude"] Watchdog["自检脚本
systemd timer / cron"] Runbook["Runbooks
故障处理 SOP"] Scripts["运维脚本
aliyun / git / yunxiao / ssh"] Audit["本地审计日志
/opt/audit-logs"] end Codex --> Tmux Codex --> Runbook Codex --> Scripts Watchdog --> Audit Codex --> Audit Scripts --> Aliyun["阿里云
ECS / ALB / RDS / Redis / OSS / CDN / SLS"] Scripts --> Yunxiao["云效流水线"] Scripts --> Git["GitHub / Gitee"] Scripts --> Beex["BeeX 服务
api / wa / worker / admin"] Scripts --> SSH["业务 ECS SSH"] Scripts --> Feishu Watchdog --> Feishu Codex --> Feishu
目录规划
/opt/beex-ai-sre ├── bin/ 自检、巡检、发布、回滚脚本 ├── runbooks/ 故障处理 SOP ├── config/ 环境配置, 不提交明文密钥 ├── reports/ 巡检日报、事故报告 ├── audit-logs/ 操作审计日志 ├── state/ 自检状态、最近一次任务状态 └── README.md /opt/workspace ├── beex-service ├── beex-admin-service ├── beex-admin-page ├── beex-app-h5 ├── beex-app ├── beex-sso ├── ai-ops-worker └── beex-doc
5. 如何安排任务
5.1 日常巡检
| 频率 | 任务 |
|---|---|
| 每 1 分钟 | AI SRE 自检: CPU、内存、磁盘、Codex/tmux、网络、飞书可达性。 |
| 每 5 分钟 | 核心服务健康: api、wa、worker、admin、ALB、RDS、Redis。 |
| 每 15 分钟 | Worker 状态: 订单同步时间、分布式锁、失败任务、消息堆积。 |
| 每小时 | 第三方状态: WhatsApp、TikTok、Shopee、Xendit、飞书 webhook。 |
| 每天 | 运维日报: 可用性、错误率、费用、发布、告警、待处理事项。 |
5.2 故障处理
发现异常 → 判断影响范围 → 查最近变更 → 查日志和监控 → 匹配 Runbook → 执行修复 → 验证恢复 → 飞书汇报 → 更新事故记录
| 故障 | AI SRE 动作 |
|---|---|
| API 5xx 升高 | 查 ALB、服务日志、最近发布、RDS/Redis; 必要时滚动重启或回滚。 |
| WA 登录失败 | 查 webhook、Meta 错误、Redis login intent、模板和 token。 |
| TikTok 转链失败 | 查 token、scope、原始接口返回、商品是否可推广。 |
| 订单同步延迟 | 查 worker 锁、最近成功时间、三方接口错误, 必要时补偿同步。 |
| H5 白屏 | 查离线包版本、OSS/CDN、runtime-config、前端报错日志。 |
| 发布失败 | 查云效日志、构建产物、健康检查, 必要时回滚。 |
5.3 活动前线上预演
| 项目 | 检查点 |
|---|---|
| 测试环境扩容 | api x2 + wa x2 + worker-webhook x2 是否到位。 |
| ALB | 后端组是否挂双实例、健康检查是否通过。 |
| Worker | 双实例抢锁是否只有一台执行。 |
| WA | 登录、商品链接回复、ORDERS/WALLET 是否正常。 |
| TikTok/Shopee | 商品解析、转链、订单同步是否正常。 |
| 钱包 | 佣金生成、账本入账、提现前置校验是否正常。 |
| H5 离线包 | 下载、应用、回滚是否正常。 |
| 告警 | 飞书能否收到故障告警。 |
6. 实时自检机制
实时自检不依赖 Codex 一直主动思考, 而是由轻量脚本常驻兜底。脚本负责检查机器和工具状态, Codex 负责处理复杂判断和修复。
| 检查项 | 阈值 / 条件 | 动作 |
|---|---|---|
| CPU | 连续 10 分钟 > 80% | 飞书告警。 |
| 内存 | 使用率 > 85% | 飞书告警, 输出 top 进程。 |
| 磁盘 | 使用率 > 75% | 飞书提醒。 |
| 磁盘 | 使用率 > 90% | 自动清理临时缓存后告警。 |
| tmux | codex 会话不存在 | 自动创建会话并告警。 |
| Codex/Claude | 命令不可用 | 告警。 |
| Git | GitHub/Gitee 不可达 | 告警。 |
| Aliyun CLI | sts GetCallerIdentity 失败 | 告警。 |
| 飞书 | 测试消息发送失败 | 告警。 |
| 巡检脚本 | 最近成功时间超过 10 分钟 | 告警。 |
正常心跳
BeeX AI SRE 自检正常 机器: beex-ai-sre-id CPU: 12% 内存: 48% 磁盘: 31% Codex: alive Git: ok Aliyun: ok Feishu: ok
异常心跳
BeeX AI SRE 自检异常 异常: 磁盘使用率 82% 最大目录: 1. /opt/workspace 28G 2. /opt/audit-logs 8G 建议: 清理缓存或挂载数据盘
7. Runbook 目录
runbooks/ ├── api-5xx-high.md ├── wa-login-failed.md ├── wa-outbound-failed.md ├── tiktok-link-convert-failed.md ├── tiktok-order-sync-delay.md ├── shopee-commission-missing.md ├── xendit-webhook-failed.md ├── h5-offline-package-white-screen.md ├── h5-package-rollback.md ├── worker-lock-duplicate.md ├── rds-cpu-high.md ├── redis-memory-high.md ├── cdn-refresh-failed.md ├── yunxiao-deploy-failed.md └── activity-rehearsal-checklist.md
每个 Runbook 固定结构: 现象、影响范围、自动检查命令、判断条件、修复动作、验证方式、飞书汇报模板、复盘记录字段。
8. 飞书交互方式
@BeeX AI SRE 查一下 id-test 健康状态 @BeeX AI SRE 查一下今天 TikTok 订单同步为什么少了 @BeeX AI SRE 部署 beex-api 到 id-test @BeeX AI SRE 回滚 H5 到上一个版本 @BeeX AI SRE 刷新 prd.beexofficial.com 的 CDN @BeeX AI SRE 执行 id-test 线上预演 @BeeX AI SRE 生成今天运维日报
AI SRE 的回复必须包含: 检查了什么、发现了什么、做了什么、结果是否恢复、后续建议、相关日志/流水线/版本号。
9. 权限和凭证
因为它是可信任的 AI 运维工程师, 可以给最高权限, 但凭证要独立管理, 方便审计和轮换。
| 类型 | 方案 |
|---|---|
| 阿里云 | 单独 RAM 用户 beex-ai-sre, 高权限, 独立 AK/SK。 |
| Git | 单独 SSH key 或 deploy key。 |
| 云效 | 单独 token。 |
| 飞书 | 单独应用或机器人。 |
| ECS SSH | 独立密钥。 |
| 凭证存放 | /opt/beex-ai-sre/config/, 权限 600, 不进 Git。 |
| 操作审计 | 所有命令和关键动作写 /opt/beex-ai-sre/audit-logs。 |
10. 第一阶段落地清单
购买机器
ecs.e-c1m2.large, 2C4G, 80G ESSD, Ubuntu 22.04, EIP 按流量, 买 1 年。初始化系统
安装 git、zsh、tmux、node/pnpm、java/maven、python3、aliyun cli、ossutil、github cli、codex cli、claude code。
安装 git、zsh、tmux、node/pnpm、java/maven、python3、aliyun cli、ossutil、github cli、codex cli、claude code。
创建目录
/opt/beex-ai-sre, /opt/workspace, /opt/runbooks, /opt/audit-logs, /opt/backups。配置凭证
阿里云 AK/SK、云效 token、Git SSH key、飞书机器人/应用、业务 ECS SSH key。
阿里云 AK/SK、云效 token、Git SSH key、飞书机器人/应用、业务 ECS SSH key。
启动自检
创建
创建
beex-ai-sre-selfcheck.service 和 beex-ai-sre-selfcheck.timer, 每 1 分钟轻量检查, 每 5 分钟深度检查。| 验收项 | 状态 |
|---|---|
| 能 SSH 登录 AI SRE ECS | 待验 |
| Codex/Claude Code 可运行 | 待验 |
| 能拉取 BeeX 仓库 | 待验 |
| 能访问阿里云 API | 待验 |
| 能访问云效 API | 待验 |
| 能发送飞书消息 | 待验 |
| 能执行一次 id-test 健康巡检 | 待验 |
11. 后续演进
| 阶段 | 目标 |
|---|---|
| 第一阶段 | 可用的远程运维工作站: Codex 能跑、自检能报、仓库能拉、阿里云/云效/飞书能通。 |
| 第二阶段 | 飞书自然语言指令、自动巡检日报、Runbook 自动匹配、活动预演一键执行、发布回滚归档。 |
| 第三阶段 | 多国家统一巡检、事故自动复盘、运维知识库检索、管理后台运维控制台打通。 |
结论
先买 2C4G + 80G, 不跑本地模型, 不长期跑 Docker 镜像。用 Codex/Claude Code 作为 AI SRE 主体, 用 systemd timer 做实时自检兜底, 用 Runbook 固化做事方式, 用飞书做汇报和任务入口。