BeeX AI SRE 运维工程师方案

更新日期: 2026-06-23 · 目标: 用 Codex/Claude Code 建立可信任的 AI 运维工作站
起步 ECS
2C4G
系统盘
80G ESSD
1 年成本
¥1,597.99
工作主体
Codex

1. 定位

它不是普通监控服务, 而是可信任的 AI 运维工程师。 BeeX AI SRE 是一台长期在线的 AI 运维工作站。Codex/Claude Code 是主体, 自检脚本负责兜底, Runbook 固化做事方式, 飞书负责任务入口和汇报。
BeeX AI SRE = Codex 常驻运维工作站 + 自检守护脚本 + Runbook + 飞书汇报 + 阿里云/云效/Git/业务系统操作能力
目标说明
7x24 巡检持续检查 BeeX 测试/生产环境状态。
自动定位和修复发现故障后按 Runbook 查日志、查监控、执行修复、验证恢复。
发布和回滚触发云效流水线、检查健康状态、失败时回滚。
活动预演活动前验证 ALB、双实例、worker 抢锁、webhook 幂等、订单和钱包链路。
知识沉淀自动维护运维文档、事故复盘和 SOP。

2. 基础配置与成本

当前阶段不跑本地模型, 不长期跑 Docker 镜像, 不作为业务服务承载用户流量。它主要运行 Codex/Claude Code、Git、阿里云 CLI、云效 API、飞书通知、巡检脚本和少量日志。

项目配置
地域印尼 ap-southeast-5
实例规格ecs.e-c1m2.large
CPU / 内存2C4G
系统盘80G ESSD PL0
系统Ubuntu 22.04 LTS
公网EIP, 按流量计费, 峰值 10Mbps
部署方式tmux + systemd timer + shell/python 脚本
购买周期先买 1 年
规格月付买 1 年按量小时
ecs.e-c1m2.large 2C4G + 80G¥156.66/月¥1,597.99/年¥0.31458/小时
ecs.u1-c1m2.large 2C4G + 80G¥297.13/月¥2,139.34/年¥0.58538/小时
推荐购买 ecs.e-c1m2.large + 80G ESSD + 公网按流量计费 + 买 1 年。预计服务器基础成本约 ¥1,597.99/年。公网流量另算, 正常不会高。
升级信号动作
内存长期超过 80%升 4C8G。
CPU 长期超过 60%升 4C8G。
多仓库构建/测试明显卡顿升 4C8G 或增加数据盘。
磁盘超过 75%清理缓存; 若仍增长, 挂 100G/200G 数据盘。

3. 工作边界

AI SRE 拥有最高权限, 但工作方式要像高级工程师: 改之前理解上下文, 改的时候留痕, 改完验证, 出问题能回滚。

可以直接执行

查询监控和日志、重启服务、刷新 CDN、恢复 H5 离线包、重跑 worker 任务、触发发布、回滚版本、扩缩容、更新文档、飞书通知。

工程动作顺序

改配置前保存旧配置; 改数据库前备份或导出影响范围; 发布前记录当前版本; 回滚前记录失败原因; 释放资源前确认无流量/无绑定/无数据。

4. 总体架构

图 1 · AI SRE 工作站架构
flowchart TD
  User["团队成员 / zwp"] --> Codex["Codex / Claude Code
AI SRE 主体"] Feishu["飞书群 / 飞书应用"] --> Codex subgraph ECS["AI SRE ECS 2C4G"] Codex Tmux["tmux 会话
codex / claude"] Watchdog["自检脚本
systemd timer / cron"] Runbook["Runbooks
故障处理 SOP"] Scripts["运维脚本
aliyun / git / yunxiao / ssh"] Audit["本地审计日志
/opt/audit-logs"] end Codex --> Tmux Codex --> Runbook Codex --> Scripts Watchdog --> Audit Codex --> Audit Scripts --> Aliyun["阿里云
ECS / ALB / RDS / Redis / OSS / CDN / SLS"] Scripts --> Yunxiao["云效流水线"] Scripts --> Git["GitHub / Gitee"] Scripts --> Beex["BeeX 服务
api / wa / worker / admin"] Scripts --> SSH["业务 ECS SSH"] Scripts --> Feishu Watchdog --> Feishu Codex --> Feishu

目录规划

/opt/beex-ai-sre
├── bin/                 自检、巡检、发布、回滚脚本
├── runbooks/            故障处理 SOP
├── config/              环境配置, 不提交明文密钥
├── reports/             巡检日报、事故报告
├── audit-logs/          操作审计日志
├── state/               自检状态、最近一次任务状态
└── README.md

/opt/workspace
├── beex-service
├── beex-admin-service
├── beex-admin-page
├── beex-app-h5
├── beex-app
├── beex-sso
├── ai-ops-worker
└── beex-doc

5. 如何安排任务

5.1 日常巡检

频率任务
每 1 分钟AI SRE 自检: CPU、内存、磁盘、Codex/tmux、网络、飞书可达性。
每 5 分钟核心服务健康: api、wa、worker、admin、ALB、RDS、Redis。
每 15 分钟Worker 状态: 订单同步时间、分布式锁、失败任务、消息堆积。
每小时第三方状态: WhatsApp、TikTok、Shopee、Xendit、飞书 webhook。
每天运维日报: 可用性、错误率、费用、发布、告警、待处理事项。

5.2 故障处理

发现异常 → 判断影响范围 → 查最近变更 → 查日志和监控 → 匹配 Runbook → 执行修复 → 验证恢复 → 飞书汇报 → 更新事故记录
故障AI SRE 动作
API 5xx 升高查 ALB、服务日志、最近发布、RDS/Redis; 必要时滚动重启或回滚。
WA 登录失败查 webhook、Meta 错误、Redis login intent、模板和 token。
TikTok 转链失败查 token、scope、原始接口返回、商品是否可推广。
订单同步延迟查 worker 锁、最近成功时间、三方接口错误, 必要时补偿同步。
H5 白屏查离线包版本、OSS/CDN、runtime-config、前端报错日志。
发布失败查云效日志、构建产物、健康检查, 必要时回滚。

5.3 活动前线上预演

项目检查点
测试环境扩容api x2 + wa x2 + worker-webhook x2 是否到位。
ALB后端组是否挂双实例、健康检查是否通过。
Worker双实例抢锁是否只有一台执行。
WA登录、商品链接回复、ORDERS/WALLET 是否正常。
TikTok/Shopee商品解析、转链、订单同步是否正常。
钱包佣金生成、账本入账、提现前置校验是否正常。
H5 离线包下载、应用、回滚是否正常。
告警飞书能否收到故障告警。

6. 实时自检机制

实时自检不依赖 Codex 一直主动思考, 而是由轻量脚本常驻兜底。脚本负责检查机器和工具状态, Codex 负责处理复杂判断和修复。

检查项阈值 / 条件动作
CPU连续 10 分钟 > 80%飞书告警。
内存使用率 > 85%飞书告警, 输出 top 进程。
磁盘使用率 > 75%飞书提醒。
磁盘使用率 > 90%自动清理临时缓存后告警。
tmuxcodex 会话不存在自动创建会话并告警。
Codex/Claude命令不可用告警。
GitGitHub/Gitee 不可达告警。
Aliyun CLIsts GetCallerIdentity 失败告警。
飞书测试消息发送失败告警。
巡检脚本最近成功时间超过 10 分钟告警。

正常心跳

BeeX AI SRE 自检正常
机器: beex-ai-sre-id
CPU: 12%
内存: 48%
磁盘: 31%
Codex: alive
Git: ok
Aliyun: ok
Feishu: ok

异常心跳

BeeX AI SRE 自检异常
异常: 磁盘使用率 82%
最大目录:
1. /opt/workspace 28G
2. /opt/audit-logs 8G
建议: 清理缓存或挂载数据盘

7. Runbook 目录

runbooks/
├── api-5xx-high.md
├── wa-login-failed.md
├── wa-outbound-failed.md
├── tiktok-link-convert-failed.md
├── tiktok-order-sync-delay.md
├── shopee-commission-missing.md
├── xendit-webhook-failed.md
├── h5-offline-package-white-screen.md
├── h5-package-rollback.md
├── worker-lock-duplicate.md
├── rds-cpu-high.md
├── redis-memory-high.md
├── cdn-refresh-failed.md
├── yunxiao-deploy-failed.md
└── activity-rehearsal-checklist.md

每个 Runbook 固定结构: 现象、影响范围、自动检查命令、判断条件、修复动作、验证方式、飞书汇报模板、复盘记录字段。

8. 飞书交互方式

@BeeX AI SRE 查一下 id-test 健康状态
@BeeX AI SRE 查一下今天 TikTok 订单同步为什么少了
@BeeX AI SRE 部署 beex-api 到 id-test
@BeeX AI SRE 回滚 H5 到上一个版本
@BeeX AI SRE 刷新 prd.beexofficial.com 的 CDN
@BeeX AI SRE 执行 id-test 线上预演
@BeeX AI SRE 生成今天运维日报

AI SRE 的回复必须包含: 检查了什么、发现了什么、做了什么、结果是否恢复、后续建议、相关日志/流水线/版本号。

9. 权限和凭证

因为它是可信任的 AI 运维工程师, 可以给最高权限, 但凭证要独立管理, 方便审计和轮换。

类型方案
阿里云单独 RAM 用户 beex-ai-sre, 高权限, 独立 AK/SK。
Git单独 SSH key 或 deploy key。
云效单独 token。
飞书单独应用或机器人。
ECS SSH独立密钥。
凭证存放/opt/beex-ai-sre/config/, 权限 600, 不进 Git。
操作审计所有命令和关键动作写 /opt/beex-ai-sre/audit-logs

10. 第一阶段落地清单

购买机器
ecs.e-c1m2.large, 2C4G, 80G ESSD, Ubuntu 22.04, EIP 按流量, 买 1 年。
初始化系统
安装 git、zsh、tmux、node/pnpm、java/maven、python3、aliyun cli、ossutil、github cli、codex cli、claude code。
创建目录
/opt/beex-ai-sre, /opt/workspace, /opt/runbooks, /opt/audit-logs, /opt/backups
配置凭证
阿里云 AK/SK、云效 token、Git SSH key、飞书机器人/应用、业务 ECS SSH key。
启动自检
创建 beex-ai-sre-selfcheck.servicebeex-ai-sre-selfcheck.timer, 每 1 分钟轻量检查, 每 5 分钟深度检查。
验收项状态
能 SSH 登录 AI SRE ECS待验
Codex/Claude Code 可运行待验
能拉取 BeeX 仓库待验
能访问阿里云 API待验
能访问云效 API待验
能发送飞书消息待验
能执行一次 id-test 健康巡检待验

11. 后续演进

阶段目标
第一阶段可用的远程运维工作站: Codex 能跑、自检能报、仓库能拉、阿里云/云效/飞书能通。
第二阶段飞书自然语言指令、自动巡检日报、Runbook 自动匹配、活动预演一键执行、发布回滚归档。
第三阶段多国家统一巡检、事故自动复盘、运维知识库检索、管理后台运维控制台打通。
结论 先买 2C4G + 80G, 不跑本地模型, 不长期跑 Docker 镜像。用 Codex/Claude Code 作为 AI SRE 主体, 用 systemd timer 做实时自检兜底, 用 Runbook 固化做事方式, 用飞书做汇报和任务入口。