Agent Infra 工程师
你会负责什么
LLM Gateway 层设计与实现(基于 LiteLLM):多模型路由、降级、Token 配额、成本核算
自托管 Supabase 全栈组件 + Sandbox 沙箱基础设施的运维与稳定性保障,SLA ≥ 99.9%
Agent 全链路可观测:trace、token 成本归因、Prompt 与上下文版本管理
Agent 评测与回归管道:评测集设计、线上 A/B、Eval 指标可视化
与 Agent 应用开发同学共建数据闭环,把「成本」和「效果」做成可量化的一等公民
必须有的
实际做过 LLM 应用 / Agent 系统的可观测或成本治理,有上线案例
熟悉 LiteLLM 或类似 LLM Gateway 方案,能独立完成多模型路由与成本追踪
熟悉自托管 Supabase(PostgreSQL、Kong、GoTrue、PostgREST、Realtime 等核心组件)
熟悉至少一种 Sandbox 沙箱方案(e2b / Daytona / Modal 等),有生产集成经验
2 年以上 Kubernetes 生产运维经验(Deployment、StatefulSet、RBAC、Helm Chart)
工程基本功扎实:Python 或 TypeScript 写过可维护的服务,有上线和运维经验
Owner 心态:能定义问题、列出选项、做 trade-off 决策
加分项
Prompt 缓存 / Context 工程实战经验(如 prompt cache hit rate 优化)
懂多种主流模型 token 计费差异,做过模型选型与成本优化
熟悉阿里云 ACK / ECS / RDS / ACR 等公有云
熟悉 GitOps(ArgoCD / FluxCD)
CKA / CKS 认证
我们看重的特质
用数据说话:上线前给指标预期,上线后用数据复盘
平台思维:把「让 Agent 应用开发者好用」当产出物
跨层视角:能下到底座排查、上到 Agent 编排层一起讨论 trade-off
良好的文档与 On-Call 响应习惯
核心能力关注点
LLM Gateway 与多模型治理
LiteLLM 等网关方案、多模型路由 / 降级 / 限流、Token 配额与成本核算
Agent 可观测与评测
全链路 trace、Prompt 版本与上下文追踪、评测集与回归 A/B 管道
平台底座运维
自托管 Supabase + Sandbox 沙箱 + Kubernetes 生产环境与 PostgreSQL 高可用
技术栈偏好
•LiteLLM;Supabase(自托管)
•Sandbox(e2b / Daytona)
•Kubernetes
•Helm
•PostgreSQL
•Kong
•OpenTelemetry
•Prometheus / Grafana
•TypeScript / Python
