大模型开发工程师
职责
1. 大模型训练与对齐
•参与百亿 / 千亿参数规模大语言模型的预训练、继续训练(Continue Pre-training)
•设计和执行 SFT(监督微调)、RLHF / DPO 等对齐策略,提升模型指令遵循能力和安全性
•构建高质量训练数据集,包括数据清洗、去重、质量过滤和配比策略
•优化分布式训练效率,使用 DeepSpeed / Megatron-LM 等框架提升训练吞吐量
2. 推理优化与部署
•负责大模型推理服务的性能优化,包括量化(INT8/INT4)、KV-Cache 优化、投机采样(Speculative Decoding)等
•搭建高并发、低延迟的模型推理服务,使用 vLLM / TensorRT-LLM / SGLang 等框架
•实现模型服务的高可用架构,支持灰度发布、AB 实验和弹性伸缩
3. RAG 与 Agent 应用研发(核心方向)
•RAG 系统:设计和优化检索增强生成系统,包括 Chunking 策略、Embedding 模型选型与微调、向量数据库(Milvus / Weaviate / Qdrant)、混合检索(BM25 + 向量)、重排序(Re-ranker)、上下文压缩、多跳检索(Multi-hop Retrieval)等模块
•Agent 框架:研发 AI Agent 系统,实现工具调用(Function Calling / Tool Use)、多步推理与规划(ReAct / Plan-and-Execute)、记忆管理(短期 / 长期 / 工作记忆)、多 Agent 协作(Multi-Agent)等能力
4. 技术建设与知识沉淀
•跟踪大模型领域最新研究进展(ArXiv、顶会论文),组织技术分享和论文精读
•参与内部大模型基础设施和工具链的建设
•输出技术方案文档和最佳实践指南
我们希望你具备的软素质:
•技术热情:对 AI 和大模型有发自内心的热爱,主动追踪前沿进展
•工程素养:写出清晰、可维护、经过测试的代码,有良好的工程习惯
•沟通表达:能将复杂技术方案清晰地传达给不同背景的同事
•Owner 意识:对自己负责的模块有端到端的责任感,不只做「被安排的事」
能力要求
•计算机科学、人工智能、数学或相关专业本科及以上学历
•3 年以上深度学习 / NLP 领域工作经验,其中至少 1 年大模型相关经验
•精通 Python,熟练掌握 PyTorch 深度学习框架
•深入理解 Transformer 架构、Attention 机制及主流大模型(GPT、LLaMA、Qwen 等)的原理
•在大模型训练(预训练 / SFT / RLHF)或推理优化方面有实际项目经验
•熟悉 RAG 和 Agent 开发,至少具备以下之一:
① 有 RAG 系统搭建经验(文档解析、向量检索、Re-rank 等);
② 有 Agent 框架实践经验(LangChain / LlamaIndex / AutoGen / CrewAI 等);
③ 对 RAG 或 Agent 的核心技术原理有深入理解,能独立完成方案设计
•熟悉 Linux 开发环境,熟练使用 Docker、Git
加分项(选填)
•有百亿参数以上模型的实际训练或部署经验,熟悉分布式训练中的常见问题及优化手段
•对主流开源大模型(LLaMA、Qwen、DeepSeek、Mistral 等)的架构和训练细节有深入了解
•有 CUDA / Triton kernel 开发经验,能进行算子级别的性能优化
•在推理优化方面有深入实践:量化部署、KV-Cache 压缩、Continuous Batching、PD 分离架构等
•有高质量的开源项目贡献(GitHub 200+ stars)或在 ACL / EMNLP / NeurIPS / ICML 等顶会发表论文
•熟悉多模态模型(视觉-语言、语音-语言)的训练范式
•有生产级 RAG 系统架构经验(高并发检索、向量索引优化、知识库管理等),或独立完成过复杂 Agent 系统的设计与落地(如代码 Agent、数据分析 Agent、Multi-Agent 协同等)
