Live opening · Posted 5 days ago
At a glance
The key details from the original listing.
Your early-applicant advantage
Live timing from JobBeeper.
About the role
Description supplied by the original job listing.
该职位来源于猎聘 工作地点: 美国(硅谷 / 西雅图 / 纽约);中国(北京 / 上海 / 深圳);支持远程及混合办公 ─── 你将负责 1. 稀疏大模型算法研究与技术路线规划
负责公司稀疏计算方向的核心技术路线设计,包括稀疏训练、稀疏推理和软硬件协同优化。
研究面向 LLM / VLM 的结构化稀疏、动态稀疏、激活稀疏、梯度稀疏、稀疏反向传播等技术。
探索大模型在预训练、微调和推理阶段的稀疏化方案,在保证模型能力的前提下降低计算量、显存占用和推理延迟。
建立稀疏率、模型精度、吞吐、延迟、能耗、显存占用之间的系统评估方法。
结合真实模型和业务场景,判断不同稀疏算法的落地价值,而不仅仅停留在理论 FLOPs 降低。 ─── 2. 自研 AI 芯片上的稀疏计算协同优化
与芯片架构、编译器、Kernel 和模型团队协作,定义适合自研 AI 芯片执行的硬件友好型稀疏模式。
分析稀疏计算在访存、带宽、片上缓存、调度、数据布局和算力利用率上的瓶颈。
推动稀疏矩阵乘、稀疏激活、稀疏注意力、稀疏 MLP 等核心算子在芯片平台上的高效实现。
与底层团队共同验证稀疏计算在真实大模型工作负载中的端到端性能收益。 ─── 3. 大模型训练与推理产品落地
为大模型训练和推理提供可落地的稀疏化压缩方案。
在真实 LLM / VLM / 推荐模型场景中验证稀疏化收益。
支持云端和端侧推理场景中的延迟、吞吐、显存和能耗优化。
与产品和工程团队合作,将稀疏算法转化为可复用的系统能力。
建立从算法研究、Kernel 实现、模型评测到产品部署的闭环。 典型落地方向包括:
LLM 推理加速
长上下文 KV Cache 优化
多模态模型稀疏推理
推荐系统稀疏特征交互
端侧模型压缩与部署
科学计算 / 图计算中的稀疏线性代数优化 ─── 4. 技术壁垒、论文专利与生态影响力建设
规划公司稀疏计算方向的中长期技术路线图。
形成高价值专利组合,构建公司在稀疏大模型和 AI 芯片协同优化方向的技术壁垒。
以公司名义推动高质量论文、技术报告或开源项目。
参与 PyTorch、Triton、CUTLASS、TVM、MLIR、DeepSpeed、vLLM 等相关生态建设。
与高校、大模型团队、芯片团队和开源社区建立合作,提升公司在高效 AI 计算方向的行业影响力。
作为技术负责人,吸引和培养稀疏计算、大模型系统和 AI 芯片方向的高端人才。 ─── 任职要求 必选要求
计算机科学、人工智能、电子工程、计算机体系结构、高性能计算或相关方向博士,或具备同等研究和工程影响力。
在稀疏计算、模型压缩、高效训练、大模型推理优化、AI 芯片协同优化等方向有深入研究或工业落地经验。
熟悉大模型训练和推理的核心性能瓶颈,理解模型结构、算子性能、显存带宽和硬件利用率之间的关系。
熟悉 PyTorch 训练与推理框架,能够进行底层性能分析和算法原型实现。
熟悉 CUDA、Triton、CUTLASS、TVM、MLIR 或其他高性能算子开发工具之一。
具备将算法从研究原型推进到真实模型、真实系统或真实硬件平台中的经验。
具备较强的技术判断力,能够评估稀疏方案是否真正带来端到端收益,而不只是理论指标提升。
具备跨团队协作能力,能够与模型、系统、编译器、Kernel 和芯片架构团队共同推进复杂技术项目。 ─── 优先考虑
博士毕业于美国或全球知名高校 CS / AI / EE / Computer Architecture 相关方向,CMU、斯坦福、MIT、Berkeley、UIUC、UT Austin、UW、Princeton、Harvard、Georgia Tech、Cornell、ETH、EPFL、清华、北大等背景优先。
在 NeurIPS、ICML、ICLR、MLSys、ASPLOS、HPCA、ISCA、SC、OSDI、SOSP 等会议发表过稀疏计算、模型压缩、高效训练、AI 系统或计算机体系结构相关论文。
有 LLaMA、Qwen、Mixtral、DeepSeek、GPT 类模型的训练、微调、压缩或推理优化经验。
熟悉 Activation Sparsity、N:M Sparsity、2:4 Sparsity、4:8 Sparsity、64:16 Sparsity 或其他硬件友好型稀疏模式。
有大模型稀疏训练、稀疏推理、Sparse Fine-tuning、Sparse Attention、Sparse MLP、Sparse MoE、Sparse Backpropagation 等方向经验。
熟悉 FlashAttention、PagedAttention、KV Cache 优化、Speculative Decoding、TensorRT-LLM、vLLM、DeepSpeed、Megatron-LM 等技术或框架。
有 GPU、NPU、TPU、FPGA 或自研 AI 芯片上的算子优化经验。
熟悉 NVIDIA Sparse Tensor Core、AMD CDNA、GPU Tensor Core、片上缓存、访存优化或 AI 加速器数据流设计。
参与过 PyTorch、Triton、CUTLASS、DeepSpeed、vLLM、TensorRT-LLM、TVM、MLIR 等开源项目。
有带领小型研究团队、跨团队技术项目或产学研合作项目的经验。
有高价值专利、开源项目、工业标准、政府科研项目或大型技术合作项目经验者优先。 ─── 我们希望你具备的特质
对大模型计算成本和硬件效率有强烈兴趣。
不满足于只做论文指标,更关注真实系统中的端到端性能收益。
能够同时理解算法创新、工程实现和硬件约束。
能够在不确定的技术方向中做出判断,并带领团队持续推进。
具备国际化技术视野,能够连接学术界、工业界和开源社区资源。
Work arrangement
Yes
More openings worth a look
Recently tracked roles with full details and direct application links.