AI Infra模型推理加速工程师
岗位描述: 1、核心职责:负责音频生成大模型(Language Model / DiT / Flow)的全链路工程化部署与推理加速,打通从研发到生产的快速迭代通道,确保模型高效、稳定落地。 2、性能优化:精通性能剖析工具(如 torch Profiler、Nsight Systems、NCU),系统性定位计算、内存、IO瓶颈。综合运用CUDA编程、高性能算子开发(Triton/TileLang等)、并行计算策略,实现推理速度与吞吐量的显著提升。 3、框架适配与服务化:主导 vLLM、SGlang、TensorRT-LLM、vllm-omni、sglang-diffusion 等前沿推理框架的接入、深度定制与性能调优,针对音乐生成长序列、高并发场景进行专项优化,构建高可用、低延迟的推理服务。 4、技术攻关:深入理解并应用针对音频生成模型的加速技术,包括但不限于 KV Cache优化、Flash Attention、FlashInfer、torch compile、torchao、Cache-DiT 等,有效解决长序列生成中的显存与实时性挑战。 5、前沿探索:持续跟踪音频/音乐生成
招聘公告与岗位信息
所属企业:TT语音
招聘批次:社招/日常
截止时间:2026-12-31
学历要求:硕士
工作地点:广州
发布时间:2026-09-08
招聘方向
AI Infra模型推理加速工程师
投递提示
点击右侧「立即投递」前往官方网申渠道;投递前请核对岗位、城市与截止时间。
说明:以上内容依据原始公告字段整理,完整信息以官方公告原文(job)为准。
截止时间:2026-12-31
招聘流程
截止时间:2026-12-31
点击右侧「立即投递」前往官方网申渠道。
投递建议
在正式投递 TT语音 前,建议回到原始招聘公告再次核对投递渠道、截止时间、城市范围和学历要求,尤其留意图片中的补充说明。
如果你同时在看多条校招,建议先处理与 TT语音 匹配度最高、时间要求最明确的岗位,再做海投扩展,避免在信息不完整的职位上投入过多时间。
准备 TT语音 相关简历时,优先保留和岗位关键词、业务方向、目标城市最相关的经历,弱相关内容可以下沉到后半部分。
常见问题 FAQ
建议先看 4 件事:岗位方向是否匹配、城市是否可接受、学历和毕业时间是否符合、投递截止时间是否紧张。如果这 4 项都大致匹配,再花时间优化简历和准备笔面试,投入产出会更高。