saintube's repos on GitHub
C++ · 9 watchers
gem5-dscp
DSCP is a dynamic secure cache partitioning implementation on gem5. The code includes a ScatterCache (USENIX SECURITY'19) variant and it is partially available to reproduce set partitioning.
Python · 1 watchers
Kube-Test
run testing experiments and CI pipelines on Kubernetes and GitHub Actions
1 watchers
over-golang
Golang笔记:[进度80%]Go语法、Go并发思想、Go与web开发、Go微服务设施等
Ruby · 1 watchers
rails_sample_app
a sentiment analysis based car forum
Smarty · 1 watchers
run-kube-test
Run tests in Kubernetes by Github Actions
0 watchers
apis
Koordinator related API types and clients
Go · 0 watchers
cgroup-parser
a commandline tool writing for parsing linux cgroup files
Mustache · 0 watchers
charts
Koordinator Helm Charts.
Java · 0 watchers
dragonwell8
Alibaba Dragonwell8 JDK
0 watchers
enhancements
Enhancements tracking repo for Kubernetes
CSS · 0 watchers
EvadeML
An evolutionary framework for evading machine learning-based malware classifiers.
Go · 0 watchers
koordinator
QoS based scheduling system for hybrid orchestration workloads on Kubernetes, bringing workloads the best layout and status.
Go · 0 watchers
kubernetes
Production-Grade Container Scheduling and Management
C++ · 0 watchers
multiwalk
a graph computing implement of network embedding algorithm, which uses GraphLite to compute the random walk sequence
Go · 0 watchers
node-problem-detector
This is a place for various problem detectors running on the Kubernetes nodes.
JavaScript · 0 watchers
website
Koordinator documentations and website.
0 watchers
website-1
Kubernetes website and documentation repo:
0 watchers
zsim
A fast and scalable x86-64 multicore simulator
saintube

saintube

🏢  ISCAS
V2EX member #399471, joined on 2019-04-08 11:56:13 +08:00
Per saintube's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
saintube's recent replies
---

# 大规模模型训练的调度与框架协同优化-阿里星/A Star

## 基础信息

毕业起止时间要求:2026-11-01 - 2027-10-31

## 职位描述

1. 设计和开发面向大规模模型训练的智能调度系统,实现调度器与训练框架( Megatron-LM 、DeepSpeed 、FSDP )的深度协同,使资源分配能够感知并行策略拓扑、通信模式和显存需求,提升集群级训练效率和资源利用率;
2. 研究和实现万卡级训练的高可用与弹性机制,包括快速故障检测与自动诊断、智能恢复策略(冗余计算、在线重配)、弹性伸缩(节点增减时自动调整并行策略)、高效 checkpoint (增量/异步/分层存储)等,提升训练稳定性和有效训练时间占比;
3. 探索自动并行策略搜索与动态调整技术,基于性能建模、执行模拟或在线 profiling ,自动选择和优化 DP/TP/PP/SP/CP/EP 的多维并行组合,适应异构集群和动态资源环境,降低人工调参成本;
4. 参与 PAI-DLC 训练平台核心能力建设,将技术成果沉淀为可产品化的训练调度和稳定性能力,支撑集团内部和云上客户的大模型训练需求;
5. 有一定的技术前瞻性,可以对平台演进中的技术需求(如多阶段训练流水线编排、训练-推理混合调度、异构集群适配等)进行预研和设计。

## 职位要求

1. 具备扎实的计算机基础知识和分布式系统研发经验,C++/Python 编程能力强,对操作系统原理、计算机网络、分布式一致性等系统领域知识有较好的理解和项目应用经验。
2. 熟悉深度学习基本原理和主流深度学习框架( PyTorch ),了解分布式训练的基本并行策略( DP/TP/PP/EP )和通信原语( NCCL 、AllReduce 、P2P )。
3. 熟悉 Megatron-LM 、DeepSpeed 、TransformerEngine 、DualPipe 等训练框架技术,并在研究或实习项目中有相应的实践经历。
4. 具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心。

加分项:
1. 有很强的学术研究能力和优秀的学术成果(分布式系统/AI 系统/高性能计算领域顶会/顶刊论文);
2. 熟悉集群调度系统( Kubernetes 、YARN 、自研调度器)的设计与实现;
3. 有万卡级大模型训练实战经验,了解训练中的故障模式和稳定性优化;
4. 作为核心贡献者参与开发或负责维护 AI 领域的流行开源项目。

---

# 通义大模型-Token Foundry-AI Infra 工程师

## 基础信息

- 毕业起止时间要求:2026-11-01 - 2027-10-31

## 职位描述

在这里,你将成为大模型技术落地的“幕后推手”。你将参与构建支撑千卡/万卡规模的 AI 计算基础设施,通过软硬件协同优化,解决大模型在训练、推理、调度全链路中的工程挑战。你的代码将直接决定大模型训练的效率、推理的响应速度以及集群资源的利用率,为 AI 时代的算力底座注入核心动力。

具体的职责包括以下相关方向的一项或多项:
1. 算力基建与分布式训练:
- 深入分布式训练架构,优化通信与底层算子性能,解决大规模集群通信瓶颈,提升模型训练的吞吐量与计算效率。参与研究新的训练框架和模式。
极致推理加速:
- 针对大规模推理场景,研发高性能推理引擎,通过 kernel 、框架、与算法结合的有损优化等手段,实现极致的低延迟与高并发。
2. 智能化资源调度与系统:
- 构建大规模 GPU 集群的统一调度与编排系统,实现算力资源的弹性分配与自动化调度,设计与优化面向 AI 计算场景的高性能通信、存储系统,保障海量任务的极致的效率。
3. 工程效率与平台化建设:
- 打造一体化的平台,覆盖大模型研发和迭代的全流程,降低模型迭代门槛,提升研发效能。

## 职位要求

1. 基础条件:
- 计算机、软件工程等相关专业优先。
- 热衷于数据结构和算法、在 ACM 大赛成绩优异者优先;有顶会论文/高影响项目/开源贡献者加分。
2. 专业能力:
- 系统工程与编程能力:具备良好的系统工程基础,熟悉 Linux 开发环境,掌握 Python 、Go 、Java 等至少一门编程语言,具备扎实的工程实现能力。
- 分布式系统:了解分布式系统基本原理(如一致性、容错、扩展性等)。
- AI 系统领域专业知识:对于以下领域中的一项或者多项具备专业能力
- 了解 AI 的基本原理与常见算法,理解模型训练任务的基本流程及其资源需求。
- 了解主流训练推理框架(如 PyTorch 、TensorFlow 、vLLM 、sglang )的基本使用方式及训练流程。
- 了解异构计算或高性能计算体系,有 GPU 相关优化经验者优先。
3. 能力特质:
- 沟通能力:能与跨域岗位,如:算法、产品等,进行良好的沟通。
- 跨域视野:有较宽的技术视野与知识面,对算法研发流程、数据、GPU 调度、训练、推理等相关领域的技术逻辑都有涉猎。
- 系统思维: 乐于挑战复杂系统的性能极限,具备良好的性能分析与调优能力,喜欢从底层视角拆解并解决问题。
- 极客精神:对 AI 大模型技术充满热情,具备快速学习新技术的能力,渴望在高性能计算领域实现技术突破。

---

# 通义大模型-Token Foundry-Agent Infra 工程师

## 基础信息

毕业起止时间要求:2026-11-01 - 2027-10-31

## 职位描述

负责构建支撑 AI Agent 全生命周期的核心基础设施,涵盖设计构建、训练优化、安全部署、高并发调度及服务化交付等,为 Agent 的规模化落地提供稳定、高效、安全的底层能力。

具体职责包括以下相关方向的一项或多项:
1.Agent 基础设施:设计高并发、可扩展的 Agent 框架,覆盖沙箱执行、容器编排、任务调度及状态管理,支持训练优化与安全部署。
2.安全与稳定性:构建沙箱隔离与委托身份认证,确保 API 安全调用,并实现检查点恢复机制保障长任务可靠性。
3.平台服务能力:开发 LLM 上下文预计算、知识检索等优化能力,封装 SDK/API (如向量检索、观测体系)提升推理效率。
4.AI 能力产品化:模块化输出开发套件(如 CLI/SKLLS ),降低 Agent 构建与调优门槛,支持算法迭代优化。
5.技术前瞻与落地:跟踪 Agent 生态技术进展,推动新技术规模化应用,持续优化架构性能与易用性。
目标:通过高效、安全、先进的基础设施,实现 AI Agent 从开发到生产的全流程支持,加速规模化落地。

## 职位要求

1.基础条件:

- 计算机、软件工程、人工智能等相关专业优先。
- 有顶会论文/高影响项目/开源贡献者加分。

2.专业能力:
- 技术基础:扎实的计算机基础( OS/网络/数据库),精通至少一门编程语言( Go/Python/Java/Rust/TypeScript ),熟悉后端技术栈(微服务/消息队列/缓存)及云原生( K8s/Serverless )或安全隔离技术( Docker/gVisor )。
- AI Agent 专精领域:深入理解大模型原理,熟悉至少一种 Agent 框架( LangGraph/ADK/LangChain/AutoGen/MetaGPT 等)或核心组件( RAG/工具调用/SKILLS ),具备 Agent 全生命周期管理(训练/评测/部署)经验,有强化学习或规划算法背景优先。
- Agent Ops 运维实践:掌握 LLMOps (模型版本/监控/部署)及 AgentOps (编排/自愈/状态管理),熟悉可观测性系统(链路追踪/日志分析)。
- 工程与交付能力:擅长 AI Coding 快速原型开发,熟悉测试与变更管理( CI/静态分析),有高并发优化或多租户隔离经验。

3.能力特质:
- 对 AI 原生应用有热情,能复现前沿技术;追求简洁可扩展的架构,沟通协作能力强。
加分项:
- 有 Agent 优化实战经验、参与 Agent 平台开发、熟悉上下文工程或多 Agent 协同系统。
团队多个校招岗位在招,校招刚启动,hc 充足,欢迎投递~
顶一下,阿里星岗位仍在热招中~

我们团队新开的通义 ATH 的暑期实习岗位也欢迎投递:


# 通义 ATH-AI Infra 工程师(实习)

## 基础信息

- 毕业起止时间要求:2026-11-01 - 2027-10-31
- 笔试方向:阿里巴巴集团 27 届 - 工程方向

## 职位描述

在这里,你将成为大模型技术落地的“幕后推手”。你将参与构建支撑千卡/万卡规模的 AI 计算基础设施,通过软硬件协同优化,解决大模型在训练、推理、调度全链路中的工程挑战。你的代码将直接决定大模型训练的效率、推理的响应速度以及集群资源的利用率,为 AI 时代的算力底座注入核心动力。

具体的职责包括以下相关方向的一项或多项:

1. 算力基建与分布式训练:
- 深入分布式训练架构,优化通信与底层算子性能,解决大规模集群通信瓶颈,提升模型训练的吞吐量与计算效率。参与研究新的训练框架和模式。
极致推理加速:
- 针对大规模推理场景,研发高性能推理引擎,通过 kernel 、框架、与算法结合的有损优化等手段,实现极致的低延迟与高并发。
2. 智能化资源调度与系统:
- 构建大规模 GPU 集群的统一调度与编排系统,实现算力资源的弹性分配与自动化调度,设计与优化面向 AI 计算场景的高性能通信、存储系统,保障海量任务的极致的效率。
3. 工程效率与平台化建设:
- 打造一体化的平台,覆盖大模型研发和迭代的全流程,降低模型迭代门槛,提升研发效能。

## 职位要求

1. 基础条件:
- 计算机、软件工程等相关专业优先。
- 热衷于数据结构和算法、在 ACM 大赛成绩优异者优先;有顶会论文/高影响项目/开源贡献者加分。
2. 专业能力:
- 系统工程与编程能力:具备良好的系统工程基础,熟悉 Linux 开发环境,掌握 Python 、Go 、Java 等至少一门编程语言,具备扎实的工程实现能力。
- 分布式系统:了解分布式系统基本原理(如一致性、容错、扩展性等)。
- AI 系统领域专业知识:对于以下领域中的一项或者多项具备专业能力
- 了解 AI 的基本原理与常见算法,理解模型训练任务的基本流程及其资源需求。
- 了解主流训练推理框架(如 PyTorch 、TensorFlow 、vLLM 、sglang )的基本使用方式及训练流程。
- 了解异构计算或高性能计算体系,有 GPU 相关优化经验者优先。
3. 能力特质:
- 沟通能力:能与跨域岗位,如:算法、产品等,进行良好的沟通。
- 跨域视野:有较宽的技术视野与知识面,对算法研发流程、数据、GPU 调度、训练、推理等相关领域的技术逻辑都有涉猎。
- 系统思维: 乐于挑战复杂系统的性能极限,具备良好的性能分析与调优能力,喜欢从底层视角拆解并解决问题。
- 极客精神:对 AI 大模型技术充满热情,具备快速学习新技术的能力,渴望在高性能计算领域实现技术突破。
再顶一下,欢迎联系~
自顶一下,hc 充足,欢迎投递和交流~
还没有招满,欢迎大家投递~
热招中,欢迎大家踊跃投递~
@fengsi 我这边没听说,不过学生背景确实在初筛阶段会有一定权重。我们欢迎有对口技术背景和对这方面兴趣较强的同学投递,即使面试没有通过,我们也会争取为你转到合适的部门。
目前实习还在热招中,并非 kpi 面,对 Kubernetes 、容器、调度、AI Infra 感兴趣的同学欢迎投递~
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3828 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 12ms · UTC 00:07 · PVG 08:07 · LAX 17:07 · JFK 20:07
♥ Do have faith in what you're doing.