想象你正在设计一个下一代语言模型。你熟练地调整注意力头数、层数、隐藏维度,在 GPU 上反复实验,寻找最佳配置。但如果我告诉你,换一块芯片,所有这些经验可能都要推翻?AWS Trainium Frontier 竞赛正是这样一个实验场:它让你在 AWS 自研的 Trainium 芯片上从头训练语言模型,探索当硬件约束根本不同时,什么架构才是最优的。
为什么硬件变化会动摇模型设计?现代 LLM 架构与硬件是共同进化的。注意力机制的形状、MLP 的结构、数值格式的选择、并行策略的粒度,都受到硬件限制的塑造:warp 大小、张量核心几何、内存层次、芯片暴露的内核抽象。当硬件改变,模型架构的高效前沿也随之改变。Trainium 提供了与 GPU 截然不同的设计表面:更多的片上 SRAM(SBUF,一种高速暂存器,相当于 GPU 共享内存但容量更大)、显式的软件控制数据移动、节能的脉动矩阵乘法(systolic matmul,一种高效计算矩阵乘法的硬件实现)、以及针对训练和推理规模数据流设计的内存层次。这些差异导致性能瓶颈转移:在 GPU 上内存受限的操作(如某些注意力计算)在 Trainium 上可能变成计算受限,从而允许用更多计算换取更少内存访问的架构设计。
竞赛的核心任务是从头训练一个语言模型,起点是一个约 50M 参数的基线模型(基于 nanochat,GPT 风格密集 LLM,使用 RMSNorm 归一化、旋转位置嵌入和 ReLU² 激活的 MLP)。参与者可以修改一切:架构、优化器、训练循环,甚至编写自定义 NKI 内核。NKI(Neuron Kernel Interface)是 Trainium 的内核编程接口,允许直接控制硬件特性:SBUF 暂存器、TensorEngine 分块、显式 DMA 数据传输。这些是标准框架(如 PyTorch 原生)无法暴露的底层能力。NKI 的学习曲线很平缓,整个 API 可以在一个周末掌握,既适合手写内核,也适合 AI 代理自动生成。
AWS 为参赛者提供了完整的工具链:一个基于 nanochat 的训练流水线,内置 Muon+AdamW 优化器,可直接在 NeuronCore 上运行;一个自动研究框架,支持 AI 辅助实验;完整的 NKI 文档(编程指南、ISA 参考、架构文档和示例内核);Neuron Explorer 性能分析工具,用于 NKI 内核的详细 profiling 和调试;以及 CORE 评估工具,用于阶段 2 的推理自评分。此外,学术团队可获得 AWS 积分覆盖 Trainium 计算和 Amazon Bedrock 访问。所有这些都旨在让参赛者专注于创新,而不是环境搭建。
竞赛分为两个阶段。阶段 1:每个团队使用一个 Trainium2 芯片,训练预算 30 分钟。评分指标只有一个:验证 bits-per-byte(val_bpb,衡量模型对验证集压缩效率的指标,越低越好)。任何能在 30 分钟内带来改进的方法都算数,无论是架构、优化器、内核还是三者组合。阶段 2:前 10 名团队升级到完整的 Trainium2 服务器,训练预算 4 小时,并加入第二个评分轴:推理性能 CORE(一个综合评分,涵盖推理、理解、世界知识等上下文学习任务)。最终得分是 50/50 复合,意味着模型既要训练高效,又要学会推理。
最有趣的设计约束是:模型大小不设上限。限制不是参数量,而是芯片时间。你需要在固定的训练窗口内选择最大化能力的架构。这反转了通常的扩展范式——不是「在给定参数预算下优化」,而是「在给定时间预算下优化」。这迫使团队真正理解硬件特性:更好的架构可以减少达到目标性能所需的步骤,但更快的内核可以在相同时间内完成更多步骤。获胜方案必须找到这个权衡的最优平衡点。
这个竞赛对参与者开放多种背景:ML 架构研究人员可以探索新架构;系统研究人员可以编写高效内核;使用 AI 代理的团队可以利用自动化进行大规模探索。团队规模 1-4 人,鼓励跨学科合作。即使没有硬件内核经验,也能在 ML 层面竞争;熟悉 CUDA 或 Triton 的开发者可以快速上手 NKI。
奖项方面:前三名将在 NeurIPS 2026 悉尼的 Annapurna Labs 研究活动上展示成果,有机会与 AWS 芯片团队合著论文。奖金池 $25,000(第一名)、$10,000(第二名)、$5,000(第三名)。关键日期:2026 年 8 月 31 日阶段 1 开始,9 月 30 日截止;10 月 7 日阶段 2 开始,11 月 4 日截止;11 月 11 日选出决赛选手;12 月 6-12 日悉尼研讨会。
这个竞赛的意义不仅在于奖金或论文。它提供了一个独特的研究弧线:从「我的想法有效吗?」到「我的想法可扩展吗?」。对于整个 ML 社区,它提醒我们:硬件多样性正在增加,模型设计不能只依赖单一硬件平台。即使你不参赛,理解 Trainium 的设计思路也能帮助你思考硬件与模型的协同设计——当你的模型在推理时遇到瓶颈,也许换个硬件视角就能找到突破。而这一切,从一场 30 分钟的训练开始。
内容与图片版权归原作者所有 · 原文: https://www.amazon.science/news/aws-trainium-frontier-competition-co-design-models-and-kernels-on-purpose-built-ai-chips