NVIDIA扩展Vera Rubin系统支持智能体推理
NVIDIA宣布Vera Rubin NVL72系统全面生产,集成Groq 3 LPX以加速智能体系统的长上下文推理。基准测试显示其在Gemma 4 31B模型上输出速度达3400 token/秒,比竞品快4倍。
开发者需关注该硬件平台对长上下文和多智能体协作的性能提升,评估是否将其纳入高吞吐量推理基础设施的选型方案。
- NVIDIA Vera Rubin NVL72系统已全面投产并集成Groq 3 LPX
- Gemma 4 31B模型在10万token上下文中输出速度达3400 tokens/秒
- 推理性能比最接近的替代平台快4倍