NVIDIA Nemotron 3.5 Lightning
NVIDIA 的开放式 30B 混合 MoE 语言模型,面向需要高速推理、工具调用和长时间运行 Agent 的开发者,提供可定制的模型权重、数据与配方。
工具简介
初步判断:值得让需要本地或可控推理的团队试用,但现有证据还不足以支持直接把它设为生产环境默认模型。它的定位清晰,重点是速度、工具调用和长期运行的 Agent,而不是单纯追求聊天体验或通用文本生成的最大质量。更稳妥的采用方式是先在自身任务上做小规模评测,再决定是否替换现有模型。
实际作用上,它是一个 30B 参数、约 3B 参数激活的混合 MoE 语言模型,目标是用较低的每次激活规模换取较快推理,并服务于工具驱动的自动化流程。NVIDIA 的社媒信息称其开放并可定制,包含权重、数据和训练配方;OpenRouter 和 Ollama 的社媒信息则表明它已经进入相应的调用或本地运行渠道。NVIDIA Robotics 还在社媒中给出 Jetson AGX Thor 平均 115 tokens/s 的说法,但这属于官方社媒宣传口径,不应视为所有硬件和工作负载下的稳定结果。
门槛方面,证据没有提供官方 API 定价、托管费用、硬件最低配置或稳定吞吐承诺,因此不能据此判断云端调用成本。若自行部署,计算资源、显存或内存、模型下载、量化、运行时兼容和运维成本都需要自行核算;这是基于开放权重模型的一般保守推断,不是官方报价。通过 OpenRouter 使用可能减少部署工作,但给定材料没有价格或配额信息。适合希望控制模型、研究 Agent 工具链、在本地设备上测试长期运行任务的开发者;不适合只想获得开箱即用聊天界面、无需部署的普通用户。
它不是一个完整的 Agent 产品、代码 IDE,也不是等同于 Claude Code 的托管服务;更准确的类比是可被 Ollama、OpenRouter 或自有推理栈调用的模型底座。热度方面,榜单数据记录了 18 条 X 提及、约 178.9 万次浏览和 7,544 次互动,这能证明发布受到关注,但不能证明好用。可用性证据主要是 NVIDIA、OpenRouter、Ollama 等发布帖,以及少量早期访问和 DGX Spark 演示;其中一条实测认为它适合 Agent 和媒体编辑任务,但编码表现一般,另有帖子转述其编码准确率和速度优势。整体讨论以转发和短帖为主,缺少系统基准、长教程、代码复现和充分评论,样本有限且结论存在分歧,因此应把社媒共识视为试用线索,而不是能力定论。
这个工具还没有可展示的社媒关联内容。