calendar_today 12.08.2026 -
person
- timer ~5 Minutos
El gigante verde ha lanzado NVIDIA Nemotron 3.5 Lightning, un modelo de IA gratuito y de código abierto que se define como «open-weight». ¿Qué significa esto? Pues muy sencillo, que estamos ante un modelo de IA cuyos componentes clave se publican de manera abierta, lo que significa que no solo puede ser descargado por cualquier persona, sino que además podemos ejecutarlo en local y modificarlo para adaptarlo a nuestras necesidades.
Este lanzamiento coloca a NVIDIA en una posición aventajada dentro de lo que podemos considerar como la IA de código abierto, porque además este modelo es considerado como el más eficiente de su clase para ejecutar cargas de trabajo de IA agéntica. Además viene acompañado de una herramienta llamada NeMo Switchyard, que viene a ser una biblioteca de código abierto para enrutamiento inteligente integrada en herramientas de IA agéntica muy conocidas.

Esa herramienta se puede utilizar, por ejemplo, para crear un enrutador adaptado a nuestras necesidades concretas, ya que cuando se implementa puede dirigir de forma inteligente cada petición al modelo que identifique como el más adecuado y capaz, eligiendo entre todos los modelos que estemos utilizando, ya sean propietarios, de NVIDIA o de código abierto de otras marcas. Esto es muy importante, ya que le confiere una gran versatilidad, y sin que tengamos que reescribir nuestras aplicaciones.
Cuando trabajan juntos, Nemotron 3.5 Lightning y NeMo Switchyard nos permiten disfrutar de un mayor control sobre cómo se implementa la IA, dónde se ejecuta y con qué eficiencia funciona, en PC, estaciones de trabajo, centros de datos y la nube. Es muy interesante porque este modelo, y dicha herramienta, se pueden ejecutar sin problemas incluso en un PC a nivel local, siempre que contemos con la potencia necesaria, claro está.
Claves detrás de NVIDIA Nemotron 3.5 Lightning

- Es un modelo gratuito y de código abierto, pequeño y especializado que puede realizar tareas específicas como la revisión de código, el uso de herramientas, la monitorización de alertas de seguridad y la respuesta a preguntas sobre facturación, entre otras.
- Es un modelo totalmente personalizable, diseñado para tareas de alto volumen que impulsan agentes siempre activos. Fue desarrollado con contribuciones de la Coalición Nemotron, cuyos miembros proporcionaron metodologías de evaluación, software de inferencia y conjuntos de datos para ayudar a perfeccionar el modelo.
- Su velocidad de respuesta es hasta cuatro veces superior cuando se compara con otros modelos, lo que le permite terminar las tareas un 30 % más rápido en comparación con otros modelos de su nivel. A esto tenemos que sumar que, gracias a su diseño abierto y personalizable, Nemotron 3.5 Lightning se puede entrenar fácilmente con NVIDIA NeMo utilizando los datos, herramientas y flujos de trabajo propios para especializarlo en cosas concretas.
- Como dije anteriormente, es un modelo creado para tareas especializadas dentro de sistemas multiagente más grandes. Nemotron 3.5 Lightning parte de un concepto de modelo de «mixture of experts» de 30 mil millones de parámetros que permite crear aplicaciones agénticas más inteligentes y eficientes. ¿Qué es «mixture of experts»? Pues un modelo de IA que utiliza varios submodelos especializados, considerados como «expertos» para gestionar tareas de una manera más eficiente que un modelo de IA monolítico.
- Este modelo también ofrece un mayor control a nivel de implementación y de privacidad. Funciona sin problema en sistemas de IA locales, como PCs equipados con una tarjeta gráfica GeForce RTX, equipos NVIDIA DGX Spark, NVIDIA DGX Station e incluso sobre NVIDIA Jetson, lo que significa que es muy asequible y que puede convertirse en un aliado importante para rentabilizar nuestras inversiones en hardware sin tener que comprar nuevos componentes.
Un vistazo al rendimiento en números: el valor de NVIDIA NeMo Switchyard
NVIDIA está colaborando con socios dentro de todo el ecosistema de IA para integrar el enrutamiento inteligente de modelos en las herramientas y plataformas que los desarrolladores ya utilizan, y los resultados están siendo muy positivos, como vamos a ver a continuación:
- Boomi: evaluó Switchyard en cinco capacidades de enrutamiento, logrando una precisión del 100 % en el enrutamiento de dominios, enviando el 59% del tráfico a un modelo optimizado cinco veces más rápido y reduciendo la latencia de los últimos turnos en un 21%.
- Cadence: mejoró la eficiencia en un 9,9% mediante el uso del ChipStack AI Super Agent para un caso de uso de verificación formal.
- Classmethod: ejecuta internamente cargas de trabajo de OpenCode y Fireworks con NeMo Switchyard, y las pruebas iniciales muestran una reducción de costes del 27% manteniendo la calidad.
- Cognition: integró el enrutador por etapas NVIDIA NeMo Switchyard en Devin Desktop para uso interno de NVIDIA, logrando un rendimiento casi de vanguardia en FrontierCode Main y reduciendo el coste medio en un 28 % en comparación con el enrutamiento de todas las solicitudes a un único modelo de vanguardia subyacente.
- Kong: ofrece enrutamiento con NeMo Switchyard de forma nativa a través de Kong AI Gateway.
- LangChain: con NeMo Switchyard, logró una reducción del 74% en el costo en 145 tareas de Deep Agents de múltiples turnos, al enrutar solo el 7% de las llamadas a un modelo de vanguardia, con una pérdida de precisión del 6%.
- LiteLLM: está incorporando NeMo Switchyard como un complemento a su capa de proxy para que los desarrolladores puedan acceder a estas ventajas sin modificar su infraestructura existente.
- Nous Research: integró NeMo Switchyard en Hermes para proporcionar a los desarrolladores un sistema de enrutamiento fácil de configurar que mejora la eficiencia de los agentes.
- Ramp: utilizó NeMo Switchyard para igualar el rendimiento de un modelo de vanguardia, reduciendo los costos en un 58% y está realizando pruebas de rendimiento para mejorar la eficiencia de su agente de IA Fuse EDA.
Viendo estos resultados, y el potencial de NVIDIA Nemotron 3.5 Lightning, está claro que el presente y el futuro de la IA agéntica pasa por los modelos abiertos, gratuitos, especializados y con enrutado inteligente para optimizar las cargas de trabajo.
Editor de la publicación on-line líder en audiencia dentro de la información tecnológica para profesionales. Al día de todas las tecnologías que pueden marcar tendencia en la industria.