InicioAILos modelos de IA agéntica de NVIDIA alcanzan una velocidad 4 veces...

Los modelos de IA agéntica de NVIDIA alcanzan una velocidad 4 veces mayor con Nemotron 3.5 Lightning

NVIDIA está avanzando aún más en los modelos de IA agéntica con el lanzamiento de Nemotron 3.5 Lightning, un nuevo modelo abierto creado específicamente para el tipo de tareas siempre activas y de alto volumen que los agentes de IA autónomos gestionan ahora las 24 horas del día. Junto con él, la compañía lanzó NeMo Switchyard, una herramienta de enrutamiento de código abierto diseñada para enviar cada solicitud de IA al modelo que pueda manejarla de forma más rápida y económica. En conjunto, estos dos lanzamientos marcan el último intento de NVIDIA por hacer que los sistemas de IA agéntica no solo sean más inteligentes, sino realmente eficientes de ejecutar a escala.

Conclusiones clave

  • NVIDIA lanzó Nemotron 3.5 Lightning, un modelo abierto de mezcla de expertos de 30.000 millones de parámetros creado para cargas de trabajo de IA agéntica de alto volumen.
  • El modelo ofrece hasta 4 veces más velocidad de salida y un 30% más de rapidez en la finalización de tareas que modelos comparables de su categoría.
  • NVIDIA también lanzó NeMo Switchyard, una biblioteca de enrutamiento de código abierto que puede reducir los costos de finalización de tareas a casi un tercio de lo que costaría usar solo un modelo de frontera.
  • Nemotron 3.5 Lightning se ejecuta localmente en PCs NVIDIA RTX, DGX Spark, DGX Station y Jetson, o escala a centros de datos y a la nube.
  • Ambos lanzamientos son abiertos, personalizables y ya cuentan con el respaldo de socios del ecosistema como CrowdStrike, Harvey, CodeRabbit y Lila Sciences.

NVIDIA lanza Nemotron 3.5 Lightning para cargas de trabajo de IA agéntica

Nemotron 3.5 Lightning es la incorporación más reciente a la familia Nemotron 3 de NVIDIA, y la compañía lo describe como el modelo más eficiente de su clase para tareas agénticas de larga duración. Llega después de Nemotron 3 Nano y continúa un patrón que NVIDIA ha seguido con cada lanzamiento de Nemotron: priorizar pesos abiertos, personalización y velocidad bruta por encima del tamaño absoluto.

Un modelo de 30.000 millones de parámetros creado para la velocidad

Nemotron 3.5 Lightning es un modelo de mezcla de expertos de 30.000 millones de parámetros, lo que significa que activa solo las partes de su red necesarias para una tarea determinada en lugar de ejecutar el modelo completo cada vez. Esa decisión de diseño se refleja directamente en el rendimiento: NVIDIA afirma que el modelo ofrece hasta 4 veces más velocidad de salida, lo que se traduce en un 30% más de rapidez en la finalización de tareas agénticas en comparación con otros modelos de su misma categoría de tamaño. Según las pruebas internas PinchBench citadas por NVIDIA, esas ganancias de velocidad se obtienen sin sacrificar precisión con respecto a modelos pares.

El modelo está diseñado para un rol específico dentro de sistemas más grandes de múltiples agentes. En lugar de intentar planificar por sí solo todo un flujo de trabajo, Nemotron 3.5 Lightning está pensado para manejar trabajos estrechos, repetitivos y de alto volumen, el tipo de trabajo que se acumula rápidamente cuando un agente de IA se ejecuta de forma continua en lugar de responder a indicaciones ocasionales.

Personalización y postentrenamiento para precisión específica de dominio

Debido a que Nemotron 3.5 Lightning es abierto, las organizaciones pueden postentrenarlo usando NVIDIA NeMo con sus propios datos de dominio, herramientas internas y flujos de trabajo. Esta personalización de modelos de IA abiertos es central en la forma en que NVIDIA está posicionando el lanzamiento: en lugar de un modelo único para todos, las empresas obtienen una base que puede adaptarse a un trabajo específico, ya sea analizar contratos legales o marcar alertas de seguridad.

Varias empresas ya han hecho exactamente eso. CrowdStrike está personalizando el modelo para cargas de trabajo de ciberseguridad, Harvey está trabajando con Trajectory en aplicaciones de servicios legales y CodeRabbit lo combinó con Baseten para revisión automática de código. Lila Sciences lo está utilizando para mejorar el razonamiento en tareas de ciencias físicas y de la vida, mientras que Fastino Labs informa de una precisión líder tras ajustar el modelo para cargas de trabajo de desarrollo de software, finanzas y atención médica. NVIDIA afirma que el modelo se desarrolló con aportes de la Nemotron Coalition, cuyos miembros contribuyeron con metodologías de evaluación, software de inferencia y conjuntos de datos que ayudaron a dar forma al lanzamiento final.

NeMo Switchyard lleva el enrutamiento inteligente a los agentes de IA

NeMo Switchyard resuelve un problema que empeora a medida que los sistemas agénticos escalan: depender de un único modelo predeterminado o bien desperdicia dinero en tareas que no necesitan un razonamiento pesado, o bien perjudica la calidad cuando se le pide demasiado a un modelo ligero. La respuesta de NVIDIA es una biblioteca de código abierto que decide automáticamente, solicitud por solicitud, qué modelo debe encargarse del trabajo.

Reducción de costos con selección dinámica de modelos

NeMo Switchyard enruta cada paso del flujo de trabajo de un agente al modelo más capaz y rentable para esa tarea específica, sin requerir que los desarrolladores reescriban sus aplicaciones. Los desarrolladores pueden ajustar o sustituir el algoritmo de enrutamiento según lo que más les importe: latencia, calidad o costo. Los benchmarks internos de NVIDIA muestran que este enfoque de enrutamiento de NeMo Switchyard mantiene una precisión cercana a la de modelos de frontera mientras reduce el costo de finalización de tareas a casi un tercio de lo que costaría ejecutar todo solo con Opus 4.8.

Esa diferencia importa. En sistemas donde los agentes se ejecutan de forma continua, la diferencia entre enrutar de forma inteligente y recurrir por defecto a un solo modelo se acumula rápidamente a lo largo de miles de tareas diarias, convirtiendo lo que parece una modesta ganancia de eficiencia en una reducción significativa del costo operativo con el tiempo.

Integración en todo el ecosistema de IA

NVIDIA ya está trabajando con una amplia gama de socios para llevar este tipo de enrutamiento directamente a las herramientas que los desarrolladores usan a diario. Los primeros resultados de ese trabajo en el ecosistema ilustran cuánto puede cambiar el enrutamiento el costo y el rendimiento:

  • Boomi logró un 100% de precisión en el enrutamiento por dominio mientras enviaba el 59% del tráfico a un modelo ajustado 5 veces más rápido, reduciendo la latencia de turnos posteriores en un 21%.
  • Cognition integró un enrutador por etapas en Devin Desktop, reduciendo el costo medio en un 28% en comparación con enrutar todo a un único modelo de frontera.
  • LangChain redujo los costos en un 74% en 145 tareas de Deep Agents de múltiples turnos enviando solo el 7% de las llamadas a un modelo de frontera, con un sacrificio de precisión del 6%.
  • Ramp igualó el rendimiento de modelos de frontera mientras reducía los costos en un 58% y el tiempo de ejecución en un 33% en sus pruebas SWE-Bench.
  • Classmethod informó de una reducción de costos del 27% manteniendo la calidad en sus cargas de trabajo opencode y Fireworks.

Kong, LiteLLM, Nous Research, Cadence y Siemens también están integrando o evaluando NeMo Switchyard dentro de sus propias plataformas, desde puertas de enlace de IA hasta verificación formal de chips y agentes de ingeniería.

Flexibilidad de implementación en todo el hardware de NVIDIA

Uno de los mayores argumentos de venta de este lanzamiento es dónde puede ejecutarse realmente Nemotron 3.5 Lightning. Admite implementación local y en la nube en PCs NVIDIA RTX, DGX Spark, DGX Station y dispositivos Jetson, lo que permite a las organizaciones usar el hardware que ya poseen en lugar de trasladarlo todo a la nube. A partir de ahí, escala a estaciones de trabajo RTX PRO, dispositivos perimetrales, centros de datos y entornos completos en la nube para implementaciones empresariales más grandes.

Esa flexibilidad brinda a las organizaciones un control real sobre la privacidad y la latencia. Ejecutar el modelo localmente o en las instalaciones se adapta a tareas especializadas de alto volumen que necesitan respuestas rápidas y un control de datos más estricto, mientras que la implementación en la nube sigue disponible para cargas de trabajo que necesitan escalar bajo demanda.

Datos abiertos y disponibilidad de la plataforma

Como en cada lanzamiento de Nemotron, NVIDIA afirma que publica tantos datos de entrenamiento y técnicas como lo permiten las licencias, dando a investigadores externos una forma de rastrear, auditar e incluso entrenar otros modelos con el mismo material. Junto con Lightning, NVIDIA está lanzando Nemotron-RL-Agentic-Terminal-Pivot, un conjunto de datos de aprendizaje por refuerzo agéntico utilizado para postentrenar el modelo para tareas de agentes de codificación.

Nemotron 3.5 Lightning ya está disponible en Hugging Face, ModelScope y OpenRouter, así como en build.nvidia.com como un microservicio NVIDIA NIM, con un acceso más amplio que llegará a través de NVIDIA Cloud Partners, plataformas de postentrenamiento y proveedores adicionales de servicios en la nube. NeMo Switchyard ya está disponible en GitHub, con soporte para más plataformas de socios previsto próximamente.

Preguntas frecuentes

¿Qué es Nemotron 3.5 Lightning y qué lo hace diferente?

Nemotron 3.5 Lightning es un modelo de IA abierto de 30.000 millones de parámetros optimizado para tareas de IA agéntica de alto volumen, que ofrece hasta 4 veces más velocidad de salida y un 30% más de rapidez en la finalización de tareas que modelos comparables.

¿Cómo mejora NeMo Switchyard la eficiencia de la IA?

NeMo Switchyard es una biblioteca de enrutamiento de código abierto que dirige dinámicamente las solicitudes de IA al modelo más adecuado, reduciendo los costos de finalización de tareas a aproximadamente un tercio en comparación con depender de un solo modelo.

¿Se puede personalizar Nemotron 3.5 Lightning para necesidades específicas de una organización?

Sí. Nemotron 3.5 Lightning puede postentrenarse con los propios datos de una organización usando NVIDIA NeMo para mejorar la precisión en tareas especializadas y específicas de dominio.

¿En qué plataformas está disponible Nemotron 3.5 Lightning para su implementación?

Nemotron 3.5 Lightning admite implementación local y en la nube en PCs NVIDIA RTX, sistemas DGX, dispositivos Jetson y perimetrales, y está disponible en plataformas como Hugging Face, ModelScope, OpenRouter y NVIDIA Cloud Partners.

{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»¿Qué es Nemotron 3.5 Lightning y qué lo hace diferente?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Nemotron 3.5 Lightning es un modelo de IA abierto de 30.000 millones de parámetros optimizado para tareas de IA agéntica de alto volumen, que ofrece hasta 4 veces más velocidad de salida y un 30% más de rapidez en la finalización de tareas que modelos comparables.»}},{«@type»:»Question»,»name»:»¿Cómo mejora NeMo Switchyard la eficiencia de la IA?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»NeMo Switchyard es una biblioteca de enrutamiento de código abierto que dirige dinámicamente las solicitudes de IA al modelo más adecuado, reduciendo los costos de finalización de tareas a aproximadamente un tercio en comparación con depender de un solo modelo.»}},{«@type»:»Question»,»name»:»¿Se puede personalizar Nemotron 3.5 Lightning para necesidades específicas de una organización?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Sí. Nemotron 3.5 Lightning puede postentrenarse con los propios datos de una organización usando NVIDIA NeMo para mejorar la precisión en tareas especializadas y específicas de dominio.»}},{«@type»:»Question»,»name»:»¿En qué plataformas está disponible Nemotron 3.5 Lightning para su implementación?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Nemotron 3.5 Lightning admite implementación local y en la nube en PCs NVIDIA RTX, sistemas DGX, dispositivos Jetson y perimetrales, y está disponible en plataformas como Hugging Face, ModelScope, OpenRouter y NVIDIA Cloud Partners.»}}]}

Artículo producido con la ayuda de inteligencia artificial y revisado por el equipo editorial.

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST