Goatify IA

Noticias, guías y análisis

NVIDIA comienza a enviar Vera, su primer CPU diseñado específicamente para cargas de agentes de IA

NVIDIA confirmó que Vera CPU comienza a enviarse a escala, con entregas a proveedores cloud y laboratorios de IA y una arquitectura diseñada para orquestación y workloads agentic.

NVIDIA comienza a enviar Vera, su primer CPU diseñado específicamente para cargas de agentes de IA

NVIDIA está llevando Vera desde la promesa de arquitectura hacia sistemas físicos entregados a clouds y laboratorios de IA. El 27 de agosto de 2026, la compañía actualizó su anuncio para confirmar que Vera, su primer CPU personalizado diseñado alrededor de cargas agentic, comienza a enviarse a escala. AWS recibió su primer servidor Vera CPU y un Vera Rubin GPU en Seattle, después de entregas a Oracle Cloud Infrastructure y a laboratorios como Anthropic, OpenAI y SpaceXAI. El paso importa porque convierte especificaciones en infraestructura que ya puede ser evaluada por operadores reales.

La tesis de NVIDIA es que los agentes crean presión sobre el CPU que una conversación tradicional no mostraba con la misma intensidad. Orquestación, tool calling, sandboxes, compilación, recuperación de contexto, movimiento de datos y control de procesos son trabajos que no viven exclusivamente en la GPU. Vera se diseñó para ese plano. NVIDIA describe 88 núcleos Olympus propios, 1,2 TB/s de ancho de banda de memoria y hasta 1,8 veces más rendimiento por núcleo en workloads agentic, con el objetivo de mantener alimentada la parte acelerada del sistema.

El interés de los proveedores cloud confirma que la economía de agentes se está volviendo un problema de sistema completo. OCI planea desplegar cientos de miles de CPUs Vera desde 2026 y AWS recibió ya una primera unidad mientras amplía su relación con NVIDIA. En ambos casos, la conversación deja de ser únicamente cuántas GPUs se compran. Un agente que abre herramientas, ejecuta código y coordina tareas necesita capacidad general, memoria, red e interconexión además de aceleradores. Si uno de esos componentes se queda atrás, el usuario percibe latencia aunque el modelo tenga suficiente cómputo.

Vera también está siendo evaluada directamente por laboratorios que construyen los modelos y agentes que más demandarán esa infraestructura. NVIDIA entregó sistemas a Anthropic y OpenAI, mientras SpaceXAI evalúa Vera para reinforcement learning y pipelines de simulación basados en agentes. Esa proximidad entre fabricante de hardware y laboratorios de IA permite ajustar arquitectura a workloads reales, pero también muestra que el stack se está especializando. La época en la que cualquier CPU de servidor parecía intercambiable empieza a tensionarse cuando la orquestación agentic se convierte en una clase de carga propia.

La integración con Rubin refuerza la estrategia de codesign. Vera puede funcionar como CPU independiente, pero también actúa como host processor en Vera Rubin NVL72 y se conecta a GPUs Rubin mediante NVLink-C2C. NVIDIA afirma que esa arquitectura ayuda a manejar orquestación, control y movimiento de datos con mayor eficiencia energética. Para centros de datos, el argumento económico será cuánto trabajo agentic completo se entrega por dólar, watt y unidad de rack, no únicamente el pico teórico de una sola pieza de silicio.

La llegada de Vera ayuda a redefinir qué significa “infraestructura para agentes”. Si una empresa mide solo tokens del modelo, puede ignorar el costo de ejecutar código, consultar fuentes, mantener estado y coordinar herramientas. NVIDIA apuesta a que esos componentes crecen lo suficiente como para justificar un CPU específicamente diseñado para ellos. Para operaciones, la lección es medir el workflow de punta a punta: cuánto tiempo pasa en inferencia, cuánto en CPU, cuánto en herramientas y cuánto en espera. La optimización útil aparece donde realmente vive el cuello de botella, no donde el marketing del hardware pone el foco.

Cierre operativo. Los agentes convierten CPU, memoria y orquestación en parte visible del costo de inteligencia; optimizar solo la GPU deja media ejecución fuera del análisis. En la práctica, conviene vera comienza a enviarse a escala y el CPU incorpora 88 núcleos Olympus y 1,2 TB/s de ancho de banda de memoria antes de ampliar el workflow.

Abrir artículo en Goatify

Abriendo Goatify...