Noticias, guías y análisis
SpaceXAI lanza Grok 4.7 para trabajo de larga duración y convierte la verificación del propio trabajo en una característica central del modelo
SpaceXAI presentó Grok 4.7, un modelo orientado a coding y knowledge work de larga duración; la empresa afirma que verifica mejor su trabajo, ofrece 500k de contexto en API y publica precios desde 2 dólares por millón de
El lanzamiento apuesta por duración y autocorrección, no solo por una cifra de benchmark. SpaceXAI presentó Grok 4.7 el 21 de septiembre como su modelo más capaz para coding y knowledge work. La empresa dice que usa una base mayor que Grok 4.6 y un entrenamiento de refuerzo más largo sobre una mezcla de problemas difíciles, con mayor peso en tareas que pueden tomar muchas horas. También destaca una mejor capacidad para revisar su propio trabajo y manejar contexto largo. Ese enfoque refleja un cambio en el mercado: el modelo frontier deja de competir únicamente por acertar una respuesta y empieza a competir por sostener un proyecto, conservar estado y detectar sus propios errores.
La API convierte ese enfoque en decisiones concretas de operación. Las notas de xAI indican una ventana de contexto de 500.000 tokens, entradas de texto e imagen, salida de texto y niveles de reasoning low, medium, high y xhigh. El precio publicado comienza en dos dólares por millón de tokens de entrada y seis por millón de salida para prompts por debajo de 200.000 tokens, con tarifas mayores por encima de ese umbral. Además existe una variante Fast con mayor velocidad y mayor precio en superficies específicas. Para una empresa, estas opciones crean un problema de routing: no existe una configuración universalmente óptima cuando costo, longitud y urgencia varían por tarea.
Los benchmarks del proveedor sirven como señal, no como contrato. SpaceXAI publica resultados de CursorBench, DeepSWE, Terminal-Bench, trabajo profesional, razonamiento clínico y otros conjuntos. También compara precio y rendimiento con modelos rivales. Es información útil para seleccionar candidatos, pero no reemplaza una evaluación propia. Un modelo puede destacar en un benchmark de coding y fallar en el repositorio, herramientas o convenciones de una compañía. Además, una puntuación agregada puede ocultar distribución: algunas tareas se resuelven con diez pasos, otras consumen una hora y terminan mal. La pregunta de producción es cuánto cuesta lograr un estado final correcto en nuestro entorno.
La integración con el harness se vuelve parte del rendimiento. xAI dice que entrenó Grok 4.7 para entender de forma nativa su harness Grok Bot. Esa frase importa porque rompe la idea de que modelo y agente son piezas completamente separables. La calidad observada depende de cómo el modelo interpreta herramientas, memoria, eventos y feedback del runtime. Una organización debe registrar el conjunto completo: modelo, prompt, harness, versiones de herramientas, políticas y límites. Si cambia uno de esos componentes, no es correcto atribuir toda mejora o degradación al modelo. El producto agentic es un sistema compuesto y necesita versionarse como tal.
Las salvaguardas también se presentan como una dimensión del lanzamiento. SpaceXAI afirma que Grok 4.7 usa una nueva pila de safeguards y publica cifras propias sobre resistencia a jailbreaks, biosafety y tareas cyber de doble uso. Nuevamente, deben leerse como resultados del proveedor y contrastarse en el contexto real de despliegue. El riesgo no depende solo de que un modelo rechace una instrucción peligrosa; depende de las herramientas y permisos que reciba. Un modelo con buen comportamiento pero acceso excesivo sigue siendo una superficie seria. Las evaluaciones de seguridad deben combinar comportamiento, policy enforcement del runtime y efectos observables.
Lectura Goatify. Para Goatify, Grok 4.7 refuerza que debemos tratar cada modelo como un motor intercambiable dentro de un modelroute, no como la identidad del agente. Una habilidad puede requerir xhigh en un problema complejo, una ruta rápida para triage y otro proveedor si el costo por éxito empeora. La selección debe basarse en nuestro corpus de tareas, con éxito final, número de pasos, costo, latencia y fallos recuperados. Si un modelo nuevo es realmente mejor, debe demostrarlo contra el trabajo que vendemos. Esa disciplina nos permite aprovechar lanzamientos agresivamente sin reconstruir la plataforma alrededor de cada anuncio.