Ir al contenido

· 9 min de lectura

Noticias de IA: julio de 2026

Anthropic lanza Claude Opus 5, OpenAI publica GPT-5.6 y recorta precios tres semanas después, y Moonshot abre Kimi K3. Julio de 2026.

Ilustración de huevos antiguos dispuestos formando el número cinco de Claude Opus 5

Imagen: Anthropic

Julio de 2026 se ha ido en precios. Anthropic lanzó Claude Opus 5 el 24 de julio con la tesis explícita de dar rendimiento cercano al de Fable 5 por la mitad de coste, y OpenAI, que había sacado GPT-5.6 el día 9, bajó dos de sus tres modelos apenas tres semanas después. Por debajo, la tanda de pesos abiertos siguió llegando: Kimi K3, Inkling de Thinking Machines, Leanstral 1.5 y MiniMax H3.

Claude Opus 5, rendimiento de frontera a la mitad de coste

Anthropic publicó Claude Opus 5 el 24 de julio, disponible el mismo día en todas sus plataformas y como modelo por defecto en Claude Max. El precio no se mueve respecto a Opus 4.8: 5 dólares por millón de tokens de entrada y 25 por millón de salida, con un modo rápido que da 2,5 veces la velocidad por el doble del precio base. Las cifras que cita Anthropic son suyas: estado del arte en Frontier-Bench y en la parte de código de GDPval-AA, el triple que el siguiente mejor modelo en ARC-AGI 3, y por delante de todos en OSWorld 2.0 a un tercio del coste de Fable 5, al que se acerca hasta un 0,5% en CursorBench 3.2 con esfuerzo máximo. Llegan también los ajustes de esfuerzo, la generación visual y, en beta, el cambio de herramientas a mitad de conversación y los reintentos automáticos cuando una petición queda bloqueada por seguridad.

Para quien ya trabaja sobre Claude, el punto accionable no es la capacidad sino la relación con Fable 5: si el trabajo se sostiene con Opus 5, la factura de esas cargas cambia de escala. Conviene medirlo con tareas propias antes de dar por buena la comparación del fabricante.

Fuente: Anthropic · también en 9to5Google y The Deep View

GPT-5.6: Sol, Terra y Luna, y un recorte de precios a las tres semanas

OpenAI puso GPT-5.6 en disponibilidad general el 9 de julio con tres modelos: Sol (insignia), Terra y Luna. Los precios de salida eran 5 y 30 dólares por millón en Sol, 2,50 y 15 en Terra, 1 y 6 en Luna. El 30 de julio OpenAI bajó Luna un 80% (a 0,20 y 1,20) y Terra un 20% (a 2 y 12), dejando Sol como estaba, y lo atribuyó a mejoras de eficiencia durante el desarrollo: un 20% menos de coste de servicio de extremo a extremo y más de un 15% de ganancia en generación de tokens. Sol añade un ajuste “ultra” que coordina cuatro agentes en paralelo por defecto. En el Coding Agent Index de Artificial Analysis, Sol marca 80,0, 2,8 puntos por encima de Claude Fable 5 con menos de la mitad de tokens de salida.

Luna entra en un rango de coste distinto al que tenía el 9 de julio, lo que cambia el cálculo para equipos con volumen alto en tareas rutinarias. El recorte afecta a las tarifas de la API; los precios de Sol se quedan igual.

Fuente: OpenAI · también en TestingCatalog y CNBC

Kimi K3, 2,8 billones de parámetros con pesos abiertos

Moonshot publicó Kimi K3 el 17 de julio: un modelo de código abierto de 2,8 billones de parámetros con visión nativa, contexto de 1 millón de tokens y una arquitectura de atención propia, Kimi Delta Attention. En conjunto queda por detrás de Claude Fable 5 y de GPT-5.6 Sol, con 67,3 en DeepSWE. Lo interesante está en el precio de la API: 0,30 dólares por millón de tokens de entrada cuando hay acierto de caché, 3,00 cuando no, y 15,00 de salida, con más de un 90% de aciertos de caché en cargas de programación según Moonshot. Está en Kimi.com, Kimi Work, Kimi Code, la API y las apps móviles; los pesos completos se publicaron el 27 de julio.

La combinación de pesos abiertos, contexto largo y precio de caché agresivo lo pone en la lista corta para cargas de código sostenidas donde el modelo repite gran parte del contexto en cada llamada.

Fuente: Kimi · también en TestingCatalog

Grok 4.5, el primer modelo de xAI hecho para código y agentes

xAI lanzó Grok 4.5 el 9 de julio, su primer modelo entrenado específicamente para programación y trabajo agéntico. Salió en Grok Build, en todos los planes de Cursor y en la consola de la API, con el acceso desde la UE previsto para mediados de mes. Contexto de 500.000 tokens, llamada a funciones, salidas estructuradas, búsqueda en web y en X, ejecución de código y razonamiento configurable (alto por defecto), a unos 80 tokens por segundo. Precio: 2 dólares por millón de entrada, 0,50 con caché y 6 de salida, con tarifa mayor por encima de 200.000 tokens. Los benchmarks citados son 62,0% en DeepSWE 1.0, 83,3% en Terminal Bench 2.1 y 64,7% en SWE-Bench Pro.

Que llegue a los planes de Cursor el mismo día del lanzamiento es lo que lo hace probable en un flujo real: no hace falta cambiar de herramienta para compararlo con lo que ya se esté usando.

Fuente: TestingCatalog · también en Cursor

Inkling: Thinking Machines publica su primer modelo de pesos abiertos

Thinking Machines Lab presentó Inkling el 15 de julio: un MoE de pesos abiertos con 975.000 millones de parámetros totales y 41.000 millones activos, contexto de hasta 1 millón de tokens, preentrenado con 45 billones de tokens y con texto, imagen y audio nativos. Las cifras del laboratorio son 77,6% en SWE-bench Verified, 97,1% en AIME 2026, 87,2% en GPQA Diamond y 73,5% en MMMU Pro, y empata con Nemotron 3 Ultra en Terminal Bench 2.1 usando alrededor de un tercio menos de tokens. Se puede usar en la plataforma Tinker con un 50% de descuento temporal, en un playground gratuito y por API en Together, Fireworks, Modal, Databricks y Baseten; los pesos se descargan en formato original y NVFP4. El esfuerzo de razonamiento se ajusta entre 0,2 y 0,99. Hay además una preview de Inkling-Small, de 276.000 millones totales y 12.000 millones activos.

Es el primer modelo publicado por el laboratorio de Mira Murati, y llega con pesos descargables y esfuerzo regulable, que es la parte que permite ajustar coste y latencia sin cambiar de modelo.

Fuente: TestingCatalog

ChatGPT Work: el agente de OpenAI que entrega el trabajo terminado

El mismo 9 de julio, junto a GPT-5.6, OpenAI lanzó ChatGPT Work: un agente construido sobre Codex y GPT-5.6 que descompone un objetivo en tareas, trabaja durante horas y devuelve hojas de cálculo, presentaciones, documentos, cuadros de mando o aplicaciones web. Pide aprobación antes de acciones sensibles y opera con un navegador integrado que puede hacer clic, escribir y mover archivos. Se conecta con Slack, Microsoft Teams, Gmail, Google Drive, SharePoint, Salesforce, calendarios y CRMs, invocados escribiendo “@” y el nombre del plugin. Salió en Pro, Enterprise y Edu en web y móvil, con Plus y Business después; la app de escritorio para Windows y Mac está en todos los planes, incluido el gratuito. El consumo se mide como en Codex, no es tarifa plana.

Es el mismo patrón que ya se ve en las herramientas de código, movido al trabajo de oficina. El detalle a mirar antes de desplegarlo en un equipo es el consumo medido: el coste depende del uso, no del número de licencias.

Fuente: OpenAI · también en TestingCatalog y Bloomberg

Muse Image y Muse Video, la generación visual de Meta

Meta presentó Muse Image y Muse Video el 7 de julio. Muse Image es un modelo de imagen agéntico: invoca herramientas de búsqueda y de código, se corrige a sí mismo y escala cómputo en inferencia en lugar de generar de una pasada. Está en la app de Meta AI, en meta.ai, en las historias de Instagram en EE. UU. y en WhatsApp en un número limitado de países, con Facebook pendiente. Meta lo sitúa segundo en Arena en texto a imagen y edición a fecha de 5 de julio, e incorpora la marca de agua Content Seal. Muse Video es una preview temprana, tercera en Arena en texto a vídeo, y todavía sin fecha de disponibilidad.

Que el modelo llame a herramientas durante la generación es el cambio de fondo: acerca la generación de imagen al patrón agéntico que ya domina en texto y código.

Fuente: Meta · también en TestingCatalog

GPT-Live: voz que escucha y habla a la vez

OpenAI presentó GPT-Live el 8 de julio, con dos modelos, GPT-Live-1 y GPT-Live-1 mini. Son modelos de voz full-duplex: hablan y escuchan al mismo tiempo, gestionan los turnos sin marcadores explícitos, intercalan confirmaciones y pueden usar herramientas varias veces por segundo mientras conversan. Sustituyen al Modo de Voz Avanzado en ChatGPT, con el modelo mini por defecto y el grande en los planes de pago. En el lanzamiento el modelo que corre por debajo es GPT-5.5, no GPT-5.6. Desde el 31 de julio, el audio que generan lleva marca de agua SynthID.

Para quien esté montando agentes de voz, el full-duplex quita el problema más visible de las versiones anteriores, que era la latencia de turno. Merece una prueba antes de dar por buena la promesa de interrupción natural.

Fuente: OpenAI · también en TestingCatalog

Leanstral 1.5, el modelo de Mistral para demostración formal

Mistral publicó Leanstral 1.5 el 4 de julio bajo licencia Apache 2.0: un modelo abierto para demostración formal en Lean 4, con 119.000 millones de parámetros totales, 6.500 millones activos y 256.000 tokens de contexto. Satura miniF2F, resuelve 587 de los 672 problemas de PutnamBench, alcanza 87% en FATE-H y 34% en FATE-X, y sube el pass@8 de FLTEval de 31,9 a 43,2. Aplicado a 57 repositorios de Rust señaló 47 posibles violaciones de las que 11 eran errores reales, incluidos 5 no reportados antes en GitHub. Está en la API de Labs, en Mistral Vibe y en Hugging Face, gratis vía Labs, con retirada anunciada para el 30 de septiembre de 2026.

La verificación formal sigue siendo un nicho, pero el resultado sobre repositorios de Rust apunta a un uso más general: encontrar errores reales en código existente, no solo demostrar teoremas.

Fuente: TestingCatalog

MiniMax H3: vídeo 2K con audio nativo y pesos por publicar

MiniMax cerró el mes con H3 el 31 de julio: un modelo de generación multimodal que acepta texto, imagen, vídeo y audio, y produce vídeo con audio estéreo nativo de hasta 15 segundos a resolución 2K. La empresa sitúa el coste por segundo a 2K por debajo de un tercio de los modelos comparables, y a 768p por debajo de la mitad de lo que cuestan los modelos de 720p. Por dentro hay un tokenizador propio, H3-VAE, que reduce cuatro veces la longitud de secuencia, un transformer H3-Omni y una técnica de regeneración en contexto. Los pesos no estaban publicados el día del anuncio: MiniMax dijo que llegarían “en los próximos días”.

El audio generado junto al vídeo en la misma pasada evita el paso de sonorización posterior. Mientras los pesos no estén publicados, el único acceso es por API.

Fuente: MiniMax · también en SCMP

¿Necesitas ayuda para poner la IA a funcionar en tu empresa?

30 minutos, gratis y sin compromiso.

Agenda una llamada