
Imagen: OpenAI
Noticias de IA: abril de 2026
GPT-5.5 llega seis semanas después de GPT-5.4, Google abre Gemma 4 y DeepSeek-V4 estira el contexto a un millón de tokens. Abril de 2026 en 10 historias.
En abril de 2026 el ciclo de lanzamientos se acortó: GPT-5.5 llegó apenas seis semanas después de GPT-5.4, con el doble de precio y orientado a agentes. En paralelo, los pesos abiertos vivieron su mejor mes en mucho tiempo: Gemma 4 en cinco tamaños, DeepSeek-V4 con contexto de un millón de tokens, Kimi K2.6 y el Nemotron 3 Nano Omni multimodal de NVIDIA.
GPT-5.5: seis semanas después, el doble de precio
OpenAI lanzó GPT-5.5 el 23 de abril, disponible desde el primer día en ChatGPT y API, presentado como un modelo “para trabajo real y agentes”. Cifras propias: 73,1% en su eval interna Expert-SWE (frente a 68,5% de GPT-5.4) y 78,7% en OSWorld-Verified; la prensa técnica añade 82,7% en Terminal-Bench 2.0. Cuesta 5 dólares por millón de tokens de entrada y 30 por millón de salida, el doble que GPT-5.4, que sigue en el catálogo; la variante Pro, para investigación de horizonte largo y refactors de bases de código enteras, sube a 30 y 180.
La decisión ya no es “el modelo nuevo sí o no” sino de tarifa: GPT-5.4 sigue disponible a mitad de precio, así que conviene medir si el salto en tareas agénticas compensa el doble de coste en cada caso de uso.
Fuente: OpenAI · también en system card y Tech Insider
Gemma 4: cinco tamaños abiertos bajo Apache 2.0
Google publicó Gemma 4 el 2 de abril: cinco variantes (E2B y E4B multimodales con imagen, audio y vídeo; un 12B unificado; un MoE de 26B con 4B activos; y un denso de 31B), todas Apache 2.0, con contexto de hasta 256K y soporte de más de 140 idiomas. Según Google, el 31B es tercero del leaderboard de texto de LMArena (Elo 1452) y el MoE de 26B es sexto usando solo 4B de parámetros activos. Descargables desde el primer día en Hugging Face, Ollama, vLLM o llama.cpp.
Para infraestructura propia, el MoE de 26B es la pieza interesante: rendimiento de gama alta con coste de inferencia de modelo pequeño. Los puestos de leaderboard los cita Google, aunque LMArena es verificable públicamente.
Fuente: Google · también en Hugging Face
ChatGPT Images 2.0: el primer modelo de imagen que razona
OpenAI lanzó gpt-image-2 el 21 de abril, su tercer modelo de imagen insignia y el primero con modo de razonamiento explícito: planifica la composición, busca referencias en la web y se autorrevisa antes de generar. Mejora también el texto multilingüe con precisión de carácter en alfabetos no latinos (japonés, coreano, chino, hindi, bengalí). En ChatGPT, el modo Thinking queda para los planes de pago; en API, una imagen de 1024x1024 va de 0,006 dólares en calidad baja a 0,211 en alta.
Para creatividades con texto dentro de la imagen en varios idiomas, la precisión de carácter elimina el retoque manual que obligaba a pasar por herramientas de diseño. El modo de razonamiento añade coste y latencia, así que conviene reservarlo para las piezas que lo necesitan.
Fuente: OpenAI · también en MindWired y WaveSpeed
DeepSeek-V4: un millón de tokens de contexto utilizable
DeepSeek publicó en preview el 24 de abril dos MoE: V4-Pro (1,6 billones de parámetros, 49B activos) y V4-Flash (284B, 13B activos), ambos con ventana de un millón de tokens. La novedad es la atención comprimida por capas alternas (4x y 128x): según DeepSeek, a un millón de tokens V4-Pro necesita el 27% de los FLOPs y el 10% de la caché KV de V3.2. The Register recoge precios de 0,14 dólares por millón de entrada en Flash y 1,74 en Pro, y que los modelos se validaron en GPUs Nvidia y aceleradores Huawei Ascend. Cifras de agentes del propio DeepSeek: 80,6 en SWE-Bench Verified. Sin multimodalidad en el lanzamiento.
El titular es el coste del contexto largo: un millón de tokens deja de ser un lujo de tarifa premium. Para cargas de análisis de documentación o repositorios enteros, los checkpoints abiertos en Hugging Face permiten probarlo sin pasar por la API china.
Fuente: DeepSeek en Hugging Face · también en The Register
xAI abre su stack de voz: APIs de STT/TTS y Grok Voice Think Fast
xAI publicó su pila de voz por API en dos pasos. El 17 de abril, dos APIs de audio independientes, voz a texto y texto a voz, construidas sobre la misma pila que ya mueve Grok Voice, los vehículos Tesla y el soporte de Starlink, con voces expresivas y soporte multilingüe. El 23 de abril añadió grok-voice-think-fast-1.0, su modelo de voz insignia, orientado a flujos de varios pasos en atención al cliente y ventas; xAI lo describe con entrada de datos precisa y razonamiento en tiempo real sin latencia añadida, y dice que ya da soporte a los clientes de Starlink.
Para equipos que montan agentes telefónicos o de voz, xAI entra como competidor directo de las APIs de voz de Google y de ElevenLabs, con la baza de un modelo pensado para el ida y vuelta con herramientas en tareas de soporte.
Fuente: xAI STT/TTS · también en Grok Voice Think Fast 1.0
Nemotron 3 Nano Omni: texto, imagen, vídeo y audio en un solo modelo abierto
NVIDIA publicó el 28 de abril Nemotron 3 Nano Omni, un modelo abierto de 30B (3B activos) con arquitectura híbrida Mamba-Transformer-MoE que procesa texto, imagen, vídeo y audio con contexto de 262K tokens, hasta más de 5 horas de audio. NVIDIA lo sitúa primero en comprensión documental (MMLongBench-Doc, OCRBenchV2) y de vídeo/audio entre los modelos omni abiertos, con cifras comparativas de su propio benchmark. Publicó pesos, datasets y recetas de entrenamiento; está gratis en OpenRouter y soportado en Ollama, vLLM y llama.cpp.
Para pipelines multimodales en infraestructura propia (transcripción y comprensión de reuniones largas, vídeo, documentos escaneados) es la opción abierta más completa del mes, con la cautela de que las comparativas son del fabricante.
Fuente: NVIDIA · también en Hugging Face
Kimi K2.6: pesos abiertos para código de horizonte largo
Moonshot AI lanzó Kimi K2.6 el 20 de abril: MoE de 1 billón de parámetros (32B activos), contexto de 256K, centrado en codificación de horizonte largo y orquestación multiagente. Moonshot cita 80,2% en SWE-Bench Verified y 89,6% en LiveCodeBench v6, y describe una tarea de 12 horas con más de 4.000 llamadas a herramientas. La licencia es MIT modificada con cláusula de marca: productos con más de 100 millones de usuarios mensuales o 20 millones de dólares de ingresos mensuales deben mostrar “Kimi K2.6” visiblemente. En Hacker News hay valoraciones que lo sitúan por debajo de los modelos de Anthropic en capacidad general.
A 0,60 dólares por millón de entrada, para tareas de código largas y mecánicas la relación coste-capacidad es difícil de igualar; el contrapunto de la comunidad y la cláusula de branding son los dos matices a leer antes de adoptarlo.
Fuente: Moonshot AI · también en Hugging Face
GPT-Rosalind: el modelo de OpenAI para ciencias de la vida
OpenAI presentó GPT-Rosalind el 16 de abril, un modelo de razonamiento especializado en descubrimiento de fármacos, genómica y proteínas, bautizado por Rosalind Franklin. Consulta bases de datos especializadas, analiza literatura y propone vías experimentales; lo acompaña un plugin gratuito de Codex que conecta más de 50 herramientas y fuentes de datos científicos. Colaboradores citados: Amgen, Moderna, el Allen Institute y Thermo Fisher. Está en preview de investigación, restringido al programa de acceso de confianza de OpenAI.
Marca la dirección de los modelos verticales por disciplina, pero con acceso restringido: para equipos de biotech, lo práctico hoy es solicitar el programa de acceso y evaluar el plugin de Codex.
Fuente: OpenAI · también en Euronews y Pharmaphorum
Gemini 3.1 Flash TTS: voz expresiva con etiquetas de control
Google lanzó el 15 de abril Gemini 3.1 Flash TTS, en preview: síntesis de voz con etiquetas de audio para controlar estilo, ritmo y entrega, diálogos multihablante nativos, más de 70 idiomas y marca de agua SynthID. Los parámetros de voz se pueden exportar como código de la API para mantener la misma voz entre proyectos. Artificial Analysis, evaluador externo, le da un Elo de 1.211 en su benchmark de TTS, en el cuadrante de mejor equilibrio calidad-coste. Sin precios públicos todavía.
La exportación de voz como código resuelve un problema operativo: mantener coherente la voz de marca entre productos. Sigue en preview y sin precio publicado, así que de momento solo se puede probar.
Fuente: Google
Muse Spark: el modelo de razonamiento multimodal de Meta
Meta Superintelligence Labs anunció Muse Spark el 8 de abril: modelo de razonamiento multimodal nativo con uso de herramientas y orquestación multiagente. Meta afirma capacidades equivalentes a Llama 4 Maverick con más de un orden de magnitud menos de cómputo, y cita 58% en Humanity’s Last Exam con el modo Contemplating activado; todas las cifras son propias. Ya funciona en meta.ai y la app Meta AI, con API en preview privada y despliegue anunciado hacia WhatsApp, Instagram y Messenger en las semanas siguientes.
La vía de llegada al usuario es la distribución masiva de Meta, con la API todavía en preview privada. Para equipos de producto, el efecto inmediato está en lo que sus usuarios podrán hacer dentro de WhatsApp e Instagram.
Fuente: Meta AI · también en Meta Newsroom