
Imagen: TechCrunch
Noticias de IA: marzo de 2026
OpenAI lanza GPT-5.4 con uso de ordenador nativo, Google acelera con Gemini 3.1 Flash-Lite y Mistral abre Voxtral TTS. El repaso de marzo de 2026.
Marzo de 2026 fue el mes de GPT-5.4: OpenAI lanzó su primer modelo de propósito general con uso de ordenador de serie y, dos semanas después, las variantes mini y nano para abaratar los agentes de apoyo. Google empujó en el otro extremo con Flash-Lite y su modelo de voz en vivo, y Mistral publicó dos piezas para quien quiere IA en casa: Voxtral TTS en pesos abiertos y Forge para entrenar modelos propios.
GPT-5.4 llega con uso de ordenador nativo y 1 millón de tokens
OpenAI lanzó GPT-5.4 el 5 de marzo en variantes Thinking y Pro, disponibles desde el primer día en ChatGPT y en la API. Es su primer modelo de propósito general con uso de ordenador nativo, pensado para agentes que operan aplicaciones de escritorio, y estrena ventana de contexto de hasta 1 millón de tokens, la mayor de OpenAI hasta la fecha. La compañía declara un 33% menos de errores factuales que GPT-5.2 y un 83% en su test interno GDPval. Precio de API: 2,50 dólares por millón de tokens de entrada y 15 por millón de salida (por encima de 272.000 tokens de entrada, la tarifa sube); el nivel Pro cuesta 30 y 180.
Para quien construye agentes, las dos novedades que tocan arquitectura son el uso de ordenador sin herramientas añadidas y el contexto de 1 millón: casos que antes exigían trocear o montar RAG caben ahora en una sola llamada, pagando el sobreprecio de contexto largo.
Fuente: OpenAI · también en TechCrunch y system card
GPT-5.4 mini y nano: la gama barata para subagentes
El 17 de marzo OpenAI completó la familia con GPT-5.4 mini (400.000 tokens de contexto, texto e imagen, más del doble de rápido que GPT-5 mini y cerca del grande en SWE-Bench Pro y OSWorld según OpenAI) a 0,75 dólares por millón de entrada y 4,50 por millón de salida, y GPT-5.4 nano, solo API, para clasificación, extracción y subagentes de código, a 0,20 y 1,25: el modelo más barato del catálogo de OpenAI. Ambos en disponibilidad general desde el anuncio; mini llega también al nivel gratuito de ChatGPT.
El patrón de diseño que esto abarata es el orquestador con subagentes: el modelo grande decide y los nano ejecutan las tareas mecánicas a una fracción del coste.
Fuente: OpenAI · también en Microsoft Tech Community y The New Stack
GPT-5.3 Instant: menos advertencias, menos alucinaciones según OpenAI
OpenAI empezó a desplegar GPT-5.3 Instant el 3 de marzo como modelo por defecto de ChatGPT y en la API como gpt-5.3-chat-latest. El objetivo declarado es conversación más directa, con menos avisos y frases de relleno. En sus evaluaciones internas de casos de alto riesgo, OpenAI reporta un 26,8% menos de alucinaciones con acceso a la web y un 19,7% menos sin él. No hay benchmark independiente en la cobertura revisada; todas las cifras son del fabricante.
Afecta a cualquier producto montado sobre el alias chat-latest: el tono de las respuestas cambia sin tocar código, lo que merece una pasada por los tests de regresión de prompts.
Fuente: OpenAI · también en system card y EdTech Innovation Hub
Gemini 3.1 Flash-Lite: la gama de volumen de Google
Google anunció Gemini 3.1 Flash-Lite el 3 de marzo, en preview en AI Studio y Vertex AI. Es el modelo más rápido y barato de la serie Gemini 3: según Google, 2,5 veces menos tiempo hasta el primer token que Gemini 2.5 Flash y un 45% más de velocidad de salida, con niveles de razonamiento configurables de serie. Google cita 86,9% en GPQA Diamond y 76,8% en MMMU Pro. Precio: 0,25 dólares por millón de tokens de entrada y 1,50 por millón de salida.
Compite en la misma franja que GPT-5.4 nano: tareas de gran volumen (clasificar, extraer, resumir) donde el coste por token manda sobre la capacidad máxima. Sigue en preview, sin fecha de disponibilidad general.
Fuente: Google DeepMind
Codex Security: el agente que audita repositorios, en research preview
OpenAI lanzó Codex Security el 6 de marzo para clientes de ChatGPT Enterprise, Business y Education, con el primer mes gratis. Evolución del proyecto interno “Aardvark”, el agente analiza el repositorio, describe en lenguaje natural cómo funciona la aplicación, prueba las vulnerabilidades candidatas en un sandbox para descartar falsos positivos, las prioriza por impacto y propone parches. OpenAI dice que en 30 días lo probó contra 1,2 millones de commits e identificó unas 800 vulnerabilidades críticas y más de 10.000 altas, con la tasa de falsos positivos reducida a la mitad desde el lanzamiento inicial. Cifras propias, sin auditoría externa.
Para equipos con backlog de seguridad es un segundo revisor barato que llega antes que el pentest anual; el sandbox de verificación es la pieza que lo separa de un simple escáner estático.
Fuente: OpenAI · también en AIBusiness y SecurityWeek
MiniMax M2.7, abierto y entrenado optimizándose a sí mismo
MiniMax publicó M2.7 en pesos abiertos el 18 de marzo. Lo distintivo es el proceso: durante el entrenamiento, el modelo ejecutó de forma autónoma más de 100 rondas de optimización de su propio andamiaje, con una mejora del 30% en las evaluaciones internas según MiniMax. El Artificial Analysis Intelligence Index, un evaluador externo, lo sitúa primero de 136 modelos con 50 puntos frente a una media de 19; la cobertura independiente señala a la vez un ligero retroceso frente a M2.5 en SWE-Bench Verified (en torno al 78% frente a 80,2%).
Es el modelo abierto a probar este mes para cargas agénticas, con una lectura serena de los benchmarks: sobresale en el índice agregado externo y cede un poco en resolución de issues clásica.
Fuente: MiniMax · también en MarkTechPost y Build Fast with AI
Gemini 3.1 Flash Live: la voz en tiempo real de Google, en GA para consumidores
Google presentó Gemini 3.1 Flash Live el 26 de marzo, su mejor modelo de voz para interacción en tiempo real: Google cita 90,8% en ComplexFuncBench Audio (llamadas a funciones en varios pasos por voz) y el doble de contexto de conversación que la versión anterior, con marca de agua SynthID en todo el audio generado. Está en disponibilidad general para el público en Gemini Live y en más de 200 países en Search Live; para desarrolladores sigue en preview vía la API de Gemini Live. Entre los primeros usuarios: Verizon, The Home Depot y LiveKit.
La cifra de function calling por voz es la relevante para negocio: agentes telefónicos y de atención que ejecutan acciones en varios pasos sin perderse. El acceso de desarrollador todavía en preview marca el ritmo de adopción posible.
Fuente: Google DeepMind
Holo3 marca récord en agentes de escritorio
H Company presentó Holo3 el 31 de marzo en dos variantes: Holo3-122B-A10B (10B parámetros activos de 122B) y Holo3-35B-A3B, esta última con pesos abiertos bajo Apache 2.0. Según H Company, la grande alcanza 78,85% en OSWorld-Verified, el benchmark de referencia de agentes de escritorio, nuevo estado del arte; la abierta llega a 77,8%. La compañía afirma igualar o superar a GPT-5.4 y a Opus 4.6 en esta tarea con un coste de inferencia muy inferior, afirmación sin verificación de terceros. La API incluye un nivel gratuito.
Que una variante abierta de 3B activos roce el estado del arte en uso de ordenador acerca los agentes de escritorio a despliegues en infraestructura propia, sin depender de las APIs frontera.
Fuente: H Company · también en Hugging Face y AIHola
Voxtral TTS: texto a voz abierto con clonación en 5 segundos
Mistral publicó Voxtral TTS el 23 de marzo: un modelo de texto a voz de 4B parámetros que cubre 9 idiomas (español incluido), con 70 milisegundos de latencia y clonación de voz a partir de 3-5 segundos de audio de referencia. En la evaluación humana del propio Mistral gana a ElevenLabs Flash v2.5 en naturalidad con un 68,4% de preferencia; los análisis independientes recuerdan que es una evaluación interna, que ElevenLabs cubre más de 70 idiomas frente a 9, y que los primeros usuarios reportan clonación inestable. Pesos abiertos con licencia no comercial (CC BY-NC 4.0) y API de pago a 0,016 dólares por mil caracteres.
Para prototipos de voz en español con datos que no pueden salir de casa es la primera opción abierta seria; la licencia no comercial de los pesos obliga a pasar por la API en cuanto hay producto.
Fuente: Mistral AI · también en MarkTechPost y SiliconANGLE
Mistral Forge: entrenar modelos propios como servicio
En la GTC de Nvidia, el 17 de marzo, Mistral presentó Forge: un sistema para que las empresas entrenen modelos sobre sus datos internos, cubriendo preentrenamiento, post-entrenamiento y aprendizaje por refuerzo, con soporte de arquitecturas densas y MoE. Está pensado con agentes de código como primer usuario: Mistral Vibe puede usar Forge para ajustar modelos, buscar hiperparámetros y generar datos sintéticos. Socios de acceso anticipado: ASML, Ericsson, la Agencia Espacial Europea y DSO de Singapur, entre otros. De momento solo hay registro de interés, sin precio ni calendario.
Es la apuesta contraria al ajuste fino sobre modelos genéricos: modelo propio desde los datos de la empresa. Sin precios públicos, lo único accionable hoy es apuntarse a la lista si el caso lo justifica.
Fuente: Mistral AI · también en VentureBeat y TechCrunch