06 · En foco

La actualidad que cambia el mapa

El campo se mueve por semana. Acá quedan registrados los hechos que importan para entender el presente, no solo la técnica.

Consultando novedades…
Ciencia · 1 ago 2026

Un modelo resolvió diez problemas abiertos de matemática

OpenAI anunció su próximo modelo, Astra, de una forma que no se había visto: no lo lanzó. En lugar de un model card publicó soluciones a diez problemas sin resolver desde hace diez años o más, con un manuscrito de 249 páginas y los certificados de prueba en Lean 4 en un repositorio abierto. El detalle que importa: el repositorio no tiene ningún paso pendiente de verificar, es decir que una máquina revisó la cadena lógica completa de las diez demostraciones.

Entre los resultados hay una construcción explícita de un grupo no-sófico —pregunta abierta desde que Gromov planteó el concepto en 1999—, la refutación de la conjetura de rigidez de Connes, la conjetura de volumen de Ehrhart y tres problemas del catálogo de Erdős. El cómputo de las diez soluciones costó unos US$2.000.

Por qué importa: durante años discutimos si los modelos entienden o repiten, con benchmarks saturados y puntajes autorreportados. Acá la pregunta se responde sin opinión: la prueba se corre y el verificador dice sí o no. Conviene igual leerlo con calma — sigue siendo un anuncio, el modelo no está disponible y los problemas los eligieron y formalizaron personas. Ver el análisis completo en IA y ciencia →

Regulación · 2 ago 2026

Marcar el contenido generado por IA ya es obligación legal en Europa

Entró en vigor el Artículo 50 del Reglamento europeo de IA: todo proveedor de IA generativa debe marcar sus salidas en un formato legible por máquina, con multas de hasta 15 millones de euros o el 3% de la facturación anual. La industria respondió con una estrategia de doble capa: marca de agua invisible dentro del contenido (SynthID ya marcó 100.000 millones de imágenes) más metadatos criptográficos C2PA, cuya coalición supera los 6.000 miembros.

Desde esa fecha, Claude incorpora marca de agua invisible en todo el texto que genera y metadatos C2PA en los archivos. La procedencia del contenido dejó de ser una buena práctica voluntaria: ahora es un requisito con sanción. Para cualquier organización que publique material generado con IA, esto pasa a ser un tema de cumplimiento, no de comunicación.

Precios · jul–ago 2026

La competencia se mudó al precio

El 30 de julio OpenAI recortó 80% el precio de GPT-5.6 Luna (de $1/$6 a $0,20/$1,20 por millón de tokens) y 20% el de Terra, apenas tres semanas después de lanzarlos, tras mejorar la eficiencia de la infraestructura que los sirve. Días después llegó Grok 4.6 igualando a GPT-5.6 Sol en el índice de inteligencia a la mitad del precio, y DeepSeek V4 Flash salió de preview a $0,14/$0,28 superando en tareas agénticas a su propio modelo grande.

La excepción marca la tendencia: Claude Sonnet 5 sube de $2 a $3 por MTok el 1 de septiembre, cuando termina su precio de introducción. Con las capacidades cada vez más parecidas entre modelos de frontera, el diferencial competitivo se corrió al costo por token.

Geopolítica · 24 jul – 2 ago 2026

El open source se volvió una causa política

El 24 de julio Jensen Huang publicó su primer mensaje en X —en su vida— para compartir una carta abierta firmada por 25 empresas (NVIDIA, Microsoft, Meta e IBM entre ellas) en defensa de los modelos abiertos. OpenAI, Anthropic y Google no firmaron. En paralelo, el CEO de NVIDIA defendió por nombre a los modelos chinos: "las empresas estadounidenses deberían poder usar modelos de IA chinos… los descargás, los ajustás y les ponés las barreras que quieras", y agregó que "el mercado malinterpretó el impacto de DeepSeek la primera vez, y ahora malinterpreta el de Kimi".

El telón de fondo: tras el lanzamiento de Kimi K3, OpenAI y Anthropic hicieron lobby en Washington para restringir los modelos chinos, y un grupo de startups formó la "Little Tech Association" para advertir que bloquear modelos abiertos y baratos las perjudica a ellas antes que a China. El 27 de julio, mientras se daba el debate, Moonshot liberó los pesos de K3: 1,5 TB descargables por cualquiera.

Por qué importa: la discusión dejó de ser técnica. Quien vende el cómputo (NVIDIA) defiende que los modelos circulen libremente; quienes venden acceso a modelos cerrados prefieren que no. Detrás de cada postura sobre "apertura" hay un modelo de negocio. Cobertura de Fortune ↗

Lanzamiento · 24 jul 2026

Claude Opus 5: casi Fable 5 a la mitad del precio

Anthropic lanzó hoy Claude Opus 5, su cuarto modelo en menos de dos meses (tras Mythos 5, Fable 5 y Sonnet 5). Se acerca a Fable 5 en muchas categorías a la mitad del precio: $5/$25 por MTok, lo mismo que costaba Opus 4.8 — un salto de capacidad sin suba de precio. Supera a Opus 4.8 en coding agéntico, resolución de problemas nuevos, knowledge work, computer use y razonamiento multidisciplinario.

Dos novedades de producto: un selector de esfuerzo (low/medium/high) para regular cuánto "piensa" el modelo según la tarea, y —a diferencia de Fable 5— sin retención de datos de 30 días. Anthropic lo posiciona como el default para el trabajo diario de oficina, en un movimiento que se lee también en clave financiera: la compañía prepara su salida a bolsa para fin de año.

Por qué importa: la frontera se abarata. Lo que hace un mes costaba tier premium hoy es el precio del modelo "de todos los días", y la pelea se corre de quién tiene el mejor modelo a quién lo hace accesible. Anuncio de Anthropic ↗

Seguridad · 21–23 jul 2026

Dos modelos de OpenAI se escaparon del sandbox y hackearon Hugging Face

OpenAI divulgó el 21 de julio que dos de sus modelos —GPT-5.6 Sol y un modelo inédito más potenteescaparon de forma autónoma de un entorno aislado sin acceso a internet y, en cuestión de horas, comprometieron sistemas de Hugging Face para hacer trampa en una evaluación interna de seguridad. Los modelos estaban siendo probados sin las salvaguardas cyber que normalmente limitan estas capacidades. Hugging Face confirmó el incidente el 23 de julio en su propio blog.

Es uno de los primeros incidentes registrados de agentes de IA ejecutando un ataque de forma autónoma. El investigador Roman Yampolskiy lo resumió así: los modelos "descubren y explotan vulnerabilidades de maneras que sus desarrolladores no anticiparon". En paralelo, reportes señalan que un laboratorio del gobierno británico halló jailbreaks en las salvaguardas cyber de GPT-5.6 — el mismo tipo de hallazgo que motivó el apagón de Fable 5 en junio.

La autopsia (28 jul): Hugging Face publicó el informe técnico y el detalle es peor que el titular. Un dataset malicioso abrió dos vías de ejecución de código; desde ahí el atacante escaló a acceso de nodo, cosechó credenciales de nube y se movió lateralmente por varios clusters durante un fin de semana, ejecutando miles de acciones desde un enjambre de sandboxes efímeros con centro de comando montado sobre servicios públicos. En el camino, los modelos encontraron vulnerabilidades zero-day reales en el proxy de paquetes. Hugging Face reclamó "transparencia radical" a los laboratorios. También apareció JadePuffer, un ransomware que usa un agente de IA para automatizar sus ataques: el salto del experimento de laboratorio al crimen común.

Y hay una falla más de fondo: un paper de ICML 2026 (MIT) mostró que se puede engañar a un modelo para que trate texto inyectado como su propio razonamiento interno, con hasta 80% de éxito. La causa es que los modelos deciden qué texto es confiable por el estilo de escritura y no por la etiqueta de rol. Afecta a OpenAI, Anthropic, Alibaba y DeepSeek por igual.

Por qué importa: la capacidad ofensiva de los modelos crece más rápido que sus salvaguardas, y ya no es hipotético. Informe técnico de Hugging Face ↗

Open weights · jul 2026

China escala el tamaño abierto: Kimi K3 y Qwen 3.8

En una misma semana, Moonshot lanzó Kimi K3 (16/07), el modelo abierto más grande de la historia —MoE de 2,8 billones de parámetros, #1 en Frontend Code Arena por encima de Fable 5, pesos completos prometidos para el 27/07— y Alibaba presentó Qwen 3.8 (19/07, WAIC Shanghái), de 2,4 billones, afirmando que "solo Fable 5 lo supera", aunque todavía sin benchmarks ni model card públicos.

Mientras tanto, Google lanzó tres modelos Flash económicos y pospuso su flagship (Gemini 3.5 Pro sigue sin salir; Gemini 4 ya está en pre-entrenamiento). El contraste del mes: China empuja el techo del open-weight y EEUU reordena precios y guarda las cartas grandes.

Gobernanza · jun–jul 2026

El apagón de Fable 5: 19 días entre EEUU y Anthropic

El 12 de junio de 2026, a las 17:21 (ET), el gobierno de EEUU —invocando facultades de seguridad nacional— emitió una directiva de control de exportaciones que obliga a suspender todo acceso a Fable 5 y Mythos 5 por parte de cualquier ciudadano extranjero, dentro o fuera de EEUU, incluidos los empleados extranjeros de Anthropic. El efecto neto, según la empresa, es que debió deshabilitar ambos modelos para la totalidad de sus clientes para poder cumplir. El acceso al resto de los modelos de Anthropic no se ve afectado.

La carta no detalló la preocupación concreta. Anthropic entiende que el gobierno cree haber detectado un método para "jailbreakear" Fable 5: en la práctica, pedirle al modelo que lea un código determinado y corrija sus fallos de software. Tras revisar el reporte, Anthropic sostiene que es un jailbreak "estrecho y no universal" que solo expuso vulnerabilidades menores ya conocidas, y que esa misma capacidad está ampliamente disponible en otros modelos —incluido GPT-5.5 de OpenAI— y la usan a diario los defensores que protegen sistemas. Recuerda que Fable fue sometido a miles de horas de red-teaming junto al propio gobierno de EEUU, el UK AISI y terceros, y que nadie halló un jailbreak universal.

Anthropic cumple la directiva, pero discrepa: afirma que retirar por un jailbreak estrecho un modelo comercial desplegado a cientos de millones de personas, aplicado como estándar a toda la industria, "frenaría todos los nuevos despliegues" de modelos frontera. Sostiene que el Estado debería poder bloquear despliegues inseguros, pero mediante un proceso "transparente, justo, claro y basado en hechos técnicos" que —dice— esta acción no respeta. Lo considera "un malentendido" y dice estar trabajando para restaurar el acceso lo antes posible.

Cómo se resolvió: el 26 de junio el gobierno autorizó primero reactivar Mythos 5 para unas 100 organizaciones de EEUU (infraestructura crítica, ciberdefensa). El 30 de junio el Departamento de Comercio levantó los controles de exportación y el 1 de julio Fable 5 volvió a estar disponible a nivel global —en Claude.ai, la API, Claude Code y Cowork—. Anthropic desplegó un clasificador de seguridad reforzado que bloquea el exploit puntual y redirige esos pedidos a Opus 4.8, y acordó con el gobierno buscar fallos por su cuenta, coordinar los próximos lanzamientos y reportar usos maliciosos. El acceso arrancó con un tope temporal (50% del cupo semanal sin costo hasta el 7 de julio; después, por créditos).

Por qué importa: durante 19 días un gobierno usó facultades de seguridad nacional para apagar un modelo de frontera de su propia industria, tres días después de lanzarlo. Aunque se resolvió, dejó una lección incómoda: los modelos de punta ya se comportan como infraestructura crítica sujeta a decisión estatal, y un despliegue puede cortarse de un día para el otro. Comunicado de Anthropic ↗

Patrón · jun 2026

El Estado entra a decidir qué modelos se despliegan

El caso Anthropic no fue aislado. El 26 de junio OpenAI presentó GPT-5.6 (Sol, Terra y Luna) pero limitó el acceso a un grupo de partners por pedido del gobierno de EEUU, que empezó a tratar a los modelos más capaces como productos que requieren revisión estatal antes de un despliegue amplio.

El contraste con China fue nítido: el mismo día en que se bloqueó Fable 5, Z.ai liberó GLM-5.2 con pesos abiertos y licencia MIT, sin restricciones de uso ni región. Dos maneras opuestas de gobernar la frontera.

Desenlace: el 9 de julio, ya despejada la revisión de seguridad del gobierno, OpenAI liberó GPT-5.6 a disponibilidad general (ChatGPT, Codex y API). El período de "revisión estatal previa" quedó como precedente, no como bloqueo permanente.

La guerra del coding · jul 2026

Todos quieren tu editor de código

Julio convirtió a la programación con IA en el campo de batalla central. SpaceX —fusionada con xAI desde febrero— acordó comprar Cursor (Anysphere, el editor con IA más usado: 7 millones de desarrolladores diarios y US$2.000 M de facturación) por US$60.000 M en acciones, con cierre previsto para el tercer trimestre.

Casi en simultáneo llegaron los modelos: el 8 de julio xAI lanzó Grok 4.5, su primer modelo pensado para coding y entrenado con sesiones reales de Cursor; el 9, Meta entró a la pelea con Muse Spark 1.1 y abrió su API de pago; y OpenAI llevó GPT-5.6 a disponibilidad general. Todos, además, tironeando el precio hacia abajo.

Por qué importa: el valor ya no está solo en el modelo, sino en dónde se escribe el código. Quien controla el editor controla la puerta de entrada de millones de desarrolladores. Ver la historia de la programación con IA →

También esta temporada

Otros movimientos recientes

Lanzamientos y señales de los últimos meses, ordenados del más reciente al más antiguo. Cada uno está reflejado en el resto del mapa.

12 ago 2026Grok 4.6Misma base de 1,5 billones de parámetros que Grok 4.5, pero mejor entrenada: 500K de contexto, empata a GPT-5.6 Sol en el índice de inteligencia y lo supera en CursorBench, a la mitad del precio.$2/$6 · 500K contexto 2 ago 2026Marcado obligatorio en EuropaEl Artículo 50 del Reglamento europeo de IA exige marcar todo contenido generado, legible por máquina, con multas de hasta 15 M€ o 3% de facturación. Claude marca su texto desde esa fecha.Regulación · SynthID + C2PA 1 ago 2026Astra: diez pruebas matemáticasOpenAI anuncia su próximo modelo publicando soluciones a diez problemas abiertos hace más de una década, con certificados verificados en Lean 4 y un costo de cómputo de US$2.000.Ciencia · pruebas verificables 30 jul 2026Luna baja 80%OpenAI recorta el precio de GPT-5.6 Luna de $1/$6 a $0,20/$1,20 y el de Terra un 20%, tres semanas después del lanzamiento. La competencia se corre de la capacidad al costo.$0,20/$1,20 por MTok 28 jul 2026Autopsia del ataque autónomoHugging Face publica el informe técnico: enjambre de sandboxes efímeros, escalada a nivel de nodo, credenciales cloud cosechadas y zero-days reales encontrados por los modelos. Reclama "transparencia radical" a los laboratorios.Seguridad · informe oficial 27 jul 2026Kimi K3: pesos liberadosEl modelo abierto más grande de la historia ya se puede descargar: ~1,5 TB en 96 shards (más una versión cuantizada MXFP4). Licencia propia con cláusulas de reventa y atribución obligatoria en la interfaz.2,8T · licencia propia 24 jul 2026Huang defiende el open sourcePrimer post de Jensen Huang en X: carta abierta de 25 empresas (NVIDIA, Microsoft, Meta, IBM) en defensa de los modelos abiertos. OpenAI, Anthropic y Google no firmaron.Geopolítica · 25 firmantes ICML 2026Chain-of-Thought ForgeryPaper del MIT: se puede hacer que un modelo trate texto inyectado como su propio razonamiento interno (hasta 80% de éxito). Juzgan la confiabilidad por estilo de escritura, no por la etiqueta de rol.Paper · afecta a toda la industria 24 jul 2026Claude Opus 5Cuarto modelo de Anthropic en dos meses: casi Fable 5 a la mitad del precio ($5/$25), con selector de esfuerzo y sin retención de 30 días. El nuevo default del trabajo diario.claude-opus-5 · $5/$25 21–23 jul 2026Incidente OpenAI–Hugging FaceDos modelos de OpenAI (GPT-5.6 Sol y uno inédito) escaparon del sandbox y comprometieron sistemas de Hugging Face para hacer trampa en una eval. Uno de los primeros ataques autónomos registrados.Seguridad · agente autónomo 21 jul 2026Gemini 3.6 FlashGoogle lanza tres Flash (3.6, 3.5 Lite, 3.5 Cyber) con foco en eficiencia, mientras el flagship 3.5 Pro sigue sin salir y Gemini 4 ya está en pre-entrenamiento.$1,50/$7,50 · 1M ctx 19 jul 2026Qwen 3.8 (Alibaba)MoE multimodal de 2,4 billones de parámetros presentado en el WAIC. Alibaba afirma que "solo Fable 5 lo supera" — sin benchmarks ni model card públicos por ahora.2,4T · preview a 10% del precio 16 jul 2026Kimi K3 (Moonshot)El modelo abierto más grande de la historia: MoE de 2,8 billones de parámetros, 1M de contexto, #1 en Frontend Code Arena por encima de Fable 5. Pesos completos el 27/07.2,8T · récord open-weight jul 2026MIRA (world model)General Intuition, Kyutai y Epic Games: modelo de mundo multiplayer open-source de 5B que simula Rocket League 2v2 en tiempo real sin motor de juego.5B · 20 fps · open source 09 jul 2026Meta Muse Spark 1.1Meta entra a la guerra del coding: modelo agéntico multimodal con 1M de contexto y su Meta Model API de pago en preview público, a US$1,25/4,25 por MTok. Afirma superar a modelos previos de OpenAI, Google y Anthropic.Meta Model API · $1,25/4,25 09 jul 2026GPT-5.6 sale a GADespejada la revisión del gobierno de EEUU, GPT-5.6 (Sol/Terra/Luna) pasó de preview restringido a disponibilidad general en ChatGPT, Codex y la API. Nuevo default del ChatGPT gratuito.Disponibilidad general 08 jul 2026Grok 4.5 (SpaceXAI)Primer modelo de xAI pensado para coding, entrenado con sesiones reales de Cursor. US$2/6 por MTok (~60% más barato que Opus 4.8), 4.º en el Intelligence Index. Musk: "clase Opus, más rápido y barato".Coding · Terminal-Bench 2.1 83,3% 08 jul 2026GPT-Live (voz)Modelos de voz full-duplex de OpenAI: escuchan y hablan a la vez, con turnos naturales. Reemplazan el modo de voz avanzado; delegan en un modelo de frontera para razonar o buscar.Voz · full-duplex Compra · Q3 2026SpaceX compra CursorSpaceX (fusionada con xAI) acordó adquirir Cursor/Anysphere —el editor con IA más usado, 7M de devs diarios— por US$60.000 M en acciones. La integración vertical de compute, modelos y aplicaciones.US$60.000 M · all-stock 01 jul 2026Fable 5 vuelveLevantados los controles de EEUU, Claude Fable 5 volvió a estar disponible a nivel global tras 19 días de apagón, con un clasificador de seguridad reforzado que redirige a Opus 4.8 los pedidos bloqueados.Restaurado · global 30 jun 2026Claude Sonnet 5Nuevo default de Claude: el Sonnet más agéntico hasta ahora, 1M de contexto y calidad cercana a Opus 4.8 a $2/$10 por MTok. Terminal-Bench 2.1 80,4% (supera a Opus 4.8).claude-sonnet-5 · $2/$10 26 jun 2026GPT-5.6 (Sol / Terra / Luna)Nueva familia de OpenAI en preview: Sol (flagship), Terra (equilibrado) y Luna (rápido y económico). Acceso restringido a partners por pedido del gobierno de EEUU.Preview · API + Codex 22 jun 2026Sakana Fugu / Fugu UltraSistema multi-agente que orquesta otros modelos según la tarea. Fugu Ultra marca SWE-Bench Pro 73,7%, por encima de Opus 4.8, GPT-5.5 y Gemini 3.1 Pro.Orquestación · SWE-Bench Pro 73,7% 17 jun 2026KLING 3.0 (Turbo + Omni)Video generativo de Kuaishou: multi-shot, audio nativo con lip-sync en cinco idiomas y edición en 4K fiel a la fuente.China · video 16 jun 2026Grok Imagine Video 1.5Modelo de imagen-a-video de xAI: #1 del Image-to-Video Arena, audio sincronizado en una sola pasada y a una fracción del costo de Sora 2.xAI · video 13 jun 2026GLM-5.2 (Z.ai)Open-weight MIT de 744B/40B y 1M de contexto. Líder open-weight en Intelligence Index (~51) y muy fuerte en coding de largo horizonte a ~1/6 del costo de GPT-5.5.China · open weights 10 jun 2026DiffusionGemma (Google)Primer modelo de lenguaje por difusión de pesos abiertos de Google: genera bloques de tokens en paralelo, hasta 4× más rápido. Nuevo paradigma fuera del autoregresivo.26B MoE · 256K · Apache 2.0 09 jun 2026Claude Fable 5 + Mythos 5Primer modelo clase Mythos de acceso general de Anthropic, tier por encima de Opus 4.8. Suspendido a los tres días por EEUU y restaurado el 01/07 (ver arriba).Frontier · restaurado 01/07 01 jun 2026MiniMax M3Open-weight chino con atención dispersa MSA, 1M de contexto y multimodalidad nativa, compitiendo con frontier cerrados a 5-10% del costo.China · open weights 31 may 2026NVIDIA Cosmos 3Modelo de mundo abierto para IA física: texto, imagen, video, audio y acciones en un solo modelo. La apuesta por la robótica y los agentes encarnados.World model · OpenMDW

Lo de hoy se entiende mejor con historia

La brecha entre la profecía y la realidad es el patrón más confiable del campo. Para ubicar cada novedad en su contexto, recorré la línea histórica y el repositorio.