2026-09-23
Sebastian Raschka
modelos
★★★★☆
Xiaomi lanza MiMo-V2.6 Pro, que alcanza el primer puesto (promedio ponderado) en benchmarks de modelos open-weight pese a usar una arquitectura clásica de Grouped Query Attention con Sliding Window Attention de solo 128 tokens. Según el informe técnico, las mejoras provienen de datos y receta de post-training: más tareas de agente y entrenamiento en distintos harnesses (pass@1 en DeepSWE sobre harnesses held-out sube de ~50% a ~66%), un agentic grader que evalúa trazas de ejecución en lugar de un verificador de corrección simple, y batches de RL grandes (1.568 prompts × 16 rollouts = 25.088 trayectorias, 2.7–3.7 mil millones de tokens de entrenamiento por update).
IMPORTA: Refuerza que el rendimiento puntero viene del data y del post-training (agentes, reward signals sobre trazas, batches de RL masivos), no de variantes de atención exóticas, lo que orienta dónde invertir esfuerzo al construir o afinar mod
Por qué importa: Refuerza que el rendimiento puntero viene del data y del post-training (agentes, reward signals sobre trazas, batches de RL masivos), no de variantes de atención exóticas, lo que orienta dónde invertir esfuerzo al construir o afinar modelos propios.
The Verge · IA
agentes
★★★☆☆
Rabbit, la empresa del dispositivo R1, lanza OS3, un "agentic operating system" que corre en la nube pero opera localmente en dispositivos Windows, Mac y Linux, sin necesidad del hardware R1. Permite añadir hasta cinco dispositivos por cuenta y modelos de IA a elegir, y decide automáticamente qué dispositivos, archivos, apps y modelos necesita para cada tarea; se accede vía web de escritorio, Telegram, iMessage o el R1. La compañía dejó de fabricar el R1 y planea un "cyberdeck" de vibe-coding que ejecutará OS3 en unos meses.
IMPORTA: Es un caso concreto de agente que orquesta recursos locales y modelos externos a través de varios dispositivos y canales de mensajería, lo que plantea cómo diseñar permisos, contexto y memoria cuando el agente actúa fuera de tu infraestructura.
Por qué importa: Es un caso concreto de agente que orquesta recursos locales y modelos externos a través de varios dispositivos y canales de mensajería, lo que plantea cómo diseñar permisos, contexto y memoria cuando el agente actúa fuera de tu infraestructura.
↳ Contexto: Meta AI is getting a Mac app · ver hilo completo
The Verge · IA
seguridad
★★★★☆
Meta parcheó una vulnerabilidad zero-day en su app Muse para macOS que, según el investigador Patrick Wardle, permitía a atacantes con acceso local redirigir el procesamiento de transcripción desde los servidores de Meta a un endpoint propio y tomar control de la cuenta Muse. Wardle demostró pruebas de concepto capaces de tomar fotos y escribir archivos maliciosos en disco a través del agente sin alertar al usuario en muchos casos, y Meta publicó un hotfix horas después. Meta sostiene que el riesgo real era bajo porque el exploit requería acceso local al dispositivo.
Por qué importa: Es un caso concreto de cómo un agente de IA en el escritorio puede convertirse en vector de ataque cuando su configuración no está protegida y parte del procesamiento ocurre en la nube, algo directamente relevante para quien diseña o despliega agentes con acceso a archivos y sistema local.
↳ Contexto: Meta’s Muse is creepy, but maybe not for the reasons you think · ver hilo completo
TechCrunch · IA
producto
★★★☆☆
Snorkel AI ha levantado una Serie E de 350 millones de dólares a una valoración de 3.500 millones, casi el triple de los 1.300 millones de su Serie D 17 meses antes, liderada por Insight Partners y S32. La empresa pasó de software de automatización de etiquetado a vender datasets completos y entornos de reinforcement learning bajo un modelo de data-as-a-service híbrido (generación sintética más expertos de dominio), con un run rate anualizado de 375 millones. Se enmarca en el mismo boom que otras compañías de datos de entrenamiento como Micro1, que ya cubrimos con su run rate bruto de 500 millones.
IMPORTA: Muestra que el cuello de botella de los labs se ha desplazado hacia datos de entrenamiento y entornos de RL listos para usar, un insumo que quien entrena o hace fine-tuning de modelos tendrá cada vez más externalizado.
Por qué importa: Muestra que el cuello de botella de los labs se ha desplazado hacia datos de entrenamiento y entornos de RL listos para usar, un insumo que quien entrena o hace fine-tuning de modelos tendrá cada vez más externalizado.
↳ Contexto: AI data startup Micro1 reaches $500M gross run rate amid AI training boom · ver hilo completo
TechCrunch · IA
producto
★★★☆☆
Meta admite, vía Nat Friedman (responsable de producto de Meta Superintelligence Labs), que su app Muse estuvo "fuertemente inspirada como producto" en OpenClaw, aunque afirma que se construyó desde cero; la polémica surgió cuando usuarios señalaron que Muse reutiliza nombres de archivos del workspace de OpenClaw, incluido SOUL.md, con contenido casi idéntico. Friedman respondió que el creador de OpenClaw, Peter Steinberger, "acertó" con esos elementos, y Meta aspiraba a algo como OpenClaw pero seguro, fácil de usar y escalable a miles de millones. Muse alcanzó el nº 1 en la App Store de EE. UU. Esta pieza continúa lo que ya publicamos sobre Muse en "Meta's Muse is creepy, but maybe not for the reasons you think".
Por qué importa: Muestra que los patrones de diseño de agentes personales de código abierto —incluidos archivos de configuración como SOUL.md— se están convirtiendo en el estándar que los grandes laboratorios replican, algo relevante para quien define arquitecturas y formatos de agentes.
↳ Contexto: Meta’s Muse is creepy, but maybe not for the reasons you think · ver hilo completo
Latent Space
modelos
★★★★★
Anthropic lanzó Claude Opus 5.5, primer modelo de la familia Claude 5.5, que rinde a nivel de Claude Fable 5.1 en la mayoría de tareas con precios de lista reducidos un 20% ($4/$20 por millón de tokens) y ~30% más rápido. El ahorro real por tarea se diluye en esfuerzo máximo porque el modelo usa más tokens (Artificial Analysis calcula $5.98 vs $5.86 por tarea en el Intelligence Index), aunque a esfuerzo medio sí baja coste. El system card reporta por primera vez escalado multi-agente de hasta 100 agentes paralelos, y aparece un patrón anómalo donde esfuerzos de razonamiento más altos empeoran resultados en coding agéntico. Es una continuación directa de la pieza sobre Claude Fable/Mythos 5.1 que ya cubrimos.
IMPORTA: Para quien sirve modelos o diseña agentes, dos señales operativas: el precio por token ya no predice el coste por tarea (los tokens extra y el cache read lo dominan), y subir el esfuerzo de ra
Por qué importa: Para quien sirve modelos o diseña agentes, dos señales operativas: el precio por token ya no predice el coste por tarea (los tokens extra y el cache read lo dominan), y subir el esfuerzo de razonamiento puede degradar benchmarks agénticos por scope
↳ Contexto: [AINews] Claude Fable/Mythos 5.1: new SOTA model, 75% cache price cut but 70% more output tokens · ver hilo completo
Latent Space
investigacion
★★★★☆
Entrevista a John Platt (Google) sobre ERA, un sistema que usa Gemini/LLMs para resolver automáticamente tareas científicas formulado como "scoreable tasks", manteniendo un árbol de experimentos tipo notebooks con búsqueda guiada por la regla Upper Confidence Bound (pariente de Monte Carlo Tree Search). El equipo resolvió al menos diez papers con ERA, incluyendo un modelo para el efecto de los contrails en el calentamiento global que llevaba dos años atascado, y Platt señala un salto cualitativo entre Gemini 2.0 y 2.5 que hizo pasar el sistema de no funcionar a funcionar muy bien.
IMPORTA: ERA es un caso concreto de agente que opera sobre experimentos reales con búsqueda tipo MCTS y un LLM como motor de mutación, un patrón de diseño directamente trasladable a pipelines de AutoML, optimización y automatización de workflows técnicos.
Por qué importa: ERA es un caso concreto de agente que opera sobre experimentos reales con búsqueda tipo MCTS y un LLM como motor de mutación, un patrón de diseño directamente trasladable a pipelines de AutoML, optimización y automatización de workflows técnicos.
NVIDIA Technical Blog
investigacion
★★★★★
SWE-Serve es un benchmark desarrollado con aportes del equipo de SGLang que convierte 83 pull requests mergeados de SGLang en 53 tareas ejecutables repartidas en seis familias de ingeniería de inferencia (model enablement, decoding, caching, scheduling, serving APIs y ejecución distribuida). En 19 tareas que levantan un servidor real, los mismos parches pasan el 45.9% con verificación completa pero el 69.4% si se excluyen los tests de live serving, es decir, uno de cada tres parches que pasan el resto de comprobaciones falla al servir en vivo. Las tareas que cruzan varios dominios de runtime (request handling, scheduling, model execution, KV-cache) muestran una tasa de éxito 21.3 puntos porcentuales menor que las de un solo dominio, y en 11 modelos evaluados con mini-swe-agent en condiciones closed-book el pass@1 medio va del 34.6% al 75.5%.
Por qué importa: Si tu coding agent genera parches que pasan los tests locales pero fallan cuando se carga el modelo real y se sirven peticiones, este benchmark mide exactamente ese punto ciego
↳ Contexto: How to Evaluate AI Agents From Tool Calls to Task Completion · ver hilo completo
Ars Technica · IA
seguridad
★★★★★
Microsoft lideró la disrupción de EvilTokens, una plataforma de suscripción que usaba un chatbot con IA para comprometer 12.000 cuentas de Microsoft en 10.000 organizaciones mediante device code authentication y OAuth de Microsoft Entra. La plataforma automatizaba el envío de spam, analizaba hasta 5.000 correos a la vez para identificar empleados con autorización de pago y redactaba correos de fraude que suplantaban contactos de confianza. Microsoft incautó 50 sitios web y 150 dominios, y la Policía Metropolitana de Londres arrestó a dos hombres.
Por qué importa: Acorta drásticamente la ventana entre el compromiso de un buzón y la comprensión de su contenido, obligando a replantear la verificación fuera de canal y la monitorización de identidad para el fraude de pago.
Ars Technica · IA
seguridad
★★★★☆
La provincia de Columbia Británica demandó a OpenAI y a Sam Altman exigiendo que paguen la reconstrucción de la escuela secundaria de Tumbler Ridge, demolida tras el tiroteo de febrero de 2026 en el que un atacante usó ChatGPT para planificar la violencia y que dejó ocho muertos. La demanda también pide medidas cautelares, incluida la obligación de que ChatGPT termine automáticamente las conversaciones violentas, y exige que se hagan públicos los logs de chat del atacante, que hasta ahora OpenAI solo compartió con la RCMP. La provincia sostiene que OpenAI no ha hecho ChatGPT más seguro tras varios tiroteos con patrones recurrentes de uso violento y acusa a la empresa de ocultar los logs para proteger su salida a bolsa. Esta demanda amplía lo que ya cubrimos en "OpenAI accused of 'aiding and abetting' Tumbler Ridge mass shooting in dozens of new lawsuits".
Por qué importa: Para quien construye o despliega sistemas de IA, marca un precedente sobre cómo el análisis de logs y las políticas de moderación pueden convertirse en evidencia legal y en obligaciones exigibles judicialmente, con implicaciones directas para la reten
↳ Contexto: OpenAI accused of ‘aiding and abetting’ Tumbler Ridge mass shooting in dozens of new lawsuits · ver hilo completo
llama.cpp (release)
infraestructura
★★★★☆
El release b11136 de llama.cpp actualiza llama-server para aceptar el tipo de contenido "video_url" de la API de chat completions de OpenAI, con objeto {"url": ...}, y admite URIs data: con video en base64 (por ejemplo data:video/mp4;base64,...). Antes el servidor solo aceptaba el tipo no estándar "input_video" y rechazaba URIs data: para video (accept_base64_uri=false), lo que hacía fallar a clientes conformes con OpenAI con errores como "unsupported content[].type" o "Invalid uri format".
IMPORTA: Si sirves modelos multimodal vía llama-server, ahora puedes usar clientes compatibles con la API de OpenAI que envíen video por URI data: sin adaptaciones, evitando fallos de compatibilidad en ese tipo de contenido.
Por qué importa: Si sirves modelos multimodal vía llama-server, ahora puedes usar clientes compatibles con la API de OpenAI que envíen video por URI data: sin adaptaciones, evitando fallos de compatibilidad en ese tipo de contenido.
Simon Willison
modelos
★★★★★
Anthropic lanzó Claude Opus 5.5 y, una hora después, OpenAI publicó GPT-6 Sol y GPT-6 Luna, en un contexto de guerra de precios entre proveedores. GPT-6 Luna se sitúa en $0.10/$0.50 por millón de tokens (la mitad que GPT-5.6 Luna), mientras que Opus 5.5 baja un 20% a $4/$20 y recorta un 60% el precio de las lecturas de caché. En las pruebas del autor, Opus 5.5 con nivel de razonamiento "max" agotó el límite de 128.000 tokens de salida sin devolver respuesta al dibujar un pelícano en SVG, algo que no ocurrió con Fable 5.1 en el mismo nivel. IMPORTA: Para quien construye sistemas agénticos, la caída del precio de las lecturas de caché y de los tokens de salida cambia de forma directa el coste de las conversaciones largas y de los coding agents, y el fallo de Opus 5.5 en "max" avisa de que un nivel de esfuerzo
Por qué importa: Para quien construye sistemas agénticos, la caída del precio de las lecturas de caché y de los tokens de salida cambia de forma directa el coste de las conversaciones largas y de los coding agents, y el fallo de Opus 5.5 en "max" avisa de que un nivel de esfuerzo agresivo puede consumir el presupuesto
↳ Contexto: Anthropic releases Opus 5 with ‘close’ to Fable 5’s capabilities · ver hilo completo
Google DeepMind
seguridad
★★★★☆
Google DeepMind describe una actualización de su plataforma Private AI Compute que añade una capa de memoria persistente en servidor, con datos cifrados en almacenamiento dedicado y claves criptográficas custodiadas solo en los dispositivos del usuario. El sistema usa secure enclaves con canales cifrados end-to-end y bases de datos por usuario para descifrar temporalmente los datos en memoria aislada durante cada petición y volver a cifrarlos al terminar. Junto al whitepaper técnico actualizado, publican un registro público a prueba de manipulación del software de servidor y los resultados de una auditoría independiente. El texto continúa la línea de nuestro artículo previo sobre memoria personal a largo plazo.
Por qué importa: Resuelve el problema de que la memoria de un asistente en la nube fuera hasta ahora stateless, algo clave si diseñas sistemas de memoria persistente sobre inferencia en servidores gestionados por terceros.
↳ Contexto: To Memories and Beyond: From Remembering to Knowing You across Long-Term Multimodal Personal Archives · ver hilo completo
Google DeepMind
modelos
★★★★☆
Google DeepMind lanza Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, modelos de text-to-speech que permiten generar voces originales desde cero y dirigir la entrega línea a línea con control de acento y tono emocional, frente a los 30 presets vocales anteriores. El modelo 3.8 Flash TTS lidera el Voice Design Benchmark de Hume AI (71.4) y el apartado de modelado de acento (60.8), con soporte de más de 100 idiomas. Incluye verificación de consentimiento verbal para replicación de voz y watermarking SynthID en todo audio generado, además de integración con la Gemini API y plataformas como LiveKit, Pipecat, Agora y Vercel.
IMPORTA: Para quien construye agentes de voz o pipelines conversacionales, contar con TTS que combine voces personalizables, control granular de entrega y watermarking verificable cambia los requisitos de diseño de sistemas de audio generado, especialmente en verificación de identidad y trazabilidad de contenido sintético.
Por qué importa: Para quien construye agentes de voz o pipelines conversacionales, contar con TTS que combine voces personalizables, control granular de entrega y watermarking verificable cambia los requisitos de diseño de sistemas de audio generado, especialmente en verificación de identidad y trazabilidad de contenido sintético.
arXiv cs.CL
investigacion
★★★☆☆
El paper estudia la invariancia en la representación numérica de los language models: una misma cantidad expresada de formas distintas produce respuestas diferentes. El autor publica artefactos reproducibles sobre varios modelos en distintas cuantizaciones (gpt-oss-20b en mxfp4, mistral-small4 en q4, qwen35 en 4b/9b y q4/q8), con benchmarks, métricas de consenso, análisis de disenso y scripts de reproducción. No hay relación con nuestro artículo previo sobre uncertainty-aware decision making en modelos multimodales.
IMPORTA: Que la respuesta de un LLM cambie según cómo se escriba el mismo número es un fallo silencioso que afecta a evaluación, extracción de datos y cualquier pipeline numérico, y aquí viene con artefactos por cuantización para medirlo en modelos concretos.
Por qué importa: Que la respuesta de un LLM cambie según cómo se escriba el mismo número es un fallo silencioso que afecta a evaluación, extracción de datos y cualquier pipeline numérico, y aquí viene con artefactos por cuantización para medirlo en modelos concretos.
↳ Contexto: Uncertainty-Aware Decision Making in Multimodal Large Language Models · ver hilo completo
arXiv cs.CL
investigacion
★★★☆☆
Un paper de arXiv propone un paradigma de fusión de POIs de doble fuente cifrada (DSEP) usando un LLM sin entrenamiento, con un bucle cerrado que refina iterativamente la correspondencia de atributos y la transformación de ubicación. Combina matching de atributos guiado por LLM (reduciendo la complejidad de O(N^2) a O(N)) con optimización por enjambre de partículas en subregiones agrupadas por ISODATA, y alcanza convergencia en unas dos iteraciones. Sobre 31 capitales provinciales y municipios de China continental logra un residuo medio de fusión de ubicación de 4.58 m y una precisión de fusión de atributos del 95.12%, mejorando baseline y estado del arte en 1.77 m y 14.87% respectivamente, y permite georreferenciar datos vectoriales cifrados a WGS-84 sin puntos de control de campo.
Por qué importa: Muestra un uso de LLMs fuera del texto como motor de optimización de bucles cerrados sobre datos geoespaciales sucios, con la reducción algorítmica O(N^2)→O(N)
arXiv cs.CL
investigacion
★★★★☆
Un paper de arXiv estudia qué pasa cuando un agente escribe sus conclusiones en un store del que luego recupera información, y sostiene que el bucle no produce una degradación progresiva sino una elección entre dos estados límite, con un techo duro en (n-1)/n en un store append-only. Sobre 36 hechos de Wikidata, un primitivo medido sin parámetros ajustados, la función de copia gamma, predice la dirección del drift en 353 de 360 ejecuciones con hechos reales, y en el frontier agrupado reporta una captura de 0.850, con claude-sonnet-4.5 capturado en 20 de 20 semillas. El trabajo incluye análisis de intervenciones (el timing domina sobre la fracción a presupuesto igualado) y un control de 44 semillas donde un ordenamiento pasa de Spearman +0.98 a +0.31-0.80.
Por qué importa: Cualquiera que construya agentes con memoria o RAG que se retroalimenta necesita saber que la contaminación del propio store puede ser un problema de estado límite y no de decaimiento, y que las métricas agreg
arXiv cs.CL
investigacion
★★★★★
Un paper de arXiv demuestra por primera vez la transferencia de estado recurrente persistente entre dos modelos híbridos de distinto tamaño (una pareja Qwen3.5 4B-to-9B), sin que el receptor tenga que releer el prefijo de contexto. Transferir solo el KV cache de atención deja una brecha grande; añadir el paquete de estado persistente de Gated DeltaNet (GDN) reduce el NLL en 0.747 nats/token (IC bootstrap 95% [0.6921, 0.8047]) y mejora los 64 documentos de PG19. Una corrección adicional de 434.176 parámetros deja la pérdida de continuación a 0.076 nats/token por encima del 9B nativo, con divergencia JS de 0.022 y recuperación de contexto nativo (NCR) de 0.918, superando al 4B continuado sin procesar tokens de prefijo histórico; los autores advierten que la evidencia cubre una sola dirección, una pareja de modelos con geometría emparejada y continuación teacher-forced de 4
arXiv cs.CL
investigacion
★★★★☆
El paper propone "Memory of Memory" (MoM), un enfoque de memoria para agentes LLM de largo horizonte que registra no solo el contenido sino la procedencia, el estado y el historial de cada entrada, en lugar de reconstruir el presente en tiempo de consulta. Lo instancian como Provenant Memory (P-Mem), un grafo tipado de procedencia cuya "active frontier" expone un valor vigente por clave resuelta mientras los valores desplazados se conservan como procedencia, con operaciones tipadas que deciden si una observación apoya, reemplaza, impugna, rechaza, revoca o resuelve un valor existente. Reporta que iguala en accuracy a la mejor memoria de retrieval con ~4x menos tokens de lectura, reduce la tasa de respuestas obsoletas ante actualizaciones de conocimiento (19.4% a 10.9%), se mantiene en 100% en cadenas de revisión donde la lectura en tiempo de consulta cae al 25%, y recupera errores ya commitados que una memoria CRUD no puede (100% vs. 0%).
Por qué importa: Para quien diseña memoria de agentes de largo horizon
Construir este día costó 189.703 tokens de entrada
y 22.103 de salida en 96 llamadas a modelos — unos 0,1330 $.