2026-07-20
Simon Willison
Email de Sam Altman a la junta de OpenAI (octubre 2022), expuesto en el litigio Musk v. Altman (2026), donde expresa la intención de lanzar un modelo de lenguaje con capacidades aproximadas a GPT-3 ejecutable localmente en hardware consumer antes que competidores, con el objetivo estratégico de desincentivar a otros de liberar modelos similares y dificultar la financiación de nuevos proyectos.
arXiv cs.CL
Paper que propone usar LLMs pretrenados como aprendices multimodales unificados para predicción clínica, convirtiendo todos los datos de pacientes (narrativas clínicas, signos vitales, valores de laboratorio) en secuencias de texto único sin necesidad de arquitecturas de fusión específicas por tarea. Evalúan el enfoque en tres tareas clínicas distintas (mortalidad hospitalaria, predicción de fallo de injerto, triaje de urgencias) usando ModernBERT y varios decodificadores (Llama 3.1, Gemma, DeepSeek-R1-Qwen, Qwen3), demostrando que la serialización textual unificada iguala o supera baselines multimodales especializados y sistemas en uso clínico.
arXiv cs.CL
Investigadores identifican mediante una técnica llamada "Jacobian lens" un espacio de representaciones en LLMs análogo a un workspace global de la teoría de la conciencia, donde el modelo "verbaliza" conceptos intermedios accesibles para razonamiento flexible y deliberado. Este J-space exhibe propiedades estructurales y funcionales características (contenido coherente en capas intermedias, capacidad de broadcast, ~10s de conceptos simultáneos) y permite auditar comportamientos alineados/desalineados ocultos en la salida; los autores proponen "counterfactual reflection training" para mejorar comportamiento entrenando solo representaciones que el modelo expresaría si fuera interrumpido.
arXiv cs.CL
VarRate es un método training-free para comprimir el KV cache en LLMs de contexto largo, asignando a cada token un rango bajo-rang variable según su relevancia con la consulta, sin descartar tokens. Logra degradación de solo 3.5-5.5 puntos en LongBench con compresión al 20% de memoria en modelos como Llama-3.1-8B y Qwen2.5-7B, superando métodos de evicción irreversible (que pierden 11-15 puntos) y codificación uniforme.
arXiv cs.CL
EpiNarrate es un framework agentico que genera narrativas públicas sobre proyecciones epidemiológicas separando el razonamiento numérico estructurado de la generación de lenguaje natural, usando una gramática de comparación que garantiza consistencia semántica y aritmética. Evaluado en el COVID-19 Scenario Modeling Hub, mejora la fundamentación factual y cobertura de patrones epidemiológicos respecto a resúmenes directos con LLMs, mientras preserva el estilo de reportes escritos por expertos.
arXiv cs.CL
SkillCorpus es un framework que consolida y evalúa un ecosistema de ~821,000 skills (archivos SKILL.md) de código abierto para agentes LLM, filtrándolos a 96,401 skills organizados por taxonomía y métricas de calidad, e integrando un stack de recuperación fino. Evaluado en tres benchmarks diferentes, el corpus genera ganancias consistentes de hasta +7.5 pp en rendimiento de tareas reales de agentes, siendo el primer análisis operacional que mide cuándo y dónde un corpus comunitario curado mejora efectivamente la ejecución de agentes.
arXiv cs.CL
Proponen PATR (Process-Scorer Guided Adaptive Tree Rollout), un framework de RL para agentes LLM que organiza las trayectorias multi-turno como árboles y utiliza process feedback para detectar estados prometedores, evitando exploración uniforme ineficiente en tareas largas. Evalúan el método en SWE-Bench y FrozenLake, logrando mejoras de hasta +5.0 y +9.3 puntos respectivamente en comparación con métodos estándar como GRPO/RLOO.
arXiv cs.CL
Proponen AdaLook, un framework de lookahead adaptativo para modelos de lenguaje con difusión (DLMs) que mejora el trade-off entre precisión y eficiencia de decodificación. El método determina dinámicamente cuándo continuar explorando estados futuros basándose en varianza de scores y permite expansión de ramas en estados intermedios informativos, logrando mejor rendimiento que métodos de lookahead de un paso en múltiples benchmarks.
arXiv cs.CL
El paper propone BIRD, un método de destilación iterativa del razonamiento de modelos que reduce la longitud de cadenas de pensamiento manteniendo precisión. BIRD resuelve un cuello de botella de inicialización en destilación autosupervisada existente: primero genera soluciones concisas con instrucciones de brevedad y filtra las correctas, luego aplica destilación on-policy, logrando en Qwen3-8B mejorar precisión en MATH-500 de 86.2% a 92.0% mientras reduce la longitud promedio de respuesta de 3,099 a 1,115 tokens.
arXiv cs.CL
Se presenta Prospective Hypothesis Discovery (PHD), un benchmark que evalúa la capacidad de los LLMs para construir autónomamente espacios de hipótesis grounded y testables a partir de evidencia incompleta, sin conclusiones previas. HypoArena incluye 988 casos en seis dominios científicos/analíticos con una metodología de evaluación basada en juicios pareados bidireccionales y puntuación multidimensional, revelando estratificación clara en capacidades entre 15 modelos frontier, donde modelos de menor rendimiento mejoran mientras otros retroceden.
arXiv cs.CL
Estudio que propone usar summarización con modelos GPT-5 (variantes GPT-5, GPT-5 mini y GPT-5 nano) para resolver limitaciones de longitud de entrada en transformers para evaluación automática de ensayos, combinando resúmenes generados con características lingüísticas extraídas del texto original. Los resultados muestran trade-offs entre capacidad del modelo, calidad de síntesis y coste computacional, con GPT-5 mini logrando mayor acuerdo con puntuaciones humanas mientras que GPT-5 produce mejor calidad de resumen, aunque con pérdida de información en ensayos complejos.
arXiv cs.CL
Presentan CAMMAR, un framework de representación que organiza incrustaciones de modelos de lenguaje árabe en subespacios anidados (léxico, cultural y metafórico) mediante currículo semántico por etapas, fundamentado en la teoría de nazum de Al-Jurjani. La propuesta detecta metáforas en árabe mediante una medida geométrica que explota la distancia entre representaciones léxicas y metafóricas, logrando AUC de hasta 0.84 en un nuevo conjunto de anotaciones y demostrando que la detección requiere supervisión explícita para emerger.
arXiv cs.CL
Estudio sobre la confiabilidad de señales de toxicidad en textos multilingües y code-mixed (mezcla de idiomas) del subcontinente indio, especialmente en redes sociales. Proponen ToxGate, un mecanismo que condiciona señales auxiliares de toxicidad según el contexto lingüístico antes de integrarlas en predicciones, mejorando la detección de abuso en datasets in-domain y transfer, con ganancias más notables en casos de alto riesgo como insultos explícitos y amenazas violentas.
arXiv cs.CL
Paper sobre un método de compilación basado en MLIR para desplegar LLMs en aceleradores especializados, abordando la representación intermedia del modelo y la optimización de memoria en inferencia autoregresiva. El enfoque usa dos dialectos (TopOp para semántica agnóstica del framework y TpuOp para decisiones hardware) y divide cada capa Transformer en tres etapas (prefill, prefill_kv, decode) para optimizar tanto el procesamiento paralelo de prompts como la generación por token, implementado en TPU-MLIR con soporte para modelos Qwen, Llama, InternVL y MiniCPM-V.
arXiv cs.CL
Un estudio mide cuánta variabilidad en las anotaciones humanas de inferencia en lenguaje natural (NLI) se explica por estructura semántica formal, usando análisis preregistrados sobre 3.113 items de SNLI y MNLI en ChaosNLI. Los hallazgos principales muestran que la estructura semántica (monotonía) explica solo el 3.3-3.6% de la varianza en desacuerdo anotador y no identifica reliablemente qué items generan mayor desacuerdo, sugiriendo límites prácticamente bajos para explicar la variación mediante formalismos semánticos.
arXiv cs.CL
Se presenta DECODEM, un conjunto de benchmarks para evaluar la extracción automatizada de variables de gobernanza corporativa desde documentos organizacionales usando LLMs. El estudio evalúa múltiples pipelines con diferentes estrategias de prompting y descomposición de tareas, demostrando que los modelos frontier pueden extraer información legalmente significativa de documentos corporativos complejos con alta precisión, aunque el rendimiento varía según la variable extraída.
arXiv cs.CL
Análisis mecanístico de cómo los modelos de difusión para lenguaje (DLMs) implementan inducción, un mecanismo clave del aprendizaje en contexto, revelando un circuito de atención bidireccional que funciona aprovechando información de ambos lados del token enmascarado. El estudio compara DLMs con transformers autorregresivos de arquitectura equivalente y demuestra que los DLMs superan en inducción cuando acceden a contexto bilateral, pero no cuando solo ven contexto izquierdo como los modelos AR tradicionales.
arXiv cs.CL
Artículo de posición sobre las auto-explicaciones generadas por LLMs, cuestionando su fidelidad real al proceso de razonamiento del modelo a pesar de parecer plausibles. Propone nuevos protocolos de evaluación y criterios que vayan más allá de la plausibilidad, enfatizando la "accionabilidad" de las explicaciones para aplicaciones prácticas de IA interpretable.
arXiv cs.CL
Presenta BayesPO, un método que reformula la optimización de prompts como muestreo posterior bayesiano sobre tokens discretos, combinando una likelihood basada en ejemplos entrada-salida con un prior de modelo de lenguaje. Usa MCMC con propuestas Gibbs-with-Langevin guiadas por gradientes y templado paralelo para explorar landscapes de energía complejos, mejorando prompts de APE en tareas de inducción instruccional del 60% al 63% de precisión.
Import AI (Jack Clark)
Import AI reporta sobre las brechas entre modelos de IA abiertos y cerrados, el lanzamiento de Kimi K3 (modelo de razonamiento extendido), y un plan de política pública anunciado por Demis Hassabis; el título sugiere una reflexión sobre cómo la singularidad será percibida retrospectivamente como un período de transición.
Ars Technica · IA
Vinay Perneti de Augment Code argumenta por una interfaz de programación asistida por IA que vaya más allá de herramientas simples como grep, enfatizando la importancia del contexto rico para que los modelos de IA generen código más preciso y relevante. La pieza examina cómo los "harnesses" (arneses) de IA deben integrar mejor el contexto del proyecto para mejorar la utilidad de los asistentes de código actuales.
The Verge · IA
Empresas chinas de IA como Moonshot y Alibaba han lanzado nuevos modelos que compiten directamente con los de OpenAI y Anthropic, ofreciendo capacidades comparables a un costo significativamente menor. Los lanzamientos subrayan que la ventaja técnica estadounidense en IA se está estrechando rápidamente.
MIT Technology Review · IA
Investigación de MIT Technology Review revela que los LLMs utilizados en procesos de selección de personal pueden desarrollar sesgos propios más allá de los heredados de los datos de entrenamiento, lo que sugiere riesgos significativos cuando estos modelos evalúan currículums antes de que humanos intervengan.
arXiv cs.LG
Paper que cuestiona la aplicación del escalado probabilístico tradicional a la generación de circuitos cuánticos, argumentando que los modelos deben priorizar validez matemática sobre aumento de parámetros. Propone un enfoque centrado en verificadores en lugar de copilots, integrando restricciones jerárquicas y máscaras topológicas directamente en la generación, dado que el subconjunto válido de circuitos decae exponencialmente con el número de qubits.
arXiv cs.LG
Proponen un framework interpretable para clasificación médica basado en Bernoulli Naive Bayes con binarización estadística guiada por χ², que convierte variables continuas en reglas clínicas explícitas sin sacrificar rendimiento (AUC 0.800-0.984 en tres datasets benchmark). El trabajo enfatiza la reproducibilidad y confiabilidad probabilística mediante calibración cruzada, demostrando que el modelo puede ejecutarse con solo una tabla de referencia y aritmética básica, abordando la adopción de IA interpretable en medicina.
arXiv cs.LG
Paper que mejora la convergencia del algoritmo MGDA estocástico para aprendizaje multi-objetivo, proponiendo el método MoRe que explota continuidad de Lipschitz en la dirección conflict-avoidant bajo condiciones de regularidad; logra acelerar la tasa de convergencia de O(T^-1/4) a O(T^-1/2) en el caso no-convexo.
arXiv cs.LG
Estudio comparativo de cinco LLMs (GPT-4 Turbo, Claude 3 Opus, Gemini 1.5 Pro, Llama 3 70B y FinGPT) evaluando su capacidad para análisis técnico de mercados financieros mediante reconocimiento de patrones, generación de señales de trading y backtesting simulado. GPT-4 Turbo logra mejor rendimiento entre modelos generales y FinGPT competitivo en métricas ajustadas por riesgo, ambos superando el benchmark S&P 500, aunque todos presentan modos de fallo como alucinación numérica y limitaciones con ventanas de contexto.
arXiv cs.LG
Se presenta qZACH-ViT, un modelo Vision Transformer cuantizado para clasificación de imágenes médicas que combina eficiencia computacional con interpretabilidad mediante atribuciones a nivel de patch. El trabajo introduce RASO (Recursive Attribution-Stabilized Optimization), una técnica que alinea gradientes de clasificación y atribución para mejorar la estabilidad de las explicaciones, logrando 99.97% de concordancia entre versiones FP32 e INT8 con modelos 70% más pequeños y 2.39× más rápidos en CPU.
arXiv cs.LG
Un paper que caracteriza la interpretabilidad inherente de modelos de clasificación binaria comparando un modelo lineal estándar con un modelo de estado mixto de un único qubit, demostrando que este último aprende hiperplanos generalizados (hiperélipsoides) en lugar de límites lineales. El trabajo propone que esta analogía geométrica clara sirve como puente pedagógico accesible para introducir conceptos de machine learning cuántico a audiencias sin trasfondo en computación cuántica.
arXiv cs.LG
Se presenta Stochastic Reset Pathfinding (SRP), un problema de aprendizaje por refuerzo episódico en grafos dirigidos donde el agente selecciona caminos y cualquier fallo en una arista lo reinicia al origen, aplicable a redes cuánticas y redes de pago. El trabajo propone algoritmos PathUCB y PathTS basados en bandits combinatorios en cascada, con análisis de regret a nivel de caminos que descompone la complejidad según la confiabilidad acumulada de aristas, demostrando que PathTS funciona bien en la práctica aunque existen instancias adversariales donde falla.
arXiv cs.LG
LLM4EHR es un modelo foundation clínico que alinea temporalmente series de tiempo clínicas con secuencias de eventos médicos en registros de salud electrónica (EHR) mediante LLMs adaptados al dominio y un encoder transformer. El modelo utiliza una función objetivo contrastiva regularizada para aprender representaciones robustas de EHR-TS condicionadas a embeddings de eventos, demostrando mejor desempeño en tareas clínicas downstream e incluida transferibilidad a nuevas cohortes mediante adaptación k-shot.
arXiv cs.LG
Un paper que analiza el mecanismo de atención de Transformers usando teoría de grupo de renormalización de Wilsonian, tratando la atención como una perturbación del stack de MLPs residuales. Mediante pruebas en cadenas de Markov sintéticas, demuestra que la relevancia de la atención depende de la estructura espectral de los datos: es fuertemente relevante para correlaciones largas (cerrando brechas que MLP no puede salvar), irrelevante para correlaciones cortas, y que el primer head es responsable de la mayoría del cambio representacional.
arXiv cs.LG
Presenta Looped Latent Attention (LLA), un codec post-entrenamiento que comprime significativamente los cachés K/V en Transformers weight-tied (que reutilizan bloques) explotando la estructura baja-rango de los vectores latentes a través de loops de recurrencia. Logra compresiones de hasta 32x sin pérdida significativa de rendimiento y aumenta la capacidad de batch en decodificación en hasta 21.3x, con aplicaciones demostrables en tareas de razonamiento matemático.
arXiv cs.LG
Artículo sobre reinforcement learning con restricciones de "peak-cost" (costo máximo por trayectoria) para aplicaciones safety-critical, donde una violación única puede ser catastrófica. Los autores demuestran que estos MDPs restringidos no garantizan duality gap cero, proponen un framework de optimización con estimación robusta de valores basada en métricas de probabilidad integral, y validan que el método mantiene el rendimiento de recompensa mientras respeta restricciones ante perturbaciones en dinámicas.
arXiv cs.LG
Se presenta ADS-C, una defensa contra ataques de destilación de conocimiento en clasificadores que perturba las probabilidades servidas sin afectar las predicciones top-1 del modelo original. El método utiliza márgenes de confianza por entrada y garantiza costo cero de utilidad mientras degrada significativamente el aprendizaje del modelo atacante (hasta 29.6 puntos en CIFAR-10), invirtiendo el incentivo de realizar destilación adversarial.
arXiv cs.LG
Estudio que compara arquitecturas de deep learning (Vision Transformers y Graph Attention Networks) para detectar automáticamente apnea del sueño a partir de señales EEG multicanal en sujetos pediátricos. El modelo mejor (Vision Transformer entrenado con características de topological data analysis) alcanza AUC de 0.750, aunque muestra variación significativa según demografía del paciente y etapa del sueño, evidenciando desafíos pendientes para implementación clínica.
arXiv cs.LG
Paper que mejora métodos de XAI basados en perturbaciones para imágenes utilizando inpainting generativo en lugar de reemplazos de píxeles tradicionales, logrando muestras más fotorrealistas y alineadas con la distribución original de datos, lo que aumenta la calidad de explicaciones de modelos en LIME.
arXiv cs.LG
Un paper de arXiv que resuelve una paradoja en modelos de difusión: explica por qué pueden capturar todos los modos de una distribución multimodal pero fallar en estimar correctamente sus pesos relativos (amplitudes). Los autores demuestran que los pesos se recuperan con precisión si los scores en niveles intermedios de ruido contienen información sobre ellos, introducen el índice de sensibilidad DSSI para cuantificar esta dependencia, y prueban que para mezclas gaussianas el error de estimación de pesos es del mismo orden que la pérdida DSM; también muestran que ajustar el schedule de ruido puede reducir la amplificación de modos.
arXiv cs.LG
Un paper de arXiv que caracteriza empíricamente el caching de prompts en LLMs (específicamente en Anthropic Sonnet) y propone Cache-Aware Prompt Compression (CAPC), un método que combina compresión query-agnostic con control explícito de cache para reducir costos hasta 49-90% manteniendo calidad. Los autores demuestran que la compresión consciente del cache supera tanto al caching puro como a métodos query-aware en configuraciones realistas, validando en tres cargas de trabajo productivas.
arXiv cs.LG
Recursive Harness Self-Improvement
OpenAI News
OpenAI documenta lecciones aprendidas del despliegue de modelos de IA con horizonte temporal extendido, identificando nuevos riesgos de seguridad y fallos observados, e implementando salvaguardas mejoradas mediante despliegue iterativo. El artículo aborda directamente desafíos críticos de alineamiento y safety en sistemas de IA avanzados.
Simon Willison
Ben Thompson propone que EE.UU. legalice explícitamente la recopilación de datos para entrenar modelos como "fair use" y prohiba términos de servicio que vetén la destilación, argumentando que esto crearía un marco legal más coherente y ayudaría a modelos abiertos estadounidenses a competir con alternativas chinas. El análisis vincula la decisión reciente de Alibaba de liberar Qwen 3.8 Max como pesos abiertos (reversión respecto a versiones anteriores) con directivas estatales chinas que priorizan la apertura y colaboración en IA.
Hugging Face Blog
Hugging Face presenta Cosmos 3 Edge, un modelo de visión generativa optimizado para dispositivos edge que genera video a partir de imágenes y texto con baja latencia y menor consumo de recursos. El modelo mantiene capacidades avanzadas de generación de contenido visual mientras está diseñado para ejecutarse en hardware limitado, ampliando el acceso a modelos de generación de video fuera de servidores centralizados.
Hacker News
El artículo analiza cómo China está ganando terreno en la competencia de IA mediante una estrategia de modelos de pesos abiertos (open-weights), permitiendo que desarrolladores de todo el mundo entrenen y adapten modelos localmente sin depender de APIs centralizadas, lo que representa una alternativa significativa al dominio de modelos propietarios occidentales en la carrera de IA.
Hacker News
Más del 30% de las nuevas submisiones en ArXiv muestran características de haber sido escritas por IA, indicando una adopción generalizada de LLMs en la redacción de papers científicos; esto plantea cuestiones sobre la calidad, originalidad y validez de la investigación difundida en este repositorio central de preprints de IA y otras disciplinas.
Hacker News
No puedo evaluar este contenido porque lo que recibiste es solo un título y una sección de comentarios sin el texto del artículo en sí. Para hacer el análisis según el protocolo de El Radar, necesito el **contenido completo del artículo** (la pieza noticiosa extraída de la fuente verificada).
Por favor, proporciona el texto completo del artículo sobre "Kimi Work" y lo evaluaré con el formato requerido.
Hacker News
No puedo evaluar este artículo porque el texto proporcionado es solo un título ("Airport Simulator") sin contenido sustancial. Para hacer un resumen y asignar relevancia necesito acceso al cuerpo del artículo: descripción, detalles técnicos, contexto sobre si involucra IA/ML, o qué específicamente se presenta.
Por favor proporciona el texto completo del artículo extraído de la fuente.
Construir este día costó 88.083 tokens de entrada
y 11.948 de salida en 101 llamadas a modelos — unos 0,1478 $.