// espacio-latente.com / radar

El radar

Píldora diaria de lo que se mueve en IA: laboratorios, papers, blogs de referencia y releases relevantes, resumido y con link al original. Se actualiza dos veces al día. · ← volver a espacio-latente.com · archivo · RSS

Panorama de hoy

Hoy destaca la paradoja de la optimización en sistemas agentic: mientras que varios trabajos proponen routers adaptativos y selectores inteligentes de modelos para reducir inflación de tokens (comparando LSP vs lexical retrieval, estimando dificultad pre-ejecución, o eligiendo herramienta según tarea), emergentes evidencias cuestionan si estos "comportamientos de razonamiento" que amplificamos realmente correlacionan con precisión o solo con apariencia de deliberación. En paralelo, la especialización de modelos avanza (Jais 2 árabe-céntrico, Claude versiones por dominio, traducción multilingüe), y la evaluación se vuelve crítica: desde benchmarks de código que no generalizan hasta métricas de fairness que requieren control de confundentes, hay un patrón de desconfianza hacia métricas simples que no capturan la realidad del desempeño. Finalmente, la proliferación de agentes multi-paso (CLAIR-Fin, TeachMateGPT, SELR

2026-08-17

arXiv cs.CL ★★★★★

Does a Language Server Save Tokens for Coding Agents? A Measurement Methodology and Preliminary Study

Paper que mide la eficiencia de tokens en agentes de código comparando retrieval semántico (Language Server Protocol) vs lexical (grep), encontrando que LSP no siempre ahorra tokens: en localización de símbolos cuesta 6-118% más tokens, mientras que en tareas de edits grep resuelve casos que LSP falla (como renombramientos multi-archivo). El estudio ablativo sobre modelos de Anthropic (Opus, Sonnet, Haiku) sugiere que la estrategia óptima es un router adaptativo que elige herramienta según tarea, modelo y ruido lexical, no una adopción universal de LSP.

↳ Contexto: Every Time I Hire a Linguist, Inference Costs Go Down: On Linguistic Rules as Effective Prompt Compressors

arXiv cs.CL ★★★★★

Think in Latent, Explain in Language: Self-Explainable Latent Reasoning

Nuevo framework (SELR) que entrena un modelo único para realizar latent reasoning eficiente e interpretable simultáneamente, mediante un objetivo multi-tarea que optimiza tanto la precisión de respuestas como la capacidad de decodificar sus propias representaciones latentes en pasos de razonamiento legibles para humanos. La solución unifica las ventajas del razonamiento latente comprimido con la explainabilidad, eliminando la necesidad de decodificadores post-hoc separados, y se valida en LLMs y Vision-Language Models.

↳ Contexto: Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models

arXiv cs.CL ★★★★★

Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems

Paper que aborda el problema del "token inflation" en sistemas agentic con LLMs — cuando un modelo falla en primer intento, los reintentos multiplican el costo real respecto del precio por token anunciado (hasta >2× en tareas difíciles). Propone InflationAgent, un router de cuatro etapas que estima inflación mediante CoT Branching Entropy (señal de dificultad pre-ejecución con AUROC 0.887) y selecciona modelos maximizando Semantic Exchange Rate (exactitud esperada dividida entre costo real predicho), con policy de "fresh-escalation" que descarta cadenas fallidas antes de escalar a modelos más fuertes, logrando 94.7% accuracy en GSM8K con 31% menos tokens que FrugalGPT.

arXiv cs.CL ★★★★☆

BCMT: Blockwise Causal Memory Transformer

Se presenta BCMT, una arquitectura de Transformer que reduce la complejidad cuadrática de la atención densa mediante bloques locales de causal self-attention combinados con un mecanismo de memoria exponencial que agrega resúmenes de cada bloque para propagar contexto global de forma eficiente. En experimentos con contextos de hasta 1024 tokens, logra rendimiento comparable a Transformers densos mientras mejora significativamente el throughput de entrenamiento y reduce el consumo de memoria.

↳ Contexto: Convolution for Large Language Models

arXiv cs.CL ★★★★★

Jais 2: A Family of Arabic-Centric Open Large Language Models

Jais 2 es una familia de LLMs de código abierto centrados en árabe, desarrollada por MBZUAI, Cerebras e Inception, que incluye variantes de 70B y 8B parámetros entrenadas desde cero con vocabulario personalizado para árabe. Los modelos logran resultados competitivos en benchmarks árabe-céntricos (OALL2, AraGen) y tareas culturalmente específicas (poesía, religión, cocina), con entrenamiento computacionalmente eficiente y despliegue en hardware Cerebras que alcanza 2,000 tokens/segundo; están disponibles en HuggingFace bajo licencia comercialmente permisiva.

arXiv cs.CL ★★★★☆

IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering

IterCOMP es un framework training-free de compresión de prompts diseñado específicamente para question answering multi-hop, que mediante un loop iterativo descompone documentos en segmentos de evidencia y genera preguntas de seguimiento para integrar selectivamente información esencial mientras reduce tokens. Los experimentos en MusiQue, 2WikiMultiHopQA y HotpotQA muestran mejoras significativas en EM y F1 manteniendo presupuesto de tokens reducido, con robustez incluso ante razonamiento complejo.

↳ Contexto: Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models

arXiv cs.CL ★★★★☆

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

Proponen un framework de regresión con efectos mixtos para evaluar fairness en Large Audio Language Models (LALMs), controlando factores confundentes como variación semántica del contenido hablado e identidad del speaker. El método extrae embeddings semánticos del mismo modelo bajo evaluación y modela la identidad del speaker como efecto aleatorio, logrando reducir hallazgos espurios de sesgo y estimaciones más robustas de diferencias de rendimiento entre subgrupos demográficos.

↳ Contexto: Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

arXiv cs.CL ★★★★☆

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

Estudio empírico a gran escala de GRPO (Group Relative Policy Optimization) en configuraciones multilingües y no-inglés, evaluando cómo el entrenamiento con reinforcement learning en diferentes idiomas afecta la capacidad de razonamiento de LLMs. Los resultados muestran que entrenar en idioma nativo deja un pequeño gap respecto a entrenar en inglés, con transferencia crosslingüe fuerte pero también riesgos de regresión en capacidades fuera del dominio según el modelo y idioma específico.

↳ Contexto: BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

arXiv cs.CL ★★★★★

CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

CLAIR-Fin es un framework multi-agente de nueve agentes para verificación de claims a nivel atómico en Q&A financiero cross-modal, que mitiga alucinaciones mediante Asymmetric Evidence Authority (condiciona confianza en evidencia según tipo de claim), Chain-of-Custody Verification (verifica grounding en handoffs entre agentes), y un Adaptive Rebuttal Cycle que escala debate adversarial según necesidad. Evaluado en BB-FinQA-X (dataset de 500 preguntas de reportes del Bangladesh Bank), logra faithfulness de 0.889 (vs. 0.780 en baseline RAG simple) y se abstiene en 5.4% de casos donde la evidencia es insuficiente.

arXiv cs.CL ★★★★☆

TeachMateGPT: A Multi-Agent Knowledge-Grounded Framework for Pedagogical Assessment Generation from Science Curriculum Materials

TeachMateGPT es un sistema multi-agente para generar automáticamente ítems de evaluación en ciencias a partir de currículos escolares, mejorando sobre RAG convencional mediante tres innovaciones: COPE, una base de conocimiento jerárquica que indexa documentos según estructura del syllabus en múltiples niveles de granularidad; un pipeline de agentes especializados con gates de cobertura que retiene generación ante evidencia insuficiente; y SAVER, un protocolo de verificación que evalúa fidelidad y riesgo de alucinación contra la fuente. El equipo presenta NCTB-SciGen8, dataset de 198 ítems evaluados por docentes, logrando mejoras significativas en fidelidad (0.68→0.96) y relevancia (0.60→0.89).

↳ Contexto: TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

arXiv cs.CL ★★★★☆

StreamHear: Domain-Adapted Pseudo-Labeling for Semi-Supervised Streaming Speech Recognition

StreamHear es un pipeline semi-supervisado para adaptación de dominio en ASR streaming que combina fine-tuning de un teacher transducer offline con pseudo-labeling de datos no etiquetados y posterior fine-tuning del student. El método incluye un paso de realineación con dynamic programming regularizado que corrige posicionamiento de palabras a nivel de chunk, demostrando mejoras consistentes sobre baseline supervisado en datasets de calls financieros, speech preparado y diálogos de baja calidad.

arXiv cs.CL ★★★★☆

BM25-Augmented Many-Shot Translation for Low-Resource North-Eastern Indian Languages

Propuesta para traducción de idiomas indios nororiental al inglés usando retrieval-augmented many-shot translation sin fine-tuning: BM25 recupera ejemplos paralelos similares en tiempo de inferencia que se pasan como contexto a Gemini 2.5 Flash. El sistema fue enviado a la tarea compartida WMT26 de traducción de idiomas con recursos limitados, combinando datos oficiales con corpus públicos como Samanantar y optimizando hiperparámetros de recuperación mediante búsqueda en grid.

arXiv cs.CL ★★★★☆

GALA: Generation-Aware Cross-Modal Alignment for Text-to-Time-Series Synthesis

GALA es un método de dos etapas para síntesis de series temporales condicionadas por texto natural, que alinea intencionadamente un encoder de texto pretrenado con un foundation model de series temporales en un espacio embedding compartido, adaptado mediante una pérdida generativa auxiliar. El enfoque logra nuevo estado del arte en el benchmark TSFragment-600K, mejorando simultáneamente fidelidad (FID) y adherencia al caption, resolviendo el trade-off que presentan los encoders internos de generadores anteriores.

↳ Contexto: The Parser Already Knows: Lightweight Bias Correction in Constrained Decoding

arXiv cs.CL ★★★★★

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

Un estudio en arXiv analiza qué comportamientos de razonamiento en modelos tipo "thinking" (como o1) correlacionan realmente con respuestas correctas, usando una métrica llamada Behavioral Lift sobre 15,282 trazas anotadas. Encuentra una "Amplification-Lift Gap": el entrenamiento reasoning-oriented amplifica fuertemente autocorrección e incertidumbre, pero los comportamientos más asociados con precisión son calibración de confianza y alineación de conocimiento —lo que sugiere que el entrenamiento favorece apariencia de deliberación sobre razonamiento efectivo. Este hallazgo complementa evidencia anterior sobre pre-commitment en LLMs, sugiriendo un problema más profundo en cómo se optimizan los modelos de razonamiento.

↳ Contexto: Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM

arXiv cs.CL ★★★★☆

When Lexical Change Misleads: Rethinking Dynamic Topic Model Evaluation with Traditional and LLM-Based Metrics

Estudio que cuestiona la validez de métricas tradicionales de coherencia en topic models dinámicos, mostrando que fallan cuando el vocabulario cambia pero el significado semántico persiste. Propone usar métricas basadas en LLMs para evaluar similaridad semántica, que correlacionan mejor con juicios humanos (ρ=0.502–0.721 según dataset), y recomienda evaluar stratificando por grado de cambio léxico para captar variaciones que métricas agregadas ocultan.

↳ Contexto: Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

arXiv cs.CL ★★★★☆

ASSERT: A Measurement Pipeline for GenAI Audits

ASSERT es un pipeline de medición specification-driven para auditorías de sistemas GenAI que vincula cada tasa reportada a una especificación explícita de las decisiones de medición usadas para producirla. El trabajo demuestra mediante un caso de estudio sobre deception conversacional que las elecciones de medición (setup de diálogo, usuario simulado, juez, umbral de evidencia) impactan sustancialmente la tasa reportada e incluso pueden reordenar los rankings entre sistemas GenAI, permitiendo atribuir e interpretar más claramente las diferencias entre auditorías.

arXiv cs.CL ★★★★★

Bootstrapping Niche Multilingual Code Translation via Reinforcement Learning with Execution-Based Verifiable Supervision

Paper que presenta un enfoque de reinforcement learning basado en ejecución para entrenar modelos LLM en traducción de código entre múltiples lenguajes de programación, especialmente en nichos poco representados. El método utiliza GRPO con reward models entrenados sobre outcomes de ejecución verificada, evaluándose en 600 pares de lenguajes direccionados (25×24) e introduciendo HumanEval-X++, un benchmark de ejecución para espacios many-to-many, logrando mejoras de hasta 21% en lenguajes de nivel medio con modelos Qwen 3.5 de 4B y 9B parámetros.

arXiv cs.CL ★★★★☆

Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion

Paper que propone un framework de expansión de géneros guiado por atributos para crear datasets de escritura creativa diversa más allá de narrativas. Los autores construyen Multi-Genre Collection, un corpus de 50K ejemplos con 13 géneros creativos (historias, rap, letras, scripts, game design, entre otros) usando prompts humanos como semillas y atributos de género curados manualmente para controlar estructura y estilo. Modelos fine-tuned con este dataset superan baselines especializados en escritura y modelos entrenados con corpora existentes, demostrando que la expansión controlada de géneros es clave para capacidades robustas de escritura creativa en LLMs.

arXiv cs.CL ★★★★☆

Repair, Not Improvement: Decomposing Constrained Decoding in Tool-Call Abstention

Paper que analiza cómo las restricciones de decodificación (constrained decoding) afectan la capacidad de los modelos para abstenerse de hacer llamadas a funciones (tool abstention). El estudio descompone dos funciones del constraint gramatical —dónde detener la generación y qué tokens emitir— y evalúa modelos de 0.6B a 4B parámetros en inglés y coreano, encontrando que el costo de aplicar tokens de parada supera la ganancia de las restricciones de enumeración, resultando en reparación de forma más que mejora real de la abstención.

arXiv cs.CL ★★★★★

Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model

Se presenta un método de pruning adaptativo sin entrenamiento específicamente diseñado para inference en batch de grandes modelos de razonamiento (LRMs), que reemplaza la selección basada en threshold por top-k periódico sobre scores de importancia agregados y añade memoria de activación para retener neuronas recurrentes durante generación larga. El método logra mejoras de 39.7 puntos porcentuales en precisión respecto al estado del arte anterior en benchmarks de razonamiento, alcanzando 1.40x speedup con 50% sparsity en DeepSeek-R1-Distill-Qwen-7B.

Simon Willison ★★★★★

Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things

Simon Willison analiza en detalle Qwen 3.8 27B, el nuevo modelo vision-capable de Alibaba bajo licencia Apache 2, tras su lanzamiento reciente. El principal hallazgo es que el modelo por defecto usa reasoning_effort=xhigh, lo que causa "overthinking" extremo (21 minutos para generar un SVG con 22k tokens de reasoning), por lo que recomienda usar "low" o desactivar el reasoning; aun así, el modelo destaca en tareas como detección de bounding boxes en visión y demostración de capacidad para ejecutar coding agents con largo contexto, mejorando sobre su predecesor Qwen 3.6 27B.

↳ Contexto: [AINews] Qwen 3.8 Max(2.4T) and 27B, new open weights models for Coding and Cowork

Hacker News ★★★★☆

AI-Generated GitHub Copilot “Autofix” Allowed Compromise of Snowflake's Jira

GitHub Copilot Autofix, una característica de autocompleción de código impulsada por IA, fue aprovechada para comprometer la instancia de Jira de Snowflake, demostrando un vector de ataque donde sugerencias generadas por LLM pueden introducir vulnerabilidades si se aceptan sin revisión crítica. Este incidente se alinea con riesgos más amplios de propagación de código malicioso a través de herramientas de asistencia basadas en IA, similar a los hallazgos previos sobre worms autorreplicantes en documentos.

↳ Contexto: Document-borne AI worms can self-propagate through Copilot for Word

Hacker News ★★★★☆

Launch HN: Speko (YC S26) – OpenRouter for Voice AI

Speko es una plataforma que actúa como agregador de APIs de voice AI similar a OpenRouter para texto, permitiendo acceder a múltiples proveedores de síntesis y reconocimiento de voz a través de una única interfaz. El servicio, parte de Y Combinator S26, simplifica la integración de capacidades de voz en aplicaciones al unificar endpoints, autenticación y manejo de errores entre diferentes modelos y proveedores.

The Verge · IA ★★★★☆

Anthropic explains how Claude’s invisible text watermarks will work

Anthropic detalla su sistema de watermarks invisibles para texto generado por Claude, basado en SynthID-Text de Google DeepMind, una técnica open-source que crea patrones detectables mediante probabilidades de palabras para cumplir con normativas de transparencia de la UE. Esta es una ampliación técnica del anuncio previo sobre watermarking en texto e imágenes de Claude.

↳ Contexto: Claude will apply invisible watermarks to AI text and images

TechCrunch · IA ★★★★☆

Amazon, which started off selling books, is destroying rare texts to train AI

Amazon estaría comprando y destruyendo libros raros para entrenar modelos de lenguaje, aprovechando que estos textos no están disponibles en línea y representan datos de entrenamiento únicos y valiosos para LLMs. Esta práctica se suma a las sospechas previas sobre empresas de IA adquiriendo obras de ediciones limitadas con fines destructivos tras su uso en training.

↳ Contexto: Booksellers suspect AI firms are buying and then destroying rare books

TechCrunch · IA ★★★★☆

Groq raises $350M to fuel its pivot from AI chips to neocloud

Groq recaudó $350 millones en una ronda de financiación que valúa la empresa en $3.5 mil millones, mientras pivota desde ser un fabricante de chips de IA hacia un modelo de neocloud, expandiendo simultáneamente sus centros de datos equipados con GPUs de Nvidia. El cambio de estrategia refleja un posicionamiento enfocado en infraestructura y servicios de computación de IA en lugar de hardware propio.

TechCrunch · IA ★★★★☆

Nvidia investing $1.5B in SoftBank data center developer behind OpenAI project

Nvidia invertirá 1.500 millones de dólares en una desarrolladora de centros de datos de SoftBank que respalda un proyecto de OpenAI, asegurando que sus chips GPU alimentarán esa infraestructura. La inversión consolida la posición de Nvidia como proveedor crítico de hardware para los mayores laboratorios de LLMs, vinculando directamente su participación accionaria con la demanda de computación para entrenar y ejecutar modelos de IA avanzados.

TechCrunch · IA ★★★★☆

Stripe will reportedly acquire AI gateway startup OpenRouter for $7B+

Stripe adquiere OpenRouter, una startup de AI gateway valuada en más de 7 mil millones de dólares. OpenRouter funciona como intermediario para acceder a múltiples modelos de IA (LLMs y visión) a través de una única API, posicionándose como infraestructura crítica en el stack de IA para desarrolladores y empresas.

arXiv cs.LG ★★★★☆

L-FNO: Lorentzian Fourier Neural Operator for Stochastic Event Dynamics

Se presenta L-FNO (Lorentzian Fourier Neural Operator), un operador neural diseñado específicamente para modelar dinámicas de eventos estocásticos y procesos puntuales. El modelo combina arquitectura FNO con kernels espectrales Lorentzian para capturar dependencias temporales y usa entrenamiento basado en likelihood en lugar de regresión, mejorando en predicción de eventos raros (brotes de enfermedades, fallos en semiconductores) frente a baselines de operadores neuronales convencionales.

arXiv cs.LG ★★★★★

Don't Claim Benchmark-Oriented Optimization Improves General Coding Capability -- Diverse Evaluation Is Required

Paper que cuestiona la validez de usar benchmarks de coding tradicionales (SWE-bench, LiveCodeBench) como evidencia de capacidad general en programación. Los autores demuestran mediante una suite de evaluación basada en Django que la optimización para estos benchmarks no generaliza bien a otras tareas — los checkpoints fine-tuneados muestran poco transfer cross-task — y proponen en su lugar evaluación diversificada con múltiples suites, taxonomías de capacidades y mantenimiento sostenido de benchmarks para obtener estándares de evaluación más confiables.

↳ Contexto: Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation

arXiv cs.LG ★★★★☆

Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

Proponen Activation-Prune-Merge (APM), un método de transferencia de conocimiento entre modelos de lenguaje de distinto tamaño sin alineamiento neurónico explícito: dado un modelo grande (donor) y uno pequeño (recipient), construyen mapas de activación condicionados por tarea, podan capas, dimensiones ocultas y neuronas del donor según su relevancia, e inyectan el resultado en el recipient con bajo coeficiente de interpolación. En 16 benchmarks (razonamiento, matemáticas, generación de código, etc.), mejoran la precisión promedio de un modelo de 3B del 55.5% al 60.6%, con ganancias notables en tareas específicas (RTE: 64.3%→82.3%, QNLI: 52.3%→65.7%).

↳ Contexto: Cross-Architecture Steering Transfer in Language Models: A Systematic Empirical Study

arXiv cs.LG ★★★★☆

Hard Cases, Bad Labels: Testing Error Exposure and Error Location in Uncertainty Sampling Under Bounded Label Noise

Estudio empírico sobre active learning que examina si uncertainty sampling falla bajo ruido en las etiquetas por adquirir más labels corruptos o porque los errores concentrados en ejemplos difíciles son más dañinos. Usando datasets tabulares binarios con tres tipos de ruido (limpio, aleatorio, dependiente de dificultad), encuentra que uncertainty sampling mejora la eficiencia de labels bajo datos limpios, pero su robustez ante ruido es variable según dataset, presupuesto, estructura de ruido y métrica, sin evidencia universal de una penalización adicional por la localización estructurada de errores.

arXiv cs.LG ★★★★☆

Robust Dual-Model Collaborative Random Vector Functional Link Network

Se propone KRPRVFL, una variante robusta de redes Random Vector Functional Link que reemplaza el objetivo de mínimos cuadrados estándar por un criterio kernel risk-sensitive mean p-power (KRP) para reducir adaptivamente la influencia de muestras ruidosas y outliers durante el entrenamiento. El modelo incorpora un mecanismo de aprendizaje colaborativo entre componentes y feature mapping inducido por kernel, demostrando mejora en accuracy y robustez frente a baselines en benchmarks UCI y KEEL.

arXiv cs.LG ★★★★☆

Contrastive Learning for Interpretable Anomaly Detection at Collider Experiments

Se presenta ORCA, un framework de dos etapas que combina contrastive learning supervisado con autoencoder para detección de anomalías en física de colisionadores, resolviendo dos problemas clave: la interpretabilidad de las puntuaciones de anomalía y su correlación con escala de energía y multiplicidad de objetos. En simulaciones del Large Hadron Collider, ORCA mejora significativamente la sensibilidad a nueva física y permite atribuir eventos anómalos a procesos conocidos mediante template fitting en el espacio de embedding, con incertidumbres cuantificadas.

arXiv cs.LG ★★★★☆

The Query Knows What to Forget: A Second Erase Direction for Linear Attention

Paper que propone Query-derived Erase Direction (QED), una técnica para mejorar linear attention añadiendo un segundo vector de borrado derivado del query (además del derivado de la key) para reducir interferencia entre items en el estado de tamaño fijo. El método mejora la recuperación de información a cualquier contexto y duplica aproximadamente la longitud de contexto útil en el benchmark S-NIAH-1.

arXiv cs.LG ★★★★★

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

Paper que documenta ocho años de progreso en modelos de lenguaje (BERT a agentes frontier), mostrando mejora 6x anual en resolución de problemas de código desde finales de 2024 y colapso de la curva capacidad-costo con modelos como GPT-5.6 Luna matching flagship performance a 1-6 dólares por millón de tokens. El análisis también detalla especialización emergente (Claude Opus 5 en frontend, Claude Fable 5 en repository-level, GPT-5.6 Sol en tareas de terminal) y avances en reasoning matemático con métodos avanzados de sampling alcanzando 79% en benchmarks de aritmética básica.

arXiv cs.LG ★★★★☆

EEG-PRISM: Physiologically-Grounded Interpretability of Predictions by EEG Foundation Models

EEG-PRISM es un método post-hoc de atribución que extiende la interpretabilidad de foundation models para análisis de EEG mapeando scores de atribución desde el espacio tiempo-canal a dominios fisiológicamente relevantes (frecuencia y fuente) mediante transformaciones lineales e inversión de DFT. Validado en datos simulados y clínicos (epilepsia, autismo), demuestra recuperación espectral cercana al 100%, localización de onset de crisis con 50% de precisión y correcta identificación de biomarkers delta-alfa en regiones frontales/temporales, sin necesidad de modificar o reentrenar los modelos base.

arXiv cs.LG ★★★★☆

SAGE: Surrogate-gradient Adaptation via Attention-Guided Entropy for Spiking Transformers

Presenta SAGE, un mecanismo de surrogate-gradient adaptativo para transformers basados en redes neuronales pulsantes (SNNs) que modula la pendiente del gradiente sustituto durante el entrenamiento usando incertidumbre estimada desde la entropía de auto-atención normalizada. El método mejora la precisión en CIFAR-10/100 (ganancias de 1-2% consistentes) sin modificar la arquitectura ni los costos de inferencia, abordando el desafío central del entrenamiento de SNNs donde la función de spike no diferenciable requiere gradientes sustitutos óptimos por capa.

arXiv cs.LG ★★★★★

Capacity-Dependent Effects of Data Selection for Reasoning

Paper sobre supervisión en fine-tuning para reasoning que revela un patrón "Fast-Fit/Slow-Gain" dependiente de la capacidad del modelo: datos con alta likelihood proporcionan mejoras tempranas más rápidas y estables (especialmente en modelos pequeños de 1.5B parámetros), pero datos con baja likelihood se vuelven progresivamente más beneficiosos para modelos grandes cuando el entrenamiento se extiende. Los autores analizan dinámicas de aprendizaje mostrando que modelos pequeños no absorben bien supervisión de baja likelihood, mientras que modelos más grandes logran acercarse mejor a la distribución del teacher, sugiriendo que la selección de datos efectiva debe considerar capacidad del modelo y presupuesto computacional, no solo preferencia universal por high-likelihood responses.

arXiv cs.LG ★★★★☆

The Integer Alibi: Localizing Cross-Kernel Divergence in INT8-Quantized LLM Inference

Investigación que expone divergencias críticas entre implementaciones de kernels INT8 GEMM (CUTLASS vs Triton) en vLLM para inferencia de LLMs, donde kernels supuestamente intercambiables producen secuencias completamente diferentes (0% concordancia en múltiples runs). Mediante operandos idénticos en todas las capas de modelos como Qwen3-1.7B y 8B, localiza la divergencia en aplicación de escalas y redondeo post-acumulador (donde la aritmética INT32 es exacta), no en el dot product; el trabajo incluye procedimiento de conformancia y liberará predicciones pre-registradas para validar interoperabilidad real de kernels.

arXiv cs.LG ★★★★☆

CutClean: Neural Network Pruning for Privacy-Preserving Inference

CutClean es un método de pruning de redes neuronales diseñado para reducir filtraciones de privacidad durante la inference, usando cabezas lineales auxiliares en cada bloque para cuantificar el flujo de información sobre atributos sensibles y aplicando sparsity progresiva para eliminar ese leakage mientras se mantiene la precisión en la tarea principal.

Construir este día costó 74.708 tokens de entrada y 8331 de salida en 58 llamadas a modelos — unos 0,1164 $.