2026-08-10
arXiv cs.CL
★★★★★
Se presenta TEXAS, un método para adaptar modelos MoE (Mixture-of-Experts) LLMs en tareas específicas identificando expertos relevantes mediante análisis de patrones de activación en instancias donde el modelo falla versus donde tiene éxito, y asignando supervición ponderada a nivel de token durante fine-tuning. El enfoque logra mejoras de 1.3–1.5 puntos promedio sobre baselines en 18 configuraciones (tres modelos MoE, seis benchmarks) sin fijar un subconjunto de expertos ni imponer una distribución de routing explícita.
arXiv cs.CL
★★★★☆
Un paper de arXiv que propone una metodología de diagnóstico para descomponer las fuentes de error en speech language models aplicados a tareas paralingüísticas. Los autores introducen una "diagnostic ladder" que separa tres tipos de fallos: endpoint (generación vs. decodificación de estado), decision-rule (alineamiento entre logits y respuesta emitida) y readout-coverage (limitaciones en la representación lineal del estado oculto), encontrando que en diez condiciones experimentales existen gaps positivos en decision-rule y readout-coverage que parcialmente pueden corregirse con logit correction sin necesidad de reentrenamiento.
↳ Contexto: Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
arXiv cs.CL
★★★★☆
Nuevo paper que redefine el análisis afectivo (sentimiento y emoción) como un problema de razonamiento complejo en lugar de mapeo directo de etiquetas, permitiendo un interfaz unificado para tareas heterogéneas. Propone NTDH, un método que sintetiza trazas de razonamiento afectivo mediante naturalización, gates tolerancia-aware, estrategias domain-aware y directional hints; entrena Qwen3-8B con SFT y GRPO logrando mejora significativa con solo ~14k registros de entrenamiento y Pearson de 0.862 en emotion intensity.
arXiv cs.CL
★★★★☆
Investigadores entrenan un modelo neuronal para recuperar parámetros de lesión (layer, porcentaje de modificación, ruido) a partir de perfiles de error en tareas de denominación de imágenes en LLaMA-Vicuna, encontrando que el porcentaje de modificación y sigma de ruido son recuperables con 81.4% de fidelidad contrafáctica, mientras que el índice de layer muestra recuperación parcial debido a redundancia funcional entre capas; al validar con perfiles de error de 278 pacientes con ictus, los parámetros recuperados mostraban capacidad discriminativa de síndrome, demostrando que la validación contrafáctica proporciona un marco más riguroso que las interpretabilidad estándar para evaluar causalidad en LLMs.
↳ Contexto: SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge
arXiv cs.CL
★★★★☆
Estudio sobre cómo evolucionan las personalidades en agentes LLM condicionados por personalidad (PC-Agents) tras eventos vitales, usando los rasgos Big Five como métrica psicométrica. Los autores introducen BFI-Adapt, un benchmark para medir la fidelidad direccional del cambio de personalidad inducido por eventos, y encuentran que los modelos actuales simulan la media de la dinámica de personalidad humana pero no capturan su variabilidad o magnitudes realistas — un paso hacia agentes más coherentes en interacciones extendidas, complementario al trabajo reciente sobre memoria en agentes LLM de larga duración.
↳ Contexto: MemoryForge: Synthesize Lifelong Memory for Human-Like LLM Agents
arXiv cs.CL
★★★★☆
Se presenta ConstructCIE, un dataset anotado manualmente para extraer información causal de reportes de accidentes de construcción de OSHA, con esquema jerárquico para tipos de accidentes, factores causales y evidencia de apoyo. Los resultados muestran que sequence taggers supervisados e instruction-tuned LLMs logran buena predicción de tipos de accidente pero tienen limitaciones en la extracción precisa a nivel de span, revelando que esta tarea requiere mejor grounding de dominio y extracción más precisa de evidencia.
arXiv cs.CL
★★★★★
Un paper cuantifica la brecha de comprensión entre idiomas en LLMs: cuando el mismo contenido se presenta en lenguas no-inglesas en lugar de inglés, la calidad de respuesta cae en promedio un 17% (CLCG=0.078). El estudio evalúa cinco modelos de laboratorios distintos sobre 150 artículos en 18 idiomas usando ParallelQA-18 (corpus paralelo traducido profesionalmente), mostrando que las capacidades demostradas en inglés no transfieren equitativamente y que la brecha es más acentuada en lenguas de bajo recurso, lo que implica que las evaluaciones centradas en inglés sobrestiman la calidad para usuarios de otros idiomas.
↳ Contexto: Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language
arXiv cs.CL
★★★★☆
GRASP es un método para entrenar modelos de lenguaje pequeños que anonimicen texto eliminando atributos sensibles (edad, ubicación, ocupación) mientras preservan el significado, usando Group Relative Policy Optimization en lugar de DPO. El enfoque entrena un único modelo de 8B que actúa simultáneamente como anonimizador, adversario y juez de utilidad, logrando mejor trade-off privacidad-utilidad que baselines destiladas y ejecutándose completamente on-device a ~1% del costo de GPT-4o, lo que evita enviar texto privado a terceros durante la inferencia.
↳ Contexto: Large Language Models Threaten Double-blind Review
arXiv cs.CL
★★★★☆
Un paper de arXiv que analiza por qué el soft-masking lineal (LERP) falla en Masked Diffusion Language Models y propone Spherical Soft-Masking (S-SM) como alternativa. Los autores descubren que el embedding space de MDLMs tiene geometría hipersférica (ángulo constante ~73° entre mask y predicted-token embeddings), por lo que SLERP es más apropiado que LERP; evaluando en un checkpoint de 169M parámetros logran ganancias de hasta 2x en MAUVE y reducción de perplexidad de 16.9-19.6% sobre el baseline.
↳ Contexto: Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising
arXiv cs.CL
★★★★★
Paper sobre estimación de confianza en vision-language models (LVLMs) aplicados a finanzas, evaluando siete confidence estimators (tres inference-only y cuatro probes entrenables) en cinco modelos open-weight sobre tareas de comprensión de gráficos y documentos financieros. Encuentra que los métodos inference-only fallan en calibración (overconfident), solo los probes entrenados producen scores válidos para threshold, la fiabilidad varía por modelo y tarea sin dominante, y el deferral bajo presupuesto de error está limitado primero por competencia del modelo — conectando directamente con el problema operacional de trust (qué respuestas escalar a humano) más que pura accuracy en contextos financieros.
↳ Contexto: Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications
arXiv cs.CL
★★★★☆
Un paper en arXiv documenta un trade-off crítico en métodos de false-presupposition QA: los enfoques que mejoran en detectar presuposiciones falsas degradan significativamente el rendimiento en preguntas normales, debido a módulos de fact-checking débiles que rechazan también presuposiciones verdaderas. El trabajo advierte que los benchmarks actuales sobre-representan preguntas con presuposiciones falsas, ocultando un problema de generalización real en aplicaciones de QA con LLMs.
↳ Contexto: Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements
arXiv cs.CL
★★★★☆
TradeVerse es un nuevo benchmark que evalúa LLMs en tareas de negociación política longitudinal usando datos reales del WTO: reconstruye 1170 actas de reuniones de disputas comerciales internacionales donde participantes intercambian argumentos a lo largo de múltiples rondas, y define tres tareas (predicción de códigos de productos, identificación de país respondedor y generación de declaraciones finales). El benchmark destaca la dificultad de que LLMs rastrean y comprenden contextos extendidos donde cada turno depende de los anteriores, sin requerir anotación manual al extraer etiquetas directamente de documentos oficiales.
↳ Contexto: XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding
arXiv cs.CL
★★★★☆
Estudio que analiza los outputs de LLMs como idiolectos model-específicos en lugar de una variedad lingüística uniforme llamada "AI language". Los autores comparan datasets de 2024 y 2026 con seis modelos cada uno, revelando perfiles lingüísticos únicos por modelo (con variaciones extremas en frecuencias de contracciones: 1,200 a 30,000 por millón de palabras) y cambios generacionales entre cohortes, con implicaciones para detección de textos generados por IA y lingüística forense.
↳ Contexto: Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups
arXiv cs.CL
★★★★☆
Paper que propone un sistema de routing pre-inferencia para optimizar costos en extracción de campos de documentos, eligiendo dinámicamente entre un modelo barato y otro más potente basándose en señales de dificultad del documento (calidad de imagen, layout). El enfoque reduce costos entre 31-77% en ciertos tipos de documentos (recibos, formularios degradados) manteniendo calidad comparable, pero solo funciona cuando el modelo barato falla frecuentemente y esas fallos son predecibles desde features visibles; no generaliza entre géneros ni datasets diferentes.
arXiv cs.CL
★★★★☆
Nuevo paper que aborda el problema de recuperación en taxonomías grandes cuando la entrada es evidencia indirecta (como celdas de tabla cuyo significado depende del contexto). Propone Factorized Hypothesis Search (FHS), que mantiene múltiples interpretaciones parciales sobre dimensiones semánticas nombradas para mejorar la búsqueda estructurada; demuestra mejor Recall@1 y precisión que métodos no-oracle en tagging de taxonomía financiera y codificación clínica (CodiEsp).
↳ Contexto: TabRank: Chain-of-Thought Distillation for Table Re-Rankers
arXiv cs.CL
★★★★☆
Investigadores presentan un método no supervisado para extraer metáforas lingüísticas de corpus de texto y agruparlas mediante clustering estructurado para identificar metáforas conceptuales subyacentes. El trabajo analiza diferencias en el framing de eventos entre podcasts de izquierda y derecha, descubriendo que fuentes izquierdistas tienden a conceptualizar historias mediáticas como armas mientras que fuentes derechistas modelan la economía como un sistema sujeto a cambios verticales.
arXiv cs.CL
★★★★★
Survey exhaustivo de 1.547 papers (2024-2026) sobre agentes LLM de horizonte largo que identifica y analiza el "horizon gap" — el fracaso de modelos frontera en tareas multi-hora donde pierden contexto, olvidan decisiones anteriores o se desvían de objetivos. El trabajo desambigua tres propiedades confundidas (long-horizon como propiedad de tarea, long-context como capacidad de modelo, long-term memory como persistencia en el sistema) y organiza la literatura en seis categorías del ciclo de vida (planning, memory, execution, training, evaluation, foundations) con un eje de dónde se "llevan" los horizontes, encontrando un patrón transversal: las señales outcome-only se vuelven inefectivas con horizonte largo y el campo responde con señales densas a nivel de paso (process reward models, credit assignment).
arXiv cs.CL
★★★★☆
Paper que identifica una limitación estructural en sistemas RAG estándar: los documentos recuperados traen consigo estilos de comunicación específicos que pueden hacer que el sistema ignore instrucciones de tono del usuario, fenómeno llamado "contextual decoupling". Propone TA-RAG, un framework arquitectónico que integra alineación comunicativa (stigma-free language, readability alignment, recipient-sensitive adaptation, empathetic framing) como objetivo de diseño fundamental junto con exactitud factual, especialmente relevante para contextos socialmente sensibles como salud pública.
arXiv cs.CL
★★★★☆
Paper que introduce auditorías contrafácticas para evaluar si modelos audio-lenguaje (ALMs) realmente usan evidencia paralingüística (entonación, afecto, timing) al juzgar sistemas speech-to-speech, manteniendo transcripciones fijas mientras varían características de audio. Los autores encuentran que en modelos como Gemini y GPT, el éxito en evaluaciones contrastivas frecuentemente sobrestima la confiabilidad real del juez, y que accuracies similares pueden ocultar modos de fallo diferentes, argumentando que estos modelos requieren auditorías de comportamiento exhaustivas antes de su uso en producción.
arXiv cs.CL
★★★★☆
Presenta un algoritmo de contextual bandit que mejora el refinement iterativo en LLMs al modelar explícitamente la saturación de recompensas (reward decay) mediante EM, evitando la sobre-explotación de prompts idénticos. Utiliza un marco joint LinUCB donde los prompts se tratan como arms, mostrando ganancias significativas en benchmarks como Sentiment Reversal y GSM8K respecto a métodos existentes como Self-Refine.
Simon Willison
★★★★☆
Simon Willison cita un fragmento del system prompt de Claude Opus 5 que documenta el lanzamiento de Claude Fable 5 y Claude Mythos 5 el 9 de junio de 2026, su suspensión temporal por controles de exportación estadounidenses el 12 de junio, y la restauración de acceso el 1 de julio tras levantamiento de restricciones. El prompt instruye al modelo a confirmar estos hechos de forma neutral y remitir a la declaración oficial de Anthropic, tratándolos como información posterior a su cutoff de entrenamiento.
↳ Contexto: Anthropic releases Opus 5 with ‘close’ to Fable 5’s capabilities
Simon Willison
★★★★☆
GitHub ha retirado su servicio GitHub Models, que ofrecía un playground de modelos y una API unificada para acceder a múltiples proveedores de LLMs con la ventaja de usar la API key de GitHub Actions sin costo adicional. El cierre probablemente responde a costos prohibitivos generados por patrones de coding agents, llevando a usuarios como Simon Willison a migrar hacia alternativas como OpenAI con límites de gasto.
Hacker News
★★★★☆
Un análisis de las capacidades matemáticas de Claude, el modelo de Anthropic, explorando su rendimiento en problemas matemáticos, razonamiento algebraico y resolución de ecuaciones. Este tipo de evaluación técnica de capacidades de LLMs es relevante para entender las limitaciones y fortalezas de modelos contemporáneos en tareas cuantitativas y simbólicas.
↳ Contexto: Claude Opus 5
Hacker News
★★★★☆
Muse Glimmer es un modelo de 30B parámetros optimizado específicamente para ejecutar agentes de IA continuos en hardware local, con énfasis en bajo consumo de recursos y latencia mínima para workflows que requieren respuestas instantáneas. El modelo prioriza eficiencia en inference y adaptabilidad a restricciones de dispositivos edge, dirigido a aplicaciones que no pueden depender de APIs remotas.
Hacker News
★★★★☆
Mark Zuckerberg critica el enfoque cerrado de rivales como OpenAI y Google, reafirmando el compromiso de Meta con modelos de IA abiertos como estrategia competitiva. El anuncio continúa la apuesta de Meta en open-source para el stack de IA empresarial, ampliando su oportunidad más allá de agentes.
↳ Contexto: Zuckerberg says Meta’s enterprise AI opportunity extends beyond agents
TechCrunch · IA
★★★★☆
Meta lanza Muse Glimmer, un modelo de peso abierto que refleja la visión de Zuckerberg sobre superinteligencia personal e ilustra la creciente división entre modelos de IA que los usuarios pueden poseer versus acceder. Esta iniciativa continúa el movimiento anunciado recientemente de Meta hacia agentes de IA personales.
↳ Contexto: Mark Zuckerberg is planning a big push into personal AI agents
TechCrunch · IA
★★★★☆
Anthropic ha activado por defecto el auto mode en Claude Code, permitiendo que el modelo ejecute automáticamente acciones de programación sin intervención manual constante. Este cambio afecta a los planes Pro, Max y Team, reduciendo la fricción en flujos de desarrollo al delegar decisiones de ejecución al modelo.
↳ Contexto: Auto mode is now the default in Claude Code for Pro, Max, and Team plans
arXiv cs.LG
★★★★★
Paper que propone detectar misinformación explotando propiedades geométricas en el espacio latente de transformers, sin fine-tuning ni recuperación externa de evidencia. El método usa Contrastive Activation Addition para identificar una "dirección de falsedad" en el residual stream contrastando activaciones de afirmaciones verdaderas y falsas, luego clasifica claims desconocidas proyectando su activación final en esa dirección a través de un MLP. Evaluado en 11 modelos (Gemma, Llama, Qwen; 270M–12B parámetros) en tres benchmarks de fact-checking (AVeriTeC, LIAR, FACTors), muestra que la veracidad es linealmente separable en modelos preentrenados, con resultados competitivos especialmente en modelos más pequeños.
arXiv cs.LG
★★★★☆
Estudio que modela agentes depredador-presa bajo percepciones ruidosas, comparando políticas de decisión que explícitamente contabilizan la incertidumbre en sus predicciones. Demuestra que confiar ciegamente en etiquetas perceptuales falla catastróficamente con ruido alto, mientras que estrategias uncertainty-aware mejoran supervivencia y reducen errores fatales, con transiciones cualitativas hacia comportamientos más conservadores conforme aumenta la incertidumbre; el trabajo vincula robustez en aprendizaje con noisy labels, risk-sensitive decision-making y Artificial Life.
arXiv cs.LG
★★★★☆
Un paper de arXiv que identifica y mitiga fallos de oversight en LLMs: cuando un modelo debe evaluar muchos criterios en una sola llamada, la calidad de sus veredictos se degrada incluso con presupuesto computacional equivalente. El trabajo propone "sharding" (particionar los requisitos en grupos y asignar cada uno a llamadas separadas) como intervención efectiva, mejorando acuerdo con expertos en tareas de investigación, legal y clínica, y demostrando robustez contra adversarios que manipulan la presentación de evidencia para explotar sobrecarga.
↳ Contexto: JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation
arXiv cs.LG
★★★★★
Paper de arXiv que introduce ACIF (Adversarial Causal Intervention Falsification), un framework teórico para entrenar modelos causales generativos mediante un juego adversarial donde un experimentador selecciona intervenciones para falsificar la estructura causal propuesta por el generador. Los autores prueban resultados de identificabilidad, convergencia en muestra finita y equilibrios de estrategia mixta, conectando modelado causal generativo, descubrimiento causal activo y diseño experimental.
arXiv cs.LG
★★★★★
Paper sobre extensión de Deep Operator Networks (DeepONets) que reemplaza muestreos puntuales por functionales lineales continuos en espacios localmente convexos de Hausdorff, permitiendo medidas funcionales fijas y adaptativas. Se demuestra con varios operadores (antiderivada, flujo de Darcy heterogéneo, Navier-Stokes) que el modelo propuesto logra errores robustos independientes de discretización y competitividad con Fourier Neural Operators usando significativamente menos memoria GPU y coordenadas más compactas e interpretables.
arXiv cs.LG
★★★★☆
MiGHT-EHR es un modelo basado en graph transformers que unifica el aprendizaje multi-tarea sobre registros electrónicos de salud heterogéneos y temporales, modelando entidades clínicas (pacientes, visitas, diagnósticos), sus interacciones y dependencias estadísticas en una representación única. Evaluado en MIMIC-III y MIMIC-IV, supera métodos existentes en cuatro tareas clínicas (recomendación de fármacos, predicción de mortalidad, readmisión y duración de estancia), con representaciones interpretables donde conceptos médicos y desenlaces clínicos emergen como estructuras recuperables.
↳ Contexto: LLM4EHR: Aligning Clinical Time Series with Medical Event Sequences via Large Language Models
arXiv cs.LG
★★★★★
SNI-GNN es un sistema para entrenamiento de GNNs full-graph en clusters multi-servidor que reduce la comunicación inter-nodo (21–45%) mediante predictores lineales lightweight desplegados en SmartNICs (NVIDIA BlueField-3) que anticipan embeddings remotos directamente en la red, logrando speedups de 1.3–3.6× con pérdida de accuracy ≤0.01. El trabajo incluye análisis teórico de cotas de error y convergencia no-convexa con gradientes inexactos, demostrando que el sesgo del predictor se mantiene controlado bajo dinámicas de segundo orden acotadas.
arXiv cs.LG
★★★★☆
ED-CSP es un framework de machine learning que predice estructuras cristalinas a partir de difracción de electrones (ED) no indexada, combinando un encoder relacional, agregación multi-vista invariante a permutaciones y un generador de flujo periódico. El modelo, entrenado en ED-CS (dataset de 4.85 millones de estructuras cristalinas simuladas), logra 57.49% MR@5 en materiales held-out, superando a PXRDGen, y demuestra capacidad generativa real alcanzando 53.52% MR@5 incluso en composiciones ausentes del dataset, estableciendo un benchmark para predicción generativa de estructuras cristalinas desde observaciones ED dispersas.
arXiv cs.LG
★★★★☆
Paper que propone métodos de interpretabilidad mejorados para transformers con feature-tokenization como BiomeGPT, usando Integrated Gradients firmados en lugar de pesos de atención para distinguir señales microbianas patogénicas de las protectoras. El enfoque introduce un baseline derivado de fuentes (T' = S + A_0) que aisla el efecto de la abundancia respecto a la identidad de especies, y recomienda Integrated Hessians de segundo orden para exponer reglas de interacción en comunidades microbianas.
arXiv cs.LG
★★★★☆
Estudio empírico sobre compresión de contexto en agentes de largo horizonte, mostrando que la compresión recurrente puede debilitar la influencia de interacciones recientes y causar inestabilidad. Proponen TRACE, un framework guiado por verificador que evalúa eventos de compactación mediante continuaciones en bucle cerrado y optimiza prompts de compresión en lenguaje natural, demostrando mejoras en rendimiento y confiabilidad multi-run en el benchmark AppWorld sin necesidad de reentrenamiento.
arXiv cs.LG
★★★★☆
Paper sobre evaluación de métodos de adaptive data cleaning que identifica un sesgo metodológico llamado "removal-budget confounding": cambios en la granularidad de particiones para segmentar muestras por riesgo de corrupción alteran implícitamente cuántas muestras se remueven, generando mejoras aparentes en métricas que reflejan presupuesto de remoción menor, no mejor discriminación. Los autores proponen un framework de evaluación con controles de matched-budget y matched-recall, encontrando que las ganancias reportadas en un redesign multi-cue desaparecen cuando se igualan los operating points, y las diferencias reales se reducen drásticamente en configuraciones de baja-a-moderada corrupción.
arXiv cs.LG
★★★★☆
El paper propone TWNA (Target-Weighted Neyman Allocation), un método de diseño experimental estratificado en dos etapas que optimiza la asignación de tamaños muestrales y probabilidades de tratamiento cuando hay heterogeneidad en los efectos de tratamiento y diferencias entre la población de experimentación y la de despliegue. El método usa estimaciones piloto de varianzas para balancear la importancia de cada grupo en el despliegue con su dificultad estadística de medición, con una regla oracle en forma cerrada que se recupera mediante plug-in conforme mejoran las estimaciones preliminares.
arXiv cs.LG
★★★★☆
Se presenta CertBind, un framework teórico para composición certifiable de grafos de conectores multimodales congelados, que resuelve el problema de garantizar decisiones de retrieval fiables al conectar múltiples encoders. El método opera en cuatro escalas (nodo, arista, camino, query) aplicando técnicas como conformal prediction y calibración para mantener control de error family-wise y proporcionar certificados de recuperación o abstención explícita en consultas ambiguas.
arXiv cs.LG
★★★★★
Paper de arXiv que estudia control cooperativo en sistemas multi-agente bajo ataques bizantinos ocultos, donde un subconjunto desconocido de agentes puede reescribir las acciones planeadas. Los autores caracterizan el problema como MDPs robustos rectangulares, establecen límites información-teóricos para el security regret (descompuesto en return regret y response gap acumulado), y proponen un learner robusto con garantía de regret $\widetilde{\mathcal O}(H^2S\sqrt{AK})+\mathbb E[D_K]$, sentando bases teóricas y algorítmicas para multi-agente confiable bajo byzantinos.
arXiv cs.LG
★★★★☆
Paper de arXiv que caracteriza la complejidad muestral minimax para aprender políticas robustas en procesos de decisión de Markov con criterio de promedio en recompensas bajo incertidumbre distribucional. El trabajo establece cotas superior e inferior ajustadas que identifican dos regímenes según la escala de perturbación (σH₀), con complejidad que combina un término de span similar a MDPs nominales más un término específico de robustez en el régimen de baja tolerancia, y propone procedimientos plug-in basados en reducciones para seleccionar la política óptima.
Construir este día costó 76.239 tokens de entrada
y 8721 de salida en 60 llamadas a modelos — unos 0,1198 $.