2026-08-03
arXiv cs.CL
★★★★☆
Estudio que evalúa la capacidad de LLMs para predecir niveles de dificultad en items de pruebas de lectura y escritura. GPT-4 zero-shot alcanzó QWK de 0.578, pero fue superado por ConvBERT (0.625); además, todos los LLMs fallaron sistemáticamente en clasificar items difíciles y tendieron a subestimarlos conforme aumentó su capacidad, sugiriendo que la semántica del texto sólo es insuficiente para esta tarea y levantando dudas sobre usar LLMs para generar items con dificultad controlada.
↳ Contexto: Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups
arXiv cs.CL
★★★★☆
Proponen un método de augmentación de datos no supervisado que combina Gaussian Mixture Models para detectar clusters subrepresentados en datasets de text imbalanceados, con LLMs para generar documentos sintéticos que enriquezcan esas regiones minoritarias. Los experimentos muestran que el enfoque preserva el rendimiento del clustering y mejora la interpretabilidad de los clusters, ofreciendo una solución escalable para tareas de NLP sin supervisión con datos desbalanceados.
↳ Contexto: Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising
arXiv cs.CL
★★★★★
Paper que presenta Chain-of-Models (CoM), un pipeline automatizado donde un segundo modelo audita el razonamiento de un primer modelo antes de emitir un juicio final, buscando mitigar sesgos cognitivos en LLM judges. Evaluado en 9 modelos de 6 familias diferentes contra 4 sesgos cognitivos, encuentra que la efectividad del auditor depende del sesgo específico (GPT-4o mejor para bandwagon/autoridad, GLM-5 para sycophancy) y propone una regla de selección de auditor por sesgo que alcanza 0.884 de precisión, superando el baseline sin auditoría (0.805).
arXiv cs.CL
★★★★☆
Paper sobre adaptación de un modelo vision-language (Qwen3-VL-8B-Instruct) para clasificar discurso de odio y sentimientos en memes nepalis, usando un pipeline de dos etapas con LoRA fine-tuning y contrastive learning con InfoNCE. El enfoque logró 2º lugar en detección de hate speech (F1: 0.797) y 4º en análisis de sentimientos (F1: 0.518), evitando pipelines separados de OCR/traducción al aprovechar el soporte nativo del modelo para Devanagari.
arXiv cs.CL
★★★★☆
Un paper de arXiv que propone Stateful Knowledge Learning (SKL), un método para entrenar agentes LLM a extraer y mantener conocimiento predictivo anclado a estados específicos, en lugar de depender solo de reflexión a nivel de trayectoria. Se presentan dos variantes (SKL-SD mediante auto-destilación y SKL-RL mediante reinforcement learning) y se valida en entornos interactivos como WebShop y ScienceWorld, demostrando mejoras sobre paradigmas basados en reflexión.
↳ Contexto: SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge
arXiv cs.CL
★★★★★
Paper que analiza cómo la knowledge distillation en modelos pequeños de lenguaje produce efectos asimétricos en sesgo: mejora la capacidad de seguir contexto en tareas sin ambigüedad, pero degrada la calibración de rechazo en tareas ambiguas, causando que modelos respondan con estereotipos donde antes se abstenían correctamente. Los autores identifican que el problema viene de la escasez de ejemplos de rechazo en datos de entrenamiento (<0.5%) y proponen PCCD, un protocolo de diagnóstico que detecta estos daños por ítem que las métricas agregadas estándar ocultan.
arXiv cs.CL
★★★★★
Se presenta TokenSwap, un método que cuantifica la "modality gap" — la discrepancia en rendimiento de MLLMs cuando reciben inputs semanticamente equivalentes en texto puro versus con imágenes intercaladas. A través de TokenSwap-Bench (versión multimodal de MMLU y otros benchmarks), se observa que el rendimiento cae en promedio 19.6% al pasar a inputs con imágenes interleaved, con caídas de hasta 47.4% en algunos modelos; los modelos de reasoning muestran gaps menores (10.1% vs 25.5% en no-reasoning). El método propuesto de entrenar con TokenSwap mitiga efectivamente esta brecha sin sacrificar rendimiento en modalidades individuales.
↳ Contexto: Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising
arXiv cs.CL
★★★★★
Estudio que identifica el "Agentic Formalism Trap" en sistemas LLM-as-a-Judge, demostrando que estos evaluadores confunden el procedimiento formal con la verdad semántica bajo presión adversarial. Sobre 22.500 trayectorias en tres dominios (GAIA, SWE-bench, Multi-Challenge), los autores cuantifican mediante el Evaluative Dissonance Index cómo los LLMs caen en trampas de sesgo consensual, mapean triggers sintácticos específicos de esta vulnerabilidad (ROC-AUC 0.8779) y prueban que es domain-agnostic y sensible a la topología arquitectónica del sistema.
↳ Contexto: Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups
arXiv cs.CL
★★★★☆
Paper que estudia qué protocolos de evaluación reflejan mejor la calidad del federated pre-training en transformers, comparando downstream fine-tuning en GLUE contra next-token prediction directo. Los resultados muestran que el fine-tuning downstream no preserva confiablemente el ranking establecido en el pre-training testset, mientras que la predicción de siguiente token tiene correspondencia fuerte con la perplejidad original, sugiriendo que evaluar modelos federados con solo downstream benchmarks puede ser engañoso.
↳ Contexto: Training Skills Like Parameters via Self-Supervised Semantic Diffusion
arXiv cs.CL
★★★★★
Investigadores presentan FinIndices, un benchmark a gran escala que evalúa el razonamiento financiero de LLMs sobre declaraciones financieras sin truncar (hasta 32K tokens), revelando dos vulnerabilidades críticas: un "Knowledge Bottleneck" donde los modelos colapsan sin pistas explícitas de fórmulas (Gemini-3.1-Pro cae de 70.70% a 38.22%), y un "Structural Bottleneck" donde la carga cognitiva de generar tablas multi-métrica multi-período degrada el razonamiento a heurísticas superficiales. El fine-tuning supervisado logra mejoras significativas (+8.54% en tareas simples, +3.82% en tablas), demostrando que la lógica estructurada puede restaurarse parcialmente mediante alineación data-centric.
↳ Contexto: Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement
arXiv cs.CL
★★★★★
Estudio empírico sobre por qué los programas de IA empresarial se estancan en entornos regulados, midiendo la viabilidad de producción mediante 72 configuraciones de modelos y herramientas en tareas financieras. Los resultados muestran que solo el 56% de configuraciones supera el bar de demostración y el 32% cumple requisitos de producción (precisión sostenida, reproducibilidad, atribución verificable y señal de confianza), con la clave siendo reducir la carga de revisión humana: requiere citation de fuentes y confidence scores reduce la revisión del 100% al 49%, mientras que self-verification agrega latencia sin mantener tolerancia de error.
arXiv cs.CL
★★★★☆
TELLER es un método para entity linking en tablas que implementa optimización de preferencias iterativa con dos caminos: uno directo que mejora predicción de entidades mediante DPO adaptativo con datos refrescados según errores residuales del modelo, y otro de razonamiento que usa chain-of-thought comprimido con regularización normalizada por longitud. En benchmarks TableInstruct y MammoTab V2 alcanza mejoras consistentes (hasta +2.76% de accuracy en el razonamiento), demostrando que el aprendizaje iterativo de preferencias beneficia tanto predicción concisa como razonamiento explícito en linking de entidades de tablas.
↳ Contexto: Interpretable Column Annotation with LLM-Symbolized Decision Process Materialization
arXiv cs.CL
★★★★☆
Un paper de arXiv que cuestiona la efectividad de la poda basada en entropía para comprimir Chain-of-Thought en modelos de razonamiento grandes, demostrando que no ofrece ventaja sobre pruning aleatorio en ningún escenario evaluado. Los autores encuentran que la retención de tokens de baja entropía solo funciona en benchmarks matemáticos (por la baja entropía inherente de tokens numéricos), y mediante intervenciones causales muestran que la información de la tarea se distribuye a lo largo de toda la cadena de razonamiento, no concentrada en un pequeño conjunto de tokens identificables por heurísticas.
arXiv cs.CL
★★★★★
Se presenta Self-Supervised Skill Optimization (SSO), un framework que optimiza skills reutilizables en agentes LLM sin retroalimentación de ground-truth, usando únicamente instancias sin etiquetar. SSO genera skill probes, las ejecuta, usa un LLM judge para compararlas y un behavior extractor para identificar diferencias conductuales, luego agrega evidencia y rankea comportamientos para construir nuevos skills, validando solo si mejoran sobre un conjunto no etiquetado. El método logra rendimiento comparable a optimizadores basados en ground-truth en benchmarks cerrados y abiertos, avanzando en optimización de skills para LLM agents en contextos sin supervisión.
↳ Contexto: SkillSmith: Learning to Compose Parametric Skills and Textual Knowledge
arXiv cs.CL
★★★★★
Presenta un framework de meta-evaluación que audita benchmarks de LLMs a nivel de muestra individual según cinco dimensiones (demandas cognitivas, calidad de contenido, propiedades de tarea, contexto, ética/seguridad), aplicado a cinco benchmarks influyentes (MMLU, ARC, WinoGrande, HellaSwag, TruthfulQA). El trabajo revela heterogeneidad interna significativa ocultada por métricas agregadas y propone orquestar subconjuntos de benchmarks según criterios específicos para evaluar capacidades diferenciadas de los modelos como profundidad de razonamiento o sensibilidad ética.
↳ Contexto: A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models
arXiv cs.CL
★★★★☆
Investigación sobre cómo los LLMs fine-tuned con preference optimization (DPO) pueden ser entrenados para "rolling with resistance" en Motivational Interviewing, una técnica terapéutica clave. El estudio identifica un trade-off fundamental: penalizar respuestas confrontacionales mediante DPO reduce la persistencia en objetivos de cambio para ganar relational attunement, mientras que penalizar capitulación es inerte porque estos modelos raramente capitulación; el efecto depende del perfil de fallos base del modelo, y un control por prompt logra attunement sin el costo, sugiriendo que el trade-off reside en la optimización misma.
arXiv cs.CL
★★★★★
Paper que cuestiona la validación basada únicamente en benchmarks para LLMs en aplicaciones financieras, argumentando que se requiere evaluación a nivel de sistema (datos, retrieval, generación, comportamiento de agentes, governance). Propone un enfoque de validación multi-capa que aborde fallos específicos como retrieval failures, unfaithful generation y tool misuse, e introduce estándares de validación continua como disciplina sistémica en lugar de pruebas puntuales con LLM-as-a-judge.
arXiv cs.CL
★★★★★
TextCloak es un framework basado en reinforcement learning que genera "unlearnable examples" (texto perturbado) para proteger datos textuales contra fine-tuning no autorizado de LLMs. El método utiliza una política generativa optimizada mediante GRPO-UE que introduce degradación en modelos que entrenan con estos datos mientras preserva la utilidad semántica y naturalidad lingüística, demostrando transferibilidad y robustez frente a nueve LLMs state-of-the-art en múltiples datasets.
arXiv cs.CL
★★★★★
Nuevo paper que introduce el Authority Share Index (ASI), un método basado en Integrated Gradients para identificar a nivel de token qué partes del prompt generan sycophancy (sesgo de los LLMs a coincidir con creencias de usuarios en lugar de hechos). Los autores demuestran que respuestas sycophantic dirigen más atención a tokens de autoridad, y proponen attribution-guided contrastive activation steering para mitigar el problema en tiempo de inferencia sin retraining, logrando reducir sycophancy del 96% al 25% en casos extremos.
Hacker News
★★★★☆
ComfyUI ha añadido soporte nativo para el modelo MiniMax H3, un modelo de video generativo open-weights que permite generar videos de hasta 2K de resolución con audio integrado desde el día 0. La integración permite a usuarios ejecutar este modelo directamente en la plataforma sin dependencias externas, ampliando las capacidades de generación multimodal disponibles en este workflow de IA.
Hacker News
★★★★☆
Hoplite (YC S26) es una plataforma para desplegar agents de codificación en la nube sin fricción, permitiendo automatizar tareas de desarrollo. Se alinea con la tendencia de herramientas que potencian agents autónomos de IA, complementando soluciones como Screenpipe que actúan como capas de percepción para estos sistemas.
↳ Contexto: Launch HN: Screenpipe (YC S26) – Power your agents by your 24/7 screen recording
Hacker News
★★★★☆
AirLLM demuestra ejecutar inferencia del modelo de 70B parámetros en una GPU de 4GB mediante compresión y optimizaciones de memoria, reduciendo significativamente los requisitos de hardware para la ejecución de LLMs grandes sin degradación aparente de calidad. Se trata de un avance en la viabilidad de desplegar modelos grandes en dispositivos con recursos limitados.
Hacker News
★★★★☆
Análisis técnico de cómo operar modelos de lenguaje de gran escala (Kimi y GLM) con optimizaciones para reducir latencia, footprint de memoria y vulnerabilidades en producción. La pieza detalla técnicas de compresión, batching eficiente e implementación de guardrails de seguridad en sistemas de inference distribuido a nivel industrial.
Hacker News
★★★★☆
Se presentó una herramienta de product analytics y evaluación (evals) diseñada específicamente para sesiones de agentes en Model Context Protocol (MCP), permitiendo monitorear y evaluar el comportamiento de agentes con capacidades de análisis integradas en el flujo de trabajo.
The Verge · IA
★★★★☆
La UE ha activado nuevas obligaciones de transparencia bajo su AI Act que entran en vigor el 2 de agosto, requiriendo que las empresas revelen a los usuarios cuándo interactúan con modelos de IA y si el contenido es generado por deepfakes. Estas reglas buscan facilitar la identificación de chatbots y contenido sintetizado, marcando un paso regulatorio significativo para la gobernanza de IA en el continente.
↳ Contexto: It’s time to panic about AI safety
The Verge · IA
★★★★☆
Alibaba lanzó Qwen3.8-Max, que presenta como su modelo más grande y capaz hasta la fecha, afirmando rendimiento comparable al de sistemas frontier de Anthropic y OpenAI, así como competidores chinos como Kimi K3. El modelo está siendo puesto a disposición de usuarios, en línea con la estrategia de apertura de modelos chinos mencionada recientemente.
↳ Contexto: Why China is giving away its best AI models
TechCrunch · IA
★★★★☆
Apple lanzó su renovación de Siri con capacidades de IA mejoradas que la convierten en una asistente más capaz y útil, tras años de espera. Sin embargo, el lanzamiento ocurre en un contexto donde asistentes de IA ya pueden ejecutar tareas complejas, razonamiento y generación de código, lo que reduce el impacto diferencial que habría tenido años antes.
TechCrunch · IA
★★★★☆
June, una startup respaldada por Marc Benioff, lanzó públicamente su plataforma con una ronda de $20 millones en pre-seed enfocada en simplificar la adopción de IA en empresas, abordando el problema de facilitar el despliegue de modelos de IA en entornos productivos.
arXiv cs.LG
★★★★☆
Paper sobre optimización de transferencia de KV cache en inference disaggregado de LLMs, donde prefill y decode corren en pools GPU separados. Propone un orquestador topology-aware que selecciona el transporte óptimo según la jerarquía de interconexión (NVLink, InfiniBand, TCP), combinando transferencia pipelined layer-by-layer, colocación consciente de dominios NVLink para MoE, y CXL 3.0 como overflow tier, con proyecciones de reducción de latencia de 3 a 18x frente a RDMA uniforme.
arXiv cs.LG
★★★★☆
Paper que evalúa la robustez de tres arquitecturas de deep learning secuenciales (GRU, LSTM, Transformer encoder) para clasificar sistemas de conducción autónoma (Openpilot, Tesla Autopilot, Cadillac Super Cruise) a partir de datos telemétricos vehiculares. Los modelos logran F1 de 0.90-0.93 en datos limpios, pero un framework de evaluación modular revela vulnerabilidades críticas: mientras que corrupciones de eventos tienen impacto limitado, la distorsión temporal (jitter) colapsa el rendimiento a F1 de 0.44-0.50, exponiendo debilidades en robustez para aplicaciones de seguridad.
arXiv cs.LG
★★★★☆
Un paper de arXiv que formaliza matemáticamente por qué es posible distinguir respuestas de diferentes LLMs modelando los embeddings de tokens como trayectorias de sistemas dinámicos (DS). Los autores demuestran que la probabilidad de error de clasificación decae exponencialmente con la longitud de la secuencia, gobernada por una cantidad de "discriminabilidad dinámica", y caracterizan cómo este enfoque generaliza entre modelos de embedding diferentes a través de una condición de "intertwining" aproximada.
↳ Contexto: TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs
arXiv cs.LG
★★★★☆
Se presenta LARA, un método de adaptación eficiente que opera en el residual stream de modelos congelados en lugar de modificar sus pesos, similar a LoRA pero leyendo estados ocultos en capas específicas e inyectando correcciones de bajo rango nuevamente en el stream. A diferencia de LoRA, LARA permite interpolar entre comportamiento base y adaptado mediante un escalar ajustable en inference, y posibilita alojar múltiples comportamientos adaptados (hasta siete en el experimento) con apenas 33 MB de overhead sobre un modelo base de 1.5B, seleccionándolos automáticamente por token sin necesidad de cargar nuevos modelos.
arXiv cs.LG
★★★★☆
Proponen Hierarchical Copula-Gumbel-Top-K, un método para controlar las dependencias en el enrutamiento de tokens en modelos Mixture-of-Experts (MoE) manteniendo fijas las leyes de routing individuales de cada token. El enfoque introduce acoplamiento positivo dentro de grupos de tokens relacionados (mediante copulas gaussianas) y dependencia negativa entre grupos, permitiendo ajustar coherencia de expertos y dispersión de carga sin modificar el modelo base, usando solo un controlador entrenado sobre características congeladas. Se trata de un trabajo relacionado con la investigación reciente sobre propiedades estructurales del enrutamiento en MoE.
↳ Contexto: Is MoE Routing a Huffman Code? Discovering the Frequency-Diversity Law in Chain-of-Thought
arXiv cs.LG
★★★★☆
Investigadores presentan LAWFUL, un framework de interpretabilidad para verificar si redes neuronales han aprendido formalmente leyes físicas como conocimiento estructurado y si las usan internamente en toda su región de validez. La propuesta cierra gaps en la interpretación de circuitos sobre variables continuas —incluyendo métricas de consistencia causal y tests de dominio de validez— y la validan mostrando que un transformer puede aprender y usar internamente la ley de Doppler a partir de datos que no incluyen explícitamente las magnitudes involucradas.
↳ Contexto: VisualPatchWorld: Code World Models as Latent Structured Representations for Planning
arXiv cs.LG
★★★★★
Proponen MPP-GNN, un modelo de graph neural networks que realiza particionamiento adaptativo de grafos para detectar comunidades cerebrales específicas por sujeto a partir de datos de fMRI, usando las módulos descubiertos como prior explícito para guiar el aprendizaje de conectividad. El método logra el AUC más alto en dos datasets públicos para clasificación de Alzheimer y muestra alineación con la organización funcional canónica del atlas de Yeo, revelando patrones de dedifferentiation a nivel de red en pacientes con AD.
arXiv cs.LG
★★★★☆
Survey que sintetiza avances tecnológicos recientes en detección y manejo de deterioro cognitivo en adultos mayores usando señales neurofisiológicas (EEG), neuroimaging (MRI, PET de amiloide/tau), biomarcadores en sangre y marcadores digitales, integrados mediante AI/ML/deep learning. El paper destaca que modelos profundos (CNNs, LSTMs, transformers, self-supervised EEG foundation models) muestran alta precisión en EEG pero muchos carecen de validación externa rigurosa; meanwhile, biomarcadores en plasma como p-tau217 han alcanzado utilidad clínica (primer test sanguíneo aprobado para diagnóstico de Alzheimer en 2025), y herramientas wearables, remotas y de realidad virtual permiten monitoreo continuo con fusión multimodal mejorando sensibilidad y especificidad.
arXiv cs.LG
★★★★☆
Presentan SEDR-Seq2P, una arquitectura Seq2Point mejorada con bloques residuales dilatados y atención squeeze-and-excitation para NILM (Non-Intrusive Load Monitoring) industrial multi-tarea. El modelo logra reducir MAE ~7% respecto al baseline Seq2Point y latencia ~58% frente a WaveNet, manteniendo mejor balance accuracy-delay para desagregación de cargas eléctricas concurrentes en entornos industriales ruidosos.
arXiv cs.LG
★★★★☆
Proponen un framework de computer vision que predice la vida a fatiga de aceros desde micrografías ópticas sin pruebas mecánicas, usando un extractor de características informado por física (28 dimensiones) y CNN entrenada con pérdida GNLL para regresión + incertidumbre. ResNet-50 alcanza R² = 0.93 y reduce el error de calibración 76% frente a MSE; los resultados se validan en benchmark sintético y el código se libera en abierto, pendiente evaluación en muestras reales.
arXiv cs.LG
★★★★★
Paper de arXiv que aborda el problema de undercoverage en clases minoritarias de modelos vision-language médicos (VLMs) bajo clinical shift, donde la cobertura marginal observable se mantiene alta pero clases individuales quedan subrepresentadas. Propone CALCoDe, un método conformal post-hoc que identifica clases en riesgo mediante validación cruzada y estima thresholds class-conditional para garantizar cobertura del 0.95 incluso en escenarios con shift, evaluado en datasets de dermatología con múltiples backbones congelados (BiomedCLIP, OpenAI CLIP, PubMedCLIP, MedSigLIP).
arXiv cs.LG
★★★★☆
Nuevo método de flow matching que maneja datos con valores faltantes tratando las coordenadas ausentes como variables latentes e integrando el loss sobre sus posibles valores. El paper prueba que la corrección es exacta (no aproximada) bajo MCAR, demuestra que una sola imputación por ejemplo iguala la varianza de datos completos, y establece que el sesgo irreducible depende de la distancia Wasserstein condicional esperada del modelo de imputación — validado experimentalmente en datos tabulares reales.
arXiv cs.LG
★★★★★
Nuevo framework llamado MMFGU para federated graph unlearning en contextos multimodales, permitiendo que clientes eliminen selectivamente información (textos, imágenes, entidades) de modelos de grafos entrenados colaborativamente sin comprometer datos retenidos ni permitir recuperación a través de otras modalidades. El enfoque utiliza decoupling de representaciones específico del objetivo, detección de residuos propagados y purga selectiva en clientes afectados, logrando 41.5× speedup respecto a reentrenamiento completo.
arXiv cs.LG
★★★★☆
Proponen "mirror learning", un framework para imitation learning que transforma observaciones en tercera persona en pseudo datos de primera persona usando un video diffusion model fine-tuned y un inverse dynamics model. Demuestran que los datos sintéticos generados ("mirror data") pueden entrenar políticas efectivas por sí solos, y que aumentar el training de behavior cloning con estos datos mejora el rendimiento, sugiriendo que los generative world models modernos codifican suficiente estructura para escalar la recopilación de datos sin depender de teleoperation.
arXiv cs.LG
★★★★☆
Se presenta TAGTorch, una biblioteca PyTorch de código abierto que unifica herramientas de topología, álgebra y geometría para machine learning, incluyendo métodos de preprocesamiento, arquitecturas, técnicas de entrenamiento y herramientas de análisis de modelos. La librería aborda la fragmentación actual del ecosistema de software para redes neuronales que operan sobre datos con estructura geométrica, topológica o de simetría, consolidando en un solo repositorio mantenido métodos que hasta ahora solo existían como prototipos de investigación dispersos.
Construir este día costó 70.124 tokens de entrada
y 8161 de salida en 55 llamadas a modelos — unos 0,1109 $.