// espacio-latente.com / radar

El radar

Píldora diaria de lo que se mueve en IA: laboratorios, papers, blogs de referencia y releases relevantes, resumido y con link al original. Se actualiza dos veces al día. · ← volver a espacio-latente.com · archivo · RSS

Panorama de hoy

Hoy destaca una tensión crítica: mientras la comunidad optimiza fine-tuning parameter-efficient (MoE²-LoRA), razonamiento latente (J-CoT) y generación molecular con difusión adaptativa, emergen vulnerabilidades sistémicas en multimodal LLMs explotables mediante triggers adversariales estilísticos, y un mercado negro de tokens baratos expone fallos en gobernanza de APIs. En paralelo, la evaluación de LLMs se sofistica—desde consenso entre modelos hasta rastreo longitudinal de memoria en agentes—pero estudios controlados revelan que conclusiones sobre features pueden invertirse según diseño experimental, recordando que rigor metodológico importa tanto como escalado. Finalmente, geopolíticamente China acelera distribución de modelos competitivos mientras Occidente especializa verticales (ciberseguridad, documentos históricos), y las búsquedas AI-generadas ya dominan: el juego se mueve de capacidad bruta a implementación, seguridad y confianza operacional.

2026-07-27

Simon Willison ★★★★☆

An Inside Look at the Relay Market Powering Token Resellers and Fraud

Investigación sobre un mercado de reventa de tokens de LLM con descuentos significativos, principalmente en China, donde resellers utilizan herramientas de proxy open source (one-api, new-api) para abusar de pruebas gratuitas, bots de soporte desprotegidos o tarjetas robadas. Los compradores buscan tokens baratos, evadir restricciones geográficas o datos para distilación de modelos, lo que expone la necesidad urgente de que los proveedores de LLM implementen límites de gasto estrictos por clave API.

arXiv cs.CL ★★★★★

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

Paper que identifica una vulnerabilidad específica en multimodal LLMs (MLLMs): la inconsistencia entre su capacidad de comprensión robusta del contenido visual y sus mecanismos de defensa, que pueden ser burlados mediante triggers estilísticos adversariales. Propone Adversarial Style Optimization (ASO), un módulo que usa GRPO para optimizar modificaciones visuales estilísticas sobre imágenes adversariales, logrando aumentar significativamente la tasa de éxito de ataques jailbreak contra MLLMs mediante explotación de sesgos estilísticos.

arXiv cs.CL ★★★★☆

A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models

Paper de arXiv que propone un framework de evaluación basado en consenso entre LLMs para medir preferencias relativas entre respuestas, en lugar de correctness absoluto contra ground truth fijo. El método utiliza un panel de cinco modelos SOTA que rankean anónimamente las respuestas de sus pares en dominios como programación, razonamiento lógico y matemáticas, generando un Relative Intelligence Index (RII) que agrega acuerdo inter-modelo como proxy de calidad percibida.

↳ Contexto: Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

arXiv cs.CL ★★★★☆

Evaluation design conditions the expert-vs-auto MeSH gap: a controlled comparison of bag-of-words and BiomedBERT on the Cohen benchmark

Estudio controlado que compara directamente MeSH terms asignados por expertos frente a automáticos como features para clasificadores de abstracts biomédicos, usando bag-of-words y BiomedBERT en el benchmark de Cohen. El resultado principal muestra que la ventaja de los MeSH expertos (~0.096 WSS@95%) desaparece casi completamente (~0.02) bajo diseños de evaluación alternativos (corpus más pequeño, 10-fold CV), revelando que las conclusiones sobre fuentes de features en benchmarks pueden cambiar sustancialmente según el protocolo de evaluación elegido.

arXiv cs.CL ★★★★☆

Humanly: A Configurable and Traceable Environment for Human-AI Collaborative Writing

Humanly es una plataforma de escritura colaborativa humano-IA que registra y documenta todo el proceso de redacción, generación de IA y actividades del usuario en tiempo real, permitiendo crear certificados sellados con análisis de comportamiento anómalo configurable. El sistema incluye un detector de tipeo que distingue entre escritura manual humana y automatizada, con validación mediante estudios de usuario y pruebas adversariales (red-teaming).

arXiv cs.CL ★★★★☆

Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders

Estudio que usa Natural Language Autoencoders para analizar si el modelo Qwen2.5-7B representa internamente identidad colombiana e información estereotípica a nivel de activaciones latentes, procesando prompts en español colombiano e inglés. El trabajo combina interpretabilidad de residual streams con evaluación de sesgos para variedades de español subrepresentadas, reportando evidencia cualitativa de si el modelo infiere atributos demográficos antes de verbalizarlos explícitamente.

arXiv cs.CL ★★★★☆

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

Se presenta Khondo, el primer benchmark multimodal para dividir paquetes de documentos en formularios de gobierno bangladesí, combinando Bangla e inglés en imágenes de páginas sin OCR. La evaluación de MLLMs revela que agrupan páginas correctamente pero fallan en restaurar el orden original cuando están barajadas, identificando la reconstrucción del orden de páginas como el desafío dominante, con el idioma como factor secundario pero consistente en documentos de bajo recurso.

arXiv cs.CL ★★★★☆

Agentic Evaluation of Copyright Law Compliance

Se presenta Copyright-Bench, un benchmark para evaluar el cumplimiento de la ley de derechos de autor por parte de agentes LLM en tareas comerciales reales (desarrollo web, diseño de mercancía, creación de pitch decks). El estudio compara agentes state-of-the-art contra línea base humana, encontrando que los agentes seleccionan obras con derechos de autor incluso cuando existen alternativas de dominio público disponibles, y que las tasas de violación aumentan con ciertas preferencias de usuario y presión temporal en modelos open-weights.

arXiv cs.CL ★★★★☆

Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA

Estudio empírico sobre la internalización de documentos en adapters LoRA de un modelo Gemma 4-bit para QA sin retrieval, donde se demuestra que la calidad de datos de entrenamiento es el factor dominante sobre la capacidad del adapter (rank, learning rate, arquitectura). Una única pasada de curación manual de respuestas (canonical spans de 1-6 palabras) incrementó la precisión cerrada de 57.7% a 85.7% en un corpus de 15 documentos, superando incluso a retrieval basado en BM25 con oráculos de oro a menor latencia.

arXiv cs.CL ★★★★☆

Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

Investigadores presentan ARI, un framework que combina LLMs con retrieval-augmented generation (RAG) para restaurar documentos históricos dañados, enfocándose en recuperar entidades nombradas mediante conocimiento externo. El método supera baselines en experimentos con documentos históricos coreanos, demostrando mejoras tanto en caracteres generales como en entidades nombradas, con validación de expertos del dominio.

arXiv cs.CL ★★★★☆

On Improving Faithfulness of Podcasts from Documents

Nuevo trabajo que aborda la fidelidad (faithfulness) en la generación de podcasts desde documentos usando LLMs, un problema crítico donde los modelos generan contenido sin grounding en la fuente. Los autores construyen un dataset de 1500+ documentos, proponen un marco de evaluación turn-level con LLM-as-a-judge validado con humanos, y presentan catch-n-repair, una técnica model-agnostic que detecta y reescribe turnos conversacionales no fundamentados manteniendo la fluidez del diálogo.

arXiv cs.CL ★★★★☆

Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings

Un paper que propone una metodología inversa para evaluar memoria en agentes LLM: en lugar de generar conversaciones primero y extraer etiquetas después, siembra hechos con intervalos de validez y canales de origen antes de cualquier texto, garantizando así respuestas gold válidas por construcción. Los resultados muestran que los rankings de arquitecturas de memoria se invierten según la longitud del historial (memoria curated-map lidera en corto plazo pero cae a 72% recall en 9 semanas, mientras que graph basado en provenance sube a 90%), y libera Veracium, una librería open-source con el corpus y harness.

arXiv cs.CL ★★★★★

MoE$^2$-LoRA: When MoE Models Meet MoE-style Low-Rank Adaptation

Investigadores proponen MoE²-LoRA, un método de fine-tuning parameter-efficient específicamente diseñado para modelos Mixture-of-Experts, que acopla la especialización de expertos preentrenados con adaptabilidad task-specific mediante un módulo de Routing-Conditioned Projection que reutiliza las activaciones del router base para dirigir el routing de LoRA. El enfoque introduce un pool global de expertos LoRA compartido entre capas, logrando adaptación a nivel de modelo con utilización balanceada de expertos y superior rendimiento downstream comparado con métodos PEFT previos para MoE.

arXiv cs.CL ★★★★★

J-CoT: Chain-of-Thought in J-Space

Investigadores presentan J-CoT, un framework de razonamiento recurrente que introduce J-space, un sistema de coordenadas indexado por vocabulario dentro las representaciones ocultas del modelo, como interfaz intermedia entre pasos de reasoning. A diferencia de chain-of-thought tradicional (que requiere verbalizaciones completas) y métodos de latent reasoning (que propagan vectores ocultos densos sin mecanismo selectivo), J-CoT expresa estados intermedios como coeficientes indexados por vocabulario, permitiendo reasoning sin rationales fluidas ni recurrencia sobre el estado oculto completo, logrando resultados superiores o comparables en benchmarks de razonamiento matemático, científico, de código y de rutas estructuradas.

arXiv cs.CL ★★★★☆

Analysing Self-Harm Representations in Language Models: a Cross-Architecture Study

Estudio de cómo cuatro modelos de lenguaje representan internamente contenido de autolesiones mediante linear probes y análisis de capas, encontrando que la información se cristaliza en las últimas capas (93-97% de profundidad) y que hay variabilidad entre arquitecturas en cómo codifican estas direcciones contrastivas, con aplicaciones directas en detección de autolesiones y gobernanza de LLMs.

arXiv cs.CL ★★★★☆

DWT-Fusion: A Signal-Based Framework for Training-Free LLM-Generated Text Detection

Nuevo método training-free para detectar texto generado por LLMs usando análisis de wavelets discretos (DWT) sobre secuencias de log-probabilidades de tokens, explotando variaciones locales y multiesala que enfoques previos no capturaban. Alcanza AUROC de 0.9872 en HC3 y mejora con voting ponderado por calibración, funcionando sin entrenamiento supervisado y generalizando entre datasets, dominios y generadores no vistos.

arXiv cs.CL ★★★★★

Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

Paper que analiza cómo el entrenamiento con reinforcement learning (RL) reduce los conflictos entre tareas al hacer model merging en LLMs, comparado con SFT tradicional. Los autores identifican tres factores clave: gradientes de menor magnitud en RL que preservan conocimiento, una dinámica de optimización que reduce conflictos progresivamente, y la optimización conjunta de ejemplos positivos y negativos que genera subespacios de parámetros menos conflictivos entre tareas.

arXiv cs.CL ★★★★★

Scaling Native Multimodal Pre-Training From Scratch

Paper que caracteriza sistemáticamente las leyes de escalado para pre-entrenamiento multimodal nativo (vision-language models entrenados desde cero con inputs multimodales), demostrando que la pérdida de objetivo sigue leyes de compute predecibles y que los tamaños de modelo y conteos de tokens óptimos escalan según leyes de potencia. El hallazgo clave es que la asignación de recursos entre objetivos de lenguaje y multimodales difiere significativamente: mientras el lenguaje es robusto a cambios en la composición de datos, la asignación multimodal es altamente sensible, con mezclas text-heavy requiriendo mayor capacidad de modelo para ser eficientes computacionalmente.

arXiv cs.CL ★★★★★

Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensing Examination

Estudio que evalúa el multimodal Gemma 4 31B-IT en el examen de licencia de operador de reactores nucleares del NRC usando ocho configuraciones de fine-tuning y retrieval. El modelo combinado con supervised fine-tuning (SFT) sobre rationales de chain-of-thought y retrieval-augmented generation (RAG) con chunking de tamaño fijo alcanzó 79.7% de precisión agregada y aprobó 8 de 14 exámenes según el criterio del 80% humano, mientras que ninguna configuración sin fine-tuning pasó. El estudio identifica que la estrategia de chunking preferida depende del estado del entrenamiento del modelo y que RAFT underperforms frente a SFT estándar en entornos de búsqueda.

The Verge · IA ★★★★☆

Why China is giving away its best AI models

Moonshot AI lanzó Kimi K3, un modelo de IA chino que según reportes iguala el rendimiento de sistemas estadounidenses de punta con costos significativamente menores, intensificando la competencia geopolítica en desarrollo de LLMs. El artículo explora por qué China está distribuyendo acceso a modelos de alto rendimiento de forma amplia, en contraste con estrategias más restrictivas de Silicon Valley.

↳ Contexto: America needs to stop getting shocked by Chinese AI

TechCrunch · IA ★★★★☆

Microsoft launches its first cybersecurity model, plus a new agentic cybersecurity system

Microsoft lanzó su primer modelo de IA especializado en ciberseguridad junto con una nueva plataforma de seguridad agentic. La noticia continúa la tendencia reciente de grandes tech companies (Google lanzó hace poco Mythos, su alternativa económica) en desarrollar modelos específicos de IA para defensa cibernética.

↳ Contexto: Google launches a cheaper alternative to large AI security models like Mythos

TechCrunch · IA ★★★★☆

Google’s AI search is rapidly becoming the default, new data shows

Google's AI Overviews aparecen ya en el 43% de las búsquedas, consolidando cómo las respuestas generadas por IA se están convirtiendo en el método predeterminado de descubrimiento de información. El crecimiento rápido refleja el cambio fundamental en cómo los usuarios interactúan con los sistemas de búsqueda tradicionales.

TechCrunch · IA ★★★★☆

Ilya Sutskever’s Safe Superintelligence partners with Nvidia to scale its AI research

Safe Superintelligence Inc. (SSI), el lab de Ilya Sutskever fundado hace dos años en stealth, anuncia una asociación a largo plazo con Nvidia para escalar su investigación en IA. La alianza proporciona a SSI acceso a infraestructura y tecnología de Nvidia, posicionando al lab para acelerar su trabajo en seguridad de superinteligencia a medida que sale de su fase inicial.

arXiv cs.LG ★★★★☆

Cloud-Native Evaluation-as-a-Service: A Microservices Architecture for Scalable AI Monitoring with Conformal Guarantees

Se presenta EaaS, una arquitectura cloud-native basada en microservicios Kubernetes que operacionaliza métodos de evaluación de IA (conformal prediction, calibración, detección de drift, monitoreo de fairness) con garantías estadísticas finitas. El sistema demuestra cobertura empírica consistente con garantías marginales, latencias sub-2ms en predicción conformal, y detecta drift con potencia del 100% en escenarios controlados, ofreciendo una plataforma integrada que no existe actualmente en herramientas open-source disponibles.

arXiv cs.LG ★★★★☆

On the Depth Scalability of Logic Gate Networks

El paper introduce Input-Anchored Logic Gate Networks (IALGNs) para resolver limitaciones de escalabilidad en profundidad de las Logic Gate Networks tradicionales, que no se beneficiaban fiablemente del aumento de capas. Los autores identifican dos problemas fundamentales —colapso de optimización y limitaciones topológicas— y proponen una arquitectura donde cada gate combina features ocultas con anclajes directos a la entrada original, manteniendo una columna vertebral computacional mientras condiciona todas las capas a los datos iniciales. En experimentos con MNIST, CIFAR-10 y CIFAR-100, las IALGNs muestran mejoras consistentes depth-accuracy más allá de 100 capas, demostrando que la profundidad escalable requiere tanto estabilidad de optimización como un patrón de acceso a información que permita refinamiento condicionado por la entrada.

arXiv cs.LG ★★★★★

MotifRole-Diff: Risk-Optimal Role-Aware Corruption for Masked Molecular Graph Diffusion

Paper que presenta MotifRole-Diff, un método para mejorar la generación de grafos moleculares mediante difusión discreta con masking adaptativo según el rol estructural de cada token (átomos, enlaces, etc.). En lugar de aplicar corrupción uniforme, el método asigna tasas de masking individualizadas basadas en dificultad de denoising e impacto en la molécula final, logrando aumentar validez en QM9 (0.905→0.944) y MOSES (0.920→0.938) sin cambiar arquitectura ni presupuesto de entrenamiento.

arXiv cs.LG ★★★★☆

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

Paper que propone un nuevo enfoque de evaluación para agentes LLM personales que mantienen memoria y estado persistente. Identifica una brecha en los benchmarks actuales (que evalúan componentes aislados) y formaliza cuatro condiciones necesarias para evaluar correctamente cómo los fallos se propagan cuando intervenciones temporales afectan estados condicionados por el usuario, incluyendo un diseño mínimo de benchmark y métricas de reporte.

arXiv cs.LG ★★★★☆

Measuring the Dependency Gap: Diagnosing Inter-Column Fidelity in Tabular Generative Models

Este paper introduce una métrica diagnóstica (XGB-C2ST) que descompone la fidelidad de datos tabulares sintéticos en componentes marginales y de dependencias entre columnas, revelando que métricas estándar (C2ST logístico, Trend score) no detectan la destrucción de dependencias inter-columna. Al evaluar TabbyFlow/EF-VFM, los autores encuentran un "dependency gap" significativo que impacta la utilidad en clases minoritarias: aumentar capacidad del modelo 16x no cierra la brecha, apuntando a la ausencia de supervisión directa de dependencias en los objetivos generativos mean-field como el problema fundamental.

arXiv cs.LG ★★★★☆

Quasi-Monte Carlo Initialization for Meta-Reinforcement Learning

Paper que propone usar inicialización de pesos via quasi-Monte Carlo (QMC) para meta-reinforcement learning, demostrando que los meta-priors resultantes aceleran la convergencia de entrenamiento en tareas de control continuo similares a las vistas durante la búsqueda poblacional, aunque métodos ortogonales estándar siguen siendo superiores para generalización a tareas muy distintas.

arXiv cs.LG ★★★★☆

Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations

Paper que propone un framework de control goal-agnostic para ecuaciones diferenciales parciales (PDEs) usando arquitectura JEPA (joint-embedding predictive) con encoder ViT pequeño, donde la clave es entrenar el modelo mundo offline sin recompensa ni objetivo específico y luego reutilizarlo con un controlador MPPI. Los resultados muestran que usar observables físicos explícitos (como una sonda de energía cinética entrenada) para planificación es significativamente superior que minimizar distancia L² en el espacio latente: en Navier–Stokes 2D logra mejora de 10% en recompensa nativa y reducción de 53% en RMSE de campo de velocidad en objetivos no vistos durante entrenamiento.

arXiv cs.LG ★★★★☆

Multi-Horizon Consistency as Geometry: When Latent Dynamics Contract, and When They Do Not

Paper que analiza cómo el peso de consistencia multi-horizonte (lambda) en predictores de video y world models afecta la geometría de las dinámicas latentes. Los autores muestran empíricamente que aumentar lambda reduce significativamente la expansión en el espacio latente (L20 cae de 4.96 a 1.01 en Moving-MNIST) y el error de predicción a 20 pasos, pero este efecto es domain-limited y no se generaliza uniformemente a otros entornos como Pendulum o videos KTH Actions; proponen una ley estocástica que unifica el comportamiento en diferentes dominios de control.

arXiv cs.LG ★★★★☆

Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning

Paper sobre safe reinforcement learning que propone tratar la velocidad de adaptación como restricción de seguridad en entornos no-estacionarios. El enfoque usa representaciones de contexto aprendidas y forecasting de corto horizonte para estimar la demanda de adaptación del agente y compararla con su capacidad de recuperación calibrada, activando shields a nivel de acciones cuando la demanda supera la capacidad disponible. Experimentos en simulación de conducción muestran que reduce violaciones de seguridad en ventanas de corto horizonte durante cambios contextuales.

arXiv cs.LG ★★★★☆

A Drift Stable Quantum Federated Learning for Intelligent Services

Se propone DUQFL-Prox, un framework de federated learning cuántico que aborda la inestabilidad en entrenamientos distribuidos mediante optimización local "deep-unfolded" adaptativa y términos proximales para mantener coherencia con el modelo global. El método mejora estabilidad, generalización y equidad entre clientes en tareas de detección de fraude financiero y clasificación genómica, demostrando que el quantum federated learning puede servir sistemas inteligentes más confiables en entornos heterogéneos.

arXiv cs.LG ★★★★☆

Shallower ReLU Network Representations via Exact Linear Algebra

Paper teórico que demuestra representaciones exactas de funciones máximo mediante redes ReLU con pocas capas, usando álgebra lineal exacta sobre racionales. Para max_n con n≤10 se consigue con dos capas ocultas; para n>10, se establece una cota superior de profundidad de ~log₅(n)+1.5694 capas, mejorando resultados previos. El resultado aplica también a funciones piecewise-linear continuas arbitrarias en ℝ^d.

arXiv cs.LG ★★★★★

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt es un framework de entrenamiento nativo de PyTorch diseñado específicamente para investigación en reinforcement learning agentic, priorizando simplicidad y modularidad: el código es lo bastante compacto para que un investigador lo mantenga en su cabeza y un asistente de IA pueda razonarlo íntegramente. El framework entrena políticas multimodales y mixture-of-experts con un loop asincrónico que garantiza consistencia en tokens y versiones, y demuestra rendimiento estadísticamente comparable a stacks basados en Megatron a pesar de su arquitectura más esbelta; está disponible como open source en el repositorio de NVIDIA NeMo.

arXiv cs.LG ★★★★☆

Physically Constrained Federated Additive Models for O-RAN SLA-Risk Prediction

Paper que presenta Monotone FedNAM, un modelo aditivo federado con restricciones físicas para predecir violaciones de SLA en O-RAN sin compartir KPIs sensibles entre operadores. El trabajo resuelve el problema de que neural additive models (NAMs) aprenden efectos físicamente inválidos (como mayor riesgo cuando mejora la calidad del canal) incorporando monotone splines para KPIs con dirección física clara, manteniendo la auditabilidad del modelo mientras preserva las restricciones durante la agregación federada.

arXiv cs.LG ★★★★☆

Neural Feature Governance: Extending Atom Prevalence

Se presenta Neural Atom Prevalence (NAP), un framework Bayesiano para compresión e interpretabilidad de redes neuronales mediante selección estructurada a nivel de nodos. El método combina Iterative Magnitude Pruning, modelado variacional con Spike and Slab, selección de tamaño de capas via Poisson-Binomial, y fine-tuning Bayesiano, logrando reducir nodos activos al 8% en MNIST mientras mantiene calibración probabilística (descomposición aleatoria-epistémica del 3-4% y cobertura de intervalos del 93.4%) y alcanza sparsity estructurada state-of-the-art sin sacrificar precisión ni cuantificación de incertidumbre.

arXiv cs.LG ★★★★☆

Self-Poisoning in Adaptive Out-of-Distribution Detection: A Sharp-Threshold Theory and Certified Label-Free Calibration

Este paper arXiv analiza el colapso de detectores de out-of-distribution (OOD) adaptativos en tiempo de test que actualizan memoria con datos sin etiquetar, mostrando teóricamente que la contaminación de la memoria sigue una dinámica de urna de Pólya con un umbral crítico de reproducción. Los autores proponen una compuerta de admisión certificada basada en un conjunto reservado congelado que elimina el feedback loop y previene el colapso por contaminación adversarial, mientras mantiene calibración label-free; incluyen también CDC para fallos de calibración bajo drift y demuestran un teorema de imposibilidad que caracteriza completamente qué es posible en detección OOD adaptativa sin etiquetas.

arXiv cs.LG ★★★★☆

Encoding Invisible Causation for Bridge Diagnostic Agents: Triple-Guided Retrieval-Augmented Fine-Tuning with QLoRA

Paper que propone un Damage Cause Encoder para diagnosticar automáticamente causas raíz de deterioro en puentes (corrosión salina, congelamiento, fatiga) a partir de descripciones de daños visibles. Combina extracción de triples causales con LLM, retrieval-augmented generation indexado en FAISS, y fine-tuning con QLoRA, logrando 87.07% de precisión con 72% menos memoria GPU que LoRA completo e inference 11% más rápido, además de mejor generalización en evaluación diversa.

arXiv cs.LG ★★★★☆

CARNet Cycle-Conditioned Core Aggregation and Redistribution for Multivariate Time Series Forecasting

CARNet es un framework para forecasting de series temporales multivariadas que integra información de ciclos globales en un modelo de agregación por cores con complejidad lineal, mejorando la modelación de dependencias entre variables sin los costos computacionales de mecanismos basados en attention. El enfoque demuestra mejores resultados que baselines transformer y otros modelos en múltiples benchmarks reales y horizontes de predicción diversos.

arXiv cs.LG ★★★★☆

Learning What Matters: Supervising Sparse Attention Routing with Causal Evidence Sets

Paper que cuestiona el supuesto común de que los patrones de attention en modelos densos revelan qué partes del contexto se usan realmente para la respuesta. Los autores muestran mediante enmascaramiento de contexto que attention y dependencia causal frecuentemente divergen, causando que selectores sparse entrenados por destilación hereden esa falta de alineación; entrenar sobre "evidence sets" (conjuntos de hechos causalmente relevantes extraídos sin anotación) alcanza accuracies mucho mayores (99% vs 41% en tareas de referencia), y el patrón se replica en modelos preentrenados como Qwen2.5 y Gemma-2.

arXiv cs.LG ★★★★☆

An Introduction to Bayesian and Frequentist Simulation-Based Inference with Machine Learning

Paper introductorio sobre inference basado en simulación (SBI) con machine learning para resolver problemas inversos en ciencia e ingeniería. Cubre frameworks Bayesiano y frecuentista, métodos como neural posterior estimation y neural likelihood estimation para estimación de parámetros, así como validación de resultados e limitaciones del enfoque.

arXiv cs.LG ★★★★☆

A Defense of the Quadratic Model

Un paper que valida el modelo cuadrático como aproximación sorprendentemente precisa para predecir la dinámica de optimización en LLMs de 150M parámetros, mostrando que expansiones de Taylor locales pueden predecir la evolución del entrenamiento en ventanas de hasta el 10% de la duración total. El trabajo analiza la estructura del problema a través del espectro de Hessian y estabilidad local, encontrando patrones dependientes del batch size y precondicionador, lo que sugiere que el modelo cuadrático podría servir como proxy teóricamente manejable para entender la dinámica de pretraining en modelos de lenguaje.

Hacker News ★★★★☆

Kimi-K3 on HuggingFace

Se menciona el lanzamiento de Kimi-K3, un modelo disponible en HuggingFace. Aunque el artículo es breve, la publicación de un nuevo modelo de lenguaje en la plataforma principal de distribución de IA constituye una noticia dentro del ecosistema de LLMs.

vLLM (release) ★★★★★

v0.26.0

vLLM v0.26.0 suma 411 commits de 212 contribuidores e introduce soporte completo para la familia de modelos Inkling (con modeling base, CUDA graphs, attention relativa en Hopper FA4, speculative decoding MTP=1, LoRA y cuantización NVFP4). Además, incluye optimizaciones específicas para DeepSeek-V4 con kernels especializados de routing y fused_topk_bias, junto con backends de attention flexibles y soporte mejorado para fp32 lm_head en modelos de generación, todo esto escalable a múltiples vendors (NVIDIA, AMD, Intel).

Meta AI ★★★★☆

Reimagining Independence: How Meta’s AI Models Are Helping the University of Pittsburgh Transform Assistive Robotics

Meta ha colaborado con la Universidad de Pittsburgh para integrar sus modelos de IA en robótica asistencial, permitiendo que robots interpreten instrucciones en lenguaje natural y realicen tareas complejas de asistencia. La aplicación aprovecha capacidades de visión y comprensión del lenguaje de los modelos de Meta para mejorar la independencia de personas con discapacidades motrices mediante automatización de tareas cotidianas.

Construir este día costó 92.887 tokens de entrada y 9939 de salida en 69 llamadas a modelos — unos 0,1426 $.