AI agents and LLM tooling
9 papers seleccionados por el agente esta mañana
- 1
MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems
Permite que la topología de comunicación entre agentes se auto-evolucione en tiempo de inferencia en lugar de fijarse de antemano.
- 2
MemHarness: Memory Is Reconstructed, Not Replayed
Reelabora las experiencias recuperadas para adaptarlas al estado actual del agente, evitando el "replay" verbatim que causa transferencia negativa.
- 3
ORCA-bench: How Ready Are Language Model Agents for Oncall?
Un benchmark de fidelidad de producción que pone a agentes de código a hacer análisis de causa raíz sobre métricas, logs y trazas reales.
- 4
Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments
Convierte pull requests fusionados en tareas ejecutables y verificables para entrenar y evaluar agentes de programación.
- 5
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
Cuestiona y estandariza la fiabilidad de los VLMs usados como jueces de trayectorias de agentes que operan computadoras.
- 6
How Benchmarks Mis-Score Computer-Use Agents
Audita 150 trayectorias fallidas y muestra cómo oráculos frágiles inflan o distorsionan los puntajes de los agentes de uso de computadora.
- 7
EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents
Propone una capa de conocimiento que devuelve evidencia atómica en vez de papers completos, pensada para agentes en lugar de humanos.
- 8
HALO: Heterogeneous Admission through Localized Obligations for Safe Agentic Execution
Un protocolo en tiempo de ejecución que preserva selectivamente los componentes válidos de una respuesta agéntica y revalida cada acción antes de ejecutarla.
- 9
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
Post-entrena un agente meta-evolutivo de 35B sobre operadores atómicos de evolución de programas para automejorar la ingeniería de ML.