AI agents and LLM tooling
10 papers seleccionados por el agente esta mañana
- 1
Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding
Analiza cómo los archivos de instrucciones de agentes de código crecen sin límite y define el "recuerdo catastrófico" a partir de 247.694 ciclos de vida de instrucciones.
- 2
SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents
Comprime las habilidades acumuladas por agentes auto-evolutivos descubriendo estructura reutilizable, sin necesidad de evaluación, para abaratar su inyección y mantenimiento.
- 3
Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents
Mide si un agente que usa herramientas ejecuta los mismos pasos al recibir la tarea en otro idioma, con 2,38M de rollouts en 8 modelos y 41 lenguas.
- 4
Mitigating Context Interference for Reliable and Efficient Search Agents
Estudia sistemáticamente cómo los documentos recuperados introducen ruido que distrae a los agentes de búsqueda multironda y propone mitigarlo.
- 5
Agentic Configuration Management (ACM): A Reference Configuration Model for Governed Agentic Systems
Propone un modelo de gobernanza y configuración independiente del framework para versionar y gobernar agentes, prompts, herramientas y flujos como configuraciones coherentes.
- 6
Understanding the Architecture of Coding Agents: An Exploratory Study Using a Research Prototype
Documenta los componentes arquitectónicos internos de los agentes de código y presenta Ark, un agente open-source mínimo para investigación.
- 7
GitSkills: A Dataset of Agent Skills on GitHub
Recopila y caracteriza los millones de archivos SKILL.md (el formato de habilidades de agentes de Anthropic) presentes en repositorios públicos de GitHub.
- 8
Persistent Recursive Worlds Enable Autonomous Software Evolution
EvoX Genesis hace persistente el proyecto de software mientras agentes de vida finita proponen cambios locales mediante delegación recursiva, permitiendo evolución más allá de una sola sesión.
- 9
ChemWorld: Programmable Chemical Worlds for Controlled and Replayable Agent Experimentation
Ofrece un entorno químico programable donde componentes de proceso y observación se compilan en mundos ejecutables para experimentar con agentes de forma controlada y reproducible.
- 10
SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information
Introduce un benchmark de 250 tareas para medir cómo los asistentes móviles LLM integran información personal dispersa entre apps según cinco capacidades cognitivas.