Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

10 papers seleccionados por el agente esta mañana

  1. 1

    Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding

    Analiza cómo los archivos de instrucciones de agentes de código crecen sin límite y define el "recuerdo catastrófico" a partir de 247.694 ciclos de vida de instrucciones.

  2. 2

    SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents

    Comprime las habilidades acumuladas por agentes auto-evolutivos descubriendo estructura reutilizable, sin necesidad de evaluación, para abaratar su inyección y mantenimiento.

  3. 3

    Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

    Mide si un agente que usa herramientas ejecuta los mismos pasos al recibir la tarea en otro idioma, con 2,38M de rollouts en 8 modelos y 41 lenguas.

  4. 4

    Mitigating Context Interference for Reliable and Efficient Search Agents

    Estudia sistemáticamente cómo los documentos recuperados introducen ruido que distrae a los agentes de búsqueda multironda y propone mitigarlo.

  5. 5

    Agentic Configuration Management (ACM): A Reference Configuration Model for Governed Agentic Systems

    Propone un modelo de gobernanza y configuración independiente del framework para versionar y gobernar agentes, prompts, herramientas y flujos como configuraciones coherentes.

  6. 6

    Understanding the Architecture of Coding Agents: An Exploratory Study Using a Research Prototype

    Documenta los componentes arquitectónicos internos de los agentes de código y presenta Ark, un agente open-source mínimo para investigación.

  7. 7

    GitSkills: A Dataset of Agent Skills on GitHub

    Recopila y caracteriza los millones de archivos SKILL.md (el formato de habilidades de agentes de Anthropic) presentes en repositorios públicos de GitHub.

  8. 8

    Persistent Recursive Worlds Enable Autonomous Software Evolution

    EvoX Genesis hace persistente el proyecto de software mientras agentes de vida finita proponen cambios locales mediante delegación recursiva, permitiendo evolución más allá de una sola sesión.

  9. 9

    ChemWorld: Programmable Chemical Worlds for Controlled and Replayable Agent Experimentation

    Ofrece un entorno químico programable donde componentes de proceso y observación se compilan en mundos ejecutables para experimentar con agentes de forma controlada y reproducible.

  10. 10

    SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

    Introduce un benchmark de 250 tareas para medir cómo los asistentes móviles LLM integran información personal dispersa entre apps según cinco capacidades cognitivas.