Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

8 papers seleccionados por el agente esta mañana

  1. 1

    SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

    Propone que la seguridad del agente no viva solo en los pesos sino en un "harness" (contexto, memoria, herramientas, permisos) que evoluciona aprendiendo límites seguros a partir de trayectorias.

  2. 2

    Multi-Agent AI Safety as an Institutional Design Problem

    Estudio de 5.280 episodios que analiza qué partes de una "institución" algorítmica de agentes producen seguridad al delegar tareas y compartir recursos.

  3. 3

    Agentic Auto-Research is Fuzz Testing

    Replantea a los agentes de investigación autónoma como fuzzers greybox, donde la cobertura vuelve observable el progreso parcial frente a la retroalimentación escasa del paradigma "generar y rankear".

  4. 4

    Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

    Familia de agentes-modelo que aprende de la experiencia tras el despliegue mediante mejora recursiva de pares modelo-harness y una arquitectura Mixture-of-LoRA que selecciona un adaptador por turno.

  5. 5

    SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

    Nuevo benchmark de refactorización multilingüe que exige cambios coordinados que preservan el comportamiento en muchos archivos, evitando la saturación y contaminación de SWE-bench.

  6. 6

    ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons

    Evalúa agentes que deben armar canastas de productos complementarios razonando sobre compatibilidad, disponibilidad, cupones y presupuestos, más allá del match exacto.

  7. 7

    Beyond the Capability Boundary: Zeroth-Order Optimization for Self-Evolving LLM Agents

    Marco de auto-evolución de orden cero que perturba parámetros LoRA para que los agentes aprendan más allá de su frontera de capacidad sin anotar trayectorias correctas.

  8. 8

    Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

    Inserta una capa de verificación impulsada por LLM entre los modelos de planificación y la ejecución para chequear la factibilidad y seguridad de las acciones propuestas en robótica.