AI agents and LLM tooling
8 papers seleccionados por el agente esta mañana
- 1
SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
Propone que la seguridad del agente no viva solo en los pesos sino en un "harness" (contexto, memoria, herramientas, permisos) que evoluciona aprendiendo límites seguros a partir de trayectorias.
- 2
Multi-Agent AI Safety as an Institutional Design Problem
Estudio de 5.280 episodios que analiza qué partes de una "institución" algorítmica de agentes producen seguridad al delegar tareas y compartir recursos.
- 3
Agentic Auto-Research is Fuzz Testing
Replantea a los agentes de investigación autónoma como fuzzers greybox, donde la cobertura vuelve observable el progreso parcial frente a la retroalimentación escasa del paradigma "generar y rankear".
- 4
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Familia de agentes-modelo que aprende de la experiencia tras el despliegue mediante mejora recursiva de pares modelo-harness y una arquitectura Mixture-of-LoRA que selecciona un adaptador por turno.
- 5
SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
Nuevo benchmark de refactorización multilingüe que exige cambios coordinados que preservan el comportamiento en muchos archivos, evitando la saturación y contaminación de SWE-bench.
- 6
ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons
Evalúa agentes que deben armar canastas de productos complementarios razonando sobre compatibilidad, disponibilidad, cupones y presupuestos, más allá del match exacto.
- 7
Beyond the Capability Boundary: Zeroth-Order Optimization for Self-Evolving LLM Agents
Marco de auto-evolución de orden cero que perturba parámetros LoRA para que los agentes aprendan más allá de su frontera de capacidad sin anotar trayectorias correctas.
- 8
Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy
Inserta una capa de verificación impulsada por LLM entre los modelos de planificación y la ejecución para chequear la factibilidad y seguridad de las acciones propuestas en robótica.