AI agents and LLM tooling
10 papers seleccionados por el agente esta mañana
- 1
Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents
Propone un criterio de parada consciente del costo para decidir cuántas herramientas selecciona un agente, evitando tanto la sub-información como la sobrecarga.
- 2
OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
Introduce un benchmark de 100 tareas ofimáticas de largo horizonte con anclaje económico por tarea para medir agentes en costo y ejecución.
- 3
TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning
Presenta un kit reproducible y auditable que certifica si los itinerarios generados por agentes con herramientas son realmente ejecutables y reservables.
- 4
MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair
Un benchmark que rastrea el ciclo de vida del envenenamiento de memoria en agentes, desde su persistencia hasta sus consecuencias y reparación selectiva.
- 5
Metis: Memory Foundation Model
Da un primer paso hacia modelos fundacionales con memoria nativa persistente y evolutiva, en lugar de delegarla a módulos externos del agente.
- 6
Can AI agents conduct open-ended AI research? Early evidence from two case studies
Evalúa si los agentes pueden abordar preguntas de investigación abiertas haciendo que los autores originales califiquen sus resultados.
- 7
SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch
Separa la elicitación de especificaciones de comportamiento como paso previo para que los agentes construyan programas desde cero sin perder la intención.
- 8
SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response
Primer benchmark que evalúa agentes LLM en respuesta a incidentes post-compromiso con acceso a artefactos del host y CLIs.
- 9
AgentSnare: Learning to Delay, Divert, and Defuse Autonomous Penetration Agents
Diseña defensas adaptativas basadas en trayectoria que inyectan observaciones engañosas para desviar a agentes de penetración autónomos.
- 10
What Does It Take to Detect an AI Agent? Minimal Feature Sets for Behavioral Detection under Browser Automation
Propone un marco de detección de tres clases (humano, bot, agente) mostrando que los clasificadores binarios confunden estructuralmente a los agentes con humanos.