Evaluation An Empirical Study of Automating Agent Evaluation Paper • 2605.11378 • Published May 12 • 2 Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values Paper • 2605.10365 • Published May 11 • 10 AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling Paper • 2608.26623 • Published Aug 27 • 19
Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values Paper • 2605.10365 • Published May 11 • 10
AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling Paper • 2608.26623 • Published Aug 27 • 19
Evaluation An Empirical Study of Automating Agent Evaluation Paper • 2605.11378 • Published May 12 • 2 Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values Paper • 2605.10365 • Published May 11 • 10 AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling Paper • 2608.26623 • Published Aug 27 • 19
Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values Paper • 2605.10365 • Published May 11 • 10
AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling Paper • 2608.26623 • Published Aug 27 • 19