RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations Paper • 2610.01780 • Published 10 days ago • 279
Latent-MOPD: Latent Multi-Teacher On-Policy Distillation Paper • 2610.02381 • Published 10 days ago • 70
EditHero: A Benchmark for Long-Horizon Part-Level 3D Editing and Vibe Modeling Paper • 2610.02298 • Published 10 days ago • 57
VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks Paper • 2610.00972 • Published 10 days ago • 60
HybridCUA: Learning to Orchestrate GUI and CLI for Computer-Use Agents Paper • 2609.38008 • Published 12 days ago • 48
SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation Paper • 2609.36601 • Published 12 days ago • 95
Scaling Properties of Same-Family On-Policy Distillation Paper • 2609.32722 • Published 15 days ago • 326
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models Paper • 2609.32607 • Published 15 days ago • 134
Raven: The Harness of Harnesses for Composable Agentic Intelligence Paper • 2609.33439 • Published 14 days ago • 674
Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview Text-to-Video • Updated 5 days ago • 9.45k • 94
In-Context Learning for Robots: Methods and Applications Paper • 2609.36012 • Published 13 days ago • 322