GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture Paper • 2608.15875 • Published 12 days ago • 97
Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs Paper • 2608.12781 • Published 11 days ago • 33
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection Paper • 2608.20169 • Published 4 days ago • 10
EnvHarness: Awakening Static Worlds for Agent Learning Paper • 2608.19880 • Published 8 days ago • 265
SPADE: Self-Play in Adaptive Synthetic Executable Environments Paper • 2608.19197 • Published 9 days ago • 51
Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation Paper • 2608.17512 • Published 10 days ago • 51
Demystifying Agent Skills: Why They Work-Until They Don't Paper • 2608.14036 • Published 14 days ago • 166
HarnessEval-W: Agentifying the Evaluation of Visual Worlds Paper • 2608.16859 • Published 11 days ago • 281
PRM-as-a-Judge 1.5: A Toolkit for Robot Process Assessment Paper • 2608.14284 • Published 14 days ago • 14
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development Paper • 2608.13417 • Published 15 days ago • 55
Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence Paper • 2608.12743 • Published 15 days ago • 44
Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures Paper • 2607.28802 • Published 29 days ago • 10
SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation Paper • 2608.02287 • Published 25 days ago • 31
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Paper • 2608.01964 • Published 25 days ago • 182
PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models Paper • 2607.24957 • Published Jul 27 • 19