physical-reasoning

Tag

Cards List
#physical-reasoning

Principia: Relational Physics Tests for Video Models

Hugging Face Daily Papers · 2026-09-03 Cached

Principia is a benchmark that evaluates video models on Newtonian physics using relational consistency between paired objects, revealing significant gaps in current models' physical reasoning.

0 favorites 0 likes
#physical-reasoning

@fangfu0830: Big thanks to @_akhaliq for sharing Code-as-World We’ve open-sourced Code-as-World — a step toward turning physical exp…

X AI KOLs Timeline · 2026-09-01 Cached

Code-as-World has been open-sourced, introducing a framework that uses code as executable representations for the physical world to enhance AI physical reasoning, along with pre-trained models and evaluation tools.

0 favorites 0 likes
#physical-reasoning

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

Papers with Code Trending · 2026-08-27 Cached

Code-as-World introduces a paradigm that represents physical environments as executable code to enable quantitative reasoning for vision-language models, using an agentic discovery loop for scalable supervision and achieving state-of-the-art performance.

0 favorites 0 likes
#physical-reasoning

Answer-Level Trust Selection for Physical Vision-Language Reasoning

arXiv cs.LG · 2026-08-21 Cached

This paper proposes Answer-Level Trust Selection (ATS), a post-hoc, model-agnostic framework for assessing the reliability of individual predictions from vision-language models in quantitative physical reasoning tasks.

0 favorites 0 likes
#physical-reasoning

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

arXiv cs.AI · 2026-07-08 Cached

VAORA proposes a novel reward design for vision-language models that aligns reasoning with visual contexts and action outcomes, improving physical reasoning and generalization across unseen tasks and environments.

0 favorites 0 likes
#physical-reasoning

EVLA: An Electro-Aware Multimodal Assistant for Physically-Grounded Driving Reasoning and Control

arXiv cs.CL · 2026-06-30 Cached

Introduces EVLA, a framework that enhances vision-language driving assistants with real-time awareness of electrified powertrain states, enabling energy-optimal and physically grounded decisions.

0 favorites 0 likes
#physical-reasoning

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

arXiv cs.LG · 2026-06-09 Cached

This paper identifies a failure mode called PhysHack in LLM-based LEGO assembly generation and proposes PVPO, a sample-efficient reinforcement learning method with model-based data selection that improves physical and semantic alignment using only a small fraction of training data.

0 favorites 0 likes
#physical-reasoning

WorldOlympiad: Can Your World Model Survive a Triathlon?

Hugging Face Daily Papers · 2026-06-09 Cached

WorldOlympiad presents a comprehensive benchmark for evaluating video-based world models across physical faithfulness, geometric consistency, and interaction fidelity, revealing significant gaps in current generative models.

0 favorites 0 likes
#physical-reasoning

Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?

Hugging Face Daily Papers · 2026-06-04 Cached

Dream.exe proposes an evaluation framework that uses robotic manipulation tasks to assess video generation models' understanding of physical reality, finding that visual quality does not predict executable motion accuracy.

0 favorites 0 likes
#physical-reasoning

BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs

arXiv cs.AI · 2026-06-01 Cached

BilliardPhys-Bench is a new benchmark that tests multimodal LLMs on physical reasoning using synthetic billiards scenarios, requiring predictions of collisions and final ball positions. The paper finds that current models struggle with longer simulations and exhibit a 'stasis bias' of predicting no interaction when uncertain.

0 favorites 0 likes
#physical-reasoning

Advancing Creative Physical Intelligence in Large Multimodal Models

arXiv cs.AI · 2026-05-27 Cached

This paper introduces MM-CreativityBench, a benchmark for evaluating creative tool use in large multimodal models under physically constrained environments, and proposes affordance-grounded alignment using Direct Preference Optimization to reduce hallucination and improve grounded reasoning.

0 favorites 0 likes
#physical-reasoning

KinDER: A Physical Reasoning Benchmark for Robot Learning and Planning

Hugging Face Daily Papers · 2026-05-04 Cached

KinDER is a new open-source benchmark for physical reasoning in robotics, featuring procedurally generated environments and baselines to evaluate kinematic and dynamic constraint challenges.

0 favorites 0 likes
← Back to home

Submit Feedback