{"as_of":"2026-08-08T07:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2997f626cfb89cc615e7159d2647db2507335dc843d691b79bb98eb08df13e06","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:36:26.033113Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T23:15:38.962013Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:57:06.751718Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"cited_work":{"arxiv_id":"2505.24182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24182","snapshot_observed_at":"2026-07-02T15:57:06.751718Z","title":null,"venue":null,"work_id":"601b90d4-25ec-45d2-9b7c-801fb2aa4801","year":2025},"citing_paper":{"arxiv_id":"2604.06725","last_updated":"2026-04-08T06:47:55Z","snapshot_observed_at":"2026-08-02T13:53:46.692069Z","submitted_at":"2026-04-08T06:47:55Z","title":"Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:46.753641Z"},"links":{"cited_paper":"/paper/2505.24182","citing_paper":"/paper/2604.06725"},"observation_digest":"sha256:88a0e7aa32b4805a53f3ba7f8bd92857c97efc558c2d451a77fff688317504a8","observation_id":"90ae6915-c9f9-44fc-92cc-1bf860ead61a","resolution":{"observed_at":"2026-05-10T23:15:47.826680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"cited_work":{"arxiv_id":"2505.24182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24182","snapshot_observed_at":"2026-07-02T15:57:06.751718Z","title":null,"venue":null,"work_id":"601b90d4-25ec-45d2-9b7c-801fb2aa4801","year":2025},"citing_paper":{"arxiv_id":"2606.05966","last_updated":"2026-06-04T10:07:05Z","snapshot_observed_at":"2026-07-06T23:45:51.910263Z","submitted_at":"2026-06-04T10:07:05Z","title":"Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T23:15:38.962013Z"},"links":{"cited_paper":"/paper/2505.24182","citing_paper":"/paper/2606.05966"},"observation_digest":"sha256:74098d6d7186eb720a0d030e09bfd4c1014ea1fc32f48e1597ba83d2133b766b","observation_id":"bdd9a7af-2d5f-44c5-961e-ebf3968c4329","resolution":{"observed_at":"2026-07-02T15:57:06.752989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24182/citation-record","integrity":"/paper/2505.24182/integrity","json":"/paper/2505.24182/citation-record.json","paper":"/paper/2505.24182"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:17.832939Z","title":"Origins of physical knowledge.Psychological Review, 99(4):605–632, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:17.832939Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:6b833f52ffe81bb756fbc8fcefc5b33d890a8e2ef335495e349131d8e2cdb442","observation_id":"3cd4d0b4-5021-4b0b-b540-c9ce30af7584","resolution":{"observed_at":"2026-08-07T12:36:17.832939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:17.919876Z","title":"Infants’ physical world.Current Directions in Psychological Science, 13(3):89–94, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:17.919876Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:3d2edc1bdef5a24a0d24c89de0ae24162f4fa9b5e5bea208dc4c2899dea7fccf","observation_id":"13c7ee59-cebb-44aa-b4b2-d3e4e902b873","resolution":{"observed_at":"2026-08-07T12:36:17.919876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.059860Z","title":"A theory of causal learning in children: Causal maps and bayes nets.Psychological Review, 111(1):3–32, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.059860Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:f2fc36c29262d4c40b577c08296a7b3645b325dde89dc8fe2a5fd07d5dee27b4","observation_id":"995443c2-dab8-49d0-a6b3-c5c29f4736a0","resolution":{"observed_at":"2026-08-07T12:36:18.059860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.157018Z","title":"Building machines that learn and think like people.Behavioral and Brain Sciences, 40, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.157018Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d351a7f46dc1d10100c60b86ebed1c5548b248e76f2984d5c5281d643befdc1c","observation_id":"a44fd7cb-17b2-4bab-b091-4b6ab85da1e6","resolution":{"observed_at":"2026-08-07T12:36:18.157018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.222324Z","title":"GPT o3.https://chatgpt.com/?model=o3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.222324Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:e94489b556109b0dca0cf537347a61976814f72236a48b2d6f6ba6c6292f2b4d","observation_id":"776a1c1e-6dda-4d08-8e04-6c6cb76f62f2","resolution":{"observed_at":"2026-08-07T12:36:18.222324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.298510Z","title":"Hello GPT-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.298510Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ba5835e617e8f79d7169b35cc31c5a2089960ca9718f48eac46960d37b69334a","observation_id":"33fe6ec1-bae3-45d3-83a0-e8015b2aa7a8","resolution":{"observed_at":"2026-08-07T12:36:18.298510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.372868Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.372868Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:85025d7d9fc2637f2c00728c4c4dc96860e83f0ba0c5e43a172ba88217d376f3","observation_id":"396f73ce-a2d5-4881-95b4-2ab07a32adcf","resolution":{"observed_at":"2026-08-07T12:36:18.372868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:36:18.458818Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.458818Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:92ec5858bf9aced227603d56fb4aef240d9333ab7adca9f7c3402da48532ea79","observation_id":"01b07d1d-4d82-4309-8863-116f46653402","resolution":{"observed_at":"2026-08-07T12:36:18.458818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.521583Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.521583Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:0b47060a44de85cf6b4af7f2fe21da3f18914a83bbdc87e110f15c4da54f24a3","observation_id":"663549a3-a626-4a5a-8f3a-5289fad1bbea","resolution":{"observed_at":"2026-08-07T12:36:18.521583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.576525Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3.https://github.com/Deep-Agent/R1-V, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.576525Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4c35a92fdea2e8821c13ff079b02a6fa07ee9e25b20770a8630b98a351249f0d","observation_id":"3eaaac8c-bd53-4cf9-a801-8daa0779959d","resolution":{"observed_at":"2026-08-07T12:36:18.576525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.668837Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.668837Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:93dba67acd70f51e2cc5197707a57c7cc4b68ead01bdca9620acf6ad58d9bda3","observation_id":"6f2bb7d3-6f3a-4e60-b81b-95b08d2efed1","resolution":{"observed_at":"2026-08-07T12:36:18.668837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-07T12:36:18.739712Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning.arXiv preprint arXiv:2403.16999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.739712Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a79e615a37d62ba308269940bca42e6cc7e2bc094692026aa9f9502d177fd9c9","observation_id":"23031486-063f-4993-8aa9-75308f6d03df","resolution":{"observed_at":"2026-08-07T12:36:18.739712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.817836Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.817836Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ea3b0268ae3b550d908e86cccfbbd74aa11e05c5bd91ea7340a057df76aec582","observation_id":"c34fc8e9-6d24-4fa0-a12e-972dcae22fbb","resolution":{"observed_at":"2026-08-07T12:36:18.817836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.900204Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.900204Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:2248c5f94a98be246260fbf816d85879465cb5a38da8893744f0d917bf5e25b2","observation_id":"03e02f1f-4c35-46fe-ad00-18c1b505ff88","resolution":{"observed_at":"2026-08-07T12:36:18.900204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:18.968292Z","title":"Mm-spatial: Exploring 3d spatial understanding in multimodal llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.968292Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ab888f2e50060a7b20f4077d64906eb7b390b192e3f9465592cbec1a1c8d39fd","observation_id":"413a23f5-fecc-46b0-8e56-781aef5a4c35","resolution":{"observed_at":"2026-08-07T12:36:18.968292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.034689Z","title":"Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.034689Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4c22c16953bc47b6f830bc56396f4f18d03167b356ac9d9d7c4da3c495dc2256","observation_id":"f6977751-e323-4e53-9119-d5009e4ec2d1","resolution":{"observed_at":"2026-08-07T12:36:19.034689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.068799Z","title":"Mllm-sul: Multimodal large language model for semantic scene understanding and localization in traffic scenarios, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.068799Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4c027cbc4d87d4fd4cacd8779955f696adbdb36f2618e7329a8a7b26157b2463","observation_id":"99a5dc0e-e9aa-441d-a29e-a7e888159747","resolution":{"observed_at":"2026-08-07T12:36:19.068799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.125517Z","title":"The second half","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.125517Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:12082456d3c6fc840131ba8ceac9c9b6266f7e214764a4ea99ce85d7bb4e480b","observation_id":"15f5e482-fba9-4813-8c9b-f432791eeeb3","resolution":{"observed_at":"2026-08-07T12:36:19.125517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-07T12:36:19.219155Z","title":"How far is video generation from world model: A physical law perspective.arXiv preprint arXiv:2411.02385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.219155Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:e182d8ea19efde253f6ff912f3faf2ab2db3cf5ccd2ac69cb9c6ee7aa9212b19","observation_id":"0485d055-943c-46a3-a326-8f9d22948a46","resolution":{"observed_at":"2026-08-07T12:36:19.219155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.278900Z","title":"Contphy: Continuum physical concept learning and reasoning from videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.278900Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:0e3d775ff588e105b1ccf83182e41fb51420a1295673cd3264651653eead5f68","observation_id":"967eb7ff-d878-4022-b98b-1174ccc27284","resolution":{"observed_at":"2026-08-07T12:36:19.278900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.363631Z","title":"Mdk12-bench: A multi-discipline benchmark for evaluating reasoning in multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.363631Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:5de78738c2072c17ee2f0e129c8780973198ea9df7b8d8a746d21b2bd682e23d","observation_id":"ecfa2f21-7a48-4473-b7f1-aefb7dd0253e","resolution":{"observed_at":"2026-08-07T12:36:19.363631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.454947Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.454947Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4e9d1fd92d5e1cab2162b09be305a71aa09a5a2ddbd390a424b6c6bef398a669","observation_id":"4fba22f8-6f71-4112-887c-6250eface497","resolution":{"observed_at":"2026-08-07T12:36:19.454947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:19.547264Z","title":"Vlind-bench: Measuring language priors in large vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.547264Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:8eb8879a3f8ffc5e5ca9a2440dcef092116829bbb0ecdada710daae031703570","observation_id":"297d6855-afaa-4ef4-821a-3b05c75a24fc","resolution":{"observed_at":"2026-08-07T12:36:19.547264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-07T20:46:02.743961Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T12:36:19.638964Z","title":"Mme-cot: Benchmarking chain-of-thought in large multimodal models for reasoning quality, robustness, and efficiency.arXiv preprint arXiv:2502.09621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.638964Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:60a119e6456f40552f3f733f013184e9299d18ff02b3801cc47dd4afcb517f36","observation_id":"cd3064e3-fe71-4bab-b0a8-eada1baeb521","resolution":{"observed_at":"2026-08-07T12:36:19.638964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-07T12:36:19.731991Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems?arXiv preprint arXiv:2403.14624, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.731991Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:428fc9340d02f7ee85facb7c59e5462d027112dce526d24f3b054d8cbe8e0c8f","observation_id":"6b0461fd-5910-4188-ab00-2abd10dca60d","resolution":{"observed_at":"2026-08-07T12:36:19.731991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-08-07T12:36:19.820855Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting.arXiv preprint arXiv:2403.03174, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.820855Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:18c925f1d873e3db631d71170534a6f732b45517ea8d7121d0d8caaac6d23f48","observation_id":"95c3523d-ead9-4f75-98b5-12ad20117606","resolution":{"observed_at":"2026-08-07T12:36:19.820855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16836","last_updated":"2024-02-26T18:57:52Z","snapshot_observed_at":"2026-08-06T10:58:59.007571Z","submitted_at":"2024-02-26T18:57:52Z","title":"PhyGrasp: Generalizing Robotic Grasping with Physics-informed Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16836","snapshot_observed_at":"2026-08-07T12:36:19.942520Z","title":"Phygrasp: Generalizing robotic grasping with physics-informed large multimodal models.arXiv preprint arXiv:2402.16836, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:19.942520Z"},"links":{"cited_paper":"/paper/2402.16836","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:21faa593ce7f98bafdf8162edd72cdf5db69b14b04c00a3749c7d6f3b58db981","observation_id":"c35339db-39e9-442c-84a5-24d7b06a90b9","resolution":{"observed_at":"2026-08-07T12:36:19.942520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05862","last_updated":"2024-09-10T02:28:40Z","snapshot_observed_at":"2026-08-01T16:03:11.829608Z","submitted_at":"2024-09-09T17:59:13Z","title":"Evaluating Multiview Object Consistency in Humans and Image Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05862","snapshot_observed_at":"2026-08-07T12:36:20.033626Z","title":"Tenenbaum, and Alexei A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.033626Z"},"links":{"cited_paper":"/paper/2409.05862","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ba661f3617f2d2a6c31b0cc18c28222432e2aa6bb44af49862f3c207c451ee73","observation_id":"e603c6ff-3b77-4693-aa7e-e097e3d5c118","resolution":{"observed_at":"2026-08-07T12:36:20.033626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06430","last_updated":"2025-01-11T04:08:44Z","snapshot_observed_at":"2026-08-08T04:27:13.360500Z","submitted_at":"2025-01-11T04:08:44Z","title":"Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs","version":1},"cited_work":{"arxiv_id":"2501.06430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.06430","snapshot_observed_at":"2026-08-07T12:36:28.262113Z","title":"Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs","venue":"cs.CV","work_id":"6c3842fa-0e74-433e-9970-70421374580e","year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.108953Z"},"links":{"cited_paper":"/paper/2501.06430","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:f38c9dcfbe2816176b21a1e489c54a491eaffb50897711cc21ad9e884ad81871","observation_id":"82cf3d16-46a1-4666-86ca-38edf60f9724","resolution":{"observed_at":"2026-08-07T12:36:28.351368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06148","last_updated":"2026-04-24T03:56:57Z","snapshot_observed_at":"2026-07-06T21:06:12.984419Z","submitted_at":"2025-04-08T15:43:01Z","title":"V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06148","snapshot_observed_at":"2026-08-07T12:36:20.191213Z","title":"V-mage: A game evaluation framework for assessing visual-centric capabilities in multimodal large language models.arXiv preprint arXiv:2504.06148, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.191213Z"},"links":{"cited_paper":"/paper/2504.06148","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4b25c06c9ae020a089a4ba78c6b064c8ba2d4c1e27fa0d05bb43be729ab032b4","observation_id":"44b7c249-c56e-4905-bf2e-019f1cca6ebd","resolution":{"observed_at":"2026-08-07T12:36:20.191213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11557","last_updated":"2025-03-14T16:26:11Z","snapshot_observed_at":"2026-08-07T17:03:29.182749Z","submitted_at":"2025-03-14T16:26:11Z","title":"VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11557","snapshot_observed_at":"2026-08-07T12:36:20.262944Z","title":"Verify: A benchmark of visual explanation and reasoning for investigating multimodal reasoning fidelity.arXiv preprint arXiv:2503.11557, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.262944Z"},"links":{"cited_paper":"/paper/2503.11557","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a8fb4623445089647104a2a13846bd3c72ef42e66ae0a11203fae6c27bee7a47","observation_id":"cc6d883d-c664-4434-ba4b-aeca9bc13c0f","resolution":{"observed_at":"2026-08-07T12:36:20.262944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T12:36:20.318015Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.318015Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:f7e103a41f7031c2280d56d59d60f767bf8ee485d063c40645f2937b81bdaf63","observation_id":"e2e65cdc-7675-4ef8-b54b-3b7d1475aaf4","resolution":{"observed_at":"2026-08-07T12:36:20.318015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-07T12:36:20.404754Z","title":"Tenen- baum","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.404754Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:8e35d06fbb1b0216df324b87bf325c6b4638d537fb7afda7e70976c5813e4b8e","observation_id":"908e0f4b-ba88-4a97-9a71-89a183d4a691","resolution":{"observed_at":"2026-08-07T12:36:20.404754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08261","last_updated":"2022-06-20T14:27:21Z","snapshot_observed_at":"2026-08-01T17:46:40.019621Z","submitted_at":"2021-06-15T16:13:39Z","title":"Physion: Evaluating Physical Prediction from Vision in Humans and Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08261","snapshot_observed_at":"2026-08-07T12:36:20.520292Z","title":"Bear, Elias Wang, Damian Mrowca, Felix J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.520292Z"},"links":{"cited_paper":"/paper/2106.08261","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:21ce88fbfc7948295f445c1cfd317b93ba4b95a2cd6c44d0466b397b1b4cace2","observation_id":"b167a712-eb8e-46d2-8573-c78590142f6d","resolution":{"observed_at":"2026-08-07T12:36:20.520292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07018","last_updated":"2023-10-10T21:08:51Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T21:08:51Z","title":"NEWTON: Are Large Language Models Capable of Physical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07018","snapshot_observed_at":"2026-08-07T12:36:20.594399Z","title":"Newton: Are large language models capable of physical reasoning?arXiv preprint arXiv:2310.07018, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.594399Z"},"links":{"cited_paper":"/paper/2310.07018","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d2aa37015744cac93452367ebbb51ab14970c32f4eee5e0e9660a241a83d95a7","observation_id":"ae3560fa-e2b2-468a-8aab-1a7ca3bbf029","resolution":{"observed_at":"2026-08-07T12:36:20.594399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:20.684237Z","title":"Krishnan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.684237Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ab78b6b3aa0e9b50d7c09c4cb997d3e8018778f2ab65f6a2a747995696556fe4","observation_id":"ab2bb033-976e-482b-8352-b7c889977d56","resolution":{"observed_at":"2026-08-07T12:36:20.684237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-07T12:36:20.778339Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.778339Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4716a6b5a480212d9bc4afb43152b57b3539a17858cd548c484adfa33cccaf65","observation_id":"ecee111c-99a8-4f8e-82a8-7493c4edd222","resolution":{"observed_at":"2026-08-07T12:36:20.778339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13473","last_updated":"2023-10-20T13:14:38Z","snapshot_observed_at":"2026-07-06T16:36:07.860946Z","submitted_at":"2023-10-20T13:14:38Z","title":"Benchmarking Sequential Visual Input Reasoning and Prediction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13473","snapshot_observed_at":"2026-08-07T12:36:20.868896Z","title":"Benchmarking sequential visual input reasoning and prediction in multimodal large language models.arXiv preprint arXiv:2310.13473, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.868896Z"},"links":{"cited_paper":"/paper/2310.13473","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:c25d1b0af37c88d5f6d35e5bbf2cfff044cb16c8dfcf5fb6cb3ea23620acc57b","observation_id":"8774458e-4ede-49ad-bdfb-5ade160e8838","resolution":{"observed_at":"2026-08-07T12:36:20.868896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15668","last_updated":"2023-11-02T03:35:51Z","snapshot_observed_at":"2026-07-06T15:47:26.532273Z","submitted_at":"2023-06-27T17:59:33Z","title":"Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15668","snapshot_observed_at":"2026-08-07T12:36:20.960291Z","title":"Tenenbaum, Daniel LK Yamins, Judith E Fan, and Kevin A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:20.960291Z"},"links":{"cited_paper":"/paper/2306.15668","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:cd61f34d8d87daf3bfc816a0423c0a9fb92173e2675482aa3cfc54d0285ef9f9","observation_id":"67a775f1-c542-4221-ae98-dab8d9f561d7","resolution":{"observed_at":"2026-08-07T12:36:20.960291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07616","last_updated":"2020-02-11T10:05:20Z","snapshot_observed_at":"2026-08-01T11:20:53.002295Z","submitted_at":"2018-03-20T19:29:46Z","title":"IntPhys: A Framework and Benchmark for Visual Intuitive Physics Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07616","snapshot_observed_at":"2026-08-07T12:36:21.046870Z","title":"Intphys: A framework and benchmark for visual intuitive physics reasoning.arXiv preprint arXiv:1803.07616, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.046870Z"},"links":{"cited_paper":"/paper/1803.07616","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:6442fb7e0978e280b7ef5984da3f3ed8be1d084eb8f2a4a2ca28db5499a16467","observation_id":"822f327a-b428-42cd-8f6c-795c96b062b0","resolution":{"observed_at":"2026-08-07T12:36:21.046870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13730","last_updated":"2024-12-02T15:11:23Z","snapshot_observed_at":"2026-07-06T19:18:53.582890Z","submitted_at":"2024-09-10T01:20:26Z","title":"VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13730","snapshot_observed_at":"2026-08-07T12:36:21.116573Z","title":"Visscience: An extensive benchmark for evaluating k12 educational multi-modal scientific reasoning.arXiv preprint arXiv:2409.13730, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.116573Z"},"links":{"cited_paper":"/paper/2409.13730","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:f300b657c328617f0831bcfedebdd2c251078710002cddc9c3b8d735529be6d1","observation_id":"2b7f97da-6412-476c-a8ab-1630c8cc4cc2","resolution":{"observed_at":"2026-08-07T12:36:21.116573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-02T03:10:19.073297Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-07T12:36:21.188252Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.arXiv preprint arXiv:2209.09513, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.188252Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:8187ba77d6aadc523b804594f3dbe599861359f9f459f4c2ee7f8d98ad1377d3","observation_id":"c463ac39-5abf-407c-a49b-30cfbfc8bd6f","resolution":{"observed_at":"2026-08-07T12:36:21.188252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T12:36:21.244871Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.244871Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:2703bf53a7d1f1f56e1f599a791b5b13ef49e893aeb905816eae457216d8df83","observation_id":"a5964cce-ce42-4bca-9940-f8b194a075a7","resolution":{"observed_at":"2026-08-07T12:36:21.244871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12054","last_updated":"2025-05-26T13:42:06Z","snapshot_observed_at":"2026-08-07T18:43:21.185505Z","submitted_at":"2025-02-17T17:24:14Z","title":"PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12054","snapshot_observed_at":"2026-08-07T12:36:21.317514Z","title":"Physreason: A comprehensive benchmark towards physics-based reasoning.arXiv preprint arXiv:2502.12054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.317514Z"},"links":{"cited_paper":"/paper/2502.12054","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:8b024871ef4c4fc09bf833030d48b21b1e2b761909e8da4fc782866322ea9dc6","observation_id":"5c35bf45-4fb4-40b1-8e39-8b6d0e7510ea","resolution":{"observed_at":"2026-08-07T12:36:21.317514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16170","last_updated":"2023-12-26T18:59:11Z","snapshot_observed_at":"2026-07-06T17:08:12.928414Z","submitted_at":"2023-12-26T18:59:11Z","title":"EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16170","snapshot_observed_at":"2026-08-07T12:36:21.373436Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai.arXiv preprint arXiv:2312.16170, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.373436Z"},"links":{"cited_paper":"/paper/2312.16170","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:819120a97edf3b6859f16510355e8005a7dbfa617789ba633ee7572062aa787e","observation_id":"ad5b2f0c-bb69-4e52-85e7-1ab692f38bba","resolution":{"observed_at":"2026-08-07T12:36:21.373436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T12:36:21.417316Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.417316Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:dc3083f8c28a8eb743f4dd88197b4c7e8e31cf3f18f3bf9376fda3f553f47685","observation_id":"63384adf-d6bd-4088-81a7-c43adc1af628","resolution":{"observed_at":"2026-08-07T12:36:21.417316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06048","last_updated":"2024-11-09T03:07:33Z","snapshot_observed_at":"2026-07-06T19:47:47.232714Z","submitted_at":"2024-11-09T03:07:33Z","title":"An Empirical Analysis on Spatial Reasoning Capabilities of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06048","snapshot_observed_at":"2026-08-07T12:36:21.486935Z","title":"An empirical analysis on spatial reasoning capabilities of large multimodal models.arXiv preprint arXiv:2411.06048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.486935Z"},"links":{"cited_paper":"/paper/2411.06048","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:1f2ca03f9bc0b720316d6ad974f990f3d9d157138f6f61375b9b9eb92f2ac2d2","observation_id":"a4532fb0-a63d-47eb-bfe9-83c99d75f682","resolution":{"observed_at":"2026-08-07T12:36:21.486935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17862","last_updated":"2024-01-31T14:21:49Z","snapshot_observed_at":"2026-08-03T16:59:53.976215Z","submitted_at":"2024-01-31T14:21:49Z","title":"Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17862","snapshot_observed_at":"2026-08-07T12:36:21.555751Z","title":"Proximity qa: Unleashing the power of multi-modal large language models for spatial proximity analysis.arXiv preprint arXiv:2401.17862, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.555751Z"},"links":{"cited_paper":"/paper/2401.17862","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:5e83c5dbefbf6299ed86b74c7644f971747ebca36e84de2d5d0c2a941b07f001","observation_id":"7c262a1a-3ac7-447e-961c-842df6a37134","resolution":{"observed_at":"2026-08-07T12:36:21.555751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16411","last_updated":"2025-01-29T03:52:39Z","snapshot_observed_at":"2026-08-02T23:35:21.038166Z","submitted_at":"2025-01-27T18:59:58Z","title":"PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16411","snapshot_observed_at":"2026-08-07T12:36:21.624537Z","title":"Physbench: Benchmarking and enhancing vision-language models for physical world understanding.arXiv preprint arXiv:2501.16411, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.624537Z"},"links":{"cited_paper":"/paper/2501.16411","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:18eea464693d5f9e17a8231901d9ab2175b60d5ad317200263f379db1adb4315","observation_id":"3d74019f-fe34-4f14-a255-a411d2c9ff04","resolution":{"observed_at":"2026-08-07T12:36:21.624537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:36:21.680691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.680691Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a0e297036960b586a800fe27d64568d27a9284bc5c0d2b63d7606582e6807ff4","observation_id":"90c1b8a9-7127-4475-8b08-8073d63496b9","resolution":{"observed_at":"2026-08-07T12:36:21.680691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T12:36:21.723524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.723524Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:751ef72af255935620a1664e1aca4f7376f1d4ae8652781aeceef4f7de735607","observation_id":"46b9bca8-e09f-48f8-8f36-3c31042c8101","resolution":{"observed_at":"2026-08-07T12:36:21.723524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T12:36:21.790062Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.790062Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4e992d310361f807332807924cc00b7e0f49132c8aca8ba8a24f5152d3fdb55a","observation_id":"ea89ced4-9a2c-4a8a-b32b-ea61316a9c9a","resolution":{"observed_at":"2026-08-07T12:36:21.790062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03048","last_updated":"2023-10-04T01:15:21Z","snapshot_observed_at":"2026-08-06T10:14:06.161139Z","submitted_at":"2023-05-04T17:59:36Z","title":"Personalize Segment Anything Model with One Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03048","snapshot_observed_at":"2026-08-07T12:36:21.875766Z","title":"Personalize segment anything model with one shot.arXiv preprint arXiv:2305.03048, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.875766Z"},"links":{"cited_paper":"/paper/2305.03048","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a0473ccfcfe7f6032167dc534f23519936bf13c43fcb24cdeecaae567402cf70","observation_id":"9c6c0ba1-be81-4917-b8b0-dfa1ce47731e","resolution":{"observed_at":"2026-08-07T12:36:21.875766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:21.950051Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:21.950051Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:c9a3921a315ac0ad6c8931a99cda5afaa5a09ced9fbac135f50784cda3584bb2","observation_id":"60c21250-ccb4-4717-a05e-19930cb6a5c7","resolution":{"observed_at":"2026-08-07T12:36:21.950051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.016171Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.016171Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:26a78ffbaaac1beedbf646368d17d9597c56c10bc00078a72661618891be4748","observation_id":"260abcfe-bd4f-44d9-826f-6b836f423142","resolution":{"observed_at":"2026-08-07T12:36:22.016171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.092255Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.092255Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:e8448f9f8010fb7dc1e651ac39d8f6bfa1d3da3bc7298e424cb2dd1ea3ae260f","observation_id":"6d2a1a43-faca-45d4-8932-d7947869b798","resolution":{"observed_at":"2026-08-07T12:36:22.092255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.160080Z","title":"Pandagpt: One model to instruction- follow them all, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.160080Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:7fb888d8c0bc2724dee3907b1acb84ccf5aa1b49cdb829ababd3006a83fb5e6e","observation_id":"66df359e-d2d6-48f5-b4a9-24bd298106d0","resolution":{"observed_at":"2026-08-07T12:36:22.160080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-07T12:36:22.224140Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.224140Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:7a98decfe3d30441c8340e43dc5224de5910eba13ddea038b9eed51eb14790ba","observation_id":"1660023d-958b-4890-88a7-2a40bb1ad2aa","resolution":{"observed_at":"2026-08-07T12:36:22.224140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T12:36:22.280641Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction.arXiv preprint arXiv:2501.01957, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.280641Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d5664d7cbd67afb0fb9e76449903f8d78210449d78d0628a24268e6b10417bdd","observation_id":"69a0ebaa-6384-4a20-844d-d20a6dce74e1","resolution":{"observed_at":"2026-08-07T12:36:22.280641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.347165Z","title":"Vita-audio: Fast interleaved cross-modal token generation for efficient large speech-language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.347165Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4b8664c797609a745011e00d66b865a7c7ee1fbf039c06d481ea6736c51c87d8","observation_id":"6a9541b2-ccdc-4f3a-a939-c42387392cec","resolution":{"observed_at":"2026-08-07T12:36:22.347165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.411001Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.411001Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:39325bcad04f1c4b38b6706087704adcd202a65faef475ceb169d2f95573470e","observation_id":"c913f7a9-5fba-4d67-9171-8d4f16a12530","resolution":{"observed_at":"2026-08-07T12:36:22.411001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.455709Z","title":"Spacevllm: Endowing multimodal large language model with spatio-temporal video grounding capability, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.455709Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:e6cf3026324af7a17616920082171d7f1732c1ac84529f66524a5862dadc996f","observation_id":"f0a2e4ae-da02-4a79-a055-26a160efb31b","resolution":{"observed_at":"2026-08-07T12:36:22.455709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.458775Z","title":"LLaMA-adapter: Efficient fine-tuning of large language models with zero-initialized attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.458775Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:1ff9fe0643a87770b299979170bd12f65e9000f365fd6121685ec0f6a9d3ef3c","observation_id":"c38a4c4e-a0af-437b-87f9-6d37036f53d4","resolution":{"observed_at":"2026-08-07T12:36:22.458775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.500101Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.500101Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:14718268d782e9d8a35988d75989bfcc871371d1797f91541548dd964adbde4b","observation_id":"5039bd49-cdd8-4f8f-acd0-96f3f80d5ec1","resolution":{"observed_at":"2026-08-07T12:36:22.500101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.652265Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.652265Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:f4eb8cfc7019640b62a21bcd5f1943eada39b5d8b117a5fe1415287beaf57f45","observation_id":"a0910820-c1db-4199-8789-e26c10fe9133","resolution":{"observed_at":"2026-08-07T12:36:22.652265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.725970Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.725970Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:6d5e2131286079cc22c521f329f3e8ab68d0d8ec8fded212c8cdae658fd641be","observation_id":"ec98eba8-2dbb-41a3-9766-8566ca7da7d6","resolution":{"observed_at":"2026-08-07T12:36:22.725970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T12:36:22.768465Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.768465Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:b8493baa7c1f457cc4654f1005b7c8cdb622082a9cd2e76e57c0c08b8b5a87bd","observation_id":"f454c4e6-b036-4bd8-841f-70ce1d281766","resolution":{"observed_at":"2026-08-07T12:36:22.768465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T12:36:22.815837Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning.arXiv preprint arXiv:2310.09478, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.815837Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:5bf96def9d6253d1dd45ebc0a8a41bc73f59eee1286d8e31ca3c58f69085ea20","observation_id":"799b57d4-03be-4d41-97ff-ac0b46c843a6","resolution":{"observed_at":"2026-08-07T12:36:22.815837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:22.899311Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:22.899311Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4285868f77907f0ee8dd1ea87016b40736d15d36150a9559dac50bc03d2879a0","observation_id":"df89751e-4604-4235-91ea-81e75435bd92","resolution":{"observed_at":"2026-08-07T12:36:22.899311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.010251Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.010251Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:b8a47e8df05289af95b05b4a1ee661b0a9c86c727975925f14fa089a05fe1c9f","observation_id":"063ee0c4-8367-4705-b771-9415224150c9","resolution":{"observed_at":"2026-08-07T12:36:23.010251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:36:23.072424Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.072424Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:c05dbce230d90fcabb9ac6e2d3fd716f794b427513bd27d0e991c704e032460a","observation_id":"0829e115-4579-4cab-b61f-6d19f0feaf4d","resolution":{"observed_at":"2026-08-07T12:36:23.072424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.154071Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.154071Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:52b77499bfdfd1ece883cefc3a5c7b349f4b046717180faef40f3e021954df00","observation_id":"7a499321-9580-4479-a01d-f51d21fdf84b","resolution":{"observed_at":"2026-08-07T12:36:23.154071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.217279Z","title":"Kimi-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.217279Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ceb70cb3a0a3597947ce6253a15003b68c48904c9d98e31aa60ac924c9d1d952","observation_id":"fc6cd84c-e397-4d50-8e6a-f4c4ad5091a6","resolution":{"observed_at":"2026-08-07T12:36:23.217279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.280415Z","title":"Seed1.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.280415Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:bdde5c1e54096e3058a8e87696f16138d0ebb85ca03cfd591f863247e1fea60d","observation_id":"c45492da-7ca0-454f-b188-c47c75f7fe41","resolution":{"observed_at":"2026-08-07T12:36:23.280415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.402170Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learning for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.402170Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:dde8881767fe8f5100cc1838fd36116fdf700dd1ec44b1ea26cbcc345c24f495","observation_id":"7cc228e6-1605-4f62-abf4-ecd5acaa5b31","resolution":{"observed_at":"2026-08-07T12:36:23.402170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01800","last_updated":"2024-12-02T18:47:25Z","snapshot_observed_at":"2026-08-02T07:22:42.764229Z","submitted_at":"2024-12-02T18:47:25Z","title":"PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01800","snapshot_observed_at":"2026-08-07T12:36:23.575813Z","title":"Physgame: Uncovering physical commonsense violations in gameplay videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.575813Z"},"links":{"cited_paper":"/paper/2412.01800","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a88f05d0a2d824b2701e79ea0ac3588aa6cde1a1c3c699cc71044210836630e2","observation_id":"89ccdf80-22eb-491d-8121-9d1f4642d94a","resolution":{"observed_at":"2026-08-07T12:36:23.575813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:23.749834Z","title":"Embspatial-bench: Benchmarking spatial understanding for embodied tasks with large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.749834Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:13f739232099b67b5e7cf193d69b80c2c72694f9ed38781b5992dbe9a69012e7","observation_id":"b0d84298-b701-490d-9004-cafeff56dfbc","resolution":{"observed_at":"2026-08-07T12:36:23.749834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:34.689527Z","title":"LLaV A-onevision: Easy visual task transfer.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"8d4d9eea-8f79-466b-819e-ecfb62ea92a1","year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.835605Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:265c45756a9f8bb3b04f6fc6d2b1fef9e896b2249fb36625ffdd38f5ef6bf52a","observation_id":"e0e312f6-0e91-4162-ad4c-8b73e58f1836","resolution":{"observed_at":"2026-08-07T12:36:34.765235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T12:36:23.942050Z","title":"Llava-cot: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:23.942050Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:dbd046b11c803a8874228c14f2e7ef5dfd7984ee6725f29537f16794ca5b43d1","observation_id":"e654eca7-a0bb-4e73-b503-0d0c8e84f0dd","resolution":{"observed_at":"2026-08-07T12:36:23.942050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:36:24.031956Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.031956Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:10dc3a9fa5e41a873227be21547a267290f561372d515169da28e86ed54b5462","observation_id":"24f747fc-509d-416c-80e3-8e1d9704fa43","resolution":{"observed_at":"2026-08-07T12:36:24.031956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T12:36:24.114630Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.114630Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d10c571b1c6687e3396b765f078514b09340f5741f11fa9d298ff4d120c1bd47","observation_id":"b3d77043-991d-4814-96cc-777a89c0029a","resolution":{"observed_at":"2026-08-07T12:36:24.114630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:34.470463Z","title":"QVQ: To See the World with Wisdom, December 2024","venue":null,"work_id":"5b480c20-82dc-41a1-957b-a3c5d542cc57","year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.200139Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:273979aa7702ff8600dffa48df25055333a07d84042607dffb607ec6ddc22c85","observation_id":"5287267f-c1fb-4c71-bd5f-a630bed012fa","resolution":{"observed_at":"2026-08-07T12:36:34.558651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:34.251609Z","title":"Claude 3.7 sonnet.https://claude.ai/new, 2025","venue":null,"work_id":"f51f1493-9121-4c45-845e-26a3e21538bb","year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.300733Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:5b2ea1f1cf6997267ae91865af0b972dd4d67d1c7c3655bca201f0964dcfd6de","observation_id":"51437547-c18b-432c-bb4a-c2b70deba3b6","resolution":{"observed_at":"2026-08-07T12:36:34.368817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:34.089534Z","title":"Grok 3.https://grok.com, 2025","venue":null,"work_id":"13748c83-753b-4fe8-b334-0829b4e584d4","year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.375824Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:a0edcf04b8c319cfb8e418e1150ffd1bfb028b93e02b78df6dbcb1f5cd572cc6","observation_id":"4d2394ab-553a-4aac-93ea-025791a148fd","resolution":{"observed_at":"2026-08-07T12:36:34.160168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:36:24.505754Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.505754Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:397869ba325c2519f88a9989469dfbfd195790430cb94262a2c006b64bbce0d7","observation_id":"ea1e89af-7f03-487e-85f2-927165fd8616","resolution":{"observed_at":"2026-08-07T12:36:24.505754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T12:36:24.617986Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.617986Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d88703f9041d0158ab4ef0f493229121c0ab236e8f4e5b3d8efa449b0fb18701","observation_id":"50f62abb-79ea-4f38-a606-848e71f52a4a","resolution":{"observed_at":"2026-08-07T12:36:24.617986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T12:36:24.686510Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.686510Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:4473e7013c0dbb06ffbc14d2291768bf45e91b1f844c447deb7d008b1cabbb73","observation_id":"dab57297-c8b5-4a3c-8834-853a5d28a0ae","resolution":{"observed_at":"2026-08-07T12:36:24.686510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:33.905735Z","title":"Lighthouse Laboratory","venue":null,"work_id":"abb412b3-2ba8-4f4e-8343-4bde87805b09","year":2022},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.794031Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:70678fc1819a346da327ffcedd2f4242d025900b9c4ef3cc994ae59b6066e8a1","observation_id":"61e06049-98a8-406e-8436-d662c5ea8d02","resolution":{"observed_at":"2026-08-07T12:36:33.993893Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:33.748424Z","title":"How to accelerate the separation of B peels?","venue":null,"work_id":"2d3c7604-011c-4bf4-9995-d9345b8f7b08","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.862619Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:36027a5476cde09b1aae0629f46190817cfad95380aa38a04b66d4f747d8b634","observation_id":"6eeef0b3-d4b8-4833-a11e-7b52f54d542e","resolution":{"observed_at":"2026-08-07T12:36:33.827548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:33.265260Z","title":"Match\": Aligns with ground truth -","venue":null,"work_id":"e498b658-fcad-403a-921a-f006f4305f72","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.116132Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:af0472ddfd34be6af6d75c3d96415549622af6bacabd65411b487769fd66e534","observation_id":"27d068b8-2425-4329-a5b6-587f40f4b301","resolution":{"observed_at":"2026-08-07T12:36:33.349581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:33.061512Z","title":null,"venue":null,"work_id":"e291e586-b801-4a74-8334-cff0530d1e91","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.210835Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:42a8aec79924e1d4af1041dd21a35985e3e126dd088e7670750bbc155bcfd759","observation_id":"d1cff303-65e1-4032-8fb2-3e94366bda11","resolution":{"observed_at":"2026-08-07T12:36:33.161374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.875647Z","title":null,"venue":null,"work_id":"a2f0b949-1a1b-4a07-b662-6a8fc09d1c21","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.270152Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:7c103f76852dd08b7e8918b6c833be358ac2d8526d456ceb28491372b9df800c","observation_id":"46994528-e7f1-4df4-9cc5-0f478736c365","resolution":{"observed_at":"2026-08-07T12:36:32.975801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.732674Z","title":"step_type","venue":null,"work_id":"ff26224a-de38-4077-a246-6b3b138108cd","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.327962Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d4a2419f8f9b881067576b70f1ccd44649a6168edd3e534a320abc728d969fb1","observation_id":"4bd75fcd-905f-471e-9ccb-710fa60f1e58","resolution":{"observed_at":"2026-08-07T12:36:32.788316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.565290Z","title":null,"venue":null,"work_id":"43a0cda0-c2aa-40bd-ae43-50333a6fa47f","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.377531Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:cb224f5c96c46ff38f65fce64c234b2e421f89b880a2018f895bde951ef49a55","observation_id":"c66b620a-fc0a-4b2c-b5e3-ac3a7dec9427","resolution":{"observed_at":"2026-08-07T12:36:32.636472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.354466Z","title":null,"venue":null,"work_id":"5eb10890-7848-443d-8bdb-b45a597a1790","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.437494Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d7ae74abcb71a4e588b64a36766da60c64f00e173a67552a619e76e0907d6cd1","observation_id":"922b58cc-43e4-4bd1-8e6d-61ed70f34379","resolution":{"observed_at":"2026-08-07T12:36:32.446079Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:32.160364Z","title":"step_index","venue":null,"work_id":"6bdeffa2-2273-4685-9f81-acab28867038","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.529787Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:cf4ab8355935c7117c0398a882def630db69ab699d33a8ee6283b8aa8964bb45","observation_id":"bd4f9cf0-0f23-4be6-8ff7-5ebbe941f9fe","resolution":{"observed_at":"2026-08-07T12:36:32.256146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:31.930199Z","title":null,"venue":null,"work_id":"5267bdb0-46a6-45a1-bc0c-e74504d5e04e","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.673411Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:eef98d442acf44d423edbf0b3b86bc13ad53a9f65f5bd49bfdc5df88c624ad1f","observation_id":"f6e2c853-6c79-4e77-b795-20ce8555daf2","resolution":{"observed_at":"2026-08-07T12:36:32.013586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:31.736265Z","title":null,"venue":null,"work_id":"74b6715a-4e4c-4ffd-9ad1-ddc86ec0e91f","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.792224Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:2bbae10338388c0043fefc90e773af6be77f981ccee039b096d9cf188da2a620","observation_id":"bdad26ad-30d8-437d-8bc8-bb1be0eca3bd","resolution":{"observed_at":"2026-08-07T12:36:31.807240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:31.515743Z","title":null,"venue":null,"work_id":"71a3d72c-618b-43da-b436-30aba7baee6c","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:25.911829Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:ac293e42d0a2c84f2a814496157e069abe0952fafa1a0ce09f2dc0a74aac93aa","observation_id":"2d06af11-b0a8-43e7-abe8-135072fcb745","resolution":{"observed_at":"2026-08-07T12:36:31.634903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:31.292251Z","title":null,"venue":null,"work_id":"85911318-7e70-4f7b-864a-3a1807129bbf","year":null},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:26.033113Z"},"links":{"citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:0ba38d5eb00fd3954236e61949f86dd9f87feb7b9fe01ab789726f7e61d6b0ab","observation_id":"157d4246-ebd0-4774-a782-365a36baeb31","resolution":{"observed_at":"2026-08-07T12:36:31.403584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:28:20.030911Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":89,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 2 inbound Pith citation observations for arXiv:2505.24182."}