{"as_of":"2026-08-06T17:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b883f0855e1924e2be792e88694a69c8f5bab0a82380e47c02bff8f5889f558b","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T20:23:18.667677Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07962/citation-record","integrity":"/paper/2606.07962/integrity","json":"/paper/2606.07962/citation-record.json","paper":"/paper/2606.07962"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"pi_0.5: a vision-language-action model with open-world generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:b30e82073e5ad3b65e67d8483e07a409b81e358a6ebf7016c894220c095eebf7","observation_id":"bf0541a9-2202-44c7-b345-c270330acc71","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:a819b2aca60c3d6461000dcbf4dce0756c7d36f0d711d084deb9dc47d4deacf9","observation_id":"910f267a-b047-4ef7-bec9-d3769cbb93ba","resolution":{"observed_at":"2026-07-02T20:27:22.640801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":"2603.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-10T18:47:31.580281Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","venue":"cs.CV","work_id":"772d0226-9ad6-42c0-9c79-d36d37edbbe4","year":2026},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:3ae8d4569495f7242264b3820f7621ddf35a25876efe5ba33ded6972cea97072","observation_id":"2c9e4979-3a23-41b0-a78b-2608e2ed50db","resolution":{"observed_at":"2026-07-02T20:27:22.596414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Re-align: Aligning vision language models via retrieval-augmented direct preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:401f7037ef98ca6e41f4f32dbe13146650d7b6ddc14f016162b593ea550f0337","observation_id":"bcfff88e-07d6-46e0-a3b7-4e8cef209b65","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:2834fa7ee2989b713a88628c0be05c8e32f54af50281e44db0db7117ba69e06a","observation_id":"af4b3146-4303-475e-9324-f5f53971d929","resolution":{"observed_at":"2026-07-02T20:27:22.632913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:e98edd7adf1b53a746a2ae8f2736d39ab950b9b2d4f63059eff539fe9b6e4020","observation_id":"ccbfccdb-0628-4274-974c-5bc0f3215510","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Weakly-supervised 3d spatial reasoning for text-based visual question answering.IEEE Transactions on Image Processing, 32:3367–3382, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:cd2f2d75dbcd295a1720dce97b20cf566f0ea98a367d2850c25874d6d7ee1409","observation_id":"03ae5149-4b9f-4832-8314-29adaa73d87e","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"V-fat: Benchmarking visual fidelity against text-bias, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:48fe9efd07845d404d95f91624dcbe1d7312be4a0dd98795735bc0d48aa66e31","observation_id":"7f7d9f75-087b-4e17-9d97-477d99b2ca05","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Mitigating hallucination in visual-language models via re-balancing contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:17c5df1539f6fa585639995a8993c3732cabfa3c50d301b4def5ef21a00d1012","observation_id":"0862f782-6095-41ad-8478-f4dd03a7d89a","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11892","last_updated":"2026-04-11T05:18:32Z","snapshot_observed_at":"2026-07-06T20:53:04.582301Z","submitted_at":"2025-03-14T21:47:48Z","title":"DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning","version":3},"cited_work":{"arxiv_id":"2503.11892","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.11892","snapshot_observed_at":"2026-07-02T20:27:22.635470Z","title":"DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning","venue":"cs.CV","work_id":"3d0b2d39-4c98-43a6-a8da-33d014925d45","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2503.11892","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:8208cf2acf06cbc2551e31b0ee6e67f804883049374a5fc364342d1d8223a307","observation_id":"170f310b-dafd-4d5d-841c-4c505427b94b","resolution":{"observed_at":"2026-07-02T20:27:22.636691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Robust multimodal large language models against modality conflict","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:541c01ca46bb11a0dde7870c407c25de34146f6c9b38c70ae70577af33834816","observation_id":"ebb366bc-11ca-4c02-9194-c0a6c28de517","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Mitigating modality prior-induced hallucinations in multimodal large language models via deciphering attention causality","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:75eb8bef4b80570f2e5743a4dce10a35d8575024d64c12492f31c257e0c03cbc","observation_id":"0b412b7a-76e0-49e3-a476-e5b9e2255f71","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Quantum physics intelligent question answering (q&a) system based on retrieval-augmented generation.Concurrency and Computation: Practice and Experience, 38(1):e70379, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:9fb878b9e02e033e79a8acb0a5d6e5c3bd745720dc5ba6daaf0b953b18b5a260","observation_id":"e4c6dcbe-4472-44a1-bf04-71ca73eb9610","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03659","last_updated":"2024-10-11T15:07:31Z","snapshot_observed_at":"2026-08-05T12:32:26.990966Z","submitted_at":"2024-10-04T17:59:28Z","title":"Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.03659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03659","snapshot_observed_at":"2026-07-03T20:18:56.589135Z","title":"arXiv preprint arXiv:2410.03659 (2024) A Judge Reliability and Probe Detection Hall","venue":null,"work_id":"8ee6f3ff-2d6e-479e-8027-1e5502ce0d38","year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2410.03659","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:6d1c98079ce48dcc3091fce859288c9dc0f65860bf1bab3504aa1ffc00b387b1","observation_id":"bbd94af2-b3eb-4169-8e70-07eacc036cfe","resolution":{"observed_at":"2026-07-02T20:27:22.638397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.01346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:27:22.585602Z","title":"Large vision-language model alignment and misalignment: A survey through the lens of explainability","venue":null,"work_id":"eb9e4e70-8839-4a58-b512-97f072f5d676","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:f09d5b658057513a4cf2f6367c69ece76317e509dc460fb22d53221373dc0c40","observation_id":"81065ccc-859e-4c68-bc0f-c883bfe7f79d","resolution":{"observed_at":"2026-07-02T20:27:22.587656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-02T03:03:02.061698Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:198e8c0ea682904d201c7e2d664315ad4d3266e6f1e23319860820eba0b1daf3","observation_id":"b397e0b1-1b2e-4a2a-bbc7-90c5013a1e00","resolution":{"observed_at":"2026-07-02T20:27:22.590378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:b97fd456321641c935cf04b03062d8b4b7516a14e5b43efe5a40befc2ff1bfa6","observation_id":"bd0110c8-f3d1-4d28-82ae-c5374eeae13d","resolution":{"observed_at":"2026-07-02T20:27:22.652231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:65ad4baafd5eec1fd89f42a5c21cb5f5db7a32e9e598bdbb61a67acfb5e55ee7","observation_id":"4a4ad08b-812e-4496-a1e4-4a1e60a9d0ca","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:f04de70e835c03c7af0361b584246000d79c3875e4df1c699a54f201e8770f45","observation_id":"56e30cd9-bb06-48ab-a870-2bc5984bc98a","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:654582b2746da3e0a8c443b40c9ec45ce97140f55cea6753c62fce230d5d59ee","observation_id":"c791b204-4b76-4e26-be4b-612271297f20","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding.Advances in Neural Information Processing Systems, 37:89098–89124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:dfc766960d546f732d072e8bc68ada7a7f5733d224e9c9ae21d235437b549867","observation_id":"a07a93fa-9fbd-43d8-81b9-5768c7d6d442","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:6bc5a5c8511759929be20a699ce15b3e4be305f9a9e62a044307a5e93f9980d9","observation_id":"40e7df6d-df4c-4bd7-b012-c1704e6591d5","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:806e37fd350f1aa0c07f1aaf651585281080b9d1b2e5d65868cc2ea99e516293","observation_id":"fa802e29-c999-41bc-a413-89a1db1cb71f","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.Advances in Neural Information Processing Systems, 37:28828–28857, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:3e7eb9d2b740eba8e225d92cf54640b99c22e8c45b10b3cc5f55c9f5bfe30e1c","observation_id":"ef33675a-6350-4390-ad5c-53bfea09d88e","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:d37bd524ee9bb8643474ee8561cb884abdac801c83cc48c1ce38fb5e43e6d2c9","observation_id":"93a41931-5898-48ea-bf7f-a2ce6852876b","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:f1c2f77fbb0205d9f1312b1c23eedd40faececdd214d581698b03e7469bf7847","observation_id":"4fd69f7f-2839-4ff7-9249-b74e8c26b73d","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Behavior in habitat 2.0: Simulator-independent logical task description for benchmarking embodied ai agents, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:f8c07196a52a23d57cdde53f4feb66de0a84a4db072ed43fa24f635b82cd270a","observation_id":"684f383e-b0a0-49ef-8502-2c42132a79c8","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:c6c6d2abae5ffeb474a6d76c82e7c9c927555daad6e1ec8b85c9f4d2751198ae","observation_id":"24df9feb-bf49-44df-9b0a-fa33147d580e","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00893","last_updated":"2025-08-02T10:06:31Z","snapshot_observed_at":"2026-08-03T07:00:21.246856Z","submitted_at":"2025-06-01T08:26:34Z","title":"Affordance Benchmark for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.00893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00893","snapshot_observed_at":"2026-07-02T20:27:22.653340Z","title":"Affordance benchmark for mllms.arXiv preprint arXiv:2506.00893, 2025","venue":null,"work_id":"c40afa09-3fbf-47b7-ac11-5089db8548e5","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2506.00893","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:f581d9ea79e6de3a6153e5832e791894d8c9f63da5aed0d23a242321f61eafea","observation_id":"32794ebc-2422-43b8-8482-139a441032b6","resolution":{"observed_at":"2026-07-02T20:27:22.654711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:27:22.600457Z","title":"Phystoolbench: Benchmarking physical tool understanding for mllms","venue":null,"work_id":"1eba44ed-158c-4ed9-9585-0572f7d8be04","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:0ff8160c9082689fbda62c9cba49d56eba626b721c8ae23c0d1fe0665271724b","observation_id":"7e053c8f-27e8-4918-a40a-43d004865a00","resolution":{"observed_at":"2026-07-02T20:27:22.602087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16408","last_updated":"2025-03-20T17:58:38Z","snapshot_observed_at":"2026-07-30T21:18:54.445306Z","submitted_at":"2025-03-20T17:58:38Z","title":"RoboFactory: Exploring Embodied Agent Collaboration with Compositional Constraints","version":1},"cited_work":{"arxiv_id":"2503.16408","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16408","snapshot_observed_at":"2026-07-03T10:58:02.795943Z","title":"Robofactory: Exploring embodied agent collab- oration with compositional constraints","venue":null,"work_id":"a3e39d0a-2209-4214-bc16-103941f68b68","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2503.16408","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:1beed97177233a9cad505d01ebe7ee1b12778ed8195e7e5fe1e65642dc9866b4","observation_id":"c8c42eb3-de11-4ba8-ae44-72d02d4eedc3","resolution":{"observed_at":"2026-07-02T20:27:22.609663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19526","doi":"10.48550/arxiv.2512.19526","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QuantiPhy: A quantitative benchmark evaluating physical reasoning abilities of vision-language models","venue":"arXiv (Cornell University)","work_id":"8b939c70-60da-4d56-a4df-9f8257547c3b","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:e03f48b78769648812d91a85bf2876f8bbb1d23480be3923e2101f22014a3be7","observation_id":"3ee49f16-c076-4817-9bae-c03b8296568f","resolution":{"observed_at":"2026-07-02T20:27:22.609970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Do generative video models understand physical principles? InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pages 948–958, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:8879d39cd95045399da8a8e149d5f4660e9b1a037add59580618d5882e61c547","observation_id":"012b3919-45ed-4e1e-b211-7b779cd4bde7","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:79135f1efb5d38e1b89d16676ca86da3e8104c639f66e56543e23a19dcfd362a","observation_id":"5541e0bd-d6fb-49d9-9bbf-de7e114fb2f1","resolution":{"observed_at":"2026-07-02T20:27:22.654943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Intphys 2019: A benchmark for visual intuitive physics understanding.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(9):5016–5025, 2021","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:a8a2abfada9a4b0e85d0273c61163c4f75b74f40005b19673bd83412c1dd444d","observation_id":"846e9bad-35a8-4e0c-a7be-4c49aa3d42c2","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":"1910.01442","doi":"10.48550/arxiv.1910.01442","metadata_source":"pith","pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","venue":"cs.CV","work_id":"595fdbf7-89d5-4593-8f57-24e8b469a43c","year":2019},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:bc9d9bbcd560dc861091a6485c9673c3df0bc43a3d5ff94fb0f15278a37c3df1","observation_id":"21aa4551-0cc1-4dc5-961f-c27edbaf7cab","resolution":{"observed_at":"2026-07-02T20:27:22.604481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08261","last_updated":"2022-06-20T14:27:21Z","snapshot_observed_at":"2026-08-01T17:46:40.019621Z","submitted_at":"2021-06-15T16:13:39Z","title":"Physion: Evaluating Physical Prediction from Vision in Humans and Machines","version":3},"cited_work":{"arxiv_id":"2106.08261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.08261","snapshot_observed_at":"2026-07-04T13:19:51.051888Z","title":"Blattmann, A., Dockhorn, T., Kulal, S., Mendelevitch, D., Kilian, M., Lorenz, D., Levi, Y ., English, Z., V oleti, V ., Letts, A., Jampani, V ., and Rombach, R","venue":null,"work_id":"8077bdbc-fa73-44a4-a120-92725975df49","year":2021},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2106.08261","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:7ee5c81fa1f1f7fbddbc78b6252533b3cb576c6ba9533a231da4051d3d779c7c","observation_id":"29da7131-22a1-4951-8475-d270991ad4c0","resolution":{"observed_at":"2026-07-02T20:27:22.625194Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:beff8a23bb2f996b57b63f1bc7a9f3a22fa0fde38a9a27641f508519529e43bd","observation_id":"b3615da6-f8a3-4fba-9760-37cfad50b70a","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01089","last_updated":"2022-05-02T17:59:13Z","snapshot_observed_at":"2026-08-02T08:10:51.211813Z","submitted_at":"2022-05-02T17:59:13Z","title":"ComPhy: Compositional Physical Reasoning of Objects and Events from Videos","version":1},"cited_work":{"arxiv_id":"2205.01089","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.01089","snapshot_observed_at":"2026-07-02T20:27:22.626361Z","title":"arXiv preprint arXiv:2205.01089 (2022) 16 M","venue":null,"work_id":"391f1d7b-643b-4e57-b7b2-d55e0b53f76c","year":2022},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2205.01089","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:6e1debbdba876c3e45a605fcc8948a146babcdbef91d6806e80d6a511871dc5a","observation_id":"0fa09806-9e8c-4453-b0c5-4bdba8143b62","resolution":{"observed_at":"2026-07-02T20:27:22.627870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06119","last_updated":"2024-07-28T05:43:43Z","snapshot_observed_at":"2026-08-06T07:55:22.565492Z","submitted_at":"2024-02-09T01:09:21Z","title":"ContPhy: Continuum Physical Concept Learning and Reasoning from Videos","version":2},"cited_work":{"arxiv_id":"2402.06119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.06119","snapshot_observed_at":"2026-07-02T20:27:22.634310Z","title":"Tenenbaum, and Chuang Gan","venue":null,"work_id":"599092a7-998e-49f6-a9f7-62c5966b971d","year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2402.06119","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:56c05aac10da7fc63b40df7a98b17d08110b9cc50e57b8c2b595f64b5721008a","observation_id":"178f3444-3905-4505-bef9-d75a1c981d15","resolution":{"observed_at":"2026-07-02T20:27:22.635819Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00334","last_updated":"2025-06-03T07:13:03Z","snapshot_observed_at":"2026-07-06T20:29:26.524162Z","submitted_at":"2025-02-01T06:42:02Z","title":"UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models","version":4},"cited_work":{"arxiv_id":"2502.00334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00334","snapshot_observed_at":"2026-07-02T20:27:22.655814Z","title":"Ugphysics: A comprehensive benchmark for undergraduate physics reasoning with large language models","venue":null,"work_id":"27267f7a-aa31-4ea6-a562-43e22f02cf50","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2502.00334","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:b9b2ff7c0c8b5e2939c071196fad73bd9fc6b60580f05f827094b70adaf5b3b9","observation_id":"847de4d2-6bbe-4c0c-800b-16f2fc34a3f8","resolution":{"observed_at":"2026-07-02T20:27:22.657341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-07-06T21:13:09.093282Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.16074","doi":"10.48550/arxiv.2504.16074","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models","venue":"ArXiv.org","work_id":"d2ae619c-0cbb-45af-8aa0-0a52a9b8dec1","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:98f53adce9b88117a4aed1757150ce39451f2173b900216f3bba55117f856d13","observation_id":"22bbed5b-1b7d-4d4c-87bf-c95da090f955","resolution":{"observed_at":"2026-07-02T20:27:22.619660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16411","last_updated":"2025-01-29T03:52:39Z","snapshot_observed_at":"2026-08-02T23:35:21.038166Z","submitted_at":"2025-01-27T18:59:58Z","title":"PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding","version":2},"cited_work":{"arxiv_id":"2501.16411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16411","snapshot_observed_at":"2026-07-09T18:06:25.898385Z","title":"PhysBench: Benchmarking and enhancing vision-language models for physical world understanding","venue":"cs.CV","work_id":"3a5e1663-11b8-43aa-8e78-33ab23326881","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2501.16411","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:e91e24bafba46e22b0adf9307cb7cd2edbcef886f404cbe59bd9a7ac93670dec","observation_id":"d8f0afaf-4af6-4b32-b691-5135409340bd","resolution":{"observed_at":"2026-07-02T20:27:22.649811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04744","last_updated":"2020-04-05T03:39:21Z","snapshot_observed_at":"2026-08-05T03:18:15.393648Z","submitted_at":"2019-10-10T17:52:19Z","title":"CATER: A diagnostic dataset for Compositional Actions and TEmporal Reasoning","version":2},"cited_work":{"arxiv_id":"1910.04744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.04744","snapshot_observed_at":"2026-07-04T12:49:53.191967Z","title":"Cater: A diagnostic dataset for compositional actions and temporal reasoning","venue":null,"work_id":"0df31525-83f4-4de5-bc21-7c1e20006efb","year":2020},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/1910.04744","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:b524c4ec33f09b57660d2130ca82c18a974b0c3099a89c6b65440c203b924e97","observation_id":"50f1a3af-5596-4128-ad9d-c0b632926066","resolution":{"observed_at":"2026-07-02T20:27:22.646770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Intphys 2: Benchmarking intuitive physics understanding in complex synthetic environments, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:715ac4e527e6b521159ee628a306905c88c2cccd0c7bc3739acd61ff41d94ec0","observation_id":"46bb0bf4-c1d4-4ca0-9f42-5f6873fc888d","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Compositional physical reasoning of objects and events from videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:eac3f00dbb57ba49c32b66d925223df50fd4bb5b62b1a5799d32bb853df0bb15","observation_id":"247f534e-37e3-49ec-add2-34809bed93d8","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Craft: A benchmark for causal reasoning about forces and interactions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:697b92101a55fcf99e1c0f7435eaee951e1ab7b8918588c96a6fea7f9d3d47fe","observation_id":"5d6d2c36-e0cc-480d-af49-4f313ed60854","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:ba2443da19ec9ef43c8a431abbfb958dfc10e5670c273844008f17a22e1450b5","observation_id":"3d1a870a-19fc-44cb-8043-7c4b6b8886b8","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-03T10:25:11.936842Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:027c3e5fc9936aa128a882205f0f33f66ae069ef0514781d14cc0c99b7ba9f99","observation_id":"a0677d9f-3162-40e3-93f3-a10432fe406a","resolution":{"observed_at":"2026-07-02T20:27:22.643440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Perception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Systems, 36:42748–42761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:4154a63e2ade4fe90fd75c26643ce42bdf238d31a02ae984f0117bcb58f229ed","observation_id":"63c365ef-b8cf-4732-b275-be649d161d0e","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Seeing sound, hearing sight: Uncovering modality bias and conflict of ai models in sound localization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:4db07e088919009da83fda1612dd1f05cff385a5fd99d31029f9837f1f31d6cb","observation_id":"3921d17e-1f03-4205-b931-c1c531c532e6","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Vmbench: A benchmark for perception-aligned video motion generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:645098a7c180758dd6177c4f967c48c36d16ea41e4cb5cd54b12e66018cf8a56","observation_id":"f2449d16-3e95-47f8-8557-8c265af7382f","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01989","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:26.226892Z","title":"Unipc: A unified predictor-corrector framework for fast sampling of diffusion models.Advances in Neural Information Processing Systems, 36:49842–49869","venue":null,"work_id":"13626a02-1712-4ec2-968b-44548bb50736","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:d7a7fba68a27f957950aedba5d7942e45329a288e1d157528044068642ecaea5","observation_id":"e9b47191-b58c-42da-af36-52e7a56a3d64","resolution":{"observed_at":"2026-07-02T20:27:22.630518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.17667","doi":"10.48550/arxiv.2506.17667","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Physunibench: An undergraduate-level physics reasoning benchmark for multimodal models","venue":"ArXiv.org","work_id":"13fd5295-e317-40b1-8acd-27ae7ead944e","year":2026},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:0411e53ff403b5eb8474cc85edd3926906cbf0ea27194a1b5b277bde65ea78de","observation_id":"9bff6b47-c3d9-478a-9ff8-1ef17734dc33","resolution":{"observed_at":"2026-07-02T20:27:22.607461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:3e24eed3d5eaa97d2257c5d7428484682363998ffc18874c6fcd2f5c9996b745","observation_id":"581918d4-a989-411e-b8e9-4d7e39d59181","resolution":{"observed_at":"2026-07-02T20:27:22.641767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:f6933ff7a75a0a613f73fe316b6fc327ab49c051665cfd29d0b8ca57ef05e0fa","observation_id":"f8f1d2a6-44ba-42b6-8af2-59fa58f21aa8","resolution":{"observed_at":"2026-07-02T20:27:22.644118Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:23:18.667677Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:88bbf0eda86982587f7147d6eb97ac5e0309084d4c34893db66c30f5d0f03373","observation_id":"f21d63bb-17f0-49f3-9cdb-6988fa0df3c2","resolution":{"observed_at":"2026-06-27T20:23:18.667677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":31,"verified_exact":22,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2606.07962."}