{"as_of":"2026-08-08T08:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23202a8d277f35b628f530b94b55af3a4d4348301f91c135598c864e0e950a34","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:11:14.766000Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16572/citation-record","integrity":"/paper/2507.16572/integrity","json":"/paper/2507.16572/citation-record.json","paper":"/paper/2507.16572"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:11:12.168546Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.168546Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:7e26cac5b65d0f7d62ae7bff420a495bc7d5338d5c151deaaac6a344707f82dd","observation_id":"6c4eb6a0-cc59-4a8c-8053-f812c3f5d742","resolution":{"observed_at":"2026-08-06T15:11:12.168546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:12.225522Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.225522Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:05f9500cb90456b85400a24c72a1b3f068be6e93216158a1b725956034d58e35","observation_id":"eee8b781-685f-4c45-9eaa-57c3e993e3ba","resolution":{"observed_at":"2026-08-06T15:11:12.225522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:12.307404Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.307404Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:994733253a19c10a09512f45fda5fb8bb1f12f87ac652c1051db1e55d1cee03d","observation_id":"5125d093-4fff-48cd-8765-35e7db76f562","resolution":{"observed_at":"2026-08-06T15:11:12.307404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T15:11:12.407564Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.407564Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:f4c6ed959a10a6a226acd0b56b603644035cc0ebba533db06bfb32900a5c214c","observation_id":"7eff2aa3-7d81-40f1-bb84-3a1d4e6e64a4","resolution":{"observed_at":"2026-08-06T15:11:12.407564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:12.488884Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.488884Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:e815c04cc9618c46c9b4152ee5a2bd77b14294f5f27cea2f278eeb11878077b4","observation_id":"d8945958-0cc0-4c78-a9dd-684d30b50619","resolution":{"observed_at":"2026-08-06T15:11:12.488884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09849","last_updated":"2025-06-11T15:21:16Z","snapshot_observed_at":"2026-08-07T14:02:52.704779Z","submitted_at":"2025-06-11T15:21:16Z","title":"IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09849","snapshot_observed_at":"2026-08-06T15:11:12.519978Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.519978Z"},"links":{"cited_paper":"/paper/2506.09849","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:46376e14469cc902c1633c35e89747febef6d88646bcb2f0e425b84fc3c4ecab","observation_id":"387556de-6c77-4331-ae44-bac8cd03dfb6","resolution":{"observed_at":"2026-08-06T15:11:12.519978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:12.606431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.606431Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:b6ce5971e9c455319f444941d2c10db726218ca3705bb37552c53b90abb03ebe","observation_id":"6117e60a-2a34-49a7-b331-e209d9b7f235","resolution":{"observed_at":"2026-08-06T15:11:12.606431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T15:11:12.698230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.698230Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:e71222e53d7ce50b8881bbf7dbef1ca2edfbcc479d127a135c998ca0cd7d698d","observation_id":"2c3c7f0b-8a1b-4314-b006-38b8da8989f5","resolution":{"observed_at":"2026-08-06T15:11:12.698230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.969191Z","title":null,"venue":null,"work_id":"1af250f7-5964-44d0-9e3b-74f297973d6f","year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.771898Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:e1ecfbcaf7c621b491908bdd2f1cadd67e3ff1195c04ae4fc804496ecb8f4214","observation_id":"b5355c35-c65c-42c7-8578-35f1c534e48a","resolution":{"observed_at":"2026-08-06T15:11:15.973886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08826","last_updated":"2021-11-16T22:59:25Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-16T22:59:25Z","title":"A Benchmark for Modeling Violation-of-Expectation in Physical Reasoning Across Event Categories","version":1},"cited_work":{"arxiv_id":"2111.08826","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08826","snapshot_observed_at":"2026-08-06T15:11:15.123641Z","title":"A Benchmark for Modeling Violation-of-Expectation in Physical Reasoning Across Event Categories","venue":"cs.CV","work_id":"6bcd44b3-b724-4387-b9aa-54127a6fe9ae","year":2021},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.876139Z"},"links":{"cited_paper":"/paper/2111.08826","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:3904ae51892f81a468315fb459126be6324133aa129573d41726cfa3b50933cb","observation_id":"bedc9eb0-4a7c-44e5-a2b8-bd4491814976","resolution":{"observed_at":"2026-08-06T15:11:15.130252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05836","last_updated":"2021-11-16T22:24:45Z","snapshot_observed_at":"2026-07-06T11:56:53.376781Z","submitted_at":"2021-10-12T08:59:19Z","title":"AVoE: A Synthetic 3D Dataset on Understanding Violation of Expectation for Artificial Cognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05836","snapshot_observed_at":"2026-08-06T15:11:12.965960Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:12.965960Z"},"links":{"cited_paper":"/paper/2110.05836","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:bb9eb245a0b684a9b405ede03407efa2f95ba4c0e492ef8bbf6cba635c41e1bf","observation_id":"df6f8801-d1d8-4a69-b72d-d98be9929044","resolution":{"observed_at":"2026-08-06T15:11:12.965960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:13.008606Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.008606Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:f128990c1fd8bed763c936e982f073dc63b0a9db9940c047e75e2046f7013c59","observation_id":"5d3b3982-8459-4e62-99ee-af3cc39f2383","resolution":{"observed_at":"2026-08-06T15:11:13.008606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T15:11:13.080676Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.080676Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:fdab83fe0e150d4d3c0d84b73dd999474fec18828f0f17eeb0cec60a0e2691df","observation_id":"6556c17f-6a96-4a6a-97e8-c84941104b5b","resolution":{"observed_at":"2026-08-06T15:11:13.080676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11831","last_updated":"2025-02-17T14:27:14Z","snapshot_observed_at":"2026-08-07T18:12:21.463545Z","submitted_at":"2025-02-17T14:27:14Z","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11831","snapshot_observed_at":"2026-08-06T15:11:13.195335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.195335Z"},"links":{"cited_paper":"/paper/2502.11831","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:a18c774c297a7908125d8423a00a90c3f1799ebfbef50acd4aa8292af2105451","observation_id":"cae7475f-b3f7-4dbb-b554-b0be803e9fd3","resolution":{"observed_at":"2026-08-06T15:11:13.195335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T15:11:13.255782Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.255782Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:4fbd598c59a59957ff4fbdecc1394f471d08c8dcf64433f2940607f9d9e8884d","observation_id":"56d724ea-ea0f-4cb3-a221-7f85e6fec3f1","resolution":{"observed_at":"2026-08-06T15:11:13.255782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.874436Z","title":null,"venue":null,"work_id":"096a2812-6bc2-4b98-a891-b70c8fa80116","year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.371765Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:9287333796d3c06c6dc446e9d3351684c89d0be554919cca6650671ca400185a","observation_id":"ff96b2ae-d259-4667-ba64-f467b78f95b3","resolution":{"observed_at":"2026-08-06T15:11:15.949373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09048","last_updated":"2024-06-06T09:35:53Z","snapshot_observed_at":"2026-08-06T04:51:16.861858Z","submitted_at":"2023-11-15T15:38:28Z","title":"GRASP: A novel benchmark for evaluating language GRounding And Situated Physics understanding in multimodal language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09048","snapshot_observed_at":"2026-08-06T15:11:13.541388Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.541388Z"},"links":{"cited_paper":"/paper/2311.09048","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:f7ab24c0d62cb1a96db95733c1ffe56bd1ab8e6574d126d8d88b88a342866a02","observation_id":"e0a564ef-37bb-4197-b0a3-f27ad1b4f9ec","resolution":{"observed_at":"2026-08-06T15:11:13.541388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.648261Z","title":null,"venue":null,"work_id":"f93d16e2-fb3b-40a0-9ecf-237fceadcd2a","year":2017},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.657772Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:1fd889455f2bee46f04fba19e37252f3ac813b4a3095e4d2094eb1b0714e07d7","observation_id":"24da215f-88ec-4365-aa02-19409ed2aacf","resolution":{"observed_at":"2026-08-06T15:11:15.762191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T15:11:13.766494Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.766494Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:09be8612e6949287f1d045346761ec901be682f99b4015143de537adb94853d5","observation_id":"5b114338-6480-458b-9d1a-0e77fd4c6538","resolution":{"observed_at":"2026-08-06T15:11:13.766494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:13.890245Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:13.890245Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:6da10621c3388bbe926b2e8323c1c50119666d7b772c66f3ab68037f2dc24a9a","observation_id":"f34fa65d-ada7-4c2a-b0c6-fadb9762d3ac","resolution":{"observed_at":"2026-08-06T15:11:13.890245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14057","last_updated":"2023-05-23T13:36:55Z","snapshot_observed_at":"2026-08-05T14:56:20.504812Z","submitted_at":"2023-05-23T13:36:55Z","title":"Can Language Models Understand Physical Concepts?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14057","snapshot_observed_at":"2026-08-06T15:11:14.036103Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.036103Z"},"links":{"cited_paper":"/paper/2305.14057","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:fec888a25925c331f57da099e7cc7aee25625461b176706bd0c465c5b1372170","observation_id":"aac878d5-99d3-4f04-8489-8dda9dc91fbd","resolution":{"observed_at":"2026-08-06T15:11:14.036103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.173321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.173321Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:e6fc905d7db5b6eea2e993e92f0d9a905c1784a3e02105e97f817c0514883d41","observation_id":"08d661fb-8165-4d39-a219-3d60e3b1bed8","resolution":{"observed_at":"2026-08-06T15:11:14.173321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.356424Z","title":null,"venue":null,"work_id":"e097b2ec-d772-46ac-8c17-e0ca5d8ec0e1","year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.279711Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:f2d04868df9a10b8862b3029e3a0428e19136ab989b6139b7abc7d5be11e7c3c","observation_id":"6f21a6b0-703c-4c97-9e54-50383e7ab20b","resolution":{"observed_at":"2026-08-06T15:11:15.467863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.432587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.432587Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:431bf8ad78f4f4d67d9cece53ec7bb06fa6f4a945c735cd4aa7828cb6d6a4477","observation_id":"e17c428e-f5aa-42da-9d43-d02deb25a53a","resolution":{"observed_at":"2026-08-06T15:11:14.432587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.552976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.552976Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:4751c7ff2424d12e34a74d351c68269e2e869f6d3ea859faba1b44ef6dd225ae","observation_id":"98e189a2-5eb0-458a-9320-da2582ddc8a3","resolution":{"observed_at":"2026-08-06T15:11:14.552976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T15:11:14.696170Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.696170Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:3d3a0f2dfca926203f020ef995bfee9cc4fb903da085bc71585e04055fc217d7","observation_id":"5b33f8da-5510-4578-b4c7-ccb39706b3e5","resolution":{"observed_at":"2026-08-06T15:11:14.696170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.700889Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.700889Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:810554e6e4aa9c8ff31250b097c6dd9732aa859aa9415beb5f53d8f6b8b9b998","observation_id":"2929b9cd-ac8d-4be9-8a81-ea8c3bdb57a5","resolution":{"observed_at":"2026-08-06T15:11:14.700889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.320560Z","title":null,"venue":null,"work_id":"25db917e-615a-4ea8-9d72-4ed61cdf201a","year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.705407Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:071ed5db4489b7070e1afb8e2d1158c5a8e7336759248308d90d2324d963eb71","observation_id":"efb7f591-37b2-43e4-b927-0253584f9f46","resolution":{"observed_at":"2026-08-06T15:11:15.326860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.709448Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.709448Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:b0eaae1e173804c04b36d184a9f25b6cad7710110d3b07c76d6f2d8f497f8a95","observation_id":"58de5064-d534-495e-83a7-ef8579e7e366","resolution":{"observed_at":"2026-08-06T15:11:14.709448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.713561Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.713561Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:9b04c67b434a8aaf40a829b2be759107ab74a01ec3b051719fc8b44fc8a14e47","observation_id":"04da826a-c3d4-41ee-9601-45ae32d62018","resolution":{"observed_at":"2026-08-06T15:11:14.713561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.717818Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.717818Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:52b0cacd4d826d279f331a52d39942591a334ecaa53a41ac620883431025201c","observation_id":"63edee14-d71c-4460-8f39-3cb13866f2a9","resolution":{"observed_at":"2026-08-06T15:11:14.717818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.279579Z","title":null,"venue":null,"work_id":"c3976e1d-d8f4-48fc-8c8c-fcb4d63f2bce","year":2021},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.721837Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:984423dede668364468b8fe48820e42d01fd13996fa76544b52e9c0b22b844a9","observation_id":"b6be27a9-8810-4e2c-a5c1-b4e9c0031158","resolution":{"observed_at":"2026-08-06T15:11:15.283706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-06T15:11:14.725690Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.725690Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:df55a29b46409d0348b7c3ae2cb9730428d80f13fdd8fff4de76715d6ac3b18e","observation_id":"bae01cb4-bef2-4d1b-a36b-52a4ed951b4b","resolution":{"observed_at":"2026-08-06T15:11:14.725690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T15:11:14.730419Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.730419Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:a5a07865a20b1e498596f23c0f49b077aa1d1da01a4a2faf6f8e05d115a2465a","observation_id":"6c7ca839-5847-4978-a424-2cbf06b1e371","resolution":{"observed_at":"2026-08-06T15:11:14.730419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.734477Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.734477Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:a6207b1147fb17515fd807c188516bd3e6ab6bc25ce1616918c8ee3b8bdbc1b6","observation_id":"91ea4641-b347-479d-a10f-b9fc7611c18d","resolution":{"observed_at":"2026-08-06T15:11:14.734477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-06T15:11:14.739001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.739001Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:525dd5fd85313e5ad387b0e27311ce856aec1ac331dce479833269d01aa7ac55","observation_id":"90b2e545-4d4e-477d-87b8-f5f0060242f2","resolution":{"observed_at":"2026-08-06T15:11:14.739001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.255378Z","title":null,"venue":null,"work_id":"20b1a582-b2c7-48ec-a897-bbd8c7cd360e","year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.743067Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:424316607bd4fa7636f77337137557d9c838843c52bc297f7804381c2155db45","observation_id":"2354edb6-f071-4b39-b282-583b62b60d57","resolution":{"observed_at":"2026-08-06T15:11:15.259105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.242771Z","title":null,"venue":null,"work_id":"155733e6-9227-494c-90fe-bc2db3522fb9","year":2020},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.746584Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:e59f67bff13d64b3c57d6d75acd3e77229e1b97a72e4493953ea7a4866ce0829","observation_id":"a7fa17ee-5ec7-4bd3-82bc-7df24defbc88","resolution":{"observed_at":"2026-08-06T15:11:15.246673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.228785Z","title":null,"venue":null,"work_id":"6529f708-0ccd-4a3f-950b-b6eedfc91ce0","year":2024},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.750384Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:a1634afee7752eeae03de6312d8246805e55832428ba278258641695e4485c2d","observation_id":"404dedfe-0ead-453f-b051-e3bcd61e3b77","resolution":{"observed_at":"2026-08-06T15:11:15.232591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.212912Z","title":null,"venue":null,"work_id":"397c673a-2f23-49bb-98b6-a75b3e5b463e","year":2022},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.753937Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:21e733e72e2ca548fb2897b09834c2cc6aa91d25bb64ad8eab7c703476df6bf3","observation_id":"7d7ced0c-17d5-4d50-9919-256056341202","resolution":{"observed_at":"2026-08-06T15:11:15.218647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T15:11:14.757700Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.757700Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:c87027844ba916d4bdb47a9ebc575d0a6f6b58a608b9c7f359d8b4aa41aa267e","observation_id":"4fffeeb7-8366-4d76-b761-0728ff6abae7","resolution":{"observed_at":"2026-08-06T15:11:14.757700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.761625Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.761625Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:a18b4096924d3a584d3039a3c786820abd49b3fbc9009fa64247fd30ccd811ae","observation_id":"53e4cc5f-28ac-44d8-a4ec-60a9a19b8b32","resolution":{"observed_at":"2026-08-06T15:11:14.761625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.766000Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:11:14.766000Z"},"links":{"citing_paper":"/paper/2507.16572"},"observation_digest":"sha256:a30399228ba7ec86626cc543234001a5389164e44fa68174695324ce39dc1d5a","observation_id":"b60a00c7-41f4-4c66-9ef6-5372d4799f25","resolution":{"observed_at":"2026-08-06T15:11:14.766000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.16572","last_updated":"2025-07-22T13:24:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:04:17.912418Z","submitted_at":"2025-07-22T13:24:42Z","title":"Pixels to Principles: Probing Intuitive Physics Understanding in Multimodal Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2507.16572."}