{"as_of":"2026-08-17T14:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6f5be88743349d80f3e5a2ae786ef1f0870f91dcea15cd1b8d5530fb584c776","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:22:39.392445Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:04:43.145985Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21876","snapshot_observed_at":"2026-08-03T03:04:43.145985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-08T23:46:38.596764Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.145985Z"},"links":{"cited_paper":"/paper/2506.21876","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:d46b1cc9db35a060ea6c5946c75beca7ec1cd5c3b1ea6ccee30c4e019307bb53","observation_id":"770e4f03-85ca-428b-9829-82fbbaaf69ce","resolution":{"observed_at":"2026-08-03T03:04:43.145985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21876","snapshot_observed_at":"2026-07-11T21:36:42.378149Z","title":"arXiv preprint arXiv:2506.21876 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04112","last_updated":"2026-07-05T04:44:59Z","snapshot_observed_at":"2026-08-16T22:47:52.122956Z","submitted_at":"2026-07-05T04:44:59Z","title":"DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-11T21:36:42.378149Z"},"links":{"cited_paper":"/paper/2506.21876","citing_paper":"/paper/2607.04112"},"observation_digest":"sha256:1685a213070dee003a055a85646df5068e3931536d60b1c24d1333b0b93f7586","observation_id":"17d4b390-cd08-4e15-a2f8-2390ef800198","resolution":{"observed_at":"2026-07-11T21:36:42.378149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21876","snapshot_observed_at":"2026-07-14T07:27:08.281893Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11044","last_updated":"2026-07-13T03:13:39Z","snapshot_observed_at":"2026-08-15T18:58:41.003327Z","submitted_at":"2026-07-13T03:13:39Z","title":"RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T07:27:08.281893Z"},"links":{"cited_paper":"/paper/2506.21876","citing_paper":"/paper/2607.11044"},"observation_digest":"sha256:17146972ea296c9aa3b3bf79327982664362ae1ae8862a71db80a6734072a4cf","observation_id":"f6bf9e4e-5780-48d2-9252-45f48f43f995","resolution":{"observed_at":"2026-07-14T07:27:08.281893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21876","snapshot_observed_at":"2026-08-02T05:16:36.966727Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-16T10:27:13.748143Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.966727Z"},"links":{"cited_paper":"/paper/2506.21876","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:e2fd6c577cbd4959562e93e43ff24ddcfc4d6b416038eb449fdaa9cb9d48586e","observation_id":"d023fc94-0bd3-4f98-b89b-fe4b2cc8c1be","resolution":{"observed_at":"2026-08-02T05:16:36.966727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21876/citation-record","integrity":"/paper/2506.21876/integrity","json":"/paper/2506.21876/citation-record.json","paper":"/paper/2506.21876"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:44.528921Z","title":null,"venue":null,"work_id":"395b4cd8-b679-446e-8fe0-51cc6f473d65","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.684245Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:549be5552e2328cde4a0a4f739246f7a96647c77b4dac1563580b4f337f94737","observation_id":"96d09218-983c-4fd2-8ab9-aa20774187c0","resolution":{"observed_at":"2026-08-06T22:22:44.639025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:44.243110Z","title":null,"venue":null,"work_id":"e8707edc-9863-4d6c-ace0-73ae843498fb","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.707507Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:340297007d64f77f60726020c6e91ade6f862accfdfcb04688374dffa2fb77c6","observation_id":"165c8bd4-30ce-460b-b4e2-37a3124c2fa5","resolution":{"observed_at":"2026-08-06T22:22:44.365198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:43.981806Z","title":"The topological order of the graph is determined by time and world dynamics","venue":null,"work_id":"47415386-a556-414f-896c-d87b5d0cc32b","year":2013},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.734779Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:329ff08e563d92daf59a06e8d283b2e010efd5faba87d7687d893ba8f74265c5","observation_id":"3b6f71db-95d1-49e5-9e86-1c708b75a125","resolution":{"observed_at":"2026-08-06T22:22:44.089308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.617395Z","title":"These multi-view tasks emphasize the model’s ability to synthesize distinct viewpoints into a coherent three-dimensional representation of object arrangements","venue":null,"work_id":"5cbebd5d-8254-4460-a8ba-9aca494e7daf","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.917251Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:33bfbce2b9082083f0d0b8e9212ade49880455244f8a2cca76a5ed16ca375198","observation_id":"afe4b3b5-5f30-46f6-b85c-2d8ea1bffb13","resolution":{"observed_at":"2026-08-06T22:22:42.690342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13112","last_updated":"2025-05-27T14:49:49Z","snapshot_observed_at":"2026-08-12T16:47:22.702728Z","submitted_at":"2024-11-20T08:14:01Z","title":"SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13112","snapshot_observed_at":"2026-08-06T22:22:37.200429Z","title":"International Journal of Computer Vision, 127(4):398–414","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.200429Z"},"links":{"cited_paper":"/paper/2411.13112","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:aa1d4b5731678dd015f582e1b4079a87086498169cbb4ba92f0723e3d8b1a12d","observation_id":"93f01c19-7bb6-40be-94fd-880cabfa4775","resolution":{"observed_at":"2026-08-06T22:22:37.200429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03843","last_updated":"2023-11-02T20:32:43Z","snapshot_observed_at":"2026-08-16T15:41:56.400257Z","submitted_at":"2023-04-07T21:04:03Z","title":"Why think step by step? Reasoning emerges from the locality of experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03843","snapshot_observed_at":"2026-08-06T22:22:37.379328Z","title":"Preprint, arXiv:2304.03843","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.379328Z"},"links":{"cited_paper":"/paper/2304.03843","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:b4cc847dde12f56b4051fcc4f2e1b0bba6ad561a636fbfd06ed64f54984bb83f","observation_id":"515bd20e-6045-42d8-9c10-e33ef8999192","resolution":{"observed_at":"2026-08-06T22:22:37.379328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-16T13:35:54.889031Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-06T22:22:37.423858Z","title":"Preprint, arXiv:2407.06581","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.423858Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:d6e3cc35d73f3f0563a49dc2a89026aeffd2ddfcbffc78ddd4edac9e763dc55a","observation_id":"e34fa55c-165e-4d18-b51e-fd7d9700d18d","resolution":{"observed_at":"2026-08-06T22:22:37.423858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07616","last_updated":"2020-02-11T10:05:20Z","snapshot_observed_at":"2026-08-16T01:42:59.802334Z","submitted_at":"2018-03-20T19:29:46Z","title":"IntPhys: A Framework and Benchmark for Visual Intuitive Physics Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07616","snapshot_observed_at":"2026-08-06T22:22:37.457730Z","title":"In Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 2)","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.457730Z"},"links":{"cited_paper":"/paper/1803.07616","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:fd96f0aac61df56d4c0e2c05b170568e222a20d72347f342dfad379491ba7c38","observation_id":"aeed72a1-4d00-48c2-8431-55b489ce3dc5","resolution":{"observed_at":"2026-08-06T22:22:37.457730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11999","last_updated":"2025-08-29T22:59:16Z","snapshot_observed_at":"2026-08-17T07:18:53.117898Z","submitted_at":"2025-03-15T05:34:26Z","title":"Diffusion Dynamics Models with Generative State Estimation for Cloth Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11999","snapshot_observed_at":"2026-08-06T22:22:37.511154Z","title":"science, 332(6033):1054– 1059","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.511154Z"},"links":{"cited_paper":"/paper/2503.11999","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:005494c367ad1e63bbb23e34795152d74bc6d32bcc73ac3a872726329bf954b7","observation_id":"8098a857-5480-4c86-831a-40b6fb1c9afb","resolution":{"observed_at":"2026-08-06T22:22:37.511154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-06T22:22:37.580685Z","title":"In Workshop on Responsibly Building the Next Generation of Multimodal Foundational Models","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.580685Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:2cd5aaf64b601de2e9783954a5f2f8aabc98be73f8456cb4dca7b0abb9447c3b","observation_id":"b42919ff-a75d-4e1c-bf9c-1db86f018aab","resolution":{"observed_at":"2026-08-06T22:22:37.580685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-16T16:49:03.285397Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-06T22:22:37.649660Z","title":"inaction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.649660Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:528544fd9a809165a77462c3046c10d6cce5e6bef22e8c3cd9985957e9031f28","observation_id":"3ccfcbb2-0c3b-4b86-ac09-df84f94e9a8b","resolution":{"observed_at":"2026-08-06T22:22:37.649660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:43.312800Z","title":"This task evaluates whether the model can accurately discern spatial relationships based on visual cues","venue":null,"work_id":"a6317321-5363-42f0-8efe-9836c385bf77","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.794107Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:417b84fddf3dd19725a73f5d1bfde8b3fcf94ad0ffe2aa543f14b1aeb23dbdc3","observation_id":"d2eb0d2c-2e7e-46ed-b259-451264b35f48","resolution":{"observed_at":"2026-08-06T22:22:43.479831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:43.041344Z","title":"Thus testing the model’s understanding of spatial constraints","venue":null,"work_id":"8913d4f9-74b1-4dcd-9105-e58655ba78ca","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.824097Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:06bcb5c580017688650bd706365a308d7bee26ffb4e37e8c50a05a15ecd6c8ee","observation_id":"f3fab12a-a7f6-4d52-bcfc-09507104ee3b","resolution":{"observed_at":"2026-08-06T22:22:43.162217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.786384Z","title":"Thus testing the model’s understanding of object size","venue":null,"work_id":"d93424a5-45fa-4f2d-a63e-a77d01cf1ace","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.864031Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:8abae249e2ac5d86cf024451f94e9f58a093d1182efe1f3ec787a88af18e2ca8","observation_id":"e601943c-4656-44f8-99b2-02a51961ab65","resolution":{"observed_at":"2026-08-06T22:22:42.943046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.426820Z","title":null,"venue":null,"work_id":"18e634e5-3243-4f8b-ad2b-536ebb690284","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.953529Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:9abf1082e5660002afaba1fcd65f7521149ee37914999e3d2f3aee66b3870e3d","observation_id":"155d7142-72dd-44bc-8a7c-1ce312aabd2d","resolution":{"observed_at":"2026-08-06T22:22:42.551464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.314124Z","title":"Collectively, these tasks investigate the aptitude of a model to maintain consistent temporal representations, estimate durations, and infer the correct order of events","venue":null,"work_id":"db71f17c-b860-4669-aab6-58edf1d71ae7","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.991794Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:191850ef1a723f9467a531d6185fbbcf8b03acab29a7b8b99e3c38f095800e3b","observation_id":"47f848a7-016a-4c1b-9e7f-817bd4eb82cd","resolution":{"observed_at":"2026-08-06T22:22:42.369495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.191699Z","title":null,"venue":null,"work_id":"7e70caf0-f2d9-4ca6-bfaa-e834f5d7c4b3","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.024311Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:f6c939651c22a829df1fb9b49ddf5afae66dbb726835477e34c96996fd450648","observation_id":"2a7c8717-0104-4d8b-b9ce-b329c2b846e8","resolution":{"observed_at":"2026-08-06T22:22:42.257805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.089665Z","title":null,"venue":null,"work_id":"4e9465e3-776a-47c1-8bef-aaae0825082f","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.094325Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:e5c8374433c36023ac10656d83377828687d53fcf1178acf20a4598c28ce68b7","observation_id":"e521baee-d6a4-4daa-b710-1e437ba9f704","resolution":{"observed_at":"2026-08-06T22:22:42.135747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.947257Z","title":null,"venue":null,"work_id":"0387ea32-7fc2-48ad-a286-d67e85c98b97","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.154224Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:2553e58f67fdf34853b0a5ef97adcd9aca165c94ac95e1d3178a1b0a6c5eaf3a","observation_id":"2d1df94b-2d08-4c4c-bc53-87f17ad2d684","resolution":{"observed_at":"2026-08-06T22:22:42.036339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.811613Z","title":"This setup tests the model’s capacity to identify the moving action of objects","venue":null,"work_id":"d138a10e-124c-44c7-a157-433994a916bf","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.224945Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:3eb38d61c4b7394ac0aa0324a0b37b7f4c1cf84f1b0c4f1fe2955c9808c91267","observation_id":"42c72287-8263-46a2-b8fb-3256ec1db670","resolution":{"observed_at":"2026-08-06T22:22:41.857927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.684990Z","title":"This setup tests the model’s capacity to track position changes over time and estimate relative velocity","venue":null,"work_id":"85172ab8-6161-466c-bdda-ef6d8eb4b6a8","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.287916Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:7666d1f170590869bc540fa2d0d0255f4ac302b7ad140cc07e7f47aeca66f794","observation_id":"e8c37cfd-8fe3-4aa4-a7dc-816b6751e3c5","resolution":{"observed_at":"2026-08-06T22:22:41.741165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.561637Z","title":"This setup tests the model’s 20 capacity to track position changes over time and estimate relative moving direction","venue":null,"work_id":"a88994a2-9565-4571-945b-b1a4607ff853","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.367788Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:ebd185678e71cd1450b851a414a825ad20f68d4c5e5c2ca23fab16b9aeae259a","observation_id":"958617c8-47ad-4c21-ae53-9e26396b54d7","resolution":{"observed_at":"2026-08-06T22:22:41.615188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.438812Z","title":"Quantitative Perception","venue":null,"work_id":"6a65ccf1-c904-4c14-bfba-4e5520c04b25","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.459906Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:d6ea1638df264f7efa02bbbbdda5240dac930ffcaebe57bd07c93740625d396b","observation_id":"6c57eddc-4f41-46e4-b015-a3257e87c33d","resolution":{"observed_at":"2026-08-06T22:22:41.495654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.325526Z","title":"This setup evaluates the model capacity for discrete numerical estimation","venue":null,"work_id":"2803e3f3-6c21-4d0c-8313-7e52ec5f1160","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.534512Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:5605c39ccbaceba8d9810ae9a708f747851dc832779cc33a44a69112326ed589","observation_id":"8b0665ea-32c4-4eb6-b3a6-141e4b19dccb","resolution":{"observed_at":"2026-08-06T22:22:41.375521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.214831Z","title":null,"venue":null,"work_id":"91d0447b-04fb-4b26-9f5f-6092a46534a6","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.610245Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:5549c98f85345afda978e8785963e21736874f7ca708946c5647e7acf4b0cdf9","observation_id":"74281348-1b85-4e0e-aee5-7c50ec805ee0","resolution":{"observed_at":"2026-08-06T22:22:41.268379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.107013Z","title":"This setup probes counting skills, numerical reasoning, and perceptual comparisons in a visual context","venue":null,"work_id":"1e4952da-36f6-469a-876a-a0ef9f0be838","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.684429Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:4e52e86a54bbc47ee2c01e23db97d05933e25832f41b6b7e91f785650d1cbe8a","observation_id":"e73263ab-5223-4843-a247-4e8fe27ccb9e","resolution":{"observed_at":"2026-08-06T22:22:41.156533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:40.958276Z","title":"This setup evaluates the model capacity in physical reasoning","venue":null,"work_id":"bcebf168-4771-4b30-a5b2-cc33b281710e","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.774412Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:0be0c1c72a2e27245362e2f29c172b112e8448681d58d72594a75c307f0546ca","observation_id":"5f530ea3-642d-45e2-a267-7e1b50930ba5","resolution":{"observed_at":"2026-08-06T22:22:41.056090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:40.756742Z","title":"This setup evaluates the model capacity in predictive reasoning","venue":null,"work_id":"e288d66a-affd-4e07-9431-8675d6586253","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.869516Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:794d7054d8d1a4c430d2a52deeb217cc307242a2e1b49d64ba0b67bdebad00c8","observation_id":"4ffb2d8c-db14-4262-8d1a-663616202112","resolution":{"observed_at":"2026-08-06T22:22:40.842243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:40.599045Z","title":"This setup evaluates the model capacity in predictive reasoning for robot manipulation","venue":null,"work_id":"9a694533-a657-473d-a5b2-f4c51da3194a","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.977727Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:b84aad2410894d1beabead395572a142fd83de948d34fc46129f935a60440e10","observation_id":"f77b19c7-0baa-4c21-93b7-78fb3eb07adc","resolution":{"observed_at":"2026-08-06T22:22:40.672138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:40.444926Z","title":"This setup evaluates the model capacity in predictive reasoning for autonomous navigation","venue":null,"work_id":"b0d2807d-561b-4a87-95dd-e29a038316fb","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.048655Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:0dde89047479bea2d4a005dfc0069a996eca18c4ca32c3973c81657af8d8026f","observation_id":"241f8ca8-00e2-4180-a1c0-d8ec06f2aceb","resolution":{"observed_at":"2026-08-06T22:22:40.525701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:40.263002Z","title":"This setup evaluates the model capacity in multi-step predictive reasoning for robotic manipulation","venue":null,"work_id":"d36ee1a6-a7d6-4105-8ece-861a4793c0ad","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.122549Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:ba2ed54622d9e906d7ad4124354c56f0cb414de4790a8bc63fd9b0eb775de244","observation_id":"0ee026b0-4639-4502-97dd-395333f84139","resolution":{"observed_at":"2026-08-06T22:22:40.350422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:40.082269Z","title":"This task evaluates the model’s ability to perform compositional inferences about physical causality and object behavior","venue":null,"work_id":"1ecc0c7f-5daa-4e67-97af-2e95d5e83b1f","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.211208Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:d942e5d1b24ff84f8c5723597aaaaefbbaae64823709c148b658e3634c4d16dc","observation_id":"e656d49b-4ad5-447f-b6f2-a0f0e3964994","resolution":{"observed_at":"2026-08-06T22:22:40.162338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:39.901194Z","title":"This setup evaluates the model capacity in concurrent action predictive reasoning for robotic manipulation","venue":null,"work_id":"81410167-7b19-4443-922f-e146562b450a","year":2024},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.298648Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:f4464699b7f5b89d80d9c5af166e964ed16a7a3c84059c884ad0dd1354ac5490","observation_id":"6de38852-8989-4b01-8495-8a41ab86f89d","resolution":{"observed_at":"2026-08-06T22:22:39.987746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:39.750541Z","title":"yes” or “no","venue":null,"work_id":"160552ec-cd5e-4d38-a584-55eb74418cf0","year":2022},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.392445Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:affa1765444185eee439960864ee4c9e4213494abb5ed1cf17534d27fa3812cb","observation_id":"dc74911f-a30f-40e4-8d70-b6e3e09c7389","resolution":{"observed_at":"2026-08-06T22:22:39.809002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:03.241736Z","title":"John Wiley & Sons Hoboken, NJ","venue":null,"work_id":"b9050eb3-0e60-4fed-9eaa-8f913d4547e9","year":2024},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:36.849611Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:642b5d2b843d96db628e375e3f4ec3d3e9af2b8f69c9e4f1f85b0d1d70b4c3b1","observation_id":"af3719b3-b7c1-466c-8f02-660250ebc0c0","resolution":{"observed_at":"2026-08-06T22:23:03.324343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:43.655186Z","title":"S(n) t to denote the whole relationship between n component states and complex states","venue":null,"work_id":"3e888705-bd20-4dd2-a53d-e5e2617ab086","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.758890Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:6fe7194f37fbf6d03a0f552bf09a68b61bb245b147a7be33f70a7c28fb0f5b33","observation_id":"cab77872-0d73-4b5b-b584-3375f1655071","resolution":{"observed_at":"2026-08-06T22:22:43.816986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-08-06T22:22:37.281149Z","title":"Animal behaviour, 82(2):359–367","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.281149Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:2633e0439d64186bdecae8ba83e89ad9d497b490e9aebc51d54041066c21a1c2","observation_id":"399c084c-8c05-4a5e-b08e-811189840f70","resolution":{"observed_at":"2026-08-06T22:22:37.281149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11290","last_updated":"2023-12-08T02:45:36Z","snapshot_observed_at":"2026-08-16T15:22:41.014373Z","submitted_at":"2023-06-20T05:07:23Z","title":"Habitat Synthetic Scenes Dataset (HSSD-200): An Analysis of 3D Scene Scale and Realism Tradeoffs for ObjectGoal Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11290","snapshot_observed_at":"2026-08-06T22:22:37.339688Z","title":"Social and Personality Psychology Compass, 10(7):405–420","venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.339688Z"},"links":{"cited_paper":"/paper/2306.11290","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:20333fca353170727c0dc34115dc2328628ab70fad74475305ab985a5923efac","observation_id":"ee900967-a049-4644-9de2-b0cda7747bd3","resolution":{"observed_at":"2026-08-06T22:22:37.339688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T22:22:36.559873Z","title":"In 2018 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) , pages 2127–21273","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:36.559873Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:5734d1d74651c23a1b16a35c908b9833bfa3e0affe601359bcb21da14f87ec2a","observation_id":"2f2ff74f-0605-4c25-919e-08b5cca1b525","resolution":{"observed_at":"2026-08-06T22:22:36.559873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02660","last_updated":"2019-08-29T20:30:38Z","snapshot_observed_at":"2026-08-15T06:04:15.667040Z","submitted_at":"2019-08-07T14:41:30Z","title":"SpatialSense: An Adversarially Crowdsourced Benchmark for Spatial Relation Recognition","version":2},"cited_work":{"arxiv_id":"1908.02660","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.02660","snapshot_observed_at":"2026-08-06T22:22:39.534674Z","title":"SpatialSense: An Adversarially Crowdsourced Benchmark for Spatial Relation Recognition","venue":"cs.CV","work_id":"18c615c4-e391-48c3-a505-bece3f803265","year":2019},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.555217Z"},"links":{"cited_paper":"/paper/1908.02660","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:a64f978f625155bd05cb8d3febe3a62495c9424eaf35d5172318ff9adace8046","observation_id":"7f3f7446-c88c-416c-a422-478b4e23c352","resolution":{"observed_at":"2026-08-06T22:22:39.582059Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:45.307182Z","title":"In Advances in Neural Information Processing Systems, volume 33, pages 10514–10525","venue":null,"work_id":"3a793f1a-b220-479a-a2fe-429530b1bbfd","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.101582Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:dce5b1d74f9077430ee481203293521e06788efa8d05c4cbca89d569b624cf75","observation_id":"890028db-ee63-46c2-ab8e-277326e274e3","resolution":{"observed_at":"2026-08-06T22:23:02.907075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04744","last_updated":"2020-04-05T03:39:21Z","snapshot_observed_at":"2026-08-13T13:07:55.618967Z","submitted_at":"2019-10-10T17:52:19Z","title":"CATER: A diagnostic dataset for Compositional Actions and TEmporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04744","snapshot_observed_at":"2026-08-06T22:22:36.996473Z","title":"In Proceedings of the Neural Information Processing Systems Track on Datasets and Benchmarks 1, NeurIPS Datasets and Benchmarks 2021, December 2021, virtual","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:36.996473Z"},"links":{"cited_paper":"/paper/1910.04744","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:826755c22c3cd1df41f223bdb19811eb04809a6f1c33c4a4f65e624f4b0bc5b7","observation_id":"6c279471-d033-4ad8-8d46-16a9da93dcc7","resolution":{"observed_at":"2026-08-06T22:22:36.996473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18654","last_updated":"2023-10-31T16:35:07Z","snapshot_observed_at":"2026-08-16T15:28:31.336480Z","submitted_at":"2023-05-29T23:24:14Z","title":"Faith and Fate: Limits of Transformers on Compositionality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18654","snapshot_observed_at":"2026-08-06T22:22:36.904449Z","title":"Preprint, arXiv:2305.18654","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:36.904449Z"},"links":{"cited_paper":"/paper/2305.18654","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:0f43f32882cfe20d8d80965074b950efba6c927e9833b88c4d1405012a77c5d0","observation_id":"bc149e21-7257-48a7-ad3a-38db00cca78b","resolution":{"observed_at":"2026-08-06T22:22:36.904449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-16T02:35:29.869873Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-06T22:22:37.307022Z","title":"arXiv preprint arXiv:2411.02385","venue":null,"work_id":null,"year":1934},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.307022Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:d4739773cd3dce02e845e19592ec078b1350fae230309adfe716326e4cff0628","observation_id":"802dd24f-d6f8-43b7-b55e-d9e7c290a502","resolution":{"observed_at":"2026-08-06T22:22:37.307022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:44.780611Z","title":"In The Thirteenth International Conference on Learning Representations","venue":null,"work_id":"92a0f835-527e-4b1e-ba5d-857801ae644e","year":null},"citing_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.626475Z"},"links":{"citing_paper":"/paper/2506.21876"},"observation_digest":"sha256:56ddd7007b561904c2249ad4c66c0b40e56c6c5f6a62e0f7b71080625101fba7","observation_id":"3392a115-99fe-46c2-9cc2-5a7dc56cf3e8","resolution":{"observed_at":"2026-08-06T22:22:44.942959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 4 inbound Pith citation observations for arXiv:2506.21876."}