{"as_of":"2026-08-19T05:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe0b4d0c4c9298577832e4e93fa51755d6ff5f1e934ae50751cac999c032615c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:15:18.724350Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05747/citation-record","integrity":"/paper/2608.05747/integrity","json":"/paper/2608.05747/citation-record.json","paper":"/paper/2608.05747"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-08T00:15:18.613690Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.613690Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:ea865c6e51259b1330d9d7c6618124e7cd2fa3921c7084f4f70c701f5a7147a6","observation_id":"42253e57-622b-40b3-afd3-45ffb4fe9c95","resolution":{"observed_at":"2026-08-08T00:15:18.613690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-08T00:15:18.618117Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.618117Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:54d04b18c756ea90478cffe18a507915b2e3f3988a9941dc704290ec0ea64d6a","observation_id":"e6bfcd7c-3d19-448f-ab10-1de98cd9705b","resolution":{"observed_at":"2026-08-08T00:15:18.618117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-08T00:15:18.622060Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.622060Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:1162718e490abd921cf6b59da428e01846837613ae5215ddcddcf0838b886660","observation_id":"522bc332-6aa4-43f1-82c2-8e649d86a955","resolution":{"observed_at":"2026-08-08T00:15:18.622060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.239188Z","title":"Mm-spatial: Exploring 3d spatial understanding in multimodal llms","venue":null,"work_id":"25a0ad3b-bd62-4180-8386-bbc623e80a0b","year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.626142Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:9917b2f837e03ed153f01dbd22d6f31c93f8f05fcc4275ce7c8c159033eff86f","observation_id":"48afbab3-510e-4247-8b5a-8ff59c37fd2b","resolution":{"observed_at":"2026-08-08T00:15:19.243096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01106","snapshot_observed_at":"2026-08-08T00:15:18.629999Z","title":"Robix: A unified model for robot interaction, reasoning and planning.arXiv preprint arXiv:2509.01106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.629999Z"},"links":{"cited_paper":"/paper/2509.01106","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:847f8e921f849011274b48af75028495b38ffc62d1f0ca67ac7ff7abbd2d7423","observation_id":"0c2694aa-3f0f-4a19-8dfa-12c24caad030","resolution":{"observed_at":"2026-08-08T00:15:18.629999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.633875Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.633875Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:9a8df8eed17a9efb8d7e9505bdd5f2ed0a9b177dcad9416bca238b5b94048223","observation_id":"536c9ea0-0a17-4a01-aa26-dab0ba904fee","resolution":{"observed_at":"2026-08-08T00:15:18.633875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.223203Z","title":"Gemini 3: Introducing the latest gemini ai model from google.https://blog.google/products/gemini/ gemini-3/, 2025","venue":null,"work_id":"02982453-2d99-49b8-aaa2-e12f0232c3c4","year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.637830Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:f0a1a89f3e578162f50bde7e573b70212a23a51c857320d6dc2158d83f68ea49","observation_id":"b2229948-db60-42f8-8924-5f2e21d61fa4","resolution":{"observed_at":"2026-08-08T00:15:19.226778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-08T00:15:18.641174Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.641174Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:fc4108904f0e601908c52763e22c8d4b0f570c9c2fb2f9c7b3d0197da9334efb","observation_id":"e5cd3282-a386-4ca1-aef1-8d3c71cad95f","resolution":{"observed_at":"2026-08-08T00:15:18.641174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.645149Z","title":"Artvip: Articulated digital assets of visual realism, modular interaction, and physical fidelity for robot learning.arXiv preprint arXiv:2506.04941, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.645149Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:3ad701048f1336493ccf0864805b2daf99f88a51b67e0e6fda7b36cf9f5c4dc4","observation_id":"f7f25101-e1f7-444f-95cb-9e77f38f45b0","resolution":{"observed_at":"2026-08-08T00:15:18.645149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.648647Z","title":"What’s “up” with vision-language models? investigating their struggle with spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.648647Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:66b73e4eb8f2397ce2c12f39afdd03988175d064d60f64c2beb283acda76a5f4","observation_id":"504a08fd-00e3-45b5-a17d-736f68c4a734","resolution":{"observed_at":"2026-08-08T00:15:18.648647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.652690Z","title":"Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.652690Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:a88d608ae00854b15e0f4e820c758361fa97e5a72a60be5e5592d86925e7b258","observation_id":"a3f31ade-1f30-4e7e-97ff-e04324714436","resolution":{"observed_at":"2026-08-08T00:15:18.652690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.655986Z","title":"Viewspatial-bench: Evaluating multi-perspective spatial localization in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.655986Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:7b92be642afd24af97f7136448404ae2c38aff0f5df7907426d5b7cd9a8a92f3","observation_id":"b64c74b1-9ef2-4f84-835a-8aea39b4162d","resolution":{"observed_at":"2026-08-08T00:15:18.655986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.201544Z","title":"Sti-bench: Are mllms ready for precise spatial-temporal world understanding? InProceedings of the IEEE/CVF International Conference on Computer Vision, pages 5622–5632, 2025","venue":null,"work_id":"95643dcd-e1b5-48a4-9a50-00cf7fb821f1","year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.659445Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:5ac1a1cf8bab1428664e5e8d250a34b8088cf855740e803006f1901a3a7c8238","observation_id":"b6dab8f6-c1fb-4272-8c69-d8548ed13058","resolution":{"observed_at":"2026-08-08T00:15:19.205132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.662749Z","title":"Mmsi-video-bench: A holistic benchmark for video-based spatial intelligence.arXiv preprint arXiv:2512.10863, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.662749Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:88e34e7075938c7093c2337f4fc1a97af3ecb32f5f25d99772e30805427d6402","observation_id":"f644afb7-65c6-4da1-9893-c1236dcb0131","resolution":{"observed_at":"2026-08-08T00:15:18.662749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.190728Z","title":"Ost-bench: Evaluating the capabilities of mllms in online spatio-temporal scene understanding","venue":null,"work_id":"7d59a272-9961-4d42-9e26-60d0f96dcbab","year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.666338Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:9b1a314e0569fa58654d4727232813cdc2c2ea14ddd83f84f89e5079267e79bf","observation_id":"73350104-8c20-4faa-98d6-3f227d77e263","resolution":{"observed_at":"2026-08-08T00:15:19.195156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.670298Z","title":"Visual spatial reasoning.Transactions of the Association for Computational Linguistics, 11:635–651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.670298Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:9e9c05af0fafdfbdd3337b6f43fd9ba0ce2be60d23269e2f59a800d80c86474d","observation_id":"31c8c0ee-1531-4362-a436-6028f7be6b1f","resolution":{"observed_at":"2026-08-08T00:15:18.670298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.674326Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.674326Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:3113cf7e0d9e30f7a71e3b59b721e3233aa7d4259928c69f9a3e5ebe6e5d9fc1","observation_id":"a554ac96-8048-45ec-8bfe-1dad6dd8746b","resolution":{"observed_at":"2026-08-08T00:15:18.674326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.678285Z","title":"3dsrbench: A comprehensive 3d spatial reasoning benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.678285Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:6fc71c65145c1a1d0e239a9651d7fe810aea6168fed6369b3b7446042fb71df8","observation_id":"1be615e0-80f8-437c-9bdc-83ed3070ae71","resolution":{"observed_at":"2026-08-08T00:15:18.678285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.162816Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"ac799fff-6604-4bb6-a650-22abe3edf231","year":2024},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.682295Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:0f40eb5de52b786079bb1f4d7d5c971078f0e6d95b7ea8ce8d6240a8dc42eea8","observation_id":"8c2f3515-ed64-4a4b-afcb-da22c99c892c","resolution":{"observed_at":"2026-08-08T00:15:19.167241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.152980Z","title":"Cosmos-reason2","venue":null,"work_id":"e35ea6ed-9a0e-42f0-84d9-b38de0f1f7ae","year":2026},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.686302Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:ee1f679ffbf08ca724b54f1eb93b2ecc8cbdd3a142e13a8452bbd570c169a051","observation_id":"c4455015-2bf4-497e-b61a-b2d99d260117","resolution":{"observed_at":"2026-08-08T00:15:19.156499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.143126Z","title":"Hypersim: A photorealistic synthetic dataset for holistic indoor scene understanding","venue":null,"work_id":"db67be22-c7a3-4c8d-9722-0cc63730ae55","year":2021},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.689975Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:52824a65be54580202a5c14db55a9dbe792cf3632e39a3016062ae4c48c373b1","observation_id":"ab821289-cf90-444a-a8b5-b00d22bd9ba8","resolution":{"observed_at":"2026-08-08T00:15:19.146707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.20633","snapshot_observed_at":"2026-08-08T00:15:18.693233Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.693233Z"},"links":{"cited_paper":"/paper/2603.20633","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:8908f6072e6ce0c30cbe84dafe1105f5bb6edabcfabbf685c3228e989f1c1c63","observation_id":"e0904a3a-a40d-4f8b-b990-0cac299f58c8","resolution":{"observed_at":"2026-08-08T00:15:18.693233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-08T00:15:18.696882Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.696882Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:22295141bff56deecc4cb26f0d1d24556f706435e01f6d1e11875c61e91a35ec","observation_id":"29f45c7e-65c3-45db-8d64-7bef050f313b","resolution":{"observed_at":"2026-08-08T00:15:18.696882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.700804Z","title":"Robobrain 2.5: Depth in sight, time in mind.arXiv preprint arXiv:2601.14352, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.700804Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:195e7b5679165b31362fbe5a047ff0a609eb3f68366da3b337db7e625a8bdeb1","observation_id":"f689b408-4562-4dee-b6ea-a9cf268ce6e9","resolution":{"observed_at":"2026-08-08T00:15:18.700804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.133332Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"2fe80c40-146d-4d23-9aef-8848e1895629","year":2024},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.704875Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:1ff8dea7371c2007191baaf5f69e6909ee2dbaab2a0b600a85498c25f4418091","observation_id":"d9576de4-a15a-465d-85f3-fd9f156fc3e9","resolution":{"observed_at":"2026-08-08T00:15:19.136900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-08T00:15:18.707962Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.707962Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:1e1f5b4977aab820b96f11ae6d54bc0e43b834cfd72d28a5736fdb5dca112374","observation_id":"d628961d-d841-4acf-b113-9d52bf31cbbe","resolution":{"observed_at":"2026-08-08T00:15:18.707962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.122590Z","title":"Spatial457: A diagnostic benchmark for 6d spatial reasoning of large mutimodal models","venue":null,"work_id":"4ef9118b-c005-4ef1-a087-d785ef8135f9","year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.711372Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:a082d8a9fc557451eef590c562d7afb44c001ce5ff7a834be00f1ebeca7dbe80","observation_id":"1a13155f-73e4-4fd4-b883-9ab534fe02ae","resolution":{"observed_at":"2026-08-08T00:15:19.126632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:18.714534Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.714534Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:2e0d9ff8cce156e5010c422e5fd2cf3ef9d5ac2483c6b135762a3ba61a2827ca","observation_id":"aec5670f-4081-4fa7-a379-d4d33b1979ff","resolution":{"observed_at":"2026-08-08T00:15:18.714534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.107282Z","title":"Cambrian-s: Towards spatial supersensing in video","venue":null,"work_id":"5f4921ae-3f1c-4f08-91c1-21dee7af91e7","year":2026},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.717864Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:9c3e84ba16c695644bda8e36716be256b9cfba358c894a2b350e1e18b189ed6c","observation_id":"54fc181a-dde9-4407-9ec2-c63dd0542529","resolution":{"observed_at":"2026-08-08T00:15:19.110735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23764","last_updated":"2026-05-23T03:42:56Z","snapshot_observed_at":"2026-08-13T16:52:15.861245Z","submitted_at":"2025-05-29T17:59:52Z","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23764","snapshot_observed_at":"2026-08-08T00:15:18.720958Z","title":"Mmsi-bench: A benchmark for multi-image spatial intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.720958Z"},"links":{"cited_paper":"/paper/2505.23764","citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:6c9d0eba51f06a755d1954bd5cf7c0a285e621a17f46530ef4d21ef9bf7a1616","observation_id":"65ce0823-fb8c-4075-af19-503139ff9bc6","resolution":{"observed_at":"2026-08-08T00:15:18.720958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:15:19.095657Z","title":"From flatland to space: Teach- ing vision-language models to perceive and reason in 3d","venue":null,"work_id":"09548a7d-429f-4243-a1bc-6d3624c664d7","year":2025},"citing_paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T00:15:18.724350Z"},"links":{"citing_paper":"/paper/2608.05747"},"observation_digest":"sha256:7fdc576363ece5ade20d27e0d2ee7b194c1f57c5496625ce6ebba258630a26c8","observation_id":"1e5482ab-af6b-4d27-be5f-a376c33dfec6","resolution":{"observed_at":"2026-08-08T00:15:19.100566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05747","last_updated":"2026-08-06T08:33:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T11:53:53.799853Z","submitted_at":"2026-08-06T08:33:13Z","title":"GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.05747."}