{"as_of":"2026-08-19T07:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b372aa726dd957cb5a6cdb7fcadc7b1a6bf6731e963192eb244a5df8c4d8e0ee","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:46:28.348279Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T12:53:40.783281Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:03:26.885433Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"cited_work":{"arxiv_id":"2507.20529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20529","snapshot_observed_at":"2026-06-29T13:03:26.885433Z","title":"org/abs/2507.20529","venue":null,"work_id":"6b83edcc-ad81-458f-8bd5-a3b0ac16eabf","year":null},"citing_paper":{"arxiv_id":"2605.28741","last_updated":"2026-05-27T17:01:39Z","snapshot_observed_at":"2026-08-12T14:08:47.746952Z","submitted_at":"2026-05-27T17:01:39Z","title":"Self-Prophetic Decoding to Unlock Visual Search in LVLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T12:53:40.783281Z"},"links":{"cited_paper":"/paper/2507.20529","citing_paper":"/paper/2605.28741"},"observation_digest":"sha256:6b0f48d48dd14d031d8884060883ea332ffc076c887d48a1d95b23bee4d228f7","observation_id":"000d1a38-48e5-4aba-b1d8-9b8defed9e68","resolution":{"observed_at":"2026-06-29T13:03:26.890094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20529/citation-record","integrity":"/paper/2507.20529/integrity","json":"/paper/2507.20529/citation-record.json","paper":"/paper/2507.20529"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-15T17:46:28.171941Z","title":"Spatialrgpt: Grounded spatial reasoning in vision language models.arXiv preprint arXiv:2406.01584, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.171941Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:a736e82e863d1bdcd68081cdfd3ea8a72ea18e580c4ef6feae1a91db275a03a1","observation_id":"6e8b5468-f395-419d-9244-d1ac0239f2ad","resolution":{"observed_at":"2026-08-15T17:46:28.171941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-15T17:46:28.177268Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.177268Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:e281b89aa3b373dfa7b7e28afd5f521172232fcd2a3c9a0d320e7b06f6c1176d","observation_id":"da9656cb-7018-45af-8910-01e3f889940e","resolution":{"observed_at":"2026-08-15T17:46:28.177268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.181982Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.181982Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:925a02389f917fcd94ae4adb4007cd827fb7aa9e809d33398ea08d914c9ad306","observation_id":"099994c9-42f5-4528-910a-d66c3848e413","resolution":{"observed_at":"2026-08-15T17:46:28.181982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.186135Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.186135Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:f52cf86192f9c8a963a70188b313847e0c9a0d82eccacc705c6d3670309693dc","observation_id":"f95802d2-3734-4585-b2b8-ceb59cbbe0d0","resolution":{"observed_at":"2026-08-15T17:46:28.186135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.190265Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.190265Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:68bc52ef11618565a52a121577f1338a5317b509b3ea3fa1fb1b0f6a97ed62b3","observation_id":"56676944-487c-4b55-a134-bf3c2fb30629","resolution":{"observed_at":"2026-08-15T17:46:28.190265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-15T17:46:28.194309Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.194309Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:e748899fd98a0d534777ff0f62fd5c94578ac16e79c3504a476fcd7e1b8dd117","observation_id":"bee5b45e-1f2f-4785-a9b7-29c546f32e90","resolution":{"observed_at":"2026-08-15T17:46:28.194309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T17:46:28.199206Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.199206Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:7f7bcdd953026682fd724d1dc23e33bb031f77207963d8b08e3b11a4e3d91552","observation_id":"3d7ac006-2f0c-4d91-8c1e-68376eef744d","resolution":{"observed_at":"2026-08-15T17:46:28.199206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T17:46:28.203594Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.203594Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:bdeefa78e25f1e7cb948a3d754269ec756e2636bfe80234fa085f953f6d31927","observation_id":"e59a3a24-09fe-458f-b91c-64ec11564fba","resolution":{"observed_at":"2026-08-15T17:46:28.203594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T17:46:28.207857Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.207857Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:8590041093d2a6b21ee63f273ec93bfdcc12e686d7c1bf49b5ed74d829d58eb1","observation_id":"b5437c73-d56e-4b0d-b296-1c66f7b1bebf","resolution":{"observed_at":"2026-08-15T17:46:28.207857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T17:46:28.212022Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.212022Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:dad12754e9a958f943e61eb24840e9b07a53afe8f836f419d6c553cd2d1a7b8f","observation_id":"b5c453ef-d1d7-470a-a9c1-cacebbafaabd","resolution":{"observed_at":"2026-08-15T17:46:28.212022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T17:46:28.216425Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.216425Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:c0c4a9068c4cf8b478debaee2a70ea2379bb806f6a2631b4df2ae1a9f4707c66","observation_id":"0cd1231b-ee16-445b-be4a-9b70a2e6fcf5","resolution":{"observed_at":"2026-08-15T17:46:28.216425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-15T17:46:28.220483Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.220483Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:2c4fa690b001566b2ac41f488fc462a7bd5d9fe2d47e54eb614b0dcc5ca4df86","observation_id":"5dcba726-8366-4b2e-8504-a8cfdc74383d","resolution":{"observed_at":"2026-08-15T17:46:28.220483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.224690Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.224690Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:f6f148e1b7dd34270cd6b810755221f360c8008ff0d235067cf6675802071d1a","observation_id":"4b70842f-48f6-4f53-bfda-9a1d33186f6a","resolution":{"observed_at":"2026-08-15T17:46:28.224690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:46:28.228774Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.228774Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:fa5ac3e832750b6b03c7d4bf8ae1681d0c9cd982651950d9590ce82c1246b34d","observation_id":"a3e73067-eae9-4a4e-b07d-89de312aa068","resolution":{"observed_at":"2026-08-15T17:46:28.228774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T17:46:28.232915Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.232915Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:d25f387615dda868d9a37a68b433dae0cf299d30d0fa52becaab07358ae6b08a","observation_id":"fc50dd51-038b-4e7f-9e5f-3f577e593fa6","resolution":{"observed_at":"2026-08-15T17:46:28.232915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T17:46:28.237063Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.237063Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:011a11c5b1b20b98cccc1db393b8483f8dc63410cdb5177976e005695909d956","observation_id":"094c6690-75ac-47f4-a864-07e5aa36828e","resolution":{"observed_at":"2026-08-15T17:46:28.237063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T17:46:28.241257Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.241257Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:d46b2433f3f9b2a30a009901ab38ca6233a936124de476b0cde8fa71d31c3e2e","observation_id":"d4ba45ae-580e-4051-8e4f-ddf3b43c7064","resolution":{"observed_at":"2026-08-15T17:46:28.241257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.245396Z","title":"Visual spatial reasoning.Transactions of the Association for Computational Linguistics, 11:635–651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.245396Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:a87df7a00bfbc8d21f3427542bff69ee75e2e7e4523154606e58df5bc43bfd96","observation_id":"25302f15-b159-4451-b2d7-9aff49fd01c2","resolution":{"observed_at":"2026-08-15T17:46:28.245396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.819059Z","title":"Navigating to objects in the real world.Science Robotics, 8(79):eadf6991, 2023","venue":null,"work_id":"0c5a2033-a224-447b-ad94-0979ff33bff8","year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.249399Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:3ba0cb8b2f4e1b8147afe8972f25ef2873bc67dbdb7100973f42f4a8529f1cbb","observation_id":"56c4b939-34b3-4254-a79d-651cf201efa1","resolution":{"observed_at":"2026-08-15T17:46:28.824661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.804620Z","title":"Iqa: Visual question answering in interactive environments","venue":null,"work_id":"28da813b-47ec-4708-958e-f7c60f2502d5","year":2018},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.253504Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:2fb4bf05348e0ef3d3df87c1eb96dd54a77f1331e25530f0b17aa5591831d864","observation_id":"ca75790d-085c-48a3-b343-fd257bef3a9d","resolution":{"observed_at":"2026-08-15T17:46:28.809394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.791209Z","title":"Learning spatial- semantic representations from natural language descriptions and scene classifications","venue":null,"work_id":"4ad00fe8-5b72-403e-9a06-2cfe64d66e2f","year":2014},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.257562Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:0b00c34b0da115d20929e9bfab398e17acc55a8f6dabcd7465cd1d5c52db4932","observation_id":"05a2a6cc-8ed2-4ed9-8117-4199f6d06b65","resolution":{"observed_at":"2026-08-15T17:46:28.795505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01072","last_updated":"2020-07-02T13:02:54Z","snapshot_observed_at":"2026-08-12T15:35:49.539626Z","submitted_at":"2020-07-02T13:02:54Z","title":"Scene Graph Reasoning for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01072","snapshot_observed_at":"2026-08-15T17:46:28.261466Z","title":"Scene graph reasoning for visual question answering.arXiv preprint arXiv:2007.01072, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.261466Z"},"links":{"cited_paper":"/paper/2007.01072","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:e78c0f89ebc2d010fb8187fcdfd186d9115d05b8d86b84058846b7093c40d8c0","observation_id":"dcc62d49-e406-4fbd-a5a5-86eb271e3aee","resolution":{"observed_at":"2026-08-15T17:46:28.261466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.265752Z","title":"Learning 3d semantic scene graphs from 3d indoor reconstructions","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.265752Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:f0887e0194f530c35daf8b5e0f7b365f7f5ca4ac699111ecee23f582e1f05bc2","observation_id":"321cced8-79c5-46c8-af7d-778c96ece3cc","resolution":{"observed_at":"2026-08-15T17:46:28.265752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.769197Z","title":"Learning semantic maps from natural language descriptions","venue":null,"work_id":"099510de-6c36-455f-860b-97353bb95829","year":2013},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.269692Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:91d1c4907d57196641cf354b7a9865e07c62e3e7f4c6ddabbe1dedf24745e8bf","observation_id":"c2c0b0c4-eb03-4e61-91c1-12c6f0a5970c","resolution":{"observed_at":"2026-08-15T17:46:28.773978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-15T17:46:28.273459Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.273459Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:47562ec86f37f62c5c105c92c889273e4cad37df35bc9512229927117e298a4c","observation_id":"7a560d01-9f50-4fd0-9e98-a3e2778cf7e3","resolution":{"observed_at":"2026-08-15T17:46:28.273459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-14T21:12:00.450049Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-15T17:46:28.277717Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.277717Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:9bd7f2042274283da73d68960763ce17674074cd52bdc94ee0da201ffcf8234e","observation_id":"189351b5-4cc7-498e-b7e1-e4079555bf4f","resolution":{"observed_at":"2026-08-15T17:46:28.277717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-17T08:25:34.071490Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-08-15T17:46:28.282024Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought.arXiv preprint arXiv:2501.07542, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.282024Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:275ba9b6a3f097f6f1f25b1cbd550944bce2ef973de982958e298de8cdd638b0","observation_id":"7863d53f-35bb-4280-817e-5b2c08add317","resolution":{"observed_at":"2026-08-15T17:46:28.282024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-08-16T12:59:16.590181Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-15T17:46:28.286350Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms.arXiv preprint arXiv:2501.06186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.286350Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:1e78e6547d0cbf398e6444faf49a5530dd00019de572d8accff3ced4f0899d74","observation_id":"a062d889-abe5-422c-94e7-72ab3453cb2f","resolution":{"observed_at":"2026-08-15T17:46:28.286350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.756409Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv e-prints, pages arXiv–2403, 2024","venue":null,"work_id":"a58f65fd-f9ca-4002-8759-187158aff310","year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.290597Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:965f5c71ccafad97b9361a97ee7d25eb1b5b4444ecedff75d0aaf17e6ba63447","observation_id":"d81247c2-0357-465e-9de4-3b592c3c7ec4","resolution":{"observed_at":"2026-08-15T17:46:28.760632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.294545Z","title":"Llava-cot: Let vision language models reason step-by-step, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.294545Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:9ecac26c23c0dd350f75ead69981fbb9a7e51a6baace33883a6179918e73fda0","observation_id":"84e91172-2b8c-49e1-999f-6a8e8e1064df","resolution":{"observed_at":"2026-08-15T17:46:28.294545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17425","last_updated":"2025-02-24T18:56:12Z","snapshot_observed_at":"2026-08-18T06:13:09.288674Z","submitted_at":"2025-02-24T18:56:12Z","title":"Introducing Visual Perception Token into Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17425","snapshot_observed_at":"2026-08-15T17:46:28.298491Z","title":"Introducing visual perception token into multi- modal large language model.arXiv preprint arXiv:2502.17425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.298491Z"},"links":{"cited_paper":"/paper/2502.17425","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:7c44bf3875420e3a617a61a559d3497a2c88909fa2bc7ee59a9edd88e2360f8f","observation_id":"4c9b82e6-839c-49f1-9544-ad7b2b8ada81","resolution":{"observed_at":"2026-08-15T17:46:28.298491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.735741Z","title":"Regiongpt: Towards region understanding vision language model","venue":null,"work_id":"a0cb5bb7-c918-46c9-b349-630af55d589e","year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.302881Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:05edac0ff46a3f6123c66f8c4c406e480af2f05ada386251fc734284418416e4","observation_id":"4eddae57-3463-4415-93d3-c60e004f968c","resolution":{"observed_at":"2026-08-15T17:46:28.739890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.306997Z","title":"Osprey: Pixel understanding with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.306997Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:cae0101977bf69360e30c1fef45779d1c3fb25e2708d948726b5f2045db13260","observation_id":"1466eacb-af93-4762-b77b-9c1a39e367c7","resolution":{"observed_at":"2026-08-15T17:46:28.306997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T17:46:28.311068Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.311068Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:fff4e6899fd3e58a29fd70acd419af9fd862d769ad8c83c1c165913591f606ee","observation_id":"6882f827-8468-4b93-b3d7-3d0f1219eade","resolution":{"observed_at":"2026-08-15T17:46:28.311068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:46:28.315715Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.315715Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:d35c776e2ba12dbcf2a4a58edbca8a4a727d4f6908ca43c6b9402a23b0631cbe","observation_id":"79d2ab21-4c76-47e1-81b8-161f199a2d23","resolution":{"observed_at":"2026-08-15T17:46:28.315715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.319857Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.319857Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:1100d4fce303d82613eb8bc68f2f457fb22c1ba2783785a1c4d999f83a3bcebd","observation_id":"45ffc4a0-b53b-430f-a3ae-8c4f201f4493","resolution":{"observed_at":"2026-08-15T17:46:28.319857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T17:46:28.323821Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.323821Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:3dfa200ed062c4caa7fae3170a53e9bde31e2ced104486c34f9472ef19aa970d","observation_id":"6cf28b03-1ef5-4798-9aff-99a59808d1f2","resolution":{"observed_at":"2026-08-15T17:46:28.323821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01261","last_updated":"2018-10-17T17:51:36Z","snapshot_observed_at":"2026-08-17T23:08:02.689731Z","submitted_at":"2018-06-04T17:58:18Z","title":"Relational inductive biases, deep learning, and graph networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01261","snapshot_observed_at":"2026-08-15T17:46:28.327569Z","title":"Relational inductive biases, deep learning, and graph networks.arXiv preprint arXiv:1806.01261, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.327569Z"},"links":{"cited_paper":"/paper/1806.01261","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:e77f6b9b70658ad289fa0aa98998ee798b81bc5ec64b4eee0cf0f550874eb996","observation_id":"c4708994-b8f1-43bd-8fb8-62b31a7d5867","resolution":{"observed_at":"2026-08-15T17:46:28.327569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.331770Z","title":"What’s “up” with vision-language models? investigating their struggle with spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.331770Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:d0511cea345baeb990c258f831c8614a25bffa660a7f158c8f9361a63f8189e1","observation_id":"79123037-c741-4491-9870-694884410744","resolution":{"observed_at":"2026-08-15T17:46:28.331770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-19T03:51:01.804369Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-15T17:46:28.335901Z","title":"Blink: Multimodal large language models can see but not perceive.arXiv preprint arXiv:2404.12390, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.335901Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:daf7c8b877068b45a2c124f7d3c04501c0d41eb36a767279722f0284e9c367a6","observation_id":"ded39013-a1bd-406f-b551-ef0bb18caf89","resolution":{"observed_at":"2026-08-15T17:46:28.335901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.698072Z","title":"Reasoning paths with reference objects elicit quantitative spatial reasoning in large vision-language models, 2024","venue":null,"work_id":"1ca8b98d-1080-4600-ae02-bfea3592c83d","year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.340169Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:6029a2fee3cd54dc92431940fc969bbbbe3ebeab658429853c65ce3aaca6f6ee","observation_id":"7d8fdc5b-c957-45c2-8d45-d219b6d34b5c","resolution":{"observed_at":"2026-08-15T17:46:28.703158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.344025Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.344025Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:ff65d7bb83f2aef8f126f8c172fd0e2eb6c7a4b82beaef401a24c78fc67df3c0","observation_id":"e97793f1-65ec-43b2-b073-5ae4f9502403","resolution":{"observed_at":"2026-08-15T17:46:28.344025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:46:28.674467Z","title":"Vqasynth, 2023","venue":null,"work_id":"bd029821-f2ee-4796-bcd6-bd3d1522e942","year":2023},"citing_paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:46:28.348279Z"},"links":{"citing_paper":"/paper/2507.20529"},"observation_digest":"sha256:affb7f573e6ac279d7dc918787991782b5d17b61891151d88f1b30b96bc96292","observation_id":"baa91c5d-606d-464f-893a-1a16ca412b6d","resolution":{"observed_at":"2026-08-15T17:46:28.679723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20529","last_updated":"2025-07-28T05:24:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T02:31:43.140009Z","submitted_at":"2025-07-28T05:24:54Z","title":"Enhancing Spatial Reasoning through Visual and Textual Thinking"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2507.20529."}