{"as_of":"2026-08-08T10:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe4c48fe68fdf3753bc3020d085a063a865851b044fc169123fa3fe830e86f38","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:54:48.162766Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:51:18.233043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:55:25.118073Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13362","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing spatial reasoning in vision-language models via chain-of-thought prompting and reinforcement learning","venue":null,"work_id":"59b66da2-a9ca-41c3-aa89-2359963af0ee","year":2025},"citing_paper":{"arxiv_id":"2511.00710","last_updated":"2026-04-13T19:25:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-01T21:19:41Z","title":"Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T00:59:29.584299Z"},"links":{"cited_paper":"/paper/2507.13362","citing_paper":"/paper/2511.00710"},"observation_digest":"sha256:68ff10846b12c25306391edd23afdecaac234d8e7b45173fdb5e49b049284044","observation_id":"205bf49e-2912-4f14-97fd-2c0ad26eddea","resolution":{"observed_at":"2026-05-18T01:00:34.244407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13362","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing spatial reasoning in vision-language models via chain-of-thought prompting and reinforcement learning","venue":null,"work_id":"59b66da2-a9ca-41c3-aa89-2359963af0ee","year":2025},"citing_paper":{"arxiv_id":"2605.18209","last_updated":"2026-05-18T10:54:55Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:54:55Z","title":"SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T11:06:29.022994Z"},"links":{"cited_paper":"/paper/2507.13362","citing_paper":"/paper/2605.18209"},"observation_digest":"sha256:04cae3411398a79c2985f772942d3f03904334f7c5683e51adb587735af67df9","observation_id":"8864a7cd-4258-41a7-8c93-e9db60e40cd3","resolution":{"observed_at":"2026-05-20T11:08:13.509580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13362","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing spatial reasoning in vision-language models via chain-of-thought prompting and reinforcement learning","venue":null,"work_id":"59b66da2-a9ca-41c3-aa89-2359963af0ee","year":2025},"citing_paper":{"arxiv_id":"2605.19859","last_updated":"2026-05-21T18:05:34Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:50:40Z","title":"Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T05:57:45.964145Z"},"links":{"cited_paper":"/paper/2507.13362","citing_paper":"/paper/2605.19859"},"observation_digest":"sha256:ea9eb5273c490c16c9a1535317e9687c61f9d07439966dccc4e5d72911a4ffdd","observation_id":"fafb401a-850a-41f4-a92c-12801b397889","resolution":{"observed_at":"2026-05-20T05:58:04.874738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13362","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13362","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing spatial reasoning in vision-language models via chain-of-thought prompting and reinforcement learning","venue":null,"work_id":"59b66da2-a9ca-41c3-aa89-2359963af0ee","year":2025},"citing_paper":{"arxiv_id":"2605.19859","last_updated":"2026-05-21T18:05:34Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:50:40Z","title":"Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:18.233043Z"},"links":{"cited_paper":"/paper/2507.13362","citing_paper":"/paper/2605.19859"},"observation_digest":"sha256:27bee3104203d19e9c303cc9329031b77a635fed296c8dd17f56da0731d11e5c","observation_id":"12a1fb11-346b-4f01-b440-4f0280f224b8","resolution":{"observed_at":"2026-05-25T05:55:25.121803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13362/citation-record","integrity":"/paper/2507.13362/integrity","json":"/paper/2507.13362/citation-record.json","paper":"/paper/2507.13362"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T19:54:48.058714Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.058714Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:edc049e765410b5f704e051f2ba1b75f5d501331ee4c62b0d3e6766f7abf47ea","observation_id":"026491a9-7bf9-4eb7-93f4-0d6ff127268f","resolution":{"observed_at":"2026-08-06T19:54:48.058714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00363","last_updated":"2023-03-22T15:42:50Z","snapshot_observed_at":"2026-08-07T10:33:25.603798Z","submitted_at":"2022-04-30T23:03:49Z","title":"Visual Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00363","snapshot_observed_at":"2026-08-06T19:54:48.062289Z","title":"Visual spatial reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.062289Z"},"links":{"cited_paper":"/paper/2205.00363","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:0dc5cf00889aac3f0121ba82b91bd375eb755de70ef6d11daf8f6d1477e64e85","observation_id":"660692e1-7f6f-4f16-a9a7-57b0b0c008ba","resolution":{"observed_at":"2026-08-06T19:54:48.062289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.065213Z","title":"Sat: Dynamic spatial aptitude training for multimodal language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.065213Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:413222a5f1ee5df7a1497ecd1900f1801c4ac43a4acab95078af6c523d100167","observation_id":"7237e9ee-d699-4820-a06a-8563f308b19f","resolution":{"observed_at":"2026-08-06T19:54:48.065213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T19:54:48.068292Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.068292Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:f84bfb305ac354aa675585360ebe6dc3aef983d9f0e7bbc57194a9bbc68cb9fb","observation_id":"2cede708-7895-4775-8ce0-f9e6f9ce8811","resolution":{"observed_at":"2026-08-06T19:54:48.068292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.610328Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning,","venue":null,"work_id":"b84a01da-c0cc-41ae-b3f3-cead35cc9db2","year":2017},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.071617Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:edc49eac6c0880ec0666a98ea80f82053e347d55b73f5b6b6e26058dcac81022","observation_id":"8b8cc7d2-446f-4491-bc6b-7dfa4da6239e","resolution":{"observed_at":"2026-08-06T19:54:48.613029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T19:54:48.074302Z","title":"Visual-rft: Visual reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.074302Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:3290cd68ec3b5d8195bd472883418eb1a626fcecf8ee7460d46f3fdfdf42fd0d","observation_id":"344944d5-44eb-4806-a839-9e0064ee6aed","resolution":{"observed_at":"2026-08-06T19:54:48.074302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T19:54:48.077400Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.077400Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:c63ee57847192f0b5e334d0ff33d9ca61a94ec713216cbb4b28c75047231d756","observation_id":"31ce173d-4c71-403f-8b5b-69c00dc94c58","resolution":{"observed_at":"2026-08-06T19:54:48.077400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.601162Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3,","venue":null,"work_id":"5fbe64b5-abf5-4f39-852b-39a2eae96de3","year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.079868Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:4c8ac28cb1ee54dc5859d29fb7a56811b32d4747953a6f23c40b01f14108142b","observation_id":"f0f284c0-8e9b-41f3-93a9-c12961eda8de","resolution":{"observed_at":"2026-08-06T19:54:48.604078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.593013Z","title":"Rlvr in vision language models: Findings, questions and directions,","venue":null,"work_id":"9a20a974-b13f-464e-a680-2252fba8b97c","year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.082191Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:6bb0f512db60f7cb011fb20dbf2fde31cee0209f55002e0a2cd5700e24ad052b","observation_id":"b5752c06-a821-4f2b-832b-c9732a089370","resolution":{"observed_at":"2026-08-06T19:54:48.595750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.585262Z","title":"R1-zero’s","venue":null,"work_id":"b481a765-a948-4b1e-8b1f-5c1227f6f560","year":null},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.084730Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:bbde7ff1a7ba0ba90ec6e8ce3443dcbf2425dde2ada58ae7650df5c0f178e4e5","observation_id":"93e83563-3570-4ed1-b0e7-64ee2a7f3db7","resolution":{"observed_at":"2026-08-06T19:54:48.587733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-06T19:54:48.090566Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.090566Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:d262e908d2315bf00e68e1ae2459e885d449e2d48894e3ef759e8352915b6c34","observation_id":"c9714968-8465-4d2e-960e-7030c0c7d297","resolution":{"observed_at":"2026-08-06T19:54:48.090566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.093206Z","title":"Think or not think: A study of explicit thinking in rule-based visual reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.093206Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:ebbbce3ed287e344f96738cf362a2866f10817fb5a66bee1c38bad4cdaff1daf","observation_id":"1aeb14d0-f97e-4d0c-b62a-c21146162283","resolution":{"observed_at":"2026-08-06T19:54:48.093206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T19:54:48.095753Z","title":"Video-r1: Reinforcing video reasoning in mllms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.095753Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:9758587a3a5ec161849d5b04aa041cfdfee1c737c4492c5cc0d5ae0c7ceda701","observation_id":"459ba278-8570-4a00-a6cf-778ca1f6a78e","resolution":{"observed_at":"2026-08-06T19:54:48.095753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.576097Z","title":"Spatial-r1: Enhancing mllms in video spatial reasoning,","venue":null,"work_id":"2ded617b-c027-4676-936f-2537c675c6df","year":null},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.098417Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:f782ea08efe786a79d2155684385279836ffa24e54fc04cd112246dd9ce80ca1","observation_id":"403e28e2-fd40-4f71-9f1f-50b839a7a5a1","resolution":{"observed_at":"2026-08-06T19:54:48.579259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-08-07T16:17:09.409469Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-06T19:54:48.103936Z","title":"Improved visual-spatial reasoning via r1-zero-like training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.103936Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:d6737522f9f762171d76962d441a2d3fc0b93e9e18d7a39a8a3ec3bbd5b954cf","observation_id":"d1911141-ba6d-45a0-9592-05121f0c56cf","resolution":{"observed_at":"2026-08-06T19:54:48.103936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-06T19:54:48.101125Z","title":"Available: https://arxiv.org/abs/2504.01805","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.101125Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:891dc9502ac12a3593177c1d08137868718da86c68adfe6854a0f53afc718fad","observation_id":"08e55a4f-c9fb-4548-899a-300f02ff56b2","resolution":{"observed_at":"2026-08-06T19:54:48.101125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17076","last_updated":"2024-04-01T03:17:09Z","snapshot_observed_at":"2026-07-06T16:53:58.875152Z","submitted_at":"2023-11-27T22:23:27Z","title":"Compositional Chain-of-Thought Prompting for Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17076","snapshot_observed_at":"2026-08-06T19:54:48.110228Z","title":"Compositional chain- of-thought prompting for large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.110228Z"},"links":{"cited_paper":"/paper/2311.17076","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:31c48bba42190335f7edb1fface6686d78eff86ede03eaafa701332ea5be7d1d","observation_id":"ef361559-baec-48aa-b250-31ffba03bdd6","resolution":{"observed_at":"2026-08-06T19:54:48.110228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T19:54:48.107118Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.107118Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:be9ad65c2f6ee096d3aec267486b261e3fbd352676e46166a23842ca0180075e","observation_id":"8bcc650d-7dcb-4299-bb70-9ff14e903ad3","resolution":{"observed_at":"2026-08-06T19:54:48.107118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03622","last_updated":"2024-10-23T07:20:26Z","snapshot_observed_at":"2026-08-01T23:41:06.358986Z","submitted_at":"2024-04-04T17:45:08Z","title":"Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03622","snapshot_observed_at":"2026-08-06T19:54:48.116134Z","title":"Mind’s eye of llms: Visualization-of-thought elicits spatial reasoning in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.116134Z"},"links":{"cited_paper":"/paper/2404.03622","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:4bf1cf932f2c402b2ca1daa4fca321cefc38b65c8baa2109d8edbfadfa1bbe47","observation_id":"5666202e-5beb-4160-8ff1-4c59f3288bbb","resolution":{"observed_at":"2026-08-06T19:54:48.116134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10074","last_updated":"2025-01-23T02:31:25Z","snapshot_observed_at":"2026-07-06T20:22:23.609336Z","submitted_at":"2025-01-17T09:46:27Z","title":"SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10074","snapshot_observed_at":"2026-08-06T19:54:48.113277Z","title":"Spatialcot: Advancing spatial reasoning through coordinate alignment and chain-of-thought for embodied task planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.113277Z"},"links":{"cited_paper":"/paper/2501.10074","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:ebab0239b58ad2075e288fed6a4c10308c15671da8a9544663a8475cf8c5786a","observation_id":"474139ab-99b5-46cc-801e-99b140d37b0b","resolution":{"observed_at":"2026-08-06T19:54:48.113277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:54:48.568421Z","title":"Clevr cogent valb,","venue":null,"work_id":"fbaa5533-4d12-4a6f-b0a8-1fc1888d9dad","year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.122022Z"},"links":{"citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:f5839bbe6d5432883cea668fd6714f761673f639d97bf4128b2fae9844390a4e","observation_id":"b4a23978-495e-42ab-a85a-5013e648f521","resolution":{"observed_at":"2026-08-06T19:54:48.571061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10276","last_updated":"2024-08-05T04:52:16Z","snapshot_observed_at":"2026-08-05T10:25:06.999919Z","submitted_at":"2023-05-17T15:07:50Z","title":"Chain-of-Symbol Prompting Elicits Planning in Large Langauge Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10276","snapshot_observed_at":"2026-08-06T19:54:48.118975Z","title":"Chain-of-symbol prompting elicits planning in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.118975Z"},"links":{"cited_paper":"/paper/2305.10276","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:4042ea51b876f8be4d862670700b7d405949855256fa3ab4bc1bccb044a62e92","observation_id":"a241cba3-ce08-431e-90ed-5525cdbb95cc","resolution":{"observed_at":"2026-08-06T19:54:48.118975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-06T19:54:48.127358Z","title":"Depth anything v2,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.127358Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:edaa3cfcadc37e5d02ea06ff7fbd17acd69c7ea64c5ba36b5c72201d9b6eb86a","observation_id":"7f53ab88-b6a3-4746-9d32-22d246d838f3","resolution":{"observed_at":"2026-08-06T19:54:48.127358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00259","last_updated":"2023-06-01T03:57:12Z","snapshot_observed_at":"2026-07-06T14:25:28.974939Z","submitted_at":"2022-12-01T03:53:24Z","title":"Super-CLEVR: A Virtual Benchmark to Diagnose Domain Robustness in Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00259","snapshot_observed_at":"2026-08-06T19:54:48.124661Z","title":"Super-clevr: A virtual benchmark to diagnose domain robustness in visual reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.124661Z"},"links":{"cited_paper":"/paper/2212.00259","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:48fad91f340998d02fd325d977716cf41f912713ec87d569b644f6cb1c6625a7","observation_id":"e63589c4-b6e1-4889-b392-73cd413e2956","resolution":{"observed_at":"2026-08-06T19:54:48.124661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12665","last_updated":"2024-01-29T10:57:38Z","snapshot_observed_at":"2026-08-06T08:13:54.199446Z","submitted_at":"2024-01-23T11:20:03Z","title":"ClipSAM: CLIP and SAM Collaboration for Zero-Shot Anomaly Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12665","snapshot_observed_at":"2026-08-06T19:54:48.132799Z","title":"Clipsam: Clip and sam collaboration for zero-shot anomaly segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.132799Z"},"links":{"cited_paper":"/paper/2401.12665","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:8fe4a8060ac2f3a82cb1020feafed735fbaaf9fac887aac89da44616c0ca90cf","observation_id":"6fe160ae-13f8-4435-baf3-d27e065c7463","resolution":{"observed_at":"2026-08-06T19:54:48.132799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T19:54:48.130017Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.130017Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:3db1f5cb57fe4d1bce24e9ae974914dd72a59d32786d54f373fb3b8b5263dde5","observation_id":"426118d5-58bd-4f7f-a067-ed12597e2dc4","resolution":{"observed_at":"2026-08-06T19:54:48.130017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T19:54:48.139134Z","title":"Dapo: An open-source llm reinforcement learning system at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.139134Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:09535d6f92c63d24db6de2c841f50fa3b697951dd2232a01956f494fe42c3c35","observation_id":"a27f093c-9609-49fb-8719-68d3b7ce78f9","resolution":{"observed_at":"2026-08-06T19:54:48.139134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-06T19:54:48.136009Z","title":"Paligemma 2: A family of versatile vlms for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.136009Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:c651e267138ce4fabe1037953d37340f26249c35119d6b9c9f61c2b6e99b234f","observation_id":"5b1b369b-9af6-4c77-bc28-85882706c23c","resolution":{"observed_at":"2026-08-06T19:54:48.136009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T19:54:48.144642Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.144642Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:eae4b0c2978fb72772056b1c7f5f418fa1d21a48e43168c144df8bdb9486153d","observation_id":"50ae8837-e520-4134-81e2-36491a27c56e","resolution":{"observed_at":"2026-08-06T19:54:48.144642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-06T19:54:48.142033Z","title":"Program of thoughts prompting: Disentangling computation from reasoning for numerical reasoning tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.142033Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:9573f532ea8ff9ca1bd4c7a9bb8360035df2d9cb8cd3594ddf17d108bc587956","observation_id":"fb0e9815-b80d-47f6-b11a-6cf7316cedc1","resolution":{"observed_at":"2026-08-06T19:54:48.142033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-06T19:54:48.150801Z","title":"Training large language models to reason in a continuous latent space,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.150801Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:9b2c2949fe3d4d820251a8aa658844c30c381311c00ff4f567fde469915ffe46","observation_id":"248d13b4-d54a-449a-91f8-49431fa02145","resolution":{"observed_at":"2026-08-06T19:54:48.150801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11089","last_updated":"2025-03-14T05:06:07Z","snapshot_observed_at":"2026-08-07T17:04:59.001128Z","submitted_at":"2025-03-14T05:06:07Z","title":"EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11089","snapshot_observed_at":"2026-08-06T19:54:48.147566Z","title":"Embodiedvsr: Dynamic scene graph-guided chain-of-thought reasoning for visual spatial tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.147566Z"},"links":{"cited_paper":"/paper/2503.11089","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:7c52bab128dae3e0954530d566a8bb257bfb79cf050b124557d1cf9123b13b91","observation_id":"25ecb92a-5ce5-4dd3-9db3-cc0770f60934","resolution":{"observed_at":"2026-08-06T19:54:48.147566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-05T18:02:56.273979Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-06T19:54:48.156627Z","title":"Spatialbot: Precise spatial understanding with vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.156627Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:ff100173833dcdff69dee98fb09a35d7180cc589209c396c6196d0ca279d28da","observation_id":"46a2075a-2a04-4750-af4a-544bd439c12c","resolution":{"observed_at":"2026-08-06T19:54:48.156627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-06T19:54:48.153646Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.153646Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:652cea5c905fbea532dc73d8d3428efa0876e16023ad54669e4f3f7fba5adff2","observation_id":"9faaa57f-7cfc-4f53-a10a-cf3e13efeb9a","resolution":{"observed_at":"2026-08-06T19:54:48.153646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-08T07:48:26.170625Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-06T19:54:48.162766Z","title":"Spatialvlm: Endowing vision- language models with spatial reasoning capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.162766Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:92419f56c4a0c43b22cd52b8207efadc978d38d4252e0d725d4d2996dba640d5","observation_id":"e7f85b5b-2a86-40c6-b069-8646390f3e0c","resolution":{"observed_at":"2026-08-06T19:54:48.162766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13438","last_updated":"2024-10-30T00:47:52Z","snapshot_observed_at":"2026-07-06T17:47:34.522070Z","submitted_at":"2024-03-18T17:38:29Z","title":"SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors","version":5},"cited_work":{"arxiv_id":"2403.13438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13438","snapshot_observed_at":"2026-08-06T19:54:48.199427Z","title":"SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors","venue":"cs.CV","work_id":"256988b5-a092-4652-8361-2c0a097dec81","year":2024},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.159895Z"},"links":{"cited_paper":"/paper/2403.13438","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:ca6c24fd798612ec667e95051b0bc13103ff4ff0151c322c9fd64ef79e0649c3","observation_id":"bd595542-d108-48c3-8ae1-71279158c07e","resolution":{"observed_at":"2026-08-06T19:54:48.204284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-06T19:54:48.087387Z","title":"Available: https://arxiv.org/abs/2503.05132","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:54:48.087387Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2507.13362"},"observation_digest":"sha256:960c8575a32e13b3d47f3b6ffdf77c56b9c5af933b9ab69efe0494284e19e4f2","observation_id":"d72bffca-7bf1-4666-bb7f-eb04a5452b88","resolution":{"observed_at":"2026-08-06T19:54:48.087387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13362","last_updated":"2025-07-06T10:51:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T08:07:57.477546Z","submitted_at":"2025-07-06T10:51:12Z","title":"Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 4 inbound Pith citation observations for arXiv:2507.13362."}