{"as_of":"2026-08-08T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3d617a1e36a628a52c7ceb337d65286e3aea4315c4a54097647c7e675714808","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:38:58.579422Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.19119/citation-record","integrity":"/paper/2511.19119/integrity","json":"/paper/2511.19119/citation-record.json","paper":"/paper/2511.19119"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.657295Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.657295Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:9a191a38e97fd2ddb5308d2f31597bbf2d92a0a89f4a5ad7ea1200f246a8fda9","observation_id":"6171e5a5-9779-4182-b1c1-21820f9db851","resolution":{"observed_at":"2026-08-03T20:38:54.657295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.706106Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.706106Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:ee1e1de556352fd3105e7f72529e751e95b211f9273e0a14a25e545419f183ad","observation_id":"94e10a9f-6b82-451b-a339-8de016a6fb1e","resolution":{"observed_at":"2026-08-03T20:38:54.706106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T20:38:54.781179Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.781179Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:b031c79a6a117a094e1cdd16f224a05a6d41693398d6f53f2da79fb3373c2f3e","observation_id":"12207c0e-8757-48fe-8568-fd461fa8b6be","resolution":{"observed_at":"2026-08-03T20:38:54.781179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-03T20:38:54.831472Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.831472Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:55fc4501cd99d8064b476e4f1105621322db295a5517b16510c3090be7809c52","observation_id":"710d92b2-ac15-4abf-bc0b-12b491aa1962","resolution":{"observed_at":"2026-08-03T20:38:54.831472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.864656Z","title":"Omni3d: A large benchmark and model for 3d object detection in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.864656Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:3ed5f9fd926e8aadac6ce43e8ed6692709a4398fb1e17ca86d7f774e3e47db66","observation_id":"0fd9d04f-37b2-42d8-a1e5-62fe5678f162","resolution":{"observed_at":"2026-08-03T20:38:54.864656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-05T18:02:56.273979Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-03T20:38:54.925300Z","title":"Spatialbot: Precise spatial understanding with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.925300Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:bd2e8c5c5b9d7c9d871a5da09b3add7a94c8a7523ec9966310790eef782ee099","observation_id":"89fc6ba7-bae3-419e-9de8-09a4738a8d4a","resolution":{"observed_at":"2026-08-03T20:38:54.925300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.954815Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.954815Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:6b422cfc6e382f61b20f51a76778866c2f3e5ce222cf87ac01795ce33cab51b3","observation_id":"1c086a39-011b-49a0-9149-adc2640e85c3","resolution":{"observed_at":"2026-08-03T20:38:54.954815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:54.974631Z","title":"Perception before reasoning: Two-stage reinforce- ment learning for visual reasoning in vision-language mod- els.arXiv preprint arXiv:2509.13031, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:54.974631Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:f64c34cb4f9cdb7e16fe48a4693aa9fdf3287c014ca5992af20fe4e60d9ace10","observation_id":"6c6b597c-a254-49e1-ab03-f7a18a027b21","resolution":{"observed_at":"2026-08-03T20:38:54.974631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.015330Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.015330Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:6bb0047c389cf61d8964220ebc9af3138a36d5c4821df8564186a7037b665748","observation_id":"a8942ee0-7dbf-45b9-ac42-d7d87e28b24f","resolution":{"observed_at":"2026-08-03T20:38:55.015330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.028226Z","title":"Collins, Ilia Sucholutsky, Umang Bhatt, Kartik Chandra, Lionel Wong, Mina Lee, Cedegao E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.028226Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:2ab9cd1274858ad0575b08536906e3ca13a69bd91f0faa5194e25d71a0014065","observation_id":"508972a0-ed4b-495d-ad5b-d2c5e2b04dab","resolution":{"observed_at":"2026-08-03T20:38:55.028226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T20:38:55.094974Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.094974Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:ed83dd44278e2b3fc56939a90dceb6515e44686588970601a06c8edb8de1717e","observation_id":"e73763e9-b8bb-4338-ad19-4d2eadd1c8f7","resolution":{"observed_at":"2026-08-03T20:38:55.094974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-03T20:38:55.151754Z","title":"Vlm-3r: Vision-language models aug- mented with instruction-aligned 3d reconstruction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.151754Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:e7e2ca733da5e288a0d50291b003f3ce225b84a3c49c3629b385ec2ef37e515a","observation_id":"72fc96a9-1852-4a86-a0bd-ed1dcd958dde","resolution":{"observed_at":"2026-08-03T20:38:55.151754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.184590Z","title":"Surds: Benchmarking spatial understand- ing and reasoning in driving scenarios with vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.184590Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:a5fc82bbc327ecb5acf9036df62f67515d1e4cb264b7e174ca962da15a54418a","observation_id":"eee8f01c-22c9-4336-b728-07c975bf8000","resolution":{"observed_at":"2026-08-03T20:38:55.184590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.239896Z","title":"3d-llm: Inject- ing the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.239896Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:80b3a37aa427c70954835643ef7501a81a48ff81c938c4efeae33186451c28e4","observation_id":"ab6ab7ac-37fd-4510-8642-cfb12d71f050","resolution":{"observed_at":"2026-08-03T20:38:55.239896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.287693Z","title":"What’s ”up” with vision-language models? investigating their strug- gle with spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.287693Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:271901b5f36ecca3ef6e892fe82c98695719872e1942e295482b5a96405b7b86","observation_id":"909bc398-84c5-4dd4-b423-b1ccc8b10f08","resolution":{"observed_at":"2026-08-03T20:38:55.287693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.318595Z","title":"Lee, Jihyeon Je, Chanho Park, Mikaela Angelina Uy, Leonidas Guibas, and Minhyuk Sung","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.318595Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:c39faf971a2f446c90164b6c09776cdb21d7fb39780de2d1cd31343b78993bbe","observation_id":"346095bd-61b2-48d3-81e5-e9db8400d8db","resolution":{"observed_at":"2026-08-03T20:38:55.318595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.361460Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.361460Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:64170402d7f9104e87c7657446e2ddb0ff1931e9d07fb723bee5d60dfd06abe6","observation_id":"532c478c-b7da-43c5-85d3-6ad7c014b912","resolution":{"observed_at":"2026-08-03T20:38:55.361460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T20:38:55.411826Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.411826Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:c2f8a34045d4fb9b3bc216537b8d2a93ec6ddf1c8e8408baa4b3acca41374f5a","observation_id":"cee1622d-630d-4358-9580-72b51b92f0c4","resolution":{"observed_at":"2026-08-03T20:38:55.411826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.448060Z","title":"Viewspatial-bench: Evaluating multi-perspective spatial localization in vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.448060Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:cb1bbce3b2dfa5481d3638797fd1ea02826def52d152e846f6fcd9657aa01cc1","observation_id":"95c1dadc-6fda-4c81-8d38-d9f20f4b0ee3","resolution":{"observed_at":"2026-08-03T20:38:55.448060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-03T20:38:55.503949Z","title":"Hoi, and Li Fei-Fei","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.503949Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:8eb654eaec190e9cff5fa17cd1eb8877de043ce1ca09ea53d18bc253561004a4","observation_id":"cd0f1fc6-39d2-4a64-b2c2-0c78d649dc57","resolution":{"observed_at":"2026-08-03T20:38:55.503949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.545210Z","title":"Spatialladder: Progressive train- ing for spatial reasoning in vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.545210Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:a3c07a439af23a0d4dd06ddfc6d2a2f39b32a46607f58e8457ca0123c302f694","observation_id":"8761fb1f-1515-494e-9010-dd67e17c3095","resolution":{"observed_at":"2026-08-03T20:38:55.545210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.596804Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.596804Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:e3279728d797d9ff524bd3c6839593167fe2773a66ca2cafd7161bf6e9fc7375","observation_id":"f54e9786-4ca9-4ced-b037-d896d0b231c2","resolution":{"observed_at":"2026-08-03T20:38:55.596804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.643951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.643951Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:8550420aa00445a7d5d849230f443004f2c4945160bb6e85c30020aa3d778f30","observation_id":"a2d028f0-fe31-4c10-8379-6933e4834c96","resolution":{"observed_at":"2026-08-03T20:38:55.643951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02684","last_updated":"2023-06-05T08:20:37Z","snapshot_observed_at":"2026-08-07T16:19:00.009101Z","submitted_at":"2023-06-05T08:20:37Z","title":"A Novel Multi-Agent Deep RL Approach for Traffic Signal Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02684","snapshot_observed_at":"2026-08-03T20:38:55.718590Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.718590Z"},"links":{"cited_paper":"/paper/2306.02684","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:3f87d00d7ead93f86acf7d1597d93d6436f34bdb3649bc1f6f8c190002567079","observation_id":"65d6b3ed-76fc-44a4-bc01-4fb57d4847a8","resolution":{"observed_at":"2026-08-03T20:38:55.718590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.770035Z","title":"Visual spa- tial reasoning.Transactions of the Association for Computa- tional Linguistics, 11:635–651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.770035Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:84ec595daa90dcf049c0e231bcf60ec4f71cb6aa86898aafa4fefb5b5dfb72c7","observation_id":"7def5476-984c-4f25-ab84-09af786d2853","resolution":{"observed_at":"2026-08-03T20:38:55.770035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.855026Z","title":"Grounding dino: Mar- rying dino with grounded pre-training for open-set object 10 detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.855026Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:5ea292d70f837aa97665943fceb7aa21db2584a205100f48183048dd6567274d","observation_id":"e9a6c7f1-deac-4565-833b-e8f48d1b5405","resolution":{"observed_at":"2026-08-03T20:38:55.855026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.901480Z","title":"3dsrbench: A compre- hensive 3d spatial reasoning benchmark.arXiv preprint arXiv:2412.07825, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.901480Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:cda01c4a91f561de333fdc7cf0f09d3c9168356f985d5154190afb6bd184a345","observation_id":"06e758fc-b272-4fee-b172-b22316866e94","resolution":{"observed_at":"2026-08-03T20:38:55.901480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:55.967821Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:55.967821Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:18dcb011782c2108f878c7c15a0e55ef284099d3be252ff44066e95f918623ea","observation_id":"809fd4d9-e63b-4352-8c61-e370e45e891c","resolution":{"observed_at":"2026-08-03T20:38:55.967821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.020436Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.020436Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:1d8a86b422a8bfa9d1ce5a66581557b60d19a05d89b2635b04952ac86c303f64","observation_id":"f5c72476-ad3f-498d-b895-80649dd2dc72","resolution":{"observed_at":"2026-08-03T20:38:56.020436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T20:38:56.091709Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.091709Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:bd2e22f7409f04fbb1e7dd2d1915b790b14a36c909ece27908026199f5fed61e","observation_id":"21436383-2142-4cfc-a7ad-c80fe38dfc3b","resolution":{"observed_at":"2026-08-03T20:38:56.091709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.095771Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.095771Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:9c05d7a94c11957de9d18ee66ec7c9ac432d059b05737dd65e5472d77de94eda","observation_id":"d48f1012-52dd-4854-80a4-4ad5e0383e39","resolution":{"observed_at":"2026-08-03T20:38:56.095771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.102240Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.102240Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d9f531959d4418792616c8cbcffbb7816f1600eb8fb5fbfc04b858dec3c27c77","observation_id":"50e00068-8775-49a4-9a94-2dbaf0723a35","resolution":{"observed_at":"2026-08-03T20:38:56.102240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T20:38:56.157395Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.157395Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:801d7c7bd8f4af6c6b7b4fccfee1cc4c5abcd1a6db8cfc8274a09aa9b42b0458","observation_id":"1e11018a-2d3c-4ed3-8394-c1f711d24bc9","resolution":{"observed_at":"2026-08-03T20:38:56.157395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.248164Z","title":"Space3D-Bench: Spatial 3D Question Answering Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.248164Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:2b270a47e43351663984b74db7e0deab8b0d177021de4e33c254c6f635fff7c8","observation_id":"ec6506ca-7cad-48d3-9bda-080642b9689e","resolution":{"observed_at":"2026-08-03T20:38:56.248164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T20:38:56.274268Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.274268Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:7ca95451e8e3ee25835b0ef7d824e33efa84c00afb6a32f4102dc75c850c1408","observation_id":"b37d4bd3-ca58-4b9d-8dc0-095031994996","resolution":{"observed_at":"2026-08-03T20:38:56.274268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03164","last_updated":"2025-04-07T03:39:02Z","snapshot_observed_at":"2026-08-07T16:09:54.936463Z","submitted_at":"2025-04-04T04:43:10Z","title":"NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03164","snapshot_observed_at":"2026-08-03T20:38:56.380114Z","title":"Nuscenes-spatialqa: A spatial understanding and reasoning benchmark for vision- language models in autonomous driving.arXiv preprint arXiv:2504.03164, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.380114Z"},"links":{"cited_paper":"/paper/2504.03164","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:e9325f0dbd01daf12f5457a563c42844853e73e700cc032e51e8242cf94cb034","observation_id":"0ed634ff-f6e0-4037-8e01-a0acee736260","resolution":{"observed_at":"2026-08-03T20:38:56.380114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T20:38:56.472453Z","title":"Llama: Open and efficient foundation lan- guage models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.472453Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:60f0d2b07bc9766352e50f9e612d28286e2f851a819410c49bc79d0e7bf83e39","observation_id":"e059e4b6-49a5-44ef-bc97-727183fc8bdf","resolution":{"observed_at":"2026-08-03T20:38:56.472453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.591800Z","title":"Cross-modal pro- jection in multimodal llms doesn’t really project visual at- tributes to textual space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.591800Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:b6bd05cd79e75465b455bdbfe684caff8532601d4cec5096d78cf619161094f4","observation_id":"df08ed63-aad8-4ade-8dee-f858468399a6","resolution":{"observed_at":"2026-08-03T20:38:56.591800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.673894Z","title":"Learning 3d semantic scene graphs from 3d indoor reconstructions","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.673894Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:564e1b93128d0d5f5d95733d4196bc8f8e7a5ab41e8d85319513b55148eabf99","observation_id":"2e583bfd-8301-48ac-8aa6-092681b606bb","resolution":{"observed_at":"2026-08-03T20:38:56.673894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.735634Z","title":"Is a picture worth a thou- sand words? delving into spatial reasoning for vision lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.735634Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d35e10cf9d0dedf019163b88d55083126467876d2d2a0af61954b6a39ecf56d5","observation_id":"a4a5cb51-d025-44e9-b5f3-a00c59a9361b","resolution":{"observed_at":"2026-08-03T20:38:56.735634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.777803Z","title":"Spatial 3d-llm: Exploring spatial awareness in 3d vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.777803Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:2e094d684770dbc669f9d6b521113249127c15512a15f779440e9b369ab80fc4","observation_id":"7acbe468-8842-49d1-99d4-ca4dfe6618ae","resolution":{"observed_at":"2026-08-03T20:38:56.777803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-08-03T20:38:56.844553Z","title":"Spatial-mllm: Boosting mllm capabilities in visual-based spatial intelligence.arXiv preprint arXiv:2505.23747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.844553Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:e1476c74f5319f36189963389a9ffc6dea0544a6adec1174e911546e8341e6ae","observation_id":"04f4922f-24b2-44f6-bfe3-9389f52a9375","resolution":{"observed_at":"2026-08-03T20:38:56.844553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.910137Z","title":"Pointllm: Empowering large lan- guage models to understand point clouds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.910137Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:ae82144abc058d6617c5e3cfd34681f25cb1ef3cfc5c011d4fce76e4cdb7aa79","observation_id":"0373d929-38c4-4c28-a8b6-d3554f1e5416","resolution":{"observed_at":"2026-08-03T20:38:56.910137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:56.976381Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:56.976381Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:645c5e0c49463782bfa5e3aad1d78c8d6c23fc261cfd8d285be73d3aa1497fda","observation_id":"45090bbc-c81e-4083-83e5-efdd44782115","resolution":{"observed_at":"2026-08-03T20:38:56.976381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.124463Z","title":"Open-vocabulary object detection using cap- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.124463Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:a0d5cb1fa651644118012b65bcc7e4808e9c55ce07fd5d2065ab7e6d8b2893d6","observation_id":"4ec212f5-83fa-4cbb-89f0-582422b9b7eb","resolution":{"observed_at":"2026-08-03T20:38:57.124463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.258520Z","title":"How to enable llm with 3d capacity? a survey of spatial reasoning in llm, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.258520Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:dfaa9831055cff36f737660945c1df5401e230c737dda2d4666e099d56584044","observation_id":"09b0e65d-2a0c-49e7-8238-0a0cd844b2c7","resolution":{"observed_at":"2026-08-03T20:38:57.258520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.314772Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.314772Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:719799b019216b8fb98c674a11cea3a767163ffbb7b6f67e995b05a957f1bab3","observation_id":"1d04de49-7abf-40cc-ad8c-ccefd429fd3c","resolution":{"observed_at":"2026-08-03T20:38:57.314772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.422175Z","title":"Spinbench: Perspective and rotation as a lens on spatial reasoning in vlms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.422175Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:611b4551b4b75b103532faf9afd63c58dc3c9777beb07fb4fef59bd71ccd2f4f","observation_id":"904bbdd2-6d8e-42bc-9365-6868345a91a9","resolution":{"observed_at":"2026-08-03T20:38:57.422175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.553330Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.553330Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d457de35222797784ead7af23afcca6985dc923da424e99ab2edf7d0655ffe08","observation_id":"2a6ba5e5-489d-4e13-b4e2-6678b7a104cf","resolution":{"observed_at":"2026-08-03T20:38:57.553330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.596020Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.596020Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:65bc1a6af62165d02edb3a5d472e6389165467b40b84940cf64baacd4756bf31","observation_id":"b94a55ac-cab6-4579-8625-16871717526a","resolution":{"observed_at":"2026-08-03T20:38:57.596020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T20:38:57.652883Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.652883Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:c95454dd06cf003e5e9cb5fc6093a11e1526cd934b6596c8dbb3db6b3cbcd383","observation_id":"f65d7cbe-43bc-4dbc-a2d9-6e2a7126a51f","resolution":{"observed_at":"2026-08-03T20:38:57.652883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.761326Z","title":"A detailed description of each level and its cor- responding tasks is provided below","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.761326Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:ece7877b2160afac46b5ec4d2f48e06610409ef19e3debf832f0323a5c3946a6","observation_id":"9d293d6a-d7db-4986-a1e2-6b7bd44fcead","resolution":{"observed_at":"2026-08-03T20:38:57.761326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.853194Z","title":"Specifically, after obtaining high-quality raw data through filtering, we generate image captions and construct scene graphs to serve as our underlying database","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.853194Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:d1a1bd448e6fdd67ddd02d6fc26b0135ab05bdac6af75396f3a00ecc39866f72","observation_id":"ff698a18-5d01-4deb-9db5-359f450867ae","resolution":{"observed_at":"2026-08-03T20:38:57.853194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.909081Z","title":"- {variation_instruction} - The rewritten question MUST include: (a) A brief motivation clause describing WHY we need this information, consistent with the motivation hint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.909081Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:4a25dee462f902ca0509938878f50969d91da594a23ead2c0a2bcc50c7e519ed","observation_id":"f1e64af2-c666-458b-a4b7-1e450b6963cc","resolution":{"observed_at":"2026-08-03T20:38:57.909081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:57.975775Z","title":"- {answer_constraint} - {task_extra} - You MUST NOT flip yesno","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:57.975775Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:f78e68e3b70a958a3a9429583f14f981fd26800a1f0b2c0d5acabeabff2d685f","observation_id":"591aa810-2306-491a-b5ac-fbdda1f876b0","resolution":{"observed_at":"2026-08-03T20:38:57.975775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.030558Z","title":"thinking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.030558Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:b145edc0ce28329d6bbbdd89e79df9c857c5e3d6c6ae1171d5e6247b0d041d8f","observation_id":"39a5c178-0457-4ead-b97f-b774b381fd20","resolution":{"observed_at":"2026-08-03T20:38:58.030558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.090253Z","title":"Scene In- formation adds global context, 2D Visual Prompts improve local grounding, and 3D Bounding Boxes deliver the largest gains through explicit geometric structure","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.090253Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:5ca095b9f74137103a9cf40f2d9d59bfb203c79d4734d63e1f94b837198708d1","observation_id":"7ab6194a-8858-4083-bc70-cf1d59d2870e","resolution":{"observed_at":"2026-08-03T20:38:58.090253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.171986Z","title":"For the 3D bounding box information, each object is rep- resented by its center coordinates, spatial dimensions (size), and orientation expressed as a rotation quaternion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.171986Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:7ba9d3746d1eab498aea829c25c854dcc889c2500acada66e47ac2cba349a27a","observation_id":"b027e5a3-9197-4b17-93b2-27c3c38441ef","resolution":{"observed_at":"2026-08-03T20:38:58.171986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.262429Z","title":"All inputs are processed with the officialQwen2.5-VLprocessor, which supports dy- namic image resolutions up to 262,144 pixels (512×512)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.262429Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:64ce6b28a92a7f58cb9f45ce0bb8a7eef09c385c5edd53b62f81c1ee5d5399bc","observation_id":"d6e8e8b5-5ad3-4d78-8169-69fca60a2b03","resolution":{"observed_at":"2026-08-03T20:38:58.262429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.358583Z","title":"- Use the format <obj>...</obj> to describe your mapping between textual entities and object IDs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.358583Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:40ac8b7bb74b04bf06a88c68c492ed6e1c9cfae667290fcfa686df05802db978","observation_id":"41a9de49-fc95-4dfc-8e96-9391fe0f4693","resolution":{"observed_at":"2026-08-03T20:38:58.358583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.429529Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.429529Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:cfb682fefd2dba348ed500213dfa38ad4a6f1889cb4dfc6f482deb427c0f81f5","observation_id":"bb5c9776-80e7-4524-8b8f-cb623da6ca9e","resolution":{"observed_at":"2026-08-03T20:38:58.429529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:38:58.579422Z","title":"Your output format should strictly follow: <obj> Object mapping: - entity_1 object {id_a} ({caption_a}) - entity_2 object {id_b} </obj> <reasoning>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T20:38:58.579422Z"},"links":{"citing_paper":"/paper/2511.19119"},"observation_digest":"sha256:4a9518f89e3a8a54b33d6596ea8bf14b5ff4b2be43bad597ce9b7795a34267af","observation_id":"5a1117f2-1d56-48f4-9935-77abe67ff869","resolution":{"observed_at":"2026-08-03T20:38:58.579422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.19119","last_updated":"2026-06-28T11:41:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T00:45:17.067470Z","submitted_at":"2025-11-24T13:49:17Z","title":"MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2511.19119."}