{"as_of":"2026-08-13T01:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:878aee1291cd18d5190e6926276b1adc579e32ef4b63177c1ee2d0a5e1e9fe97","coverage":[{"denominator":293,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:38:02.089230Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.00465/citation-record","integrity":"/paper/2509.00465/integrity","json":"/paper/2509.00465/citation-record.json","paper":"/paper/2509.00465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:53.380934Z","title":"The double sphere camera model,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:53.380934Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:1a6899c0c9b930ddca89b63b407654edcc55441f57a2b4567b8e0eb80d5b1e64","observation_id":"4cdc07b7-0a17-4fdc-bcb9-d79cb27484b5","resolution":{"observed_at":"2026-08-05T13:37:53.380934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:53.441621Z","title":"Visual- inertial mapping with non-linear factor recovery,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:53.441621Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:f462e298971c61d31a2e938070b085ef5376659108c41c12f4f12a6e3837662a","observation_id":"1eed72b7-2ef9-465a-9e15-fb516696a805","resolution":{"observed_at":"2026-08-05T13:37:53.441621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:53.515249Z","title":"The EuRoC micro aerial vehicle datasets,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:53.515249Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:71691754d82bb4ef267b99738f41eccde69689118d5e6a1250c5395574dc886c","observation_id":"d92bcc1e-b615-44d1-b442-3d8115b21a5f","resolution":{"observed_at":"2026-08-05T13:37:53.515249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:53.592344Z","title":"Depth from videos in the wild: Unsupervised monocular depth learning from unknown cameras,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:53.592344Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:a350757cbfafd8491a7be0d0f2f42290109324fefdb0e68d2918489e8a0a1610","observation_id":"be87fa4e-e8e8-405d-8d1c-1413ecf9680c","resolution":{"observed_at":"2026-08-05T13:37:53.592344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:53.736769Z","title":"PointGroup: Dual-set point grouping for 3D instance segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:53.736769Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:dab790ac447a4cfc0fa61d585a4c40571df727974bcd3819bc4ad3e2ef598e03","observation_id":"f7003379-837a-4adf-b410-fc23fc8ec9e3","resolution":{"observed_at":"2026-08-05T13:37:53.736769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:53.806140Z","title":"Mask3D: Mask transformer for 3D semantic instance segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:53.806140Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:8d222dffa991aef7229d8dd66f0a3ff3466ef6e1060d208c64611ed9f011c093","observation_id":"48df745a-15bd-4e7b-8d78-0b41d49c0a27","resolution":{"observed_at":"2026-08-05T13:37:53.806140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:53.905014Z","title":"What’s “up","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:53.905014Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:029baccba8b4398c5e1544bd5b24e7a9781834edd97f27a0a06e0cd6053f7199","observation_id":"8dccb1aa-f4b6-45bb-b8b1-26d1c364c6e2","resolution":{"observed_at":"2026-08-05T13:37:53.905014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:53.974619Z","title":"Spa- tialvlm: Endowing vision-language models with spatial reasoning capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:53.974619Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:2b9903ba92146c75e288ce64dd7d70537f1e2120d80397528cf19b68992826cf","observation_id":"90fcba9a-6fe8-4ac9-a425-e0244886c8ea","resolution":{"observed_at":"2026-08-05T13:37:53.974619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.029262Z","title":"Spatialrgpt: Grounded spatial reasoning for vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.029262Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:852bbdfed4759ed01ad42cb0c998f6c4f4ffa3c329f162214003b8f27fa3d3ee","observation_id":"c4e33feb-2483-416b-a862-1aa130dc3c84","resolution":{"observed_at":"2026-08-05T13:37:54.029262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.081750Z","title":"PointNet++: Deep hierarchical feature learning on point sets in a metric space,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.081750Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:631d00961110b08815eebbfdeab28aabef8e836cb5335fa1d41b96e0c63b46a1","observation_id":"a69eb068-8257-4961-815c-33f7ef8742ad","resolution":{"observed_at":"2026-08-05T13:37:54.081750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.128838Z","title":"KinectFusion: Real-time dense surface mapping and tracking,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.128838Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:5c4a63cbc09e6cb8a61979e73706250f778d1eba36e17e1bc3983f3df9cc81ea","observation_id":"a24f0abc-70b7-4d9e-aafa-7bc4d4864bdb","resolution":{"observed_at":"2026-08-05T13:37:54.128838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.203328Z","title":"Octomap: An efficient probabilistic 3d mapping framework based on octrees,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.203328Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:e54b1d9e54e4be44d76bf93e17589b9f7952af5556de65fe5f1acf17d38f354c","observation_id":"639d913b-0e83-4797-872b-dadd336c8014","resolution":{"observed_at":"2026-08-05T13:37:54.203328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.367466Z","title":"Dtam: Dense track- ing and mapping in real-time,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.367466Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:8b4fd12738738fa0de708d430908538a13e92999cdba6f94fb83e45f20f51cdc","observation_id":"fde67171-eaaf-49a1-ad78-8515fd7b1384","resolution":{"observed_at":"2026-08-05T13:37:54.367466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.477124Z","title":"PWC-Net: CNNs for optical flow using pyramid, warping, and cost volume,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.477124Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:90bb442ea2127c132ff8fa5961f55b49f90b0b261d33dac60097ace403630a20","observation_id":"8458e893-8483-4132-a94c-b788dae22774","resolution":{"observed_at":"2026-08-05T13:37:54.477124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.633048Z","title":"Digging into self- supervised monocular depth prediction,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.633048Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:1f82426d07957be0d424cabab5c37b5b0e52b95e429cfd5cf0724cfc7ed108fa","observation_id":"1490883a-db82-4270-bf7f-bad12b337165","resolution":{"observed_at":"2026-08-05T13:37:54.633048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.744281Z","title":"Depth field networks for generalizable multi-view scene representation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.744281Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:de3243212ef5455b01a5c630849624a13bf58ffa06449d6e124de6c286b0103e","observation_id":"153d3730-7d08-4e36-88f7-6d12f9cdb179","resolution":{"observed_at":"2026-08-05T13:37:54.744281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03243","last_updated":"2022-03-19T04:32:17Z","snapshot_observed_at":"2026-08-06T03:54:04.689431Z","submitted_at":"2021-12-06T18:49:52Z","title":"Input-level Inductive Biases for 3D Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03243","snapshot_observed_at":"2026-08-05T13:37:54.876555Z","title":"Input- level inductive biases for 3D reconstruction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.876555Z"},"links":{"cited_paper":"/paper/2112.03243","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:891b1acfafa98567c919a12facb48313da970cf4b055e1844ab7c715fbd07abb","observation_id":"a502ec19-979d-45d8-b500-235da097889c","resolution":{"observed_at":"2026-08-05T13:37:54.876555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:54.955619Z","title":"Delira: Self-supervised depth, light, and radiance fields,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:54.955619Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:d7b9fcd8470668b7a8d749e073e50bcd6f60729d5e6f92e2138dc59f78bb7080","observation_id":"9b3ebafc-6303-415e-9fb0-9ad750e95f94","resolution":{"observed_at":"2026-08-05T13:37:54.955619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.009437Z","title":"Vggt: Visual geometry grounded transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.009437Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:18ddfc56f2db8d6021040928cac6d4101a5cf4dcc3d2f228c2c0d51ff641586b","observation_id":"db6182a6-dcc3-4c59-88f9-08727acb86f8","resolution":{"observed_at":"2026-08-05T13:37:55.009437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.058673Z","title":"NeRF: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.058673Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:10db3a9eb6581fc635f24b4caab07a087d8d818316f9e5a9c7d3aa70a2d2977a","observation_id":"98f78c3f-ecbd-4451-9c00-26d6b209203e","resolution":{"observed_at":"2026-08-05T13:37:55.058673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.108812Z","title":"Nerfuser: Large-scale scene repre- sentation by nerf fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.108812Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:6320651503cf95309ef7d33f5aa98708018c36bbb92970f206bf8a8dfaa7ea31","observation_id":"a2fb5d81-08fd-4ea1-b3d6-f226c1a0b0e7","resolution":{"observed_at":"2026-08-05T13:37:55.108812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.205425Z","title":"Di-nerf: Distributed nerf for collabora- tive learning with relative pose refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.205425Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:463c9c70a3e88bd3def89c40ee803eb8e3c723a6bb1703f43326a3a924447288","observation_id":"2758cf5c-903f-4105-a5cc-140127dbf71e","resolution":{"observed_at":"2026-08-05T13:37:55.205425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19221","last_updated":"2024-04-30T02:48:20Z","snapshot_observed_at":"2026-08-13T00:18:57.507453Z","submitted_at":"2024-04-30T02:48:20Z","title":"Transcrib3D: 3D Referring Expression Resolution through Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19221","snapshot_observed_at":"2026-08-05T13:37:55.320291Z","title":"Transcrib3d: 3d referring expression resolution through large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.320291Z"},"links":{"cited_paper":"/paper/2404.19221","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:5a6fd10a3d599b4e58578ffb5df9d217634ba60f1fc0262753cf7903b72bea73","observation_id":"c1179bcc-1f72-4a7f-9aa2-8101f1237013","resolution":{"observed_at":"2026-08-05T13:37:55.320291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.386975Z","title":"Perceiving layout and knowing distances: The integration, relative potency, and contextual use of different information about depth,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.386975Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:fb2ae8e3489cd4fe371e343528fd71609d7496e3119d67b5101ff7c4441ded09","observation_id":"987baaca-d822-4d66-8601-a898c3124260","resolution":{"observed_at":"2026-08-05T13:37:55.386975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19913","last_updated":"2024-08-08T06:38:31Z","snapshot_observed_at":"2026-08-13T00:42:32.086767Z","submitted_at":"2024-03-29T01:53:24Z","title":"MANGO: A Benchmark for Evaluating Mapping and Navigation Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19913","snapshot_observed_at":"2026-08-05T13:37:55.558672Z","title":"Mango: A benchmark for evaluating mapping and navigation abilities of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.558672Z"},"links":{"cited_paper":"/paper/2403.19913","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:4698324ffa0444fc2c3f9b706858f267a3df713bf9d3c520c3a6863384c29d33","observation_id":"1e973786-0611-4dfb-a4ec-d6a22f80217c","resolution":{"observed_at":"2026-08-05T13:37:55.558672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.619120Z","title":"Do as I can, 117 not as I say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.619120Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:4f4c133721fbe63ddff043a2d694fdc84513cca4166f86301262f348c94b86ad","observation_id":"7a6be526-3fc2-4872-b31e-e10f5b574401","resolution":{"observed_at":"2026-08-05T13:37:55.619120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.763289Z","title":"Self-supervised camera self-calibration from video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.763289Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:e8ac577ad51cab9efc5f815a633da952f6c80c4dcc0929c8335681b31e009d3d","observation_id":"4202426b-fc7f-43c0-bbe9-ea94df3d0b97","resolution":{"observed_at":"2026-08-05T13:37:55.763289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.864521Z","title":"Structure-from-motion revisited,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.864521Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:746bae473db06b8f3cb073683814f6b5f56b0028f1ab3980802ab903c0b31de4","observation_id":"4a4a6ae5-4331-4f77-b25c-ca5b8da79a65","resolution":{"observed_at":"2026-08-05T13:37:55.864521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:55.963476Z","title":"Pixelwise view selection for unstructured multi-view stereo,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:55.963476Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:880815f1ae483375113552536d37e1d9980d0521e9184af3d88a5d222b2746f5","observation_id":"73319e5c-7587-43e6-b509-0d8847fc1921","resolution":{"observed_at":"2026-08-05T13:37:55.963476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.021193Z","title":"Orb-slam: a versatile and accurate monocular slam system,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.021193Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:d5f89f00a7875aeccf5be01cb7a24320bf346ffeccfd918bee0a339e3996343e","observation_id":"a726d495-6c0d-4504-9a09-dafa84671492","resolution":{"observed_at":"2026-08-05T13:37:56.021193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.050821Z","title":"NeRF: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.050821Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:22a6ddcc246a157be9c25d6d835c56a5bbad11b886cafcb702257c49bc2f8724","observation_id":"d63bc114-2d46-4d69-995e-d1ea239aef5e","resolution":{"observed_at":"2026-08-05T13:37:56.050821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.143615Z","title":"Implicit neural representations with periodic activation functions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.143615Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:544efdf6d57774288078f58e6b037471f25da6964635c05bb23291c80cb7e843","observation_id":"3e0d3a80-63d2-4cb7-94d3-15a86f271b5f","resolution":{"observed_at":"2026-08-05T13:37:56.143615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.218105Z","title":"A flexible new technique for camera calibration,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.218105Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:82a2b7e88b2dc69fe699a5fef3fb18a74c05ba53cfc061784f5fc26e1e2c5e52","observation_id":"48f1d406-43c2-49e0-b854-e6d344c54794","resolution":{"observed_at":"2026-08-05T13:37:56.218105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.267072Z","title":"A flexible technique for accurate omnidirectional camera calibration and structure from motion,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.267072Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:3e09007717130615abc8889ee2c9fbcc8393e6de1c64d63b4951eb5cd6b9621c","observation_id":"74e6c17f-fc3f-4042-b336-97fa730070ad","resolution":{"observed_at":"2026-08-05T13:37:56.267072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.340421Z","title":"A generic camera model and calibration method for conventional, wide-angle, and fish-eye lenses,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.340421Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:74672506d8441c619196fe2a8ff67bd156a08dc2f56925dfe13d2074e244f5d4","observation_id":"394c348c-a2b9-4976-9fb0-b363d612e7f4","resolution":{"observed_at":"2026-08-05T13:37:56.340421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.392051Z","title":"A general imaging model and a method for finding its parameters,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.392051Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:4ce9e1def3ae1358c558b5a1fe40d4a45d239ec7cc21dc1dd0d856c82dc1e077","observation_id":"feb00321-110d-489c-b53b-1c950ba467f2","resolution":{"observed_at":"2026-08-05T13:37:56.392051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.460814Z","title":"Using vanishing points for camera calibration,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.460814Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:e7141b1f5e70c672ae1caa36bdff275d4809d3c1d38c76088121f8e908449444","observation_id":"fbe1415f-f90e-40ae-b313-87526d9c3946","resolution":{"observed_at":"2026-08-05T13:37:56.460814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.564339Z","title":"A stratified approach to metric self-calibration,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.564339Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:acddd1ac780cbf975a07a3b8eb3ade2f2122eb7e68952af8b49f13e7545f4c5d","observation_id":"931fd8dc-34d4-47c4-8d7d-e556d1b6612f","resolution":{"observed_at":"2026-08-05T13:37:56.564339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.627318Z","title":"Camera calibration from vanishing points in image of architectural scenes,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.627318Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:74806e9f3696d191e07d5a5004071569c501b998a5e98f2563ac5e09b46d01d8","observation_id":"674a0b23-0aa1-49cb-ac17-635eb2fdd8b3","resolution":{"observed_at":"2026-08-05T13:37:56.627318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.683174Z","title":"DeepCalib: A deep learning approach for automatic intrinsic calibration of wide field-of-view cameras,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.683174Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:c706b078b9517e5fce1bb06a9656ef8ea873a4b1e80f286f3804bc12258e01fe","observation_id":"4ecb20c5-9a61-4d0e-add7-8ea28a7454c7","resolution":{"observed_at":"2026-08-05T13:37:56.683174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.768758Z","title":"Unsupervised CNN for single view depth estimation: Geometry to the rescue,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.768758Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:fc83851993ebf2fee0ab772700c7df0699919a07f6a9aee4e32eeaeacdfdba50","observation_id":"9ccd42d6-df31-41d8-b10f-252b343cf4f0","resolution":{"observed_at":"2026-08-05T13:37:56.768758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.855822Z","title":"Unsupervised learning of depth and ego-motion from video,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.855822Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:87e099b879181f1e12cfa1f30d566d88ce7fca8dd107949104d30ab8d188a5ba","observation_id":"443d7418-5d66-44d4-aff8-04fdff867a40","resolution":{"observed_at":"2026-08-05T13:37:56.855822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.908830Z","title":"Neural ray surfaces for self-supervised learning of depth and ego-motion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.908830Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:816e3281ee719bdd0a761d3511db42bb5376c7e6a2850350754fee0c582ee7e0","observation_id":"24764abd-ca0f-4c3a-a405-c42e3a304bad","resolution":{"observed_at":"2026-08-05T13:37:56.908830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:56.949948Z","title":"Hartley and A","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:56.949948Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:2dfc4f249d7a72abd6bf4f2d210fc9f24af341e99493738e22d588dec494d890","observation_id":"2ec81d1b-6f91-47eb-91e7-d288cdaf58cb","resolution":{"observed_at":"2026-08-05T13:37:56.949948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:57.006921Z","title":"Bradski and A","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.006921Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:dccafa237f774b6beb215c967ec5c3f207b71ce3e1b494f53b31cb679a327daa","observation_id":"f5b50b02-b48f-4f60-b400-2deb2421f12c","resolution":{"observed_at":"2026-08-05T13:37:57.006921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:57.066073Z","title":"Extending kalibr: Calibrating the extrinsics of multiple IMUs and of individual axes,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.066073Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:1d32151f1df61aba212d601b1a562994ea336102c1a1f98f451b67bc7203748d","observation_id":"dc05693b-d002-42ca-8925-de7c76aabb68","resolution":{"observed_at":"2026-08-05T13:37:57.066073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:57.130853Z","title":"A perception-driven autonomous urban vehicle,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.130853Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:d62224a3e5dfb072d29a47e0272415b92a5acdaab7664381f89ecdb7e9412bd8","observation_id":"1b831263-4fce-4953-ad4b-046cb161d403","resolution":{"observed_at":"2026-08-05T13:37:57.130853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:57.244343Z","title":"Autonomous driving in urban environments: Boss and the Urban Challenge,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.244343Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:1342141b7aa4fa615de7f16a089d626483367e475dcc419546a4c9aefa2e865c","observation_id":"00ecc750-00d5-4889-9e21-9ff5329202c7","resolution":{"observed_at":"2026-08-05T13:37:57.244343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:57.304726Z","title":"Lens distortion for close-range photogrammetry,","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.304726Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:11ac94f1662964481b0d10115fdfc48aab78596a0fb37a1c3a134563747ee0c4","observation_id":"37d440bd-d8d1-4c46-b53d-7ba44fc4d9bd","resolution":{"observed_at":"2026-08-05T13:37:57.304726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:57.387627Z","title":"A unifying theory for central panoramic systems and practical implications,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.387627Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:7a7034b1d9e6a3d98e2b9c99a53d5e6bba7d38bc092155d61b0e9b5cedae9efc","observation_id":"c2ea765d-2d4a-459d-9f62-3b6690737471","resolution":{"observed_at":"2026-08-05T13:37:57.387627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:57.551100Z","title":"An enhanced unified camera model,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.551100Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:5134a7b96b4c3a063828c211209b4cf2d78fa48f6f1bfb31ba72775691aa1903","observation_id":"ceade61d-2dfa-4ee8-a1e2-20888f49a535","resolution":{"observed_at":"2026-08-05T13:37:57.551100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:57.728476Z","title":"DeepFo- cal: A method for direct focal length estimation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.728476Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:9e3f200112d7b6555375e03d461fd469939d88b4bebc8c644aac8d8a729a74fd","observation_id":"2f777eed-52fd-41d3-8af4-63691348d8c7","resolution":{"observed_at":"2026-08-05T13:37:57.728476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.02129","last_updated":"2016-08-16T18:48:57Z","snapshot_observed_at":"2026-08-10T07:33:59.543157Z","submitted_at":"2016-04-07T19:38:24Z","title":"Horizon Lines in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.02129","snapshot_observed_at":"2026-08-05T13:37:57.894915Z","title":"Horizon lines in the wild,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:57.894915Z"},"links":{"cited_paper":"/paper/1604.02129","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:85da81ea497639937dd9a29b6a68018f2dedfbd1e229176993272460347bc4e2","observation_id":"8460f72d-d955-4590-b3cb-8fe1ecb8161f","resolution":{"observed_at":"2026-08-05T13:37:57.894915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:58.016806Z","title":"Radial lens distortion correction using convolutional neural networks trained with synthesized images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:58.016806Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:c2a0f7856d3f1c6799410826327c2ddb23346b8086652212e656ec9cd617852d","observation_id":"795e44a7-71d9-426e-b741-a33c2e72f55e","resolution":{"observed_at":"2026-08-05T13:37:58.016806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:58.226833Z","title":"FishEyeRectNet: A multi-context collaborative deep network for fisheye image rectification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:58.226833Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:c9e6494af2aaea9f4fb3e4ddd1dae483cbe8b339df457be4c78009072b6f9ec7","observation_id":"ad02c93c-15c3-4508-bcb5-20d1d861c049","resolution":{"observed_at":"2026-08-05T13:37:58.226833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:58.356439Z","title":"Deep single image camera calibration with radial distortion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:58.356439Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:2769c0d606cc1b1cee80c557f62e9a5a8d0c0869aae826489995bd2d17dae395","observation_id":"0e026d31-6454-47ff-bba3-aa1275156824","resolution":{"observed_at":"2026-08-05T13:37:58.356439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:58.494260Z","title":"A perceptual measure for deep single image camera calibration,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:58.494260Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:b268f3bcec70a3b631e8f0b95c80644a888301abd8f113d7947c0d23f0c09084","observation_id":"2df39836-a0e1-4681-993e-9f745af418af","resolution":{"observed_at":"2026-08-05T13:37:58.494260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:58.603720Z","title":"Single view metrology in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:58.603720Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:72594435917887a1d8177e75037bd22e0784443158d16877515e2ce36fb4fd9f","observation_id":"bad842e6-203f-45f6-9b29-7cffc5bded45","resolution":{"observed_at":"2026-08-05T13:37:58.603720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:58.734769Z","title":"DeepPTZ: Deep self-calibration for PTZ cameras,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:58.734769Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:95d31ffef292138db530e83df96fb25790558428f5c1e6d55d52fafb9969c483","observation_id":"3233e825-b9c7-489d-a11c-c36c189180b7","resolution":{"observed_at":"2026-08-05T13:37:58.734769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:58.839853Z","title":"Learning perspective undistortion of portraits,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:58.839853Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:ad4ec7c2f9adc74ec61b22aec05c16097f80640795ba140f4e3f2d25582ca0cc","observation_id":"0c531814-752d-43e8-b5f8-ffc2a1f763c9","resolution":{"observed_at":"2026-08-05T13:37:58.839853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:58.971330Z","title":"Learning to recover 3D scene shape from a single image,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:58.971330Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:c5f5a7705729827bbe488f860dc7967634670918b2c55dbda77e43160c640e28","observation_id":"6228e8c6-6e54-4e0e-bb03-c97856088135","resolution":{"observed_at":"2026-08-05T13:37:58.971330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.064754Z","title":"Progressively complementary network for fisheye image rectification using appearance flow,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.064754Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:5e66d602cf77b1406921192d62c89045856c14cb1cd06ef659f85e340f58fb3b","observation_id":"7c1fc499-fe7f-4584-a4ad-e403eab7dbe9","resolution":{"observed_at":"2026-08-05T13:37:59.064754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.232042Z","title":"A deep ordinal distortion estimation approach for distortion rectification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.232042Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:3b3b805fd5fda09916b9be5908ea8ad6cfe1e5011d3f5110850176fd8cf8dc33","observation_id":"936c65e3-4fdd-4627-a8a0-62e2b5711f26","resolution":{"observed_at":"2026-08-05T13:37:59.232042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.327526Z","title":"Deep geometry-aware camera self- calibration from video,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.327526Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:182604674f6f5b76d5abcedc5a057736d2909b49f5212ee72c2f4d5736c39181","observation_id":"f2ddc5f5-f03d-4cd3-acef-960fb501b203","resolution":{"observed_at":"2026-08-05T13:37:59.327526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.464309Z","title":"Robust self-supervised extrinsic self-calibration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.464309Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:9a70c9cc0366fa7443466dfc5bffcd2935fd124073e4bda91430e0ef078ff2e8","observation_id":"ce1aee53-87c9-4b1a-9647-55be46b76dc8","resolution":{"observed_at":"2026-08-05T13:37:59.464309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.581447Z","title":"Digging into self- supervised monocular depth estimation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.581447Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:0931797387e56821ec22bcfe02df1145d5ba741d3282b529d8361c437626059b","observation_id":"69c17c61-7812-4c0b-94bd-69b19b73c044","resolution":{"observed_at":"2026-08-05T13:37:59.581447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.686366Z","title":"3D packing for self-supervised monocular depth estimation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.686366Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:e93283cb133a5e87913e35729d0532c6b5c6919d40ff91bf8ab39f37ee8bdb7f","observation_id":"97ee85d6-a693-49f9-9d41-be4c505dd426","resolution":{"observed_at":"2026-08-05T13:37:59.686366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.790937Z","title":"SuperDepth: Self-supervised, super- resolved monocular depth estimation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.790937Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:c4c82062b5c987dca541abe0ed57e86d4e41aa7fb92539452ef4a50bb1a9b45a","observation_id":"d2a0c7d5-d4fa-4ba5-b1d0-84853fd12563","resolution":{"observed_at":"2026-08-05T13:37:59.790937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.843920Z","title":"Are we ready for autonomous driv- ing? The KITTI vision benchmark suite,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.843920Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:f58002b4fc06bde2227429c1f2b591b8ef307becb893daa145def15cb758d0dd","observation_id":"49ece13b-1df4-4679-82a3-be79b0b33d9c","resolution":{"observed_at":"2026-08-05T13:37:59.843920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:37:59.893473Z","title":"nuScenes: A multimodal dataset for au- tonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.893473Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:5788c9547990dc2f89a71684cf8f73e2c272e94b99b811f867a7751aea7ce2ff","observation_id":"11208013-1f36-4226-8cb3-27c22f13de47","resolution":{"observed_at":"2026-08-05T13:37:59.893473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2283","last_updated":"2014-06-09T19:01:18Z","snapshot_observed_at":"2026-08-04T06:35:22.636228Z","submitted_at":"2014-06-09T19:01:18Z","title":"Depth Map Prediction from a Single Image using a Multi-Scale Deep Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2283","snapshot_observed_at":"2026-08-05T13:37:59.967036Z","title":"Depth map prediction from a single image using a multi-scale deep network,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T13:37:59.967036Z"},"links":{"cited_paper":"/paper/1406.2283","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:f1ae8ffb6383bf9005fe15a6fa1761d592e63ac3e18b800464e4d1dfca41e029","observation_id":"5971d777-9e41-4212-9fe5-287c2b683f87","resolution":{"observed_at":"2026-08-05T13:37:59.967036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.051650Z","title":"Calibrating and centering quasi- central catadioptric cameras,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.051650Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:9cf4ff7575f55bdfbde126fc164f6182d272748931a9309c99715a0b4e9226d2","observation_id":"887407b6-a654-4d4b-bcfc-a05a654492ee","resolution":{"observed_at":"2026-08-05T13:38:00.051650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.104618Z","title":"Automatic differentiation in PyTorch,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.104618Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:547a35a65700f5b46ffc197788e6e0521f8e9d524292af6226d8590b561548b3","observation_id":"d43fa651-9222-41ff-a2a7-b259d6863151","resolution":{"observed_at":"2026-08-05T13:38:00.104618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.170624Z","title":"AprilTag: A robust and flexible visual fiducial system,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.170624Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:5ce93a10ba7c81e15617e1001d7cabc5ff62720d8d96b0499fb6c1d2acd7ffec","observation_id":"0d27603e-6d77-438a-a2e4-67fb28b2f1fd","resolution":{"observed_at":"2026-08-05T13:38:00.170624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.329923Z","title":"End-to-end learning of geometry and context for deep stereo 122 regression,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.329923Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:2d24d7c8e33f2e89c1cac0f66d531c009008a88dca75dfe5c82f0036691fd059","observation_id":"aef9595e-66d2-48aa-bcbf-0240bd7ebfee","resolution":{"observed_at":"2026-08-05T13:38:00.329923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.413274Z","title":"RAFT-Stereo: Multilevel recurrent field transforms for stereo matching,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.413274Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:98083bdc5202c1e2cb5b4b169b96c3c18a259928b9e8c8fe76e61cc3cbe97845","observation_id":"e417a4a0-725d-4d69-a7c5-4e3f9aed6e23","resolution":{"observed_at":"2026-08-05T13:38:00.413274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.497678Z","title":"RAFT: Recurrent all-pairs field transforms for optical flow,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.497678Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:f6926c760ba22c21073ca5c8ec5108e4197bfde3dfd593308802b0927f7d0acf","observation_id":"c3dc1400-575e-42a3-9ff8-232516f52341","resolution":{"observed_at":"2026-08-05T13:38:00.497678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.543515Z","title":"DeepV2D: Video to depth with differentiable structure from motion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.543515Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:936cf415810c21f5b19fb366d7014319f597da54812bc0066849f6d7877d0169","observation_id":"3e6117f0-cd6e-46cc-9af1-51431de2877c","resolution":{"observed_at":"2026-08-05T13:38:00.543515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11426","last_updated":"2022-04-05T18:19:13Z","snapshot_observed_at":"2026-08-01T15:21:43.173232Z","submitted_at":"2021-11-22T18:57:51Z","title":"Neural Fields in Visual Computing and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11426","snapshot_observed_at":"2026-08-05T13:38:00.625436Z","title":"Neural fields in visual computing and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.625436Z"},"links":{"cited_paper":"/paper/2111.11426","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:38b2a0ebaadafef8883323f812595d38e40bb7e9cce0a2f12562bad1e08b09da","observation_id":"4df23a34-ed42-4046-ab9e-55e0a787d226","resolution":{"observed_at":"2026-08-05T13:38:00.625436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.686102Z","title":"pixelNeRF: Neural radiance fields from one or few images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.686102Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:ba3660b52d9942ac4ced749a2425462c5605daf23a950f988a14b9922910f1e8","observation_id":"9a3f52b9-4b0c-43fb-ae22-792c07eeb2da","resolution":{"observed_at":"2026-08-05T13:38:00.686102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T13:38:00.769698Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.769698Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:2d09ebb59f9868daf06ccd359339dacad6fc00705f3bebd70f13bdf973b1ab80","observation_id":"14b87086-9ad0-43d3-877e-2e10f5f220d0","resolution":{"observed_at":"2026-08-05T13:38:00.769698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.857046Z","title":"Revisiting stereo depth estimation from a sequence-to-sequence perspective with transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.857046Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:4993329c8162ee8537404ba7e79583a33921c570c1b1f9d6f7bf3d1a15cfe1a4","observation_id":"ed40c296-1de9-4181-a47b-4c87363a95d8","resolution":{"observed_at":"2026-08-05T13:38:00.857046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:00.913529Z","title":"Vision transformers for dense prediction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.913529Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:cacc079d8eb3e7eeb5b3b8c734542ebe36c7800b40663cd90187d92f21da60ff","observation_id":"274ede3b-077a-4867-9828-296a4e323601","resolution":{"observed_at":"2026-08-05T13:38:00.913529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-05T13:38:00.990676Z","title":"Perceiver IO: A general architecture for structured inputs & outputs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:00.990676Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:32e0f206c10fca38e4e1ded5eaf1cdc043c80cb31c9517a73be1833eaa5591e2","observation_id":"6b8a3617-abaa-4646-88e0-06b97cdcb78c","resolution":{"observed_at":"2026-08-05T13:38:00.990676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.062778Z","title":"Taming transformers for high-resolution image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.062778Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:38aab4b818a7be562c1cff8130c22c340b61007a9a1b52fe779a65f0be1b0c97","observation_id":"5beebb8e-af9b-4416-9c38-ee54a35d2755","resolution":{"observed_at":"2026-08-05T13:38:01.062778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.119681Z","title":"Geometry-free view synthesis: Trans- formers and no 3D priors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.119681Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:71623ff17c490b7ee3a8cd2700e4d3afd5029d48ffcd7bb376010fa83d5877a4","observation_id":"3461054d-51bf-47ce-9aaf-ac76f507e401","resolution":{"observed_at":"2026-08-05T13:38:01.119681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13152","last_updated":"2022-03-29T10:37:07Z","snapshot_observed_at":"2026-08-10T16:52:16.488769Z","submitted_at":"2021-11-25T16:18:56Z","title":"Scene Representation Transformer: Geometry-Free Novel View Synthesis Through Set-Latent Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13152","snapshot_observed_at":"2026-08-05T13:38:01.181011Z","title":"Scene representation transformer: Geometry-free novel view synthesis through set-latent scene representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.181011Z"},"links":{"cited_paper":"/paper/2111.13152","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:ecc7b5f43ba0c7cc22baf9a5b2a3d4c781a1162831f6a1afa6797afb512f0a5d","observation_id":"916e1156-54c4-4c2a-acc6-2913135f17fd","resolution":{"observed_at":"2026-08-05T13:38:01.181011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.268597Z","title":"Perceiver: General perception with iterative attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.268597Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:401711d8e7a9ecfd34e017f7b1994697b1131f92a852fb991af0186fcfb94028","observation_id":"a1e18286-978e-4815-a46a-315624c57ba2","resolution":{"observed_at":"2026-08-05T13:38:01.268597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.323100Z","title":"ScanNet: Richly-annotated 3D reconstructions of indoor scenes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.323100Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:ed3eff00d19665130596e993ed921513ecb836883af5eeb27fea3beba6ae024e","observation_id":"eee36d00-d597-40d9-8240-b63ee8e10fa6","resolution":{"observed_at":"2026-08-05T13:38:01.323100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.407328Z","title":"Scene coordinate regression forests for camera relocalization in RGB-D images,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.407328Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:6871d140cc242b62d55817a6a637ebe39e089282eb5b177c31f375777bb9608b","observation_id":"fe17bc39-d3d1-43eb-8b53-d8ea02e8bd1e","resolution":{"observed_at":"2026-08-05T13:38:01.407328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.461794Z","title":"Learning depth from single monocular images,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.461794Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:288053e7bc3fff40884950fedf1ddf188f6e0b9ccb644bf5d6912c5b91346596","observation_id":"46fa62e1-6060-4572-bbcd-69fdb6eeb451","resolution":{"observed_at":"2026-08-05T13:38:01.461794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.514565Z","title":"Predicting depth, surface normals and semantic labels with a common multi-scale convolutional architecture,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.514565Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:73949ec45639bc0ed2e08cf174509d33824c2a611ae7505dcb02fc0c438d7af3","observation_id":"1a332975-5249-4086-86fc-704d41a04e16","resolution":{"observed_at":"2026-08-05T13:38:01.514565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.570384Z","title":"Deep ordinal regression network for monocular depth estimation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.570384Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:3398a0c06e806d79b1159dacf198fd68eb447aebc46c2c63cc060d1207288657","observation_id":"80c28c60-f75d-412b-b099-e9d90f1d3e92","resolution":{"observed_at":"2026-08-05T13:38:01.570384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.618556Z","title":"Deeper depth prediction with fully convolutional residual networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.618556Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:69b7d4b7a0fc5e845aaff4f0f98eb23d17e9ea044774abbf6f51afb0c7cea721","observation_id":"35628117-2dc5-4413-aac1-278927b1a587","resolution":{"observed_at":"2026-08-05T13:38:01.618556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10326","last_updated":"2021-09-23T10:23:51Z","snapshot_observed_at":"2026-08-12T18:24:55.944115Z","submitted_at":"2019-07-24T09:31:24Z","title":"From Big to Small: Multi-Scale Local Planar Guidance for Monocular Depth Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10326","snapshot_observed_at":"2026-08-05T13:38:01.697274Z","title":"From big to small: Multi- scale local planar guidance for monocular depth estimation,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.697274Z"},"links":{"cited_paper":"/paper/1907.10326","citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:8e0521de8a13fae92cbca9c4ffa594714591aab2991261e4d9e2141a78fb755a","observation_id":"d4cbc3d3-6812-41d0-b0df-1272fcf2a258","resolution":{"observed_at":"2026-08-05T13:38:01.697274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.780519Z","title":"Unsupervised monocular depth estimation with left-right consistency,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.780519Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:2e638b347b6c6c8a19bddd3bc4cec6fe5b3285484c2cdcd08c607fa9d3767467","observation_id":"c60aaab9-478c-40fb-992f-5c721853cc29","resolution":{"observed_at":"2026-08-05T13:38:01.780519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.861616Z","title":"Feature-metric loss for self-supervised learning of depth and egomotion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.861616Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:0175cf5634e1aefdd8c1b7474d2f68cea53ba0fdd0c0f98e140c3de2427fec1b","observation_id":"eb12b98e-e96a-4ebf-876a-849823377e2f","resolution":{"observed_at":"2026-08-05T13:38:01.861616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:01.946801Z","title":"The temporal opportunist: Self-supervised multi-frame monocular depth,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:01.946801Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:983186c1c43cb3b0ffda350819f589c5e6535883949fcbce8480dfba303177db","observation_id":"0841fa30-28fc-4ccb-a711-907eae901297","resolution":{"observed_at":"2026-08-05T13:38:01.946801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:02.004233Z","title":"Towards zero- shot scale-aware monocular depth estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:02.004233Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:be71a605f0edb67008eb310af21600684c653f2dc3efb0c4984c7cb0ca1c2314","observation_id":"0a63fb16-dbfd-4258-b864-eb4cd7a76274","resolution":{"observed_at":"2026-08-05T13:38:02.004233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:38:02.089230Z","title":"Structure-from-motion revisited,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-05T13:38:02.089230Z"},"links":{"citing_paper":"/paper/2509.00465"},"observation_digest":"sha256:6f98e87488c36e3bb790251ab2f9e9fdb7220c536cb14738ccfbc6eaa420feed","observation_id":"db96c661-a30c-42c0-af46-99f77fd327d6","resolution":{"observed_at":"2026-08-05T13:38:02.089230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00465","last_updated":"2025-08-30T11:42:26Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-10T14:21:50.311860Z","submitted_at":"2025-08-30T11:42:26Z","title":"Embodied Spatial Intelligence: from Implicit Scene Modeling to Spatial Reasoning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":293},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 293 outbound references and 0 inbound Pith citation observations for arXiv:2509.00465."}