{"as_of":"2026-08-19T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32956b07099ab7e33a42b8751d31660a229a6e5f111cae4d1f11cd0fd9d9bcd4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":65,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:58:28.023924Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:37:43.684631Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T03:27:40.524895Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2302.01560"},"observation_digest":"sha256:19fb37b4f9d9d547d5972c9ca2f49bacfc72be5e9e8d06db097ce827d8f5c5dd","observation_id":"819c36a9-47cb-438d-93f7-8b8516abab46","resolution":{"observed_at":"2026-05-16T03:27:40.683807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-12T05:52:39.078828Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.078828Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:7f3902c89b17bd828ac6f01254711d0e3cb36a039c2cf2b2aa66e8a65d1c8279","observation_id":"436a7c1b-a225-465c-8ada-000d3831bd31","resolution":{"observed_at":"2026-08-12T05:52:39.078828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2412.07160","last_updated":"2026-04-26T01:15:25Z","snapshot_observed_at":"2026-08-12T15:00:25.452816Z","submitted_at":"2024-12-10T03:41:07Z","title":"Motion-aware Contrastive Learning for Temporal Panoptic Scene Graph Generation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-23T07:23:51.435139Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2412.07160"},"observation_digest":"sha256:4ba4dae8016c0441d47a14270f6ac5e9125b89fa18ad63cfaeec33abd722dfba","observation_id":"b423ee5f-888c-4ac2-9c5e-6767df90a78b","resolution":{"observed_at":"2026-05-23T07:25:28.485261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-11T15:43:51.702124Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10726","last_updated":"2024-12-14T07:52:24Z","snapshot_observed_at":"2026-08-16T22:30:48.839992Z","submitted_at":"2024-12-14T07:52:24Z","title":"NoisyEQA: Benchmarking Embodied Question Answering Against Noisy Queries","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:51.702124Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2412.10726"},"observation_digest":"sha256:4ee05697d9ee69b0b0d94d7074f45b640afaba10c3aa4f600fb4047ae31d21ae","observation_id":"e21d37cc-8cd7-4298-8ba7-7674f125bd40","resolution":{"observed_at":"2026-08-11T15:43:51.702124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-11T04:45:36.728239Z","title":"Sqa3d: Sit- uated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18450","last_updated":"2025-08-06T06:29:23Z","snapshot_observed_at":"2026-08-11T04:39:26.638560Z","submitted_at":"2024-12-24T14:21:58Z","title":"3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:45:36.728239Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2412.18450"},"observation_digest":"sha256:c29bc59dfff2fa6f7081a6359f40066189f612d155f9f8660578d8b1e59231b4","observation_id":"e8c46256-0ae8-43b0-aca2-222628685921","resolution":{"observed_at":"2026-08-11T04:45:36.728239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-11T04:39:55.834755Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18605","last_updated":"2024-12-24T18:58:43Z","snapshot_observed_at":"2026-08-17T14:49:01.554106Z","submitted_at":"2024-12-24T18:58:43Z","title":"Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:39:55.834755Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2412.18605"},"observation_digest":"sha256:05220117821ceb3696a1b573fe1083af48bd77404502a0f3a59251cd9bf8eacb","observation_id":"6a38dbac-d56f-413e-bffd-407f73c31438","resolution":{"observed_at":"2026-08-11T04:39:55.834755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-10T22:38:21.541249Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01163","last_updated":"2025-04-24T06:33:35Z","snapshot_observed_at":"2026-08-18T03:05:30.123324Z","submitted_at":"2025-01-02T09:33:13Z","title":"3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:38:21.541249Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2501.01163"},"observation_digest":"sha256:7cf3e627cb4f03ad652ca6d486698eba48e294e218903927a3598d02bc6576c7","observation_id":"88c484b1-9a0e-4456-9a8e-bce52bb091a6","resolution":{"observed_at":"2026-08-10T22:38:21.541249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-10T21:48:27.366951Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03879","last_updated":"2025-01-07T15:42:32Z","snapshot_observed_at":"2026-08-15T00:27:44.617873Z","submitted_at":"2025-01-07T15:42:32Z","title":"CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T21:48:27.366951Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2501.03879"},"observation_digest":"sha256:c24c5d3782011de56d2b91738b8a84a24aa9967f42fbef62b94cf6d337e2a052","observation_id":"f7ae0f13-03a1-47e9-829e-8ac4747cb558","resolution":{"observed_at":"2026-08-10T21:48:27.366951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-10T20:39:12.511670Z","title":"Sqa3d: Situated question answering in 3d scenes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07819","last_updated":"2025-01-14T03:50:23Z","snapshot_observed_at":"2026-08-15T16:36:45.033063Z","submitted_at":"2025-01-14T03:50:23Z","title":"3UR-LLM: An End-to-End Multimodal Large Language Model for 3D Scene Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:12.511670Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2501.07819"},"observation_digest":"sha256:5cefce2d95468b511ec85bd14b0c7ef0b40777939be14c7cccbd1332450c1092","observation_id":"a9548686-ba0b-4b81-b9d0-bb565b686606","resolution":{"observed_at":"2026-08-10T20:39:12.511670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-09T19:24:17.800718Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00342","last_updated":"2025-08-08T07:24:11Z","snapshot_observed_at":"2026-08-15T20:59:44.756476Z","submitted_at":"2025-02-01T07:01:33Z","title":"Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T19:24:17.800718Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2502.00342"},"observation_digest":"sha256:84ccfed8e8826f606dda6e98d5469f231f1d850e1a4cc032e891c270d29f47ff","observation_id":"8c2750c8-b066-42ba-af1e-1a379520b0bc","resolution":{"observed_at":"2026-08-09T19:24:17.800718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-09T17:12:16.477250Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00954","last_updated":"2025-05-27T19:23:41Z","snapshot_observed_at":"2026-08-14T06:19:41.499447Z","submitted_at":"2025-02-02T23:11:42Z","title":"Hypo3D: Exploring Hypothetical Reasoning in 3D","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T17:12:16.477250Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2502.00954"},"observation_digest":"sha256:4c77649b6e4c3c0908f852386eb0c654257dd9eec2b0fbd8c7170ed0d279509f","observation_id":"92abf978-0943-444b-8104-eeb60dacb6da","resolution":{"observed_at":"2026-08-09T17:12:16.477250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-08T04:54:02.077308Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08503","last_updated":"2025-06-06T01:51:44Z","snapshot_observed_at":"2026-08-18T01:50:30.976340Z","submitted_at":"2025-02-12T15:34:45Z","title":"Revisiting 3D LLM Benchmarks: Are We Really Testing 3D Capabilities?","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:02.077308Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2502.08503"},"observation_digest":"sha256:2a6679c2008be7ab3a8014afab5b95493ac99787c68798d9fbfd6b17134ef399","observation_id":"a8e05f33-b0bc-4aec-9385-989f13418cc5","resolution":{"observed_at":"2026-08-08T04:54:02.077308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-16T05:58:28.023924Z","title":"Sqa3d: Sit- uated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.023924Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:448ec36111aa35136228900739251b87a6b130abc4101b19a76f1f5ba741afbc","observation_id":"91930c99-fbf9-4179-abcd-b596c95a3ee6","resolution":{"observed_at":"2026-08-16T05:58:28.023924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-15T23:22:03.251882Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04911","last_updated":"2025-05-08T02:59:01Z","snapshot_observed_at":"2026-08-17T21:07:16.095581Z","submitted_at":"2025-05-08T02:59:01Z","title":"SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:22:03.251882Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.04911"},"observation_digest":"sha256:09bd9010e20adf2355197a48f393ac0f8dbbbecd3b3e78b6c4b118021a0d4df4","observation_id":"6210f3c7-3150-4d1c-8a14-250ccb5f87f9","resolution":{"observed_at":"2026-08-15T23:22:03.251882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-15T20:42:46.850936Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12253","last_updated":"2025-05-18T06:18:57Z","snapshot_observed_at":"2026-08-18T08:02:43.826301Z","submitted_at":"2025-05-18T06:18:57Z","title":"LLaVA-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:42:46.850936Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.12253"},"observation_digest":"sha256:08c9aaf9e3409b89269fb357751e4b6f0c8814a36ac856b01860af3161f920f5","observation_id":"68b11d85-261f-4f2c-9ef5-cbf1b05bcec1","resolution":{"observed_at":"2026-08-15T20:42:46.850936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-15T20:31:05.196777Z","title":"SQA3D: Situated Question Answering in 3D Scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12782","last_updated":"2025-05-19T07:11:07Z","snapshot_observed_at":"2026-08-16T22:30:48.287131Z","submitted_at":"2025-05-19T07:11:07Z","title":"AdaToken-3D: Dynamic Spatial Gating for Efficient 3D Large Multimodal-Models Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:31:05.196777Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.12782"},"observation_digest":"sha256:03db25101572e4693a96934c6ea47c838978cf2801bb27c4679ffc5b23deb125","observation_id":"1f6ad87a-adb8-4a2f-bf28-f37fa25e739c","resolution":{"observed_at":"2026-08-15T20:31:05.196777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T15:26:51.975970Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15232","last_updated":"2025-05-21T08:05:27Z","snapshot_observed_at":"2026-08-16T15:11:05.647544Z","submitted_at":"2025-05-21T08:05:27Z","title":"DC-Scene: Data-Centric Learning for 3D Scene Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.975970Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.15232"},"observation_digest":"sha256:8d068b7f3695257bf0b99a2e9b0a84169039f38b88bac4e28199fb3169c3d999","observation_id":"167fd060-4958-473b-b1af-9bbd11db0d31","resolution":{"observed_at":"2026-08-07T15:26:51.975970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T15:02:55.344695Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16663","last_updated":"2025-05-22T13:27:54Z","snapshot_observed_at":"2026-08-17T09:28:14.310629Z","submitted_at":"2025-05-22T13:27:54Z","title":"CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:55.344695Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.16663"},"observation_digest":"sha256:9cbd4ae1c4b9c7506647244009ad588be7302ec696ba8b188034244a4a96e96c","observation_id":"3037b647-cbac-4793-bddc-87e095cc4d53","resolution":{"observed_at":"2026-08-07T15:02:55.344695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:01.013242Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.20279"},"observation_digest":"sha256:e1ca0d759016577dcad72f711f29fae3da89cfffa48bf63fe7e3c9be29d9a51b","observation_id":"c627b4dc-78c6-4e8b-a85c-543e476b10c9","resolution":{"observed_at":"2026-05-19T12:57:17.925336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T13:46:13.614106Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21079","last_updated":"2025-05-27T12:03:30Z","snapshot_observed_at":"2026-08-15T10:22:51.546118Z","submitted_at":"2025-05-27T12:03:30Z","title":"Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:13.614106Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.21079"},"observation_digest":"sha256:8ceedb83548640c229a5ca9bd299c2a84202bc63bdc87bfd846c87b57c0d61f9","observation_id":"0c12676b-a1a9-41a5-b575-7c99e3bc2948","resolution":{"observed_at":"2026-08-07T13:46:13.614106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-15T23:37:18.723910Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T08:34:36.824053Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:a5971accf409fcab99354e54ae5f70dea14e31db63b0fdd1ff4668e2307ab3cd","observation_id":"35281398-dec0-4f5a-9f3e-b9ae96e21f3e","resolution":{"observed_at":"2026-05-16T08:34:36.901724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-15T23:37:18.723910Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T00:59:13.826054Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:ea5d92e76d92ba0bdec7059131e5d77cc7a1554574c896f735eb6896d205a53d","observation_id":"b1371454-5560-4685-be67-40b01adbe23b","resolution":{"observed_at":"2026-05-22T01:00:51.433617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T12:16:13.281354Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.281354Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d9f83aa6c115c45d909eaf796c93e5a1251ec11496147e64f71bdde1f5beffcd","observation_id":"5e872cd2-3e60-48b5-b16e-e9c2b767fd75","resolution":{"observed_at":"2026-08-07T12:16:13.281354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T10:29:07.844021Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05287","last_updated":"2025-06-05T17:44:12Z","snapshot_observed_at":"2026-08-17T01:40:28.319500Z","submitted_at":"2025-06-05T17:44:12Z","title":"EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.844021Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.05287"},"observation_digest":"sha256:1e39c274b3a004390800107216c4aa5cb4185aa5179a34dd551fa95f039a9b96","observation_id":"7ce951ce-6584-460d-a315-39895b64c3f3","resolution":{"observed_at":"2026-08-07T10:29:07.844021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T10:25:45.371810Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05318","last_updated":"2025-06-06T07:09:06Z","snapshot_observed_at":"2026-08-16T14:13:17.677398Z","submitted_at":"2025-06-05T17:56:12Z","title":"Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:45.371810Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.05318"},"observation_digest":"sha256:03eeb7625687423536073947f9747f2eca5da2460f0a29936c2955416ee8b198","observation_id":"fd4dec3b-1a3b-4b5f-b142-d4d15b470c63","resolution":{"observed_at":"2026-08-07T10:25:45.371810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T21:53:00.971816Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-14T06:19:39.931283Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.971816Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:4fa0854543c28e7f3bd8210235b12283f9cf6179420407a26c89afe5521953de","observation_id":"27d46f3b-d777-4076-b839-5e64e9a65f93","resolution":{"observed_at":"2026-08-06T21:53:00.971816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T18:03:02.275383Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:02.275383Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:b79be554fc977ed235f003a63e3e51370701b843710ec7d6624bc65bbbb47dca","observation_id":"c05b8ad3-7462-4d43-a348-e4e2897b91a0","resolution":{"observed_at":"2026-08-06T18:03:02.275383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T15:14:16.929007Z","title":"Sqa3d: Situated question answering in 3d scenes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16524","last_updated":"2025-07-22T12:32:35Z","snapshot_observed_at":"2026-08-18T10:31:05.809825Z","submitted_at":"2025-07-22T12:32:35Z","title":"Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:16.929007Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2507.16524"},"observation_digest":"sha256:78c255df1e3c2e2a4adf5e5567f98930e0fdb9da182423bd92782b7c58e982fd","observation_id":"68b78ee9-4bc6-4ab9-9f87-2c5e4c9eaa73","resolution":{"observed_at":"2026-08-06T15:14:16.929007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-15T18:19:07.226106Z","title":"Sqa3d: Situated question answering in 3d scenes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18484","last_updated":"2025-07-24T14:56:21Z","snapshot_observed_at":"2026-08-18T10:17:16.980844Z","submitted_at":"2025-07-24T14:56:21Z","title":"Reinforced Embodied Active Defense: Exploiting Adaptive Interaction for Robust Visual Perception in Adversarial 3D Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:19:07.226106Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2507.18484"},"observation_digest":"sha256:c71056109130aa9ec0fe91976f5fd6bc7439664eb0020bfa6ac4359c5b8b2855","observation_id":"16a7dcca-1648-4e11-a8d9-68a24647f1d1","resolution":{"observed_at":"2026-08-15T18:19:07.226106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T13:48:03.529117Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-16T20:17:10.571287Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:48:03.529117Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2507.20110"},"observation_digest":"sha256:66a015b9f4453fe700b502be8af2a3e3c7fab1992db7fd77e47c4ada66c8034f","observation_id":"6fe358d8-c9ab-4143-9eb9-a6092229c0b9","resolution":{"observed_at":"2026-08-06T13:48:03.529117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-04T14:41:50.768259Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.24380","last_updated":"2026-07-04T03:50:21Z","snapshot_observed_at":"2026-08-16T08:21:48.955157Z","submitted_at":"2025-09-29T07:29:18Z","title":"Agentic Services Computing","version":3},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-04T14:41:50.768259Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2509.24380"},"observation_digest":"sha256:6e5754f87347f9ba99096fbc38ffdf23fb03696a4004a4c3d25c542bb49d8625","observation_id":"db95da7b-c382-4b00-a051-48f98fe660d1","resolution":{"observed_at":"2026-08-04T14:41:50.768259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-04T11:38:13.152895Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-13T14:22:12.349032Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.152895Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:a892eb96a661d3759e329b262c8cac1f0027ebbb36cd9d5145342abd53e2dd2e","observation_id":"959ea317-4073-4a7c-9901-74d0171b7331","resolution":{"observed_at":"2026-08-04T11:38:13.152895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-08-13T19:00:10.952463Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:2dc7855ec5eb64a5d5e8169b2a173133e3bd6d8c744f1c5a86d6390eb7b49095","observation_id":"4110447d-fc49-4567-9278-45ac00f965b6","resolution":{"observed_at":"2026-05-17T20:42:05.711355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2511.16567","last_updated":"2026-05-06T15:47:48Z","snapshot_observed_at":"2026-08-15T10:36:11.723291Z","submitted_at":"2025-11-20T17:22:51Z","title":"POMA-3D: The Point Map Way to 3D Scene Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T20:27:27.347592Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2511.16567"},"observation_digest":"sha256:df86e4fde9ff58a5678515ff46baac27ae59603ec90248670e37c28975f52a00","observation_id":"b197cc77-cd8e-4bac-8457-6fb4a9deafa2","resolution":{"observed_at":"2026-05-17T20:30:11.613552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-03T20:15:34.304977Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.20644","last_updated":"2026-07-09T17:59:10Z","snapshot_observed_at":"2026-08-18T12:35:53.127359Z","submitted_at":"2025-11-25T18:59:02Z","title":"Vision-Language Memory for Spatial Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:34.304977Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2511.20644"},"observation_digest":"sha256:70e62800e675cba3277ed3ff9e1ed3166313b978f02fc42bcdde6329b245dac0","observation_id":"0dc1fc8b-b746-4df7-a58d-114e42ef3a65","resolution":{"observed_at":"2026-08-03T20:15:34.304977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2512.23365","last_updated":"2026-04-09T12:09:38Z","snapshot_observed_at":"2026-08-14T14:52:34.820232Z","submitted_at":"2025-12-29T10:48:54Z","title":"SpatialMosaic: A Multiview VLM Dataset for Partial Visibility","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T19:42:25.626448Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2512.23365"},"observation_digest":"sha256:78e25b3ba173910e54e9a117f5020c0d21643e594e69cfb48f886c9f3ae6ec4a","observation_id":"a5cd0976-4699-43a0-9fbc-cd9b660cc7f7","resolution":{"observed_at":"2026-05-16T19:43:20.617257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2603.17980","last_updated":"2026-05-07T05:29:31Z","snapshot_observed_at":"2026-08-14T09:51:49.331073Z","submitted_at":"2026-03-18T17:42:49Z","title":"Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T09:30:03.668178Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2603.17980"},"observation_digest":"sha256:edc98a59f25036de61aea61fee1341f6df5cfc6677fa2f10208377e7d6595323","observation_id":"28c0cfce-8169-4eb5-8926-21892d136bf1","resolution":{"observed_at":"2026-05-15T09:30:22.455334Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-08-10T23:52:35.908557Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:49302f26a46b6c92de2dbeb5d130c6197fee9367974b487f50d39a0289285ad8","observation_id":"6692311b-c692-414b-9e12-bbd1b51aa19b","resolution":{"observed_at":"2026-05-14T21:32:59.431171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2604.02546","last_updated":"2026-07-02T01:57:06Z","snapshot_observed_at":"2026-08-16T15:07:07.050738Z","submitted_at":"2026-04-02T21:54:43Z","title":"RGB-Pointmap Pretraining for Unified 3D Scene Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T21:19:49.421653Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2604.02546"},"observation_digest":"sha256:083461dc0a76d1c8127d493d2fa0d39539d8919caba83cdeb02c407efbc5d037","observation_id":"ae767bea-78e7-4d99-a4fd-658e6227ffd2","resolution":{"observed_at":"2026-05-13T21:23:17.922593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2604.18260","last_updated":"2026-04-20T13:33:50Z","snapshot_observed_at":"2026-08-16T05:12:33.891180Z","submitted_at":"2026-04-20T13:33:50Z","title":"Geometry-Guided 3D Visual Token Pruning for Video-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:49:38.346274Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2604.18260"},"observation_digest":"sha256:b1dbb5f705292a5ae3e658a6e39cd57fbc1a0eb35bc10554c6b1244523c1265e","observation_id":"2a22fb0e-cdbe-4f8f-b2e3-4f2abead8eca","resolution":{"observed_at":"2026-05-10T05:51:09.960260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2605.07148","last_updated":"2026-05-08T02:32:27Z","snapshot_observed_at":"2026-08-11T13:55:37.544974Z","submitted_at":"2026-05-08T02:32:27Z","title":"Uncovering and Shaping the Latent Representation of 3D Scene Topology in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:06.243890Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2605.07148"},"observation_digest":"sha256:ff7d7cc96ee5ca86edfc58b16132d90414d8890969db574f9bedff0297d7399c","observation_id":"ef9c6ca6-02f4-4ae1-ab5f-df39ffd73df5","resolution":{"observed_at":"2026-05-11T05:00:55.089512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2605.15876","last_updated":"2026-05-20T09:56:58Z","snapshot_observed_at":"2026-08-16T00:44:05.083067Z","submitted_at":"2026-05-15T11:54:17Z","title":"Unlocking Dense Metric Depth Estimation in VLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T19:20:04.468206Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2605.15876"},"observation_digest":"sha256:1a5d3ee85b937c70e3869b46b90bf61e117ca88ab40e165600d1ae61e49e8411","observation_id":"ef774b3a-3006-4e17-b46c-3109d04b72bf","resolution":{"observed_at":"2026-05-20T19:23:40.988324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2605.15876","last_updated":"2026-05-20T09:56:58Z","snapshot_observed_at":"2026-08-16T00:44:05.083067Z","submitted_at":"2026-05-15T11:54:17Z","title":"Unlocking Dense Metric Depth Estimation in VLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T07:54:52.926995Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2605.15876"},"observation_digest":"sha256:4fc947e8093ec7cab5a1afeeb6fe455ac82a570526bb1fd886e817c20a1949f7","observation_id":"11710254-5529-4b0e-8a7f-ec29e86173f0","resolution":{"observed_at":"2026-05-21T07:59:51.100352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2605.20837","last_updated":"2026-05-20T07:27:08Z","snapshot_observed_at":"2026-08-15T05:24:00.779954Z","submitted_at":"2026-05-20T07:27:08Z","title":"ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T04:55:40.370796Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2605.20837"},"observation_digest":"sha256:e5b0c8bcc25cfdeae299b092e363925c5eb4e2f86740f8f75ba462e8f64ffa7d","observation_id":"357819a6-6195-4f6b-8724-839622430391","resolution":{"observed_at":"2026-05-21T04:59:36.535565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-12T17:22:45.772096Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:bfb55e63d20ba028ab46529421577add03ca010e1d8e3a87a8e2f7a525b39f3d","observation_id":"9f8efa9a-6140-4949-8425-2f04eabe57c1","resolution":{"observed_at":"2026-06-29T21:33:58.998391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2605.30557","last_updated":"2026-05-28T20:44:47Z","snapshot_observed_at":"2026-08-15T13:58:33.370405Z","submitted_at":"2026-05-28T20:44:47Z","title":"Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T07:48:19.295578Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2605.30557"},"observation_digest":"sha256:7dfa886adaaa20045b54037980529aa910464aad343728919a815a0ade8b1a76","observation_id":"65436e5f-a2d6-426a-9bb6-6f72fb166a94","resolution":{"observed_at":"2026-06-29T07:53:13.561481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2606.01247","last_updated":"2026-05-31T14:00:10Z","snapshot_observed_at":"2026-08-12T17:06:18.347949Z","submitted_at":"2026-05-31T14:00:10Z","title":"Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T17:08:59.111306Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2606.01247"},"observation_digest":"sha256:25fafec15e1abf1e78a4fb2ce3e3a98e40f29ad794b2b458537751d9a95e4ecd","observation_id":"c4294406-1598-4665-9516-753a97861a12","resolution":{"observed_at":"2026-06-28T17:12:24.824379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2606.03100","last_updated":"2026-06-04T05:13:15Z","snapshot_observed_at":"2026-08-01T16:37:35.015535Z","submitted_at":"2026-06-02T03:38:51Z","title":"Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T10:54:02.188634Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2606.03100"},"observation_digest":"sha256:45ecb5d890b7377709c2523684b1909594f69445c4364ee052f2318e824ef9b7","observation_id":"26e71fa9-63e9-477d-9549-df1090713b02","resolution":{"observed_at":"2026-07-02T02:26:27.034459Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2606.05833","last_updated":"2026-06-18T15:40:37Z","snapshot_observed_at":"2026-08-03T07:19:30.958860Z","submitted_at":"2026-06-04T08:11:12Z","title":"Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:13:53.219095Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2606.05833"},"observation_digest":"sha256:0fd9d0f693ef93e21cd5156def86a0ea9890604690fa4338d4951a20680a3439","observation_id":"3290b45a-ea4f-4d17-ac26-f0b2dceadf3c","resolution":{"observed_at":"2026-07-02T12:16:57.525718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2606.06485","last_updated":"2026-06-04T17:59:04Z","snapshot_observed_at":"2026-08-14T18:35:33.162837Z","submitted_at":"2026-06-04T17:59:04Z","title":"PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.190068Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2606.06485"},"observation_digest":"sha256:9ed93a4aff21984ded2425ba459b387fc66e48435d52b0b03525428ce25566b4","observation_id":"9a827449-de59-4e92-a137-7a6db53cd253","resolution":{"observed_at":"2026-07-02T12:16:57.091368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2606.09669","last_updated":"2026-06-08T15:51:51Z","snapshot_observed_at":"2026-08-12T07:31:07.648632Z","submitted_at":"2026-06-08T15:51:51Z","title":"SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T16:35:14.099586Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2606.09669"},"observation_digest":"sha256:4e7494027c61c18f8a1640a1eabadc01aa48b32859e1d3072d35b684494f05b2","observation_id":"e3bbb6fe-fb9b-44d0-8d3b-509856a63db1","resolution":{"observed_at":"2026-07-03T01:27:30.647837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2606.12207","last_updated":"2026-06-10T15:25:02Z","snapshot_observed_at":"2026-08-11T08:12:28.526333Z","submitted_at":"2026-06-10T15:25:02Z","title":"Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-06-27T09:17:50.473747Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2606.12207"},"observation_digest":"sha256:624dc09fff2f7e00ffd73a027403ca4f6f931a411ba6ec02d59d1d002994fa45","observation_id":"9db02e74-6048-4617-85ec-1b3aea2b3f17","resolution":{"observed_at":"2026-07-03T11:58:05.934971Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Sqa3d: Situated question answering in 3d scenes, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-12T13:31:45.799876Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:fcdaa04989558bd26519c7100814aa8b1741f200b2aa90c8fea82bf83fb196ca","observation_id":"c57f703c-ac56-45fd-a4df-08ab3dffc33d","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-07-16T23:18:47.677814Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T02:44:00.608590Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:b885c4bfdf09986cccebbed37b7ec3959d0af6b5c05cf54b040d198e73812d72","observation_id":"5a206202-79d4-4d82-9ccd-deef6721c0ae","resolution":{"observed_at":"2026-07-08T02:44:27.689493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-07-16T23:18:47.677814Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:026427af54ebe81d711ac908fb1d65f97051347622a2cc205588ae29ca8c3e19","observation_id":"6d7833d2-f947-402c-8f2f-9c41c8434e18","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":"2210.07474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-11T01:37:43.684631Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":"cs.CV","work_id":"8d9797f2-5882-4b0e-99d7-62e075c67387","year":2022},"citing_paper":{"arxiv_id":"2607.06620","last_updated":"2026-07-07T09:27:38Z","snapshot_observed_at":"2026-08-16T22:29:17.317123Z","submitted_at":"2026-07-07T09:27:38Z","title":"SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T01:29:46.709388Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2607.06620"},"observation_digest":"sha256:c757a89edac86cf71d69c780dd7d521b06ebba67448feb00419b9c28973c3919","observation_id":"6c66308c-2870-44c7-824a-b686389d25ba","resolution":{"observed_at":"2026-07-11T01:37:43.718773Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-01T22:45:08.351210Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15641","last_updated":"2026-07-17T05:34:29Z","snapshot_observed_at":"2026-08-18T04:16:02.444073Z","submitted_at":"2026-07-17T05:34:29Z","title":"IMBench: A Benchmark for Intuitive Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T22:45:08.351210Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2607.15641"},"observation_digest":"sha256:0eccbf3f1b1b8a2bdeb4f9b9023e1092e87e690ab8840676f05c77b96154cbc9","observation_id":"e3603877-e820-49b5-abad-1c6e8531855f","resolution":{"observed_at":"2026-08-01T22:45:08.351210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-07-31T06:18:55.880583Z","title":"SQA3D: situated question answering in 3D scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-08-08T15:15:40Z","snapshot_observed_at":"2026-08-19T08:51:57.216752Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation: A Survey","version":1},"reference_index":268,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.880583Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:a34cd961af00a344c12353a8e3da440253ae751a0a0efbb8a3ee52d1e8f6f282","observation_id":"c77eab79-ef14-4e5a-92a2-79d6ed19107c","resolution":{"observed_at":"2026-07-31T06:18:55.880583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-04T00:41:37.886561Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00110","last_updated":"2026-07-31T08:24:05Z","snapshot_observed_at":"2026-08-16T06:32:34.586905Z","submitted_at":"2026-07-31T08:24:05Z","title":"Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T00:41:37.886561Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.00110"},"observation_digest":"sha256:4b74e23367411cb57ee240b72d267d787affdf9eecd7041ee40fa662a7b1bc97","observation_id":"ba8df6b1-1262-4c46-9504-2301ce664a74","resolution":{"observed_at":"2026-08-04T00:41:37.886561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-15T15:08:10.235780Z","title":"arXiv preprint arXiv:2210.07474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01899","last_updated":"2026-08-03T08:36:18Z","snapshot_observed_at":"2026-08-17T23:44:23.207611Z","submitted_at":"2026-08-03T08:36:18Z","title":"SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:08:10.235780Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.01899"},"observation_digest":"sha256:d8150f7cae6f479e9ff42bdcb47f0e71eae5ffd7a204b12dd962908ab071be84","observation_id":"1c97c294-4d7f-4147-b2f8-df8ad2e07620","resolution":{"observed_at":"2026-08-15T15:08:10.235780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-08T04:27:28.908340Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02980","last_updated":"2026-08-04T00:32:09Z","snapshot_observed_at":"2026-08-16T12:56:35.931974Z","submitted_at":"2026-08-04T00:32:09Z","title":"Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T04:27:28.908340Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.02980"},"observation_digest":"sha256:440d2931804509a6a388011047f924ec140aa078f66d21ee615802ef60605d3f","observation_id":"eaa2cf8c-ab49-4f40-9e22-9dd632d5699f","resolution":{"observed_at":"2026-08-08T04:27:28.908340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T20:51:52.908285Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04610","last_updated":"2026-08-05T09:15:43Z","snapshot_observed_at":"2026-08-17T14:26:12.123577Z","submitted_at":"2026-08-05T09:15:43Z","title":"HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:51:52.908285Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.04610"},"observation_digest":"sha256:05ded93a0f3ca33129a76c73b47c62e99a5278b1529ca48e992bf021fc7c1a21","observation_id":"9883fbc9-cda3-4c97-9331-2b087a2e0870","resolution":{"observed_at":"2026-08-06T20:51:52.908285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-12T15:33:29.481703Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10864","last_updated":"2026-08-11T12:34:41Z","snapshot_observed_at":"2026-08-16T14:27:26.828874Z","submitted_at":"2026-08-11T12:34:41Z","title":"Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.481703Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.10864"},"observation_digest":"sha256:9abd5029027e0721b040ce26034379ad40a13444d0c6d55baa47896a6197532b","observation_id":"32cd7efc-d531-4675-b0dc-53185f7009b0","resolution":{"observed_at":"2026-08-12T15:33:29.481703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-12T05:15:36.107424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11150","last_updated":"2026-08-12T06:41:14Z","snapshot_observed_at":"2026-08-16T16:00:22.847931Z","submitted_at":"2026-08-11T17:09:49Z","title":"CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:15:36.107424Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.11150"},"observation_digest":"sha256:f2bd7f8cc3c0bb2323dbdd3b278371187cc24d5b8c206fd4fbb39e50f866c169","observation_id":"9109863f-f2b3-4b28-9562-c3096244ddf3","resolution":{"observed_at":"2026-08-12T05:15:36.107424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-15T14:18:39.145114Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11150","last_updated":"2026-08-12T06:41:14Z","snapshot_observed_at":"2026-08-16T16:00:22.847931Z","submitted_at":"2026-08-11T17:09:49Z","title":"CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:18:39.145114Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2608.11150"},"observation_digest":"sha256:8c15d7eb869a9e68cb323c457beeba1d83db7b1655921f7d51c2709c5f12fce7","observation_id":"db4ce132-ef9d-4b62-91fb-afec3b931859","resolution":{"observed_at":"2026-08-15T14:18:39.145114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2210.07474/citation-record","integrity":"/paper/2210.07474/integrity","json":"/paper/2210.07474/citation-record.json","paper":"/paper/2210.07474"},"outbound":[],"paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T22:30:06.161719Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 65 inbound Pith citation observations for arXiv:2210.07474."}