{"as_of":"2026-08-19T10:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64b923b32519a4722674c23eaf8b3feae4053f15c4c8ed5ca6bb1446ef69145d","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:34:56.080841Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.10616/citation-record","integrity":"/paper/2411.10616/integrity","json":"/paper/2411.10616/citation-record.json","paper":"/paper/2411.10616"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-12T19:34:55.834265Z","title":"Do as i 3 Synthesize Aggregate Synthesize Aggregate t","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.834265Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:fca4f1337571426836ab7b192795f139d0ac540ce222171de491a179ea7aa597","observation_id":"531e709f-84f1-4a75-8576-dc9a59e20fb7","resolution":{"observed_at":"2026-08-12T19:34:55.834265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:55.842385Z","title":"Openflamingo: An open-source frame- work for training large autoregressive vision-language mod- els, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.842385Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:120a407548904fdc2eb1d4c20dfa035763519f63ad02418da724ca3df1860d25","observation_id":"f0d8c161-0491-45b4-be93-c5f6e9c5e9d1","resolution":{"observed_at":"2026-08-12T19:34:55.842385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.853230Z","title":"Understanding human perception by human-made illusions","venue":null,"work_id":"d9725b4f-c2bc-442c-8a5a-f56221527f53","year":2014},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.848018Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:722916f29b8ec859d7b0643921d0973f00da198f7a4e1b0b5031d9399b16c89a","observation_id":"8c015225-5638-49cb-9901-54699e5afe93","resolution":{"observed_at":"2026-08-12T19:34:56.864286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:55.853514Z","title":"End-to- end object detection with transformers, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.853514Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:4f4f16a4983a7d4dac94da0b313e588ed28e42620a1dc4a20052f7aedcea4c47","observation_id":"3f240ac7-6db2-4e0b-aaed-2f28f43dce1b","resolution":{"observed_at":"2026-08-12T19:34:55.853514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.816985Z","title":"Xia, Brian Ichter, Kanishka Rao, Keerthana Gopalakrishnan, Michael S","venue":null,"work_id":"6c6f4c67-7936-48b2-ba2a-a63f019043ca","year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.860018Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:caec04a9b5fba65e10b664a82b0435310d54fc0e8817ede43056db29aa546c45","observation_id":"54a1b167-01d2-4dab-8add-765b49067847","resolution":{"observed_at":"2026-08-12T19:34:56.823333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.802903Z","title":"Schwing, and Alexander Kir- illov","venue":null,"work_id":"21b753ed-297e-42aa-a297-db7dcbc659f7","year":2021},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.867392Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:a61d80b99b2dff4e1d60dcf7b5ecc6c01f8cbf8c402d35d3a12ea28cf78b89ae","observation_id":"a42ac2ab-eec6-4087-801d-3d97cfe09065","resolution":{"observed_at":"2026-08-12T19:34:56.807137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.785866Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels, 2022","venue":null,"work_id":"987f64f1-6434-4d7d-a51b-5adb1a1694ed","year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.874576Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:8580a591935eade3e0c48ff45a1278887cce13905994a2cec507ef0f0dd673b1","observation_id":"d546126a-fd89-4be5-ab04-25ec6ad221a8","resolution":{"observed_at":"2026-08-12T19:34:56.791287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.765778Z","title":"Tenenbaum, Antonio Torralba, Florian Shkurti, and Liam Paull","venue":null,"work_id":"eab25830-6f69-4a8b-ba5a-ecadf5789a60","year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.880286Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:c8d6f8a1fd50f270d7dafd85472f88969b955733fbbca9ae59e10db72277523c","observation_id":"a30dda8d-4f95-44e7-aa2b-5a6cd195a278","resolution":{"observed_at":"2026-08-12T19:34:56.771724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.748431Z","title":"Tenenbaum, Antonio Torralba, Florian Shkurti, and Liam Paull","venue":null,"work_id":"df88e01c-9d66-4309-be5f-bf92c222f6cf","year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.885341Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:42c2f093272c07c2fa2f2c30857133517ff27d285c805cbbc3ba9d98a5012f99","observation_id":"f58aad0e-2c0e-4cb7-b540-69f2805e0551","resolution":{"observed_at":"2026-08-12T19:34:56.754571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.725036Z","title":"Semantic abstraction: Open- world 3d scene understanding from 2d vision-language mod- els, 2022","venue":null,"work_id":"1a2cfb1e-f969-4cd7-85b5-95de2495e76e","year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.895924Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:a583569d22696398ab7b948a8db5a5a0561279d9e112fe8452d632e888ea5916","observation_id":"7d5dd664-7570-4a71-b4f8-93fb7e4e769f","resolution":{"observed_at":"2026-08-12T19:34:56.734066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.704777Z","title":"3d-llm: Inject- ing the 3d world into large language models, 2023","venue":null,"work_id":"b43a50e1-b495-46ed-bb57-eb1b84201445","year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.901273Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:656daa3e1df17acb1d98aac3c5a258a8087306b87e5164178470edb825c8cc52","observation_id":"1a639bdc-df96-4da4-82d1-e98875365f10","resolution":{"observed_at":"2026-08-12T19:34:56.711968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.685675Z","title":"Toward general-purpose robots via foundation mod- els: A survey and meta-analysis, 2023","venue":null,"work_id":"4282ef20-0a2a-4899-8dba-2171e3d8a3ba","year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.907985Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:e0c23c8ca23e3e2415b05913ce348020e801b912dcee740692afbcecbe5a4d8a","observation_id":"9e9d2957-8b09-46d7-a1bf-491fc93a95d7","resolution":{"observed_at":"2026-08-12T19:34:56.691802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:55.913851Z","title":"Planning-oriented autonomous driv- ing, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.913851Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:05c0494365b8b92f149eeb9910f027ffdf1c63d20786e46b10a7755d07b276d6","observation_id":"70630af9-3200-4334-ba7c-caa26534b2eb","resolution":{"observed_at":"2026-08-12T19:34:55.913851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.660940Z","title":"Visual language maps for robot navigation","venue":null,"work_id":"a77513f7-0ab4-416e-9ea3-7092223705a4","year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.918327Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:154cb6ea5e53517d07e69a82a0a512ffa8499b1811358cba89fcda94916f0003","observation_id":"69cba47d-919b-4305-8554-0074e44e4a9d","resolution":{"observed_at":"2026-08-12T19:34:56.666428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07241","last_updated":"2023-10-23T14:56:15Z","snapshot_observed_at":"2026-08-16T15:55:21.590710Z","submitted_at":"2023-02-14T18:40:26Z","title":"ConceptFusion: Open-set Multimodal 3D Mapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07241","snapshot_observed_at":"2026-08-12T19:34:55.924583Z","title":"Conceptfusion: Open-set multimodal 3d mapping","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.924583Z"},"links":{"cited_paper":"/paper/2302.07241","citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:be9d9e159aced63f7350146ac944e46e26c7418d6e403475a4d1b4b756cf248b","observation_id":"87689f36-2c3e-44a2-b751-d9414707ad63","resolution":{"observed_at":"2026-08-12T19:34:55.924583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:55.930248Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.930248Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:b1b5d1584c2612c3bb1b1cadba36fa3d5dcdf70de37f0422dce7781d38151712","observation_id":"05abe6b6-e4d1-4a97-974d-8d5e3e97a6d3","resolution":{"observed_at":"2026-08-12T19:34:55.930248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.631821Z","title":"Multi-agent trajectory prediction by combin- ing egocentric and allocentric views","venue":null,"work_id":"a6070851-443f-4234-9552-6438a33e6024","year":2021},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.934814Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:5fdd17b30304c16362a0eb923e5689b539bc10f9b8a86bbc5b4e0928fb28c6b3","observation_id":"42196c0d-aa6d-4e13-ab1b-f9153397911c","resolution":{"observed_at":"2026-08-12T19:34:56.636683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.611413Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":"073faa61-c488-4924-8471-35f1d5502638","year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.939298Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:e5fade5a97e888d98ef90f93d5e0807ed91d4e27e69df774733a8e52d47a05cd","observation_id":"dd5b581a-917b-4347-9680-74da97a5e702","resolution":{"observed_at":"2026-08-12T19:34:56.616575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.591397Z","title":null,"venue":null,"work_id":"7d901889-a075-4484-b190-d8cec11b3f82","year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.943563Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:e1dbfd9999ddc5f82591cf104e28cd1104f428edcc9d4e7a9269047dba746d92","observation_id":"c9881d37-d89a-47fb-8f76-3f1342f15267","resolution":{"observed_at":"2026-08-12T19:34:56.597191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.573611Z","title":"Weinberger, Serge Belongie, Vladlen Koltun, and Ren ´e Ranftl","venue":null,"work_id":"ae67cb28-1cd6-4b50-809f-a899623309d4","year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.947832Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:55c36248496cc157f16c05ca29cb07c4b9415060ebae49884cde8c842bff63ea","observation_id":"fe928651-fdf9-4db9-add7-074ad3d2a8d8","resolution":{"observed_at":"2026-08-12T19:34:56.580958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.547973Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"9109116f-d354-4151-8ee1-42080e2f5bd5","year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.952558Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:59c5fd8db34c95a3ed52dcfa5c926677d5c68ff04b66cccd29f396878164051f","observation_id":"b1e4cf62-b16b-4297-90de-b2aff4a0bc5e","resolution":{"observed_at":"2026-08-12T19:34:56.553555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:55.957064Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.957064Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:6f954b123ebfd65c9160c9a1ab8f69cdf8638ce12365baad120ca50f07bb92de","observation_id":"374f6bc5-6fee-485d-8165-e79f87fcdf85","resolution":{"observed_at":"2026-08-12T19:34:55.957064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.518411Z","title":"Alvarez, Ping Luo, and Tong Lu","venue":null,"work_id":"0e05439f-8740-439b-bbf7-07f2ab7d5fad","year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.962388Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:1f5cbca1fab18cf3fdd3819845eded0ca7ceaae729be15844dfd09858d47156c","observation_id":"4f23bb91-3098-416c-ba3a-a30218d00071","resolution":{"observed_at":"2026-08-12T19:34:56.523727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04648","last_updated":"2024-09-21T15:06:21Z","snapshot_observed_at":"2026-08-16T14:20:43.185360Z","submitted_at":"2024-02-07T08:19:57Z","title":"OV-NeRF: Open-vocabulary Neural Radiance Fields with Vision and Language Foundation Models for 3D Semantic Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04648","snapshot_observed_at":"2026-08-12T19:34:55.967704Z","title":"Ov-nerf: Open-vocabulary neural radiance fields with vision and language foundation models for 3d semantic understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.967704Z"},"links":{"cited_paper":"/paper/2402.04648","citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:0dd5856b2bc9002fc34afe60baa2f86ef15eae00d72f9de4ebe2bb7d679747fc","observation_id":"014565d7-fa95-4abe-abc6-73486127a571","resolution":{"observed_at":"2026-08-12T19:34:55.967704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14093","last_updated":"2024-01-09T17:09:47Z","snapshot_observed_at":"2026-08-18T09:44:34.958088Z","submitted_at":"2023-05-23T14:16:49Z","title":"Weakly Supervised 3D Open-vocabulary Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14093","snapshot_observed_at":"2026-08-12T19:34:55.972382Z","title":"Xing, and Shijian Lu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.972382Z"},"links":{"cited_paper":"/paper/2305.14093","citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:8072bae6fdab0eadc657408bc28ad52cf1d413541f9783da0b9d18c52a4cd027","observation_id":"7d0ea6bc-40c1-464c-973e-9a881ea5a784","resolution":{"observed_at":"2026-08-12T19:34:55.972382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.500593Z","title":"Roco: Di- alectic multi-robot collaboration with large language models,","venue":null,"work_id":"26edf077-b5b0-4feb-bedf-f747baef05f2","year":null},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.983150Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:2369b275afdd867d38698d0124784868fe5b9dcaefa9bdc2c7ced9745efd5199","observation_id":"a81be63e-8a03-48d3-95c2-6e0232fde316","resolution":{"observed_at":"2026-08-12T19:34:56.507166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.484803Z","title":null,"venue":null,"work_id":"a0e0c126-58d4-4f19-93ed-3733d8f8d168","year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.987822Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:cfc6b7c865157584b400e0b4306c1f7603b4c9b4fc2b7860ac64b5d1276a3733","observation_id":"de141646-0788-48a0-b20a-4e1f6e5b072d","resolution":{"observed_at":"2026-08-12T19:34:56.489795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.466165Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":"af288550-98e9-4120-a3db-281ecbbe957b","year":2020},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.992370Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:52af73f6752523b036d85e17691ff962ad6da35d01f2fe7f14a2cb3f53f31314","observation_id":"df7fdc46-3dd7-4633-8bc9-c4904ca96ca1","resolution":{"observed_at":"2026-08-12T19:34:56.473247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.445966Z","title":null,"venue":null,"work_id":"313266bb-9df7-48fa-938e-6707e4e3ae40","year":2024},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:55.998080Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:f28ec90039df84f1e85d9fad5f22668d2e2044d595f43c27a7c7cb32fa0fa0ad","observation_id":"86671350-5c7e-4996-b2bb-35b8bf898645","resolution":{"observed_at":"2026-08-12T19:34:56.450696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.005561Z","title":"Openscene: 3d scene understanding with open vocabularies,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.005561Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:b35235269dfe85da4ad007a083e84ed43be807883f21d8c67da99939ef024dfa","observation_id":"ea81edee-456f-477d-9bbf-25110fdfe87f","resolution":{"observed_at":"2026-08-12T19:34:56.005561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.011017Z","title":"Langsplat: 3d language gaussian splatting,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.011017Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:63ebd603befd5d78a1985aee65f19f0587f5efd38f59a31b149bd899456740e1","observation_id":"f4a08239-0cbd-4f13-977a-596d08174c97","resolution":{"observed_at":"2026-08-12T19:34:56.011017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.385638Z","title":null,"venue":null,"work_id":"f7c42a52-0a3b-415a-be17-2082ddb2e3f8","year":2021},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.016312Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:9637deb595b8449ba0de1a8331b4fe52eda835ae3a3367cee519b1e345a5d979","observation_id":"4025fdae-a82d-4840-a678-dc972374d3f7","resolution":{"observed_at":"2026-08-12T19:34:56.397965Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05663","last_updated":"2023-05-22T22:34:29Z","snapshot_observed_at":"2026-08-16T16:25:05.169917Z","submitted_at":"2022-10-11T17:57:10Z","title":"CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05663","snapshot_observed_at":"2026-08-12T19:34:56.021757Z","title":"Clip-fields: Weakly supervised semantic fields for robotic memory","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.021757Z"},"links":{"cited_paper":"/paper/2210.05663","citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:99ff1c2eeff746629ef5d3550d159f6f53159c6d03ff87cc53710a1237f81376","observation_id":"bec7eb8c-c25c-49ba-a8d1-07e34a2eaadc","resolution":{"observed_at":"2026-08-12T19:34:56.021757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.369313Z","title":"Davi- son","venue":null,"work_id":"9f677346-3576-475f-abd8-06aed851bcac","year":null},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.027871Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:8f3bf3ad2b0082c235cceb14b187f34b0aac6c575ce505a92bd175724d1c7d11","observation_id":"14269923-c1ce-46dd-8898-87dee3ccecbf","resolution":{"observed_at":"2026-08-12T19:34:56.373795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.347149Z","title":"Vi- sual slam algorithms: A survey from 2010 to 2016","venue":null,"work_id":"cfbea74b-bfcc-4201-a7a9-6314e9c2e284","year":2010},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.034798Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:bf62a9bd3f995fea2f46f3a05169318ca813ac4553fd9f32a0d7317193a2540e","observation_id":"b90d7ba4-e30a-454c-a1cf-678d61228c48","resolution":{"observed_at":"2026-08-12T19:34:56.352431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T19:34:56.043054Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.043054Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:20af98f1939d6df6907681025c0410d0e19db166866ade2b1c6a36344667ee07","observation_id":"3ef6df43-fe41-4555-81a2-d25742e49bfa","resolution":{"observed_at":"2026-08-12T19:34:56.043054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.331561Z","title":"Neural feature fusion fields: 3d distillation of self- supervised 2d image representations","venue":null,"work_id":"64700786-eca6-4858-9864-4fa861bd9c78","year":2022},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.051380Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:539f2c348714b55311e8fbffabe57f9878c04b9bf65c2fe02f1bc93599dd5b4f","observation_id":"e023892a-3207-4ebb-9001-2127f74a8a27","resolution":{"observed_at":"2026-08-12T19:34:56.336261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.056558Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.056558Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:b8c65ddc7110cce7c473c813c60c15e7c3c56c36500b29c5012f55f26222d033","observation_id":"1eb6e6d6-accd-4864-9a9c-38dcc527289c","resolution":{"observed_at":"2026-08-12T19:34:56.056558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.300771Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":"eae888b4-5d88-4d1c-a2e8-318c8a4bce34","year":null},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.062747Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:3bbf522876061244a871ab35402fc2ee9916b2fe193c51ed07dc6e759e10db63","observation_id":"fbfd4aa3-5288-4aa2-8354-c5f56e396a15","resolution":{"observed_at":"2026-08-12T19:34:56.308085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.067324Z","title":"Deformable detr: Deformable transformers for end-to-end object detection, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.067324Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:c2abec337cf9e8f4da732da0af554854a1a94f08d5a8dd865613c74d71ed811c","observation_id":"67669d34-0828-4c40-b6f5-1665c6d0b353","resolution":{"observed_at":"2026-08-12T19:34:56.067324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.071456Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.071456Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:869684131edda23cb7cb7b3e22a4eaa4375a3e6dcf48fcb7b4979132c07845a8","observation_id":"28da500d-cb2b-4928-b5ad-cd1e2c7a563c","resolution":{"observed_at":"2026-08-12T19:34:56.071456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:34:56.251428Z","title":"Natural language processing in the era of large language models","venue":null,"work_id":"5b3eb6f9-0191-4d19-ad4d-b399d7bd163a","year":null},"citing_paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:34:56.080841Z"},"links":{"citing_paper":"/paper/2411.10616"},"observation_digest":"sha256:0d04cb986743a40d84d641315aafd0259ee1e8aee7aecc733ffaba65b126f054","observation_id":"a8013756-5c17-4eee-b079-29acdffd6c0e","resolution":{"observed_at":"2026-08-12T19:34:56.259142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.10616","last_updated":"2025-01-09T15:45:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T09:45:16.913156Z","submitted_at":"2024-11-15T22:37:56Z","title":"Voxel-Aggregated Feature Synthesis: Efficient Dense Mapping for Simulated 3D Reasoning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2411.10616."}