{"as_of":"2026-08-17T21:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6bdcbe817ea2a5ca2f6c45010bbf276ff449c53933a40a52da6f07096f9bcb9","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:11:06.173763Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:41.125211Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:53:48.384530Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"cited_work":{"arxiv_id":"2411.17458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17458","snapshot_observed_at":"2026-08-07T13:53:48.384530Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","venue":"cs.CV","work_id":"04098dd0-0641-4aa2-a971-d7ed78bca367","year":2024},"citing_paper":{"arxiv_id":"2505.20814","last_updated":"2025-05-27T07:22:33Z","snapshot_observed_at":"2026-08-14T19:21:07.548972Z","submitted_at":"2025-05-27T07:22:33Z","title":"Spatial RoboGrasp: Generalized Robotic Grasping Control Policy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:53:41.125211Z"},"links":{"cited_paper":"/paper/2411.17458","citing_paper":"/paper/2505.20814"},"observation_digest":"sha256:aad264af8c49104727ffa007f0498adc4789de4ec285d67d1d401ca5b6e37cb2","observation_id":"f87aae73-bfc0-414e-a53d-ef1deb55b78a","resolution":{"observed_at":"2026-08-07T13:53:48.437750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17458/citation-record","integrity":"/paper/2411.17458/integrity","json":"/paper/2411.17458/citation-record.json","paper":"/paper/2411.17458"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.13682","last_updated":"2024-09-20T17:50:07Z","snapshot_observed_at":"2026-08-16T13:16:47.678009Z","submitted_at":"2024-09-20T17:50:07Z","title":"ReMEmbR: Building and Reasoning Over Long-Horizon Spatio-Temporal Memory for Robot Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13682","snapshot_observed_at":"2026-08-12T12:11:05.998750Z","title":"Remembr: Building and reasoning over long- horizon spatio-temporal memory for robot navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:05.998750Z"},"links":{"cited_paper":"/paper/2409.13682","citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:3b463b359cf33d12262ab3eff8106b61b6d2d3ac6b8748edd33a06c35e5fb559","observation_id":"05292ab4-7592-4685-bbe2-7d00d23bbcda","resolution":{"observed_at":"2026-08-12T12:11:05.998750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.689374Z","title":"Apollo: An open autonomous driving platform","venue":null,"work_id":"afb2af71-5c74-424c-8552-fb9800c43414","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.002889Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:880c1c3b45f30999a0122d72c16609874de7a04e49d9f5b20bc35ca7b3840cfc","observation_id":"5da46c21-4592-4bde-9125-4497ac67d6ae","resolution":{"observed_at":"2026-08-12T12:11:06.692850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.006478Z","title":"Midas v3.1 – a model zoo for robust monocular relative depth estimation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.006478Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:5c7debc94f8e196bba946c05208acdb419285595cb7eee96d52b1c9b8a249267","observation_id":"e6bb57c4-c001-4563-8d8d-52f56dc1e29a","resolution":{"observed_at":"2026-08-12T12:11:06.006478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.673658Z","title":"Jackel, Mathew Monfort, Urs Muller, Jiakai Zhang, Xin Zhang, Jake Zhao, and Karol Zieba","venue":null,"work_id":"964106cb-3231-4915-be5b-dc4239e22ca3","year":2016},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.009591Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:b0f920d42de5306f5e5c230d914d0198b22249157e924470d1ea842890e6846b","observation_id":"b6f76a4f-7d49-499b-9a86-ae9874b24064","resolution":{"observed_at":"2026-08-12T12:11:06.677483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.662840Z","title":"Emerg- ing properties in self-supervised vision transformers, 2021","venue":null,"work_id":"ab137844-79c0-4cfb-a5c5-ce6ebcf3f856","year":2021},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.014148Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:6e44ff34e324c6970da7c82557c5e4e63812be90e3b0c1583188bdacc1fb4944","observation_id":"d8a7978b-24fd-4db2-85ba-6588255f7bd3","resolution":{"observed_at":"2026-08-12T12:11:06.666409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.652715Z","title":"Diffusion policy: Visuomotor policy learning via action dif- fusion, 2024","venue":null,"work_id":"20015f8a-4fc6-4340-bde0-a2de63adc218","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.017559Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:ac5c0ff392b90a13243c6ee37af7f294bcde68a0b646ca19d80652e857589c51","observation_id":"bd12b86e-0516-4d2c-87bb-c0eae77808f3","resolution":{"observed_at":"2026-08-12T12:11:06.656143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.642906Z","title":"Benchmarking robustness of 3d object detection to common corruptions in autonomous driving, 2023","venue":null,"work_id":"4279c5f6-4da9-4fce-9740-731f155ed6a9","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.020995Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:290ad6b0e0f55cbbf728bbe8bcafc763795ad827fcca9980f360617749212efc","observation_id":"3de98456-9ac8-4106-83a1-595aa2294fb7","resolution":{"observed_at":"2026-08-12T12:11:06.646607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.632063Z","title":"Scene memory transformer for embodied agents in long-horizon tasks","venue":null,"work_id":"0bf76d96-2596-4b9b-abd3-5c09aa8d9ac7","year":2019},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.024570Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:57a01759f42dc2c665de4474dcf98cfa63804f98b1b78d5803029a4e9d27ccce","observation_id":"55821bf4-f2ee-4649-a53c-4f9923024e3c","resolution":{"observed_at":"2026-08-12T12:11:06.636071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.622464Z","title":"Zhao, and Chelsea Finn","venue":null,"work_id":"98a092df-f58c-48b1-8f4c-5aaf53a9a8c6","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.027615Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:93e3679c4c5b0505b2a7694fe0f0b88d921b6783dab4b56d84eb2f271d17e38f","observation_id":"930ebf98-1653-42c2-bc59-d760aa38b90d","resolution":{"observed_at":"2026-08-12T12:11:06.625829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.612697Z","title":"Paschalidis","venue":null,"work_id":"6cd89063-9378-4421-9fe9-9b11dc3dd375","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.031366Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:f825afa88ce6e4ae4707b9b797b021bd294314b03738ee8500dbb991654d0d8a","observation_id":"0b024a8a-8a48-4f46-baa8-2d3aa87ee571","resolution":{"observed_at":"2026-08-12T12:11:06.616123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.034373Z","title":"Deep residual learning for image recognition, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.034373Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:5978c5cc37eded5d0e7d7f304b95ece3cb5e18b758dc4a392f0cae21e7201b14","observation_id":"51faa333-791a-4e2e-8b0e-5ec08dfd631a","resolution":{"observed_at":"2026-08-12T12:11:06.034373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.596969Z","title":"Benchmarking neu- ral network robustness to common corruptions and perturba- tions, 2019","venue":null,"work_id":"f1c20667-30ca-4def-961f-62bbd9708b13","year":2019},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.037463Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:e97edff53ec802fc2cff05d774ebd7174ca89a8b322cc5acc8e5d5a0b9f6f5d6","observation_id":"40c0f03f-4c7b-44eb-a316-9940aa962930","resolution":{"observed_at":"2026-08-12T12:11:06.600588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.586973Z","title":"Cubuk, Barret Zoph, Justin Gilmer, and Balaji Lakshminarayanan","venue":null,"work_id":"23d454ed-0732-4497-8f20-60cf0d4b11ab","year":2020},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.040735Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:3d6a4fa085c605594b23cb154d3d86730ecf2c3353d9e595fbcab3b441efb05d","observation_id":"4bbfd44e-1f49-4642-8712-e3777da4631a","resolution":{"observed_at":"2026-08-12T12:11:06.590619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.043979Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.043979Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:2e194dee55b7c0a5e314345ea51d25d04ac6c7dcb0d771ccb176639fe224a068","observation_id":"8b252dcc-41b9-4d61-aeb0-fe07db93735b","resolution":{"observed_at":"2026-08-12T12:11:06.043979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.570940Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":"ccd76f98-432c-4d60-ae62-6a5b744b4ae1","year":2020},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.048481Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:e81e712fdf468f6333a27457b197cebd55b4f59c403f1cb12aa2818e5a24f82a","observation_id":"2f0e422d-2544-4b7f-987d-62580a4f7be8","resolution":{"observed_at":"2026-08-12T12:11:06.574467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.561023Z","title":"Imitation with spatial-temporal heatmap: 2nd place solution for nuplan challenge, 2023","venue":null,"work_id":"43820ff3-32f5-419d-b71c-43ccdb3cb1ef","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.051348Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:fa85f3ceb8d55f383111fe57fc5c1c517b5c98dc01ca25f3dccbe02cab47a57d","observation_id":"13ee5704-8452-448f-bb21-00dc28be95f0","resolution":{"observed_at":"2026-08-12T12:11:06.564541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.549744Z","title":"Rekep: Spatio-temporal reasoning of rela- tional keypoint constraints for robotic manipulation, 2024","venue":null,"work_id":"c6a6b3a8-b825-4433-9ac0-f293254a90f7","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.054277Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:f03b720e486c4b30cf18d479edcb5c5be4fbffd5b14030b8f29c148a9dd9d8a2","observation_id":"baa3a2d1-e2b5-4e0e-82c3-76731d9a76ba","resolution":{"observed_at":"2026-08-12T12:11:06.554356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.539616Z","title":null,"venue":null,"work_id":"ddc90133-3403-4e62-9480-baf01f00693a","year":null},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.057152Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:c814d31aa6d5866e7308e7af7a29b3ce4c212624d128183fd3d93ea45fa4e5a0","observation_id":"a7024e10-5360-46b7-b313-c8c4902faff2","resolution":{"observed_at":"2026-08-12T12:11:06.543429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.529584Z","title":"FORTRESS: Feature optimization and robustness techniques for 3d object detection systems","venue":null,"work_id":"5c392ddf-3133-4c8c-bac3-8ca7b38864e5","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.060238Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:3e4f46fd378db7b601ac445ae37f7c9677d94c98c696f503643cafef3c09f504","observation_id":"1edb32ea-cb36-4614-b2f7-609917775d55","resolution":{"observed_at":"2026-08-12T12:11:06.533148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.519836Z","title":null,"venue":null,"work_id":"7997b0c2-ef5a-4d93-989f-69111de58c20","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.063227Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:6a28312a0b8987b86da9d3acaf9f817800fef6d3cfcb4c5677eb99175cf7e474","observation_id":"2af1f14e-5e7b-49a7-8372-0623b9baa02f","resolution":{"observed_at":"2026-08-12T12:11:06.523206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.067182Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.067182Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:38789a1b5764238af38f09bf68cf5145be0fb183e6335b092323973ea22a1ed4","observation_id":"1dd02c3a-31aa-40e7-86d1-167eef805a80","resolution":{"observed_at":"2026-08-12T12:11:06.067182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.503238Z","title":"Domain adaptive imitation learning, 2020","venue":null,"work_id":"4d1fc339-3e68-46fd-bd97-67e8f163ebad","year":2020},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.070759Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:ea7af72f89aae005db0cdfaa734abd96974d154c516f8f4d55167d5f308d318e","observation_id":"26f973a4-f821-4f13-95f1-b477ec9c2418","resolution":{"observed_at":"2026-08-12T12:11:06.507570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.493355Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":"50c5878a-10ce-47ce-8b5c-f86da4b9c7ac","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.074201Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:d82a43a4ec60e8c05e17599bb07f864209df2b8b881316cf0a666da5d3ebd414","observation_id":"bee77bd3-b4a6-4ca6-80de-c1a596f63857","resolution":{"observed_at":"2026-08-12T12:11:06.496777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.483563Z","title":"End-to-end planning of au- tonomous driving in industry and academia: 2022-2023,","venue":null,"work_id":"cb54eea2-b298-4e10-aa0f-ba048d9dcc49","year":2022},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.077155Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:8af2775e6c7967a290a2cf7097a85172c27d7ba1a4fc1ac66c6d981516e6be7e","observation_id":"ab7c5d8c-e958-4ae4-8bc1-5cb1f5e24b9b","resolution":{"observed_at":"2026-08-12T12:11:06.487292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.473352Z","title":"Okami: Teaching hu- manoid robots manipulation skills through single video imi- tation","venue":null,"work_id":"6b65e052-ba32-4989-870d-c802532ab16f","year":null},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.079956Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:2ca58c3b09223caebf2fbf771afe202e707ab3f639c813f395b1269dcf995575","observation_id":"2d89ebcf-d984-4897-af65-70aa664c2e76","resolution":{"observed_at":"2026-08-12T12:11:06.476798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.463711Z","title":"Robust visual imi- tation learning with inverse dynamics representations, 2023","venue":null,"work_id":"929dbad4-d422-4f92-8737-4a75f8143f58","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.083229Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:ab9114417abed0522abf8f1537447ae507f44aa866d9887a85437c7c17b9ba08","observation_id":"7f950add-244f-4605-a44e-ddd0f0c18ba5","resolution":{"observed_at":"2026-08-12T12:11:06.467262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.452422Z","title":"Alvarez, Sanja Fidler, Chen Feng, and Anima Anandkumar","venue":null,"work_id":"2df2d3a6-459f-4f45-a71d-8f2983645e08","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.086198Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:23236e8e488cec04ba5b7994a42873f5e69b6fb2e6f1f68e2ffcc27e47dcb2a6","observation_id":"bf545937-1fd5-43ae-9db4-bb40a6a04ee2","resolution":{"observed_at":"2026-08-12T12:11:06.455765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18647","last_updated":"2026-06-26T02:30:53Z","snapshot_observed_at":"2026-08-16T13:06:19.118101Z","submitted_at":"2024-10-24T11:19:30Z","title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18647","snapshot_observed_at":"2026-08-12T12:11:06.089934Z","title":"Data scaling laws in imi- tation learning for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.089934Z"},"links":{"cited_paper":"/paper/2410.18647","citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:3bd2ac774908c4392df8501255733fb8ec60022732518ccb9049eb8f5e659b3f","observation_id":"3b31211a-e08b-447b-a758-1a862bd0df1e","resolution":{"observed_at":"2026-08-12T12:11:06.089934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.093513Z","title":"Feature pyramid networks for object detection, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.093513Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:add97fa37b6c73a71320e86731bb1850dd6667870ef36d86e5c9d537e1bca8c0","observation_id":"923ed01d-a193-488c-8e22-e285877e3d52","resolution":{"observed_at":"2026-08-12T12:11:06.093513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.436485Z","title":"Occupancy prediction-guided neural planner for autonomous driving,","venue":null,"work_id":"ead2b006-cd7e-42a2-ba5f-758c556c0352","year":null},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.097408Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:717c02a0edba6572646cbad2222c97a18bcea1649e9c91de455be158217441c8","observation_id":"8219f36a-4d8e-4438-9df8-8743b6a37c88","resolution":{"observed_at":"2026-08-12T12:11:06.439946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.426746Z","title":"Robust imitation learning from corrupted demonstrations, 2022","venue":null,"work_id":"530eb766-6d9e-46e1-94ce-49b9001f82c3","year":2022},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.100566Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:128e4ba48e2ae63b62ab4c77222ed8bdb45edef4d8be899cf3a285a26f2deff0","observation_id":"45b45b28-2c97-4a96-a4fa-d222d0dca406","resolution":{"observed_at":"2026-08-12T12:11:06.430049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.416396Z","title":"The practice of mass produc- tion autonomous driving","venue":null,"work_id":"8d040a43-fe7f-4c79-a2a0-252cb135da10","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.103451Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:b40b9c18c911743d2d66060286648fd2afa88b3806cab7d0ea8125c054aa3a95","observation_id":"208e5e7a-f2fc-48cc-abd2-d40e2eb94c7a","resolution":{"observed_at":"2026-08-12T12:11:06.420462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.406423Z","title":"Point- voxel cnn for efficient 3d deep learning, 2019","venue":null,"work_id":"30fe9d7a-2f6b-4ff9-857e-44994dd1ba02","year":2019},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.106579Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:d70c429f1bfa994cfbbc8fbdb17b170ff04b942a25ded7f45d5a04b1b629d267","observation_id":"5548b18a-b12c-4441-8b5b-80f165ad3c81","resolution":{"observed_at":"2026-08-12T12:11:06.410182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.396654Z","title":"Ecker, Matthias Bethge, and Wieland Brendel","venue":null,"work_id":"2ac59071-833d-4a11-8e2b-5ea79b2b67d1","year":2020},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.109482Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:366083b6d5199491bb51c21105348252f1f5d86c6febf0d5d47a2b107e14442b","observation_id":"1b4aa277-7ef5-4661-8c79-eb96b0d9cb51","resolution":{"observed_at":"2026-08-12T12:11:06.400366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.112441Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.112441Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:3a3e19e55b67641d40d56c2ee485ea541c38ae1f8d837c279c8a4b4317073621","observation_id":"9ecf87b2-dc2a-4059-80bd-47c763f9644b","resolution":{"observed_at":"2026-08-12T12:11:06.112441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.380797Z","title":"Dinov2: Learning robust visual features with- out supervision, 2024","venue":null,"work_id":"4d3d739e-58f8-4c0a-a90b-37a3a0be6845","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.115494Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:7d47f73d2bee51e418fc324623d6f0e97533ab46f828f8eec973e170cf182f60","observation_id":"8ca51b71-4b15-480f-9234-5b83ff81272e","resolution":{"observed_at":"2026-08-12T12:11:06.384151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.370622Z","title":"Ro- bust multimodal vehicle detection in foggy weather using complementary lidar and radar signals","venue":null,"work_id":"0902ae00-9123-485d-bf29-33a3e9b1081a","year":2021},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.118747Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:e5d3f2a6dbe7d734b382586ee5e80c541b103761775160b83674612089e18109","observation_id":"a19c879d-4659-4872-8fb4-9c0999b1d237","resolution":{"observed_at":"2026-08-12T12:11:06.374004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.121684Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.121684Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:7eb9163064ef9915e7a2a3256afaf4f23a3419495bf5060ecbe32329b06730e8","observation_id":"7c988782-7f13-4341-8b15-d479b02de059","resolution":{"observed_at":"2026-08-12T12:11:06.121684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.355787Z","title":"3d-outdet: A fast and memory efficient outlier detector for 3d lidar point clouds in adverse weather","venue":null,"work_id":"f3ecb852-fc54-444e-be00-b3dbeb810c81","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.124719Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:1da54571ea373845604a877d1557a109b3a6e0d010e1b1e80fb1b1fbfff10a72","observation_id":"78bd8131-3d91-417c-bd42-774f5acaa08f","resolution":{"observed_at":"2026-08-12T12:11:06.359139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.128514Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.128514Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:192cb1fc5c6f655f6edceb1936849033f9ee0f9356c2669ce126043664ed2df9","observation_id":"6c7b082a-71f5-4fc6-bf87-3632672f0aa2","resolution":{"observed_at":"2026-08-12T12:11:06.128514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.340741Z","title":"Raychaudhuri, Sujoy Paul, Jeroen van Baar, and Amit K","venue":null,"work_id":"40e7f4f5-c1c2-4df0-aa43-705d9b806942","year":2021},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.132259Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:3747f7e71ed9c6a7d6427ca3125b5cf2f2160a06699461604f787bea9a2e9764","observation_id":"759924a2-2e49-432b-a265-18631f4bf98b","resolution":{"observed_at":"2026-08-12T12:11:06.344235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.330563Z","title":"Cliport: What and where pathways for robotic manipulation, 2021","venue":null,"work_id":"893f232b-4189-41a5-9c10-4369410a34ab","year":2021},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.135178Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:7be2fea8f4973ab8653ce6bd950f64681fce1f5b9f528fba077b5cbcff799b87","observation_id":"a08cf6cc-4ce0-4319-9f5c-7bb9f2cdf61e","resolution":{"observed_at":"2026-08-12T12:11:06.334713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.321130Z","title":"Robust imitation learning from noisy demon- strations","venue":null,"work_id":"f11b90ba-c62d-454c-925a-396ce8991347","year":2021},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.138077Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:89f765269e00b8562c3064f38e056a383fb6829e3748ecc38618d80f34eba1be","observation_id":"98987e00-98c4-483c-9311-dd3bc9cf4d6c","resolution":{"observed_at":"2026-08-12T12:11:06.324554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.311281Z","title":null,"venue":null,"work_id":"4116a2a6-dd45-470e-95e6-f1f717e50a72","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.141063Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:3fa2c945aa2837a298a05894be5e938806e09a8bad8d6a14aebba7a2f77474a1","observation_id":"11a403a0-0469-451e-87a4-1b5ccf31885c","resolution":{"observed_at":"2026-08-12T12:11:06.314659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.144398Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.144398Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:78372fd04c82d3d12e3a175dcb6755a05b42f7f91104d64837033b9fb02d2310","observation_id":"d671a01d-b05f-4cfd-a051-793d4b4ba993","resolution":{"observed_at":"2026-08-12T12:11:06.144398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.295965Z","title":"4seasons: A cross-season dataset for multi-weather slam in autonomous driving, 2020","venue":null,"work_id":"4ae21a4d-cfcf-4607-b73c-6bd0937bcbcf","year":2020},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.147285Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:010fb3ff4fb12b20103e0d738275e6afdf0c2c29012f24ed56302c09239a6aed","observation_id":"85d13d6e-ef95-447a-86fe-7e4ccf771520","resolution":{"observed_at":"2026-08-12T12:11:06.299863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.286426Z","title":"Generalized robot learn- ing framework, 2024","venue":null,"work_id":"544f83a8-f00f-464c-bc05-2471a95e5e46","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.150126Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:285405b23094281ac70db0ff1e2ee9d4c5a507e2f0a46a16fb24f81e025a9253","observation_id":"e829b718-02ee-4af4-b1a2-fdf55325b12e","resolution":{"observed_at":"2026-08-12T12:11:06.289786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.153216Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.153216Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:5a0a5a303e61a770d375152e999e2ffbf5802d914ada205e13e737b2b7d906fd","observation_id":"b84897ce-0550-4e87-a5a9-d01a2272e809","resolution":{"observed_at":"2026-08-12T12:11:06.153216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.270537Z","title":"Depth any- thing v2, 2024","venue":null,"work_id":"ba0dd547-a77d-40a3-8841-396daec8ce4f","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.156316Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:41e9a4baad8c238be64f1785325354ed4b69cc227dd375c3294b6b4c0f41d0f4","observation_id":"9c2553ae-fa63-4d74-980a-45aa5e05a6ea","resolution":{"observed_at":"2026-08-12T12:11:06.274032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.260528Z","title":"Primedepth: Efficient monocular depth estimation with a sta- ble diffusion preimage, 2024","venue":null,"work_id":"fdb8cb72-9848-44d7-b8c0-37d06ec57f77","year":2024},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.159789Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:68183195af23574d69933ba94b561116a5bb74cb422c39cdb13013f56296f782","observation_id":"686a6ab6-2083-45c7-939b-b4dd5bb029ec","resolution":{"observed_at":"2026-08-12T12:11:06.264018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.250636Z","title":"Multi-object detection at night for traffic in- vestigations based on improved ssd framework","venue":null,"work_id":"6c8f7277-133a-4899-acec-88eed04e78ed","year":2022},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.163389Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:df58cea884ff114a91157c9d514232b6d33f0962a2f07dc658c48015b1607791","observation_id":"19b0e112-9ecf-4397-b796-7360df63bafe","resolution":{"observed_at":"2026-08-12T12:11:06.254669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.241160Z","title":"Safe occlusion-aware au- tonomous driving via game-theoretic active perception","venue":null,"work_id":"e77b89d0-fa35-474e-9f9c-03c9a7ea8951","year":2021},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.167169Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:e21a18efb7f4c6f9352c4c97cbc039c8995ee7a932e2e901f4bd08340fb97456","observation_id":"7c29df97-cbed-4b20-b09a-6c7f8b5f010d","resolution":{"observed_at":"2026-08-12T12:11:06.244517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.230885Z","title":"Autofed: Heterogeneity-aware federated multimodal learning for robust autonomous driving, 2023","venue":null,"work_id":"9b92880a-eb74-4e5d-82db-ba6de4c3346b","year":2023},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.170444Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:121a31df9625171bc4f158f33dd5feca9ba0d3ba4a7c8e099434753aefc02780","observation_id":"6739c108-dbc8-431f-934b-b839510eb26f","resolution":{"observed_at":"2026-08-12T12:11:06.235125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:11:06.219280Z","title":null,"venue":null,"work_id":"c3206aa4-3cfc-4799-a15d-cc00cce99cb7","year":2022},"citing_paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:11:06.173763Z"},"links":{"citing_paper":"/paper/2411.17458"},"observation_digest":"sha256:f0ec6476eee1b006e5996e68adff6f30b84d023fb68ab19edb969cbbdbd8088d","observation_id":"a9359d3f-ef55-4a2e-9514-e40df5bb5fa0","resolution":{"observed_at":"2026-08-12T12:11:06.223321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17458","last_updated":"2024-11-26T14:23:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T16:30:45.687831Z","submitted_at":"2024-11-26T14:23:42Z","title":"Spatially Visual Perception for End-to-End Robotic Learning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2411.17458."}