{"as_of":"2026-08-07T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acc85c0e2798a42eb2409e713f3ca399d953dd6c7b58dfc34435f9374397ffb2","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:03:21.467027Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T04:18:02.341742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:05:50.616851Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"cited_work":{"arxiv_id":"2508.17230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17230","snapshot_observed_at":"2026-07-01T17:05:50.616851Z","title":null,"venue":null,"work_id":"8c14de08-f2b6-4b92-922a-13bf51271878","year":2025},"citing_paper":{"arxiv_id":"2606.28215","last_updated":"2026-06-26T16:05:58Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T16:05:58Z","title":"HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T04:18:02.341742Z"},"links":{"cited_paper":"/paper/2508.17230","citing_paper":"/paper/2606.28215"},"observation_digest":"sha256:5db578d4a5de10a2154e52ba959ca315be5f7aa55504a60f1d0c23ab04e98326","observation_id":"5a7e9431-ae2c-4ab2-8f13-ae8a4b1ad604","resolution":{"observed_at":"2026-07-01T17:05:50.618485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.17230/citation-record","integrity":"/paper/2508.17230/integrity","json":"/paper/2508.17230/citation-record.json","paper":"/paper/2508.17230"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.14257","last_updated":"2024-11-04T03:01:27Z","snapshot_observed_at":"2026-08-06T00:31:00.527257Z","submitted_at":"2021-05-29T09:26:02Z","title":"Diffusion-Based Representation Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14257","snapshot_observed_at":"2026-08-05T17:03:21.017683Z","title":"Diffusion-based representa- tion learning.arXiv preprint arXiv:2105.14257, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.017683Z"},"links":{"cited_paper":"/paper/2105.14257","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:d1a2cb82418ccd9051b7cf3341083f7b5f9c8e5ff775dd565ada69f0e794a34d","observation_id":"6a635510-11fe-4aeb-9a56-f8e3070eb9b9","resolution":{"observed_at":"2026-08-05T17:03:21.017683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.333829Z","title":"Cobot magic: An open-source robotic system.https://global.agilex.ai/products/ cobot-magic, 2025","venue":null,"work_id":"e0fde486-f578-4ec9-ac5d-3614addd71b4","year":2025},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.139352Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:6f8f7d4d3fd8ef7684a72e69a075e9cedb6155bfdd3ade265e033bf2b2e53bf4","observation_id":"966afc96-74aa-45a7-8078-86a83e867bc3","resolution":{"observed_at":"2026-08-05T17:03:22.338006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.320397Z","title":"Is conditional gen- erative modeling all you need for decision-making?, 2023","venue":null,"work_id":"94f2341b-7c7d-4bf9-99bf-71db0fc91dd0","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.225443Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:999ffe244acd3d1ea6c4090cf939e933e43800c1fedb2aef2cce54576fec32aa","observation_id":"eb778560-faca-4d28-99e0-00c7c75dabbd","resolution":{"observed_at":"2026-08-05T17:03:22.324751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-03T00:02:57.373313Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-05T17:03:21.230022Z","title":"Diffu- sion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.230022Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:e64d487227614d32c6038f8bb73338639251494eb3d2a5a2659da6eaff8412bd","observation_id":"342b70fd-7065-47be-b0f9-bb647dbf006c","resolution":{"observed_at":"2026-08-05T17:03:21.230022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.306081Z","title":"An unbiased look at datasets for visuo-motor pre-training","venue":null,"work_id":"7b786ce0-1433-4e14-8c7e-14a3be746361","year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.235078Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:5596e0ee03b54102cb9ee4cb69cfdc5aa20e9a82b5d4753f2adb900ff5ef3270","observation_id":"080d14c6-c09b-47f0-a02b-db9d260702ed","resolution":{"observed_at":"2026-08-05T17:03:22.311444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.239383Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.239383Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:01f4a3f9b36e512a8830ded5d3070ae9774a45d03286dd81d7a28a308c0e2924","observation_id":"a5c3e32a-eacd-4969-9d67-60d8dc9eb804","resolution":{"observed_at":"2026-08-05T17:03:21.239383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.280925Z","title":"Implicit behavioral cloning, 2021","venue":null,"work_id":"ba827cf7-a8a6-4d89-905c-8303a1a683ba","year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.243345Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:75b8b62ccfea9396d67fafe421162d822a69a71f16bc515c2a29988956926bc8","observation_id":"fe6f73e4-40b5-457f-b7bc-28a6fa23caca","resolution":{"observed_at":"2026-08-05T17:03:22.285073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.266733Z","title":"Mobile aloha: Learning bimanual mobile manipulation using low-cost whole-body teleoperation","venue":null,"work_id":"0a15c270-0b5b-4e3a-add6-fb1fec6819e0","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.247675Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:c3cf5c4c8f5b29c92fcd753090d6765d60042bd0b2fbf943b741452961bbeb84","observation_id":"c6797594-bb4b-411a-bd3a-acd7e4450313","resolution":{"observed_at":"2026-08-05T17:03:22.270882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17817","last_updated":"2023-10-19T19:36:31Z","snapshot_observed_at":"2026-07-06T15:48:55.605324Z","submitted_at":"2023-06-30T17:34:06Z","title":"Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17817","snapshot_observed_at":"2026-08-05T17:03:21.251510Z","title":"Act3d: Infinite resolution action detec- tion transformer for robotic manipulation.arXiv preprint arXiv:2306.17817, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.251510Z"},"links":{"cited_paper":"/paper/2306.17817","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:c5fb1681736b0529dc95f168f4dc6a87353ad85bca8da73c4c87430708b7a258","observation_id":"46de06a7-c92b-41d2-a328-70e47d45189a","resolution":{"observed_at":"2026-08-05T17:03:21.251510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.256034Z","title":"Rvt: Robotic view transformer for 3d object manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.256034Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f872b786415b608e2829718ba606e1e445366aa8e87fe509969e910725688b32","observation_id":"2b504652-2d46-471b-9b87-7fbefc7645a0","resolution":{"observed_at":"2026-08-05T17:03:21.256034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.260015Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.260015Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:23058e48c1d8b75f8b9ac3ac8d978768f3dfabf9895f8f199fce979ecc318a1a","observation_id":"1870c50b-f686-4f1c-9515-cb016b6942d0","resolution":{"observed_at":"2026-08-05T17:03:21.260015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.263906Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.263906Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:6a06b159903927f08ab1036812ff599a58d74097801e8c90b7c66d8902197e3d","observation_id":"dd8634bf-ca7c-421b-a163-a6e0de0fb295","resolution":{"observed_at":"2026-08-05T17:03:21.263906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.226609Z","title":"Spatio-temporal self-supervised representation learning for 3d point clouds","venue":null,"work_id":"5279a804-259f-4ac7-83f4-d1cfe70c4a32","year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.267884Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:d1babf7a51f5222be95c039e65d1f0dc4f7683631df4a23605bc1bcd78f32a61","observation_id":"ccfc23a4-d579-4898-8f7e-a97b12171a8f","resolution":{"observed_at":"2026-08-05T17:03:22.231230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14134","last_updated":"2024-08-09T03:06:42Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-21T18:55:05Z","title":"Diffusion Reward: Learning Rewards via Conditional Video Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14134","snapshot_observed_at":"2026-08-05T17:03:21.271906Z","title":"Dif- fusion reward: Learning rewards via conditional video diffu- sion.arXiv preprint arXiv:2312.14134, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.271906Z"},"links":{"cited_paper":"/paper/2312.14134","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:fd840de9b23a621f1829190f370e204241b8d61ae2dd38e58477e4e9d059a0d4","observation_id":"bd3e5533-a953-4d6f-8a46-80ed849f5f90","resolution":{"observed_at":"2026-08-05T17:03:21.271906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17901","last_updated":"2023-11-29T18:53:34Z","snapshot_observed_at":"2026-07-06T16:54:33.882767Z","submitted_at":"2023-11-29T18:53:34Z","title":"SODA: Bottleneck Diffusion Models for Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17901","snapshot_observed_at":"2026-08-05T17:03:21.276099Z","title":"Soda: Bottleneck diffusion models for representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.276099Z"},"links":{"cited_paper":"/paper/2311.17901","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:bf3f1536874f3c1a89e64287ff7ea0708767aa7653b3ec940b94e5a2b13000ad","observation_id":"6beb5b35-e348-4134-bc37-0d3edd306821","resolution":{"observed_at":"2026-08-05T17:03:21.276099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.212742Z","title":"Equilibrium free-energy differences from nonequilibrium measurements: A master-equation ap- proach.Physical Review E, 56(5):5018, 1997","venue":null,"work_id":"020b1e1f-b2eb-476c-9b39-18ebfd45491a","year":1997},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.280367Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:b81d45f2716a110bd5284c6c2273015c13b72ef743a1495d57647e20a2366d9c","observation_id":"2386e89f-27f0-4fd7-82d2-4ae15162be01","resolution":{"observed_at":"2026-08-05T17:03:22.217786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T17:03:21.284052Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipu- lation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.284052Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:c5f26098601f0f3c0cd16b4f709c130baebed87542962602d34886aa9bb31f68","observation_id":"e70ad54d-784e-41ca-9509-eec2899144b2","resolution":{"observed_at":"2026-08-05T17:03:21.284052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.200090Z","title":"Point- voxel cnn for efficient 3d deep learning.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"81a6a755-51e9-4525-a81a-1b76c314498f","year":2019},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.288110Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:95d571d9238409b7062abce3dcf04c0a421f728264c4fb834c8c632b95e677db","observation_id":"3c498518-9db0-48d2-87c9-381072874f5e","resolution":{"observed_at":"2026-08-05T17:03:22.204285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.187705Z","title":"Where are we in the search for an artificial visual cortex for embodied intelli- gence?Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"bdad6906-7936-4e7d-aeb8-61fd82291bbf","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.291729Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:ebc7c577db79a1cac6988a434311e13783553a791c3251c4cecbd1baa8b35020","observation_id":"c2315448-5b1d-40e2-b8e8-bb1a31c695e6","resolution":{"observed_at":"2026-08-05T17:03:22.191842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.174094Z","title":"What mat- ters in learning from offline human demonstrations for robot manipulation, 2021","venue":null,"work_id":"bbfdaf24-d7f9-4eb8-8fbc-36f6f75c2553","year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.295581Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:e4e688607c7c4d508116770ddbc4d983bbbd8bf1cb6913756de54d918fb3d9a2","observation_id":"0f1c4598-5ea5-478c-865a-46dbad63b42e","resolution":{"observed_at":"2026-08-05T17:03:22.178483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.160709Z","title":"Self-supervised point cloud prediction using 3d spatio-temporal convolutional networks","venue":null,"work_id":"7e137ae8-8138-4ad4-8211-eb291bbf0596","year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.299132Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:ceb796fd6c535a6de9c9908df25ae99e50e65e448d9e8fa9249ac7ce055aef37","observation_id":"15af83ac-f03b-4365-b84c-63b1c1091ae3","resolution":{"observed_at":"2026-08-05T17:03:22.165293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T17:03:21.302768Z","title":"R3m: A universal visual representation for robot manipulation.arXiv preprint arXiv:2203.12601, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.302768Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:2fa0e561e7d88edfcd2e82c41c859e55c1a30728e35837b2ee984884bfccd0c6","observation_id":"f22873ba-802a-4dab-8b1d-4e9684a4ecff","resolution":{"observed_at":"2026-08-05T17:03:21.302768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.147824Z","title":"Henriques","venue":null,"work_id":"10201f30-c253-4810-9f96-9fb6d82ade58","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.306611Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:a8b79492c8ec7610b1d1f2c40776bb7e1c8a08e71734b6526f8a9d17b180fccc","observation_id":"0fe27fdf-95fd-4700-b6cf-bc3b8bad835c","resolution":{"observed_at":"2026-08-05T17:03:22.151794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T17:03:21.310338Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models.arXiv preprint arXiv:2310.08864, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.310338Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:236d082db7a9e993e158286818b26db0473f4d421507ce5da6d4d602afd85669","observation_id":"6b24ad63-b50d-469b-a89c-1e25287e20ed","resolution":{"observed_at":"2026-08-05T17:03:21.310338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.133683Z","title":"Masked autoencoders for point cloud self-supervised learning","venue":null,"work_id":"bd54f8dc-cdc1-4805-b5cb-a4abcdaaf71f","year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.314258Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:00d42019990e621b04d43ecf36c1600b11512e1496489d051fcdc04493337057","observation_id":"a95946da-2f04-4e23-be52-f1fb9e04c6aa","resolution":{"observed_at":"2026-08-05T17:03:22.138718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.120215Z","title":"Recon- structing hands in 3d with transformers","venue":null,"work_id":"c687cc5e-ac40-41bd-b76f-322070ce03ed","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.317885Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:d73ab5751edb3d5d5ae498f017153884b4d0dc6dc5b055e9acd034e7ad0bd9c6","observation_id":"ea8bc1c0-84f5-4536-b868-67f7ae53481d","resolution":{"observed_at":"2026-08-05T17:03:22.124476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.105823Z","title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"07ca3e97-2aca-4889-997f-bf68aa9a68db","year":2017},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.321493Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:37cdef42c97c2c4c5d0213b25fa5cf08707be9e0f5a78e39f9556109660f2930","observation_id":"873be75f-5acb-4648-bb70-3c580c09c8d2","resolution":{"observed_at":"2026-08-05T17:03:22.110432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.092696Z","title":"Dexmv: Imita- tion learning for dexterous manipulation from human videos,","venue":null,"work_id":"be08fc89-259c-467a-8a47-05671cfa410c","year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.325644Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f6c61ac3eda5d73eaa0356c0c5af5f1f128307da98865c56bf933b7e74198743","observation_id":"8df40319-180d-46a0-85e5-20a73191b6b3","resolution":{"observed_at":"2026-08-05T17:03:22.096738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04577","last_updated":"2024-05-16T21:14:44Z","snapshot_observed_at":"2026-08-05T00:05:41.371154Z","submitted_at":"2023-07-10T14:11:07Z","title":"AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04577","snapshot_observed_at":"2026-08-05T17:03:21.329618Z","title":"Anyteleop: A general vision-based dexterous robot arm-hand teleoperation system.arXiv preprint arXiv:2307.04577, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.329618Z"},"links":{"cited_paper":"/paper/2307.04577","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:15d70cdf273b52fb487a2f2491f1c8eeda9340953ef95934b0a8a5a75ab4a876","observation_id":"587b6cd7-41b6-42ad-b69b-bbbaf3b0cb7b","resolution":{"observed_at":"2026-08-05T17:03:21.329618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.079703Z","title":"Robot learning with sen- sorimotor pre-training","venue":null,"work_id":"0719f714-669b-4d3f-935b-51c9f619f649","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.333713Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f21d83824e54240edc0324a2e79652d78819ab7b8c6fe00a9f940525e1862bf6","observation_id":"6ff6bb74-1dcb-46bc-b59d-99192dcf5c15","resolution":{"observed_at":"2026-08-05T17:03:22.083894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.066253Z","title":"Real-world robot learn- ing with masked visual pre-training","venue":null,"work_id":"98f05132-05d8-4ac5-9778-9272f4dce42c","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.337505Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:df5aa1ccd79bae8a6cb22fea3b97b5c3f4cc01dae3c59371ab0196e0ead8ba75","observation_id":"01aea381-36a0-446c-ae4a-6c80dead3cb8","resolution":{"observed_at":"2026-08-05T17:03:22.070451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-07-06T06:01:51.192687Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-05T17:03:21.341137Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations.arXiv preprint arXiv:1709.10087, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.341137Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:b066fefeec5e6c2ae3aa65c19c9f46fce5db03311c762cad8983c5c7eaef4279","observation_id":"7819deb8-c349-417d-aa66-fb36aa512f19","resolution":{"observed_at":"2026-08-05T17:03:21.341137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.053673Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations, 2018","venue":null,"work_id":"575a3ad4-4b45-4b67-b8dd-c2d2206d3201","year":2018},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.345166Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:a8b0b5b38778e0634adb68f4a26a67eced2beb255ee64b810d707906a9bb45b6","observation_id":"7219eb5c-e32d-48ec-b163-99877d0db233","resolution":{"observed_at":"2026-08-05T17:03:22.057737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.349065Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.349065Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f623fb80f5995ab17154538dc591b79a37d1ba417ea7e7491102b5c31be815f4","observation_id":"83e69080-267e-4218-a39e-0ae7159eb3d6","resolution":{"observed_at":"2026-08-05T17:03:21.349065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.030644Z","title":"On bringing robots home, 2023","venue":null,"work_id":"3dcdcc82-65c0-4bcc-883d-4453d56e91fb","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.352885Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f1215f4f5d34af94afd4a3c69b8a648cff1e25be0efb4ad8aec350a446a00208","observation_id":"6d495e07-46de-4594-870b-be071a7cf748","resolution":{"observed_at":"2026-08-05T17:03:22.035067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03380","last_updated":"2021-11-11T19:06:52Z","snapshot_observed_at":"2026-08-04T16:13:46.930282Z","submitted_at":"2021-07-07T17:59:07Z","title":"RRL: Resnet as representation for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03380","snapshot_observed_at":"2026-08-05T17:03:21.357019Z","title":"Rrl: Resnet as rep- resentation for reinforcement learning.arXiv preprint arXiv:2107.03380, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.357019Z"},"links":{"cited_paper":"/paper/2107.03380","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:c512861079d7c761cf0bf0f21ef2d19380600b20be430ed332c66a04ad53f56b","observation_id":"cf8d3867-1c0e-4240-9737-d6ee8115d10d","resolution":{"observed_at":"2026-08-05T17:03:21.357019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.361117Z","title":"Perceiver- actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.361117Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:a3c292d0ab1b335dfa8d32afb9cb2454bf20f6e1d78bbb966ef72f0ac7dc0906","observation_id":"95454da0-576b-4b4e-b3a7-4e83b7279563","resolution":{"observed_at":"2026-08-05T17:03:21.361117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:22.005526Z","title":"Shelving, stacking, hanging: Relational pose diffusion for multi-modal rearrangement, 2023","venue":null,"work_id":"b4394d8b-ea21-4844-a00a-dd0a2238bc08","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.364875Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:1f317496553afdd429c2feb0b6017b6c3bd9806b38c1f50bbc5943076a6762b3","observation_id":"49078f5f-c4b8-47b6-a274-86a6d7c86745","resolution":{"observed_at":"2026-08-05T17:03:22.009913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T17:03:21.368501Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.368501Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f1162ac9b5b731fc021fc1bcbd133788a5de39b9a48756cabb3bf89268350144","observation_id":"9f46b6ad-ee52-44f0-80a0-87d9a34d2370","resolution":{"observed_at":"2026-08-05T17:03:21.368501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T17:03:21.372448Z","title":"Score-based generative modeling through stochastic differential equa- tions.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.372448Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:7acc4f839aea2baab3d5507fc216050a108c2872e3d080a2fed037f24e5eb361","observation_id":"96721581-04c8-4a0b-a2f2-303837a39311","resolution":{"observed_at":"2026-08-05T17:03:21.372448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.991050Z","title":"Memory-consistent neural networks for imitation learning, 2024","venue":null,"work_id":"a09e1e51-0e65-45d0-86eb-5c39c88927e4","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.376270Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:85a50791f6d1d8236c84107e4aa10b15a877d29fdb2ff0fe7d7c4d167999447b","observation_id":"1444e2da-ffe5-44fb-9b2e-0c47c5c6a110","resolution":{"observed_at":"2026-08-05T17:03:21.995667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.977087Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"602cd0e9-bd1c-414a-961e-3b85272d2201","year":2012},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.380078Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:78d47e7136fa7bfc205c11c655d47f51164e1da1fb2e9cbd030d7ecfd38ea5bd","observation_id":"bc7977ff-7c9b-41fa-9420-907c6db02869","resolution":{"observed_at":"2026-08-05T17:03:21.981393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.963569Z","title":"Se(3)-diffusionfields: Learning smooth cost func- tions for joint grasp and motion optimization through diffu- sion, 2023","venue":null,"work_id":"8baf76e1-6ad1-454c-9817-ad64e50a584e","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.384022Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:de094dc89400c8f82cd4badaec2efc3cb6a8cf43dece989aa50ebbe91754b5f0","observation_id":"585ba0d6-7156-49ef-b8b0-cab3c9a8a156","resolution":{"observed_at":"2026-08-05T17:03:21.967856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12281","last_updated":"2024-09-10T15:28:58Z","snapshot_observed_at":"2026-08-06T03:42:19.823817Z","submitted_at":"2024-04-18T15:57:19Z","title":"RISE: 3D Perception Makes Real-World Robot Imitation Simple and Effective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12281","snapshot_observed_at":"2026-08-05T17:03:21.388478Z","title":"Rise: 3d perception makes real-world robot imitation simple and effective.arXiv preprint arXiv:2404.12281, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.388478Z"},"links":{"cited_paper":"/paper/2404.12281","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:5f237da3518d1eda84ac4a3c9703d6348a9fcbe6e09fbe0cc96e5c2039c24bb7","observation_id":"036d5778-04d8-49ac-bae7-4f680b674757","resolution":{"observed_at":"2026-08-05T17:03:21.388478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01812","last_updated":"2024-10-15T14:50:29Z","snapshot_observed_at":"2026-08-03T18:37:18.872911Z","submitted_at":"2024-07-01T21:23:26Z","title":"Equivariant Diffusion Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01812","snapshot_observed_at":"2026-08-05T17:03:21.392455Z","title":"Equivariant diffusion pol- icy.arXiv preprint arXiv:2407.01812, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.392455Z"},"links":{"cited_paper":"/paper/2407.01812","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:8f7feeab0d8e81f61852103175021507b6148754579457a680b1dca1fa8fa1a4","observation_id":"a11434cf-28ad-42a3-a12e-98d85db0e938","resolution":{"observed_at":"2026-08-05T17:03:21.392455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.950649Z","title":"Diffusion models as masked autoencoders","venue":null,"work_id":"a6a84c95-52e9-4313-bb7c-411c3c4adba0","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.396448Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:0e3f5b76cbb38d5fb6b5d8c623f1fcffc015454bc0393bb05227afbff8078fe7","observation_id":"3814d33a-265c-484a-948c-05b98b483286","resolution":{"observed_at":"2026-08-05T17:03:21.954631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-08-05T17:03:21.400105Z","title":"Robomind: Benchmark on multi- embodiment intelligence normative data for robot manipula- tion.arXiv preprint arXiv:2412.13877, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.400105Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:7eb7c3c0f91b524e738af628b2f02ef77bd96160399de7bb475dde17f53fa481","observation_id":"b26cf4c9-f623-4209-9d3e-215b8295e897","resolution":{"observed_at":"2026-08-05T17:03:21.400105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.936747Z","title":"Tiangong.https://x-humanoid.com/ bt.html, 2025","venue":null,"work_id":"ed5a79b9-987b-4d14-a2fb-d6ccd0a6dd42","year":2025},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.404049Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:0c7f87b200cabae81038bc5ed875871d75a5eefa53702ccfb2e419d438d24b2f","observation_id":"f979dbea-2f6b-4fb0-a28e-5b27753ca864","resolution":{"observed_at":"2026-08-05T17:03:21.941597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-05T17:03:21.407790Z","title":"Masked visual pre-training for motor control.arXiv preprint arXiv:2203.06173, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.407790Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:2473a7966e1711283440aa49b27f54e610702c298b8139c86d876da16e6ec93b","observation_id":"81782620-d8d6-45c8-8234-d84116b6eef8","resolution":{"observed_at":"2026-08-05T17:03:21.407790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.922788Z","title":"NeRFuser: Dif- fusion guided multi-task 3d policy learning, 2024","venue":null,"work_id":"ee4f42ab-4704-4ea0-9b1c-4877a93fce1a","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.411478Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:055fd744277c225ecc0c6927f0dfe256d6ad9aa6ecbc8600ac8c23edb614f17c","observation_id":"d885646e-f68e-477c-8b69-0b544d592100","resolution":{"observed_at":"2026-08-05T17:03:21.927021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01479","last_updated":"2024-10-29T17:49:41Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:09:43Z","title":"EquiBot: SIM(3)-Equivariant Diffusion Policy for Generalizable and Data Efficient Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01479","snapshot_observed_at":"2026-08-05T17:03:21.415481Z","title":"Equibot: Sim (3)- equivariant diffusion policy for generalizable and data effi- cient learning.arXiv preprint arXiv:2407.01479, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.415481Z"},"links":{"cited_paper":"/paper/2407.01479","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:e6547e919f314221c46dfe7eb1ac782cfc8d077e9cdc2682d3f00eb6dd874f87","observation_id":"2e69c9c8-8ab2-4008-977c-30668a545c17","resolution":{"observed_at":"2026-08-05T17:03:21.415481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.419705Z","title":"Visual point cloud forecasting enables scalable autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.419705Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:6000a117133a9a2a7ed66da7c52f7ee1a1f5ede9d5248606579ed21ef4dddedc","observation_id":"9b44c538-5c30-499b-bfec-bc31f1d38e88","resolution":{"observed_at":"2026-08-05T17:03:21.419705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.899843Z","title":"Meta- world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"14d9fc7b-5cca-4424-90ba-799c3b5fa47a","year":2020},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.423343Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:d489977f1b19a60383b8cbb15acf41ba8edf6f44a55a5dbd45e9e8d8eb0e3c15","observation_id":"d0832534-c200-4442-8c82-819a061c9a55","resolution":{"observed_at":"2026-08-05T17:03:21.904281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.885844Z","title":"Visual reinforcement learning with self- supervised 3d representations.IEEE Robotics and Automa- tion Letters, 8(5):2890–2897, 2023","venue":null,"work_id":"a85785e8-c483-420c-994c-c2bb5bd3f885","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.427088Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:7715ba8c454d127450a05f8a6bc2855f6bb0b4f19376ab49fb20cec277f02d1b","observation_id":"417a6389-f1d0-460f-a1d6-f24e13ea1190","resolution":{"observed_at":"2026-08-05T17:03:21.890339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.430762Z","title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.430762Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:f356b7dcdcf8990420b33d7d458db354b7674aacda38d46a6e6c3c95c39f4e5d","observation_id":"7ea36b4e-021c-4441-a4fb-60df61569095","resolution":{"observed_at":"2026-08-05T17:03:21.430762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-08-05T12:04:21.579432Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-08-05T17:03:21.434778Z","title":"Generalizable humanoid manipulation with improved 3d diffusion policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.434778Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:370883d935286fce65f3f872fc45350c930b01c0e3b4945e88b25416dbe6eb64","observation_id":"1b55d1fb-3853-4c82-b410-47d256aa4e45","resolution":{"observed_at":"2026-08-05T17:03:21.434778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.863717Z","title":"3d diffusion policy: Gen- eralizable visuomotor policy learning via simple 3d repre- sentations","venue":null,"work_id":"7cbc4473-92e0-4558-9bff-f439e916a5fb","year":2024},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.439233Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:baafea2f0780bc7eb8860813e0a11b40625b256b7d5dc6d7f4f8ef0e147629d9","observation_id":"4771448d-7443-4c28-ac4e-6864a87f1567","resolution":{"observed_at":"2026-08-05T17:03:21.867924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.442925Z","title":"Point-m2ae: multi-scale masked autoencoders for hierarchical point cloud pre-training.Advances in neural information processing sys- tems, 35:27061–27074, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.442925Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:b67ec817a54bb39580163001e31d5c1d78e9b926dbacdcaa83ffe8d62f576bdc","observation_id":"4260ea29-7672-4d90-8b1c-6304b1696c41","resolution":{"observed_at":"2026-08-05T17:03:21.442925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18194","last_updated":"2024-12-24T06:03:42Z","snapshot_observed_at":"2026-08-02T00:03:22.878669Z","submitted_at":"2024-12-24T06:03:42Z","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18194","snapshot_observed_at":"2026-08-05T17:03:21.446755Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long- horizon reasoning tasks.arXiv preprint arXiv:2412.18194,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.446755Z"},"links":{"cited_paper":"/paper/2412.18194","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:08a86cb706040f174c5d017598f9f76354bfc1567c5ffaa5301167e5370a1d80","observation_id":"2d85b8e6-4ffb-4fe8-823f-1a8e01e82eb8","resolution":{"observed_at":"2026-08-05T17:03:21.446755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.842535Z","title":"Complete-to-partial 4d distillation for self-supervised point cloud sequence representation learning","venue":null,"work_id":"b515cc43-d794-42de-b7d9-a455b2a6902f","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.451231Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:95bda91cf88bad9f40567b385a78111961ec3c9d41ca1bc3c4b86eb1f22f87d9","observation_id":"f6840b21-1ffe-46aa-8b0f-5fd9e948e0b5","resolution":{"observed_at":"2026-08-05T17:03:21.846631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.829551Z","title":"Point transformer","venue":null,"work_id":"106853d1-8a21-4ffd-9ead-a6feb75d52c3","year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.454842Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:0cb78171a705798a0b44d712f5c2b7e1518574396c3a947bd269a311bc7ab2c2","observation_id":"b6a15598-3cd3-4011-9959-ac5f20d1bb43","resolution":{"observed_at":"2026-08-05T17:03:21.833350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T17:03:21.458999Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.arXiv preprint arXiv:2304.13705, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.458999Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:c3353afa90d1a12c2d07735921aff84b886c86d0ae0210c80fd820bb000c3619","observation_id":"e334a8fc-fadb-4334-90f8-de9692eb52d2","resolution":{"observed_at":"2026-08-05T17:03:21.458999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14960","last_updated":"2023-11-25T08:10:05Z","snapshot_observed_at":"2026-07-06T16:52:15.355330Z","submitted_at":"2023-11-25T08:10:05Z","title":"Point Cloud Pre-training with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2311.14960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.14960","snapshot_observed_at":"2026-08-05T17:03:21.503184Z","title":"Point Cloud Pre-training with Diffusion Models","venue":"cs.CV","work_id":"804553c2-7f2f-4987-81eb-19f63014e9a3","year":2023},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.462860Z"},"links":{"cited_paper":"/paper/2311.14960","citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:960305e1ca89bb81df7a597fe8d190c99404c6cff848c74b24fee7fb086b76d6","observation_id":"07fd99e0-d749-4779-88ba-ef697ffc9aea","resolution":{"observed_at":"2026-08-05T17:03:21.509768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:03:21.815767Z","title":"3d shape generation and completion through point-voxel diffusion","venue":null,"work_id":"6fa54887-ad68-4a20-8462-1de66ee652c0","year":2021},"citing_paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T17:03:21.467027Z"},"links":{"citing_paper":"/paper/2508.17230"},"observation_digest":"sha256:c726bbe51d42757accf94e6a375dbd2f71c8b823c39c44f068bd7f1f252b1a00","observation_id":"6d5802aa-b5b4-439d-9860-80114dee874f","resolution":{"observed_at":"2026-08-05T17:03:21.820003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.17230","last_updated":"2025-09-06T14:24:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T17:03:20.491893Z","submitted_at":"2025-08-24T07:06:56Z","title":"4D Visual Pre-training for Robot Learning"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2508.17230."}