{"as_of":"2026-08-21T12:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af5c0676e6bbc214fc8d98ff5da4f46e8f531f21cb658d3ad59988efd73ffa0a","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T04:10:14.360463Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:52:22.573456Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T14:52:35.595553Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.11643","snapshot_observed_at":"2026-07-30T12:43:44.545121Z","title":"Xiaomi-Robotics-U0: Unified embodied synthesis with world foundation model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23782","last_updated":"2026-07-26T17:58:47Z","snapshot_observed_at":"2026-08-15T03:59:39.322668Z","submitted_at":"2026-07-26T17:58:47Z","title":"$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T12:43:44.545121Z"},"links":{"cited_paper":"/paper/2607.11643","citing_paper":"/paper/2607.23782"},"observation_digest":"sha256:1f308981c9acab167978b0df9250a450ee1d7670c3e83183266ca913db5b5ea5","observation_id":"b602de26-131f-44c4-a021-1052c3b0a0c6","resolution":{"observed_at":"2026-07-30T12:43:44.545121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.11643","snapshot_observed_at":"2026-07-31T06:18:55.753396Z","title":"Xiaomi-Robotics-U0: Unified embodied synthesis with world foundation model.arXiv preprint arXiv:2607.11643, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-08-08T15:15:40Z","snapshot_observed_at":"2026-08-20T20:44:59.272934Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation: A Survey","version":1},"reference_index":219,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.753396Z"},"links":{"cited_paper":"/paper/2607.11643","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:b7aba85f264719e8e37e4d749a22be863f690dfed2486f878d204b67d363a347","observation_id":"c6fc42ca-b008-4b79-94ff-0eedc6c123fd","resolution":{"observed_at":"2026-07-31T06:18:55.753396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"cited_work":{"arxiv_id":"2607.11643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.11643","snapshot_observed_at":"2026-08-05T14:52:35.595553Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","venue":"cs.RO","work_id":"9d328ddd-2c98-42c4-b932-4bb543446d72","year":2026},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-14T06:43:08Z","snapshot_observed_at":"2026-08-19T23:09:25.919020Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T14:52:35.554523Z"},"links":{"cited_paper":"/paper/2607.11643","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:bf4907c22f2e15eaf3140e5583968f94fc67cbe712734b4cab64b48b668bb11d","observation_id":"8027843d-d15f-41df-839d-1b1adf596ff4","resolution":{"observed_at":"2026-08-05T14:52:35.600405Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.11643","snapshot_observed_at":"2026-08-15T14:52:22.573456Z","title":"2607.11643 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-14T06:43:08Z","snapshot_observed_at":"2026-08-19T23:09:25.919020Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T14:52:22.573456Z"},"links":{"cited_paper":"/paper/2607.11643","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:90fdcb718f989ade14e2a600f958e7f65f50386cebea1429a53e7c4b4eda8d1f","observation_id":"89e2e64e-d393-45c9-a456-dde4bda4fe6c","resolution":{"observed_at":"2026-08-15T14:52:22.573456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.11643/citation-record","integrity":"/paper/2607.11643/integrity","json":"/paper/2607.11643/citation-record.json","paper":"/paper/2607.11643"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:fd5c418fac905dd7975c9bfd82ffcbcea2a0462c85a4ea435ac652f78119cc42","observation_id":"25d1cb50-f7ab-4983-8cba-96e8942e7e39","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21282","last_updated":"2026-04-19T13:43:39Z","snapshot_observed_at":"2026-08-15T12:07:47.739901Z","submitted_at":"2025-05-27T14:51:34Z","title":"EgoWalk: A Multimodal Dataset for Robot Navigation in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21282","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Egowalk: A multimodal dataset for robot navigation in the wild.arXiv preprint arXiv:2505.21282, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2505.21282","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:2ee0e56ab014db54cb1af48302431eb0a9627b36a5e339de533324ef048abfa4","observation_id":"9b703af7-e8db-496d-81b7-3c1d338916e4","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:6a48d9b4ff8ee788e77db03ebae38443a70031f263ff2a63f46897dbf2dc4be3","observation_id":"33f43ff5-8da2-437b-929b-e721582f7d0b","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:240cfd1df9c705163d519c16cbf7c261b96beaa22d963f47188981dd99db5dce","observation_id":"b20ba17a-0b01-4b5e-9aeb-4ab1fa507b95","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"RT-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:3be6404442de16f828a820d015cc4d592dab96c38ca1c0fbe5dd32085147f5aa","observation_id":"035d49b0-7836-48a4-b4aa-281da599d97d","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:6f76e4fa8c5c8c87545177176155e9039196c749ebae6ab12cd1cd6e89fd23e0","observation_id":"a699d510-3ca3-4e4f-925f-0606dca85e9f","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:288d6f94f5f74de88faa9250fddab6ca1b15c4f49880da6bf2d9b7eedd582876","observation_id":"de833add-c929-4160-8baa-75a8d0e195a6","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"AgiBot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:8bffd28946b3c4b90ce4cbea440461abf71001cee4f8942c0b1b37c854840eb7","observation_id":"bf09b2d1-aff2-456b-8079-560c4bb064a1","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:06277a1ad498df835dc7b0df5c5f4fba3df7351d123522b58e1b8d75fe5497aa","observation_id":"e8f31ebe-1523-40c6-98f5-55c865a515be","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Video depth anything: Consistent depth estimation for super-long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:c5b6728dd5e24bfbcca271a96ac4b58f12dbbbae67bb26193190323d21ddb35a","observation_id":"e8569a7e-2de9-40f1-8e41-eb3990da8d6b","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation.arXiv preprint arXiv:2506.18088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:294bb763a62681380bf5bc39612b2a6aaf78b50006d0708f5f77c5e8be04a19b","observation_id":"fa3e6eab-0b56-4ed5-b686-33805ab2dbc8","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Anydoor: Zero-shot object-level image customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:6ef6a840f718ce746813bb99e8bc111fae5cd73d39cf67c2b67a00fde9151d49","observation_id":"1b260aef-6c6c-41b0-8cda-a66f0feda4be","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:e13cf4b8d2729d95a0ffb5f730c883ba0a3ad2d14c27e0b727d2e22a38eb0970","observation_id":"ab5b3001-45ac-4c9f-8fa3-3dff5dd44c25","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Abot-physworld: Interactive world foundation model for robotic manipulation with physics alignment.arXiv preprint arXiv:2603.23376, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:d9f9310361ae5b6ada8e6e22fc6993023a0d4e988ac799b7ae2f5fe5aa7b3455","observation_id":"a1255016-3c8f-4d98-8479-9c32b3e2996b","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models.https://arxiv.org/abs/2310.08864, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:08619850d492389453364f4085d86bffd44d8879bd035b9757eb1c5806416141","observation_id":"d9c04fb4-e626-4a0b-a72e-39345b1d9364","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-11T01:57:48.271968Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:8fd249d66a7ac4dc1a71f871b3fcda85a4f83b304005cbdfaeaa6550ffe5ece3","observation_id":"92e9c856-d691-4660-876c-8410059df1e1","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:638eddefa6f24a9270873e5b366202d248f65766e4f9ea500f05888871bd53ce","observation_id":"e2a933b3-dd95-4a6c-ac2f-318e67acd313","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:ac3751bfd9b9be742bd348370ed8085fd52077db09c95b49c0bac5a2642b9ac1","observation_id":"8a226344-61f7-4e3b-9ad6-d64b8b3c88ee","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10314","last_updated":"2024-05-16T17:59:05Z","snapshot_observed_at":"2026-08-15T07:34:03.035482Z","submitted_at":"2024-05-16T17:59:05Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10314","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Cat3d: Create anything in 3d with multi-view diffusion models.arXiv preprint arXiv:2405.10314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2405.10314","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:9c4bcd9f5b707dae0c835b1e8578467d23a3a2373566284a5b12139efa56486b","observation_id":"72c5905b-c8f3-4319-a756-6235e976ab95","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advancesin Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:5bb110f8318b783d478d1f068441f43408230850bb219b81de18893f35a80c16","observation_id":"07d9e81a-d54f-453f-bd47-2ad3655233a8","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:f21c3a07e2d6a4b99c790a33ca44828092d7cf677310b9cf76697dba2d33e369","observation_id":"03af37ba-a092-426b-bb2c-cd10da259f62","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-20T13:32:55.916408Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Dream to control: Learning behaviors by latent imagination.arXiv preprint arXiv:1912.01603, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:83bc7b1b1c53df8fe1060b152d684065be2953dba93d03e932bf5e980decaa12","observation_id":"e35addfd-360a-4cb4-a76d-6175336c4be9","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:c58a2f98ad6bd70a685133312ffcdccf52da4bfd8f86363857a26bf67e01dd7b","observation_id":"9a52e92e-9286-49e8-b6c7-c703c6720758","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-14T02:52:34.768729Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00576","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Galaxea open-world dataset and g0 dual-system vla model.arXiv preprint arXiv:2509.00576, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2509.00576","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:97bceac712a1054c7d4fdf8b06f82bb38d015f85dea49fc7df6aac4119531b6d","observation_id":"135de540-e5f2-41bd-972a-80662266ca6a","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:ade322cc4ffd3215b07f9da0fcb7a8140613b2428b93639ad49fb88abfa15203","observation_id":"1f7e5050-230a-4779-ba7c-43cc16e35df0","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:efdbd987e9d22278334ef82dec3334008cbe203b0005bbab57a5ec9f6a8dc691","observation_id":"a1371734-58d9-42c9-a963-cd1a3d975dc7","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-08-14T01:48:52.921086Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Flux.1 kontext: Flow matching for in-context image generation and editing in latent space, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:af7c1300393ffccb025d05fd06c1b19c850b7eaadbd6f1d386a693d8328ac886","observation_id":"a121a23a-f707-4b60-b126-f9471ddd1c98","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:5c77a9dc80e2e3e7075c22c4862d5deb7331d38999de3429037724a893506a10","observation_id":"4db0f5d5-6247-4c03-9472-e509b68c1613","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Era3d: High-resolution multiview diffusion using efficient row-wise attention.Advancesin Neural Information Processing Systems, 37:55975–56000, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:78c316ce0161e9cbe94d05f0b0c6218bce75ded95f0304bf5cc790a21471d989","observation_id":"85502411-ea37-4d6a-b369-0909e560d945","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-19T23:45:04.716820Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.16732","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"A comprehensive survey on world models for embodied ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2510.16732","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:7ea460c86477a43cba81e9065ba95e7d83d9022a0fc77caab007bda7d1911cea","observation_id":"955247b7-9473-4892-89f3-23a6332fb479","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:cf397579450d2663a2d097c379b06e2c8d11efcc476f426d0593cd9baaa2687e","observation_id":"d0fb85fc-7708-41b0-8ff5-271b3c8d9748","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai.IEEE/ASME Transactions on Mechatronics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:8d5b80e40f03a7302a61fa3ad7369db767c2efbedc37d04777b2509beec430b3","observation_id":"0be5d850-83a7-4e87-be62-76e42ccfc3cb","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Syncdreamer: Generating multiview-consistent images from a single-view image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:076b1dc009b845acf710eff483f1704569f96a58687c83070afb01a9867bf109","observation_id":"69fcc8ba-6883-4af7-9daa-ee0c12e034f1","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Scaling world model for hierarchical manipulation policies.arXiv preprintarXiv:2602.10983, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:e57aa12e711988e02b5fa7b8d99397e53bd15973dc764b4e004a00df02c04071","observation_id":"470bcd0c-8e53-4363-a6a0-954733f9581a","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Wonder3d: Single image to 3d using cross-domain diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:c6aee4408fc7b40b363acd9b440e5bf8e115dfea5a76eb4bea08e0a21bfc36ed","observation_id":"383f7fdc-d685-4999-987d-e240a7e1c98e","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00917","last_updated":"2025-09-03T01:44:58Z","snapshot_observed_at":"2026-08-21T12:00:56.123898Z","submitted_at":"2025-07-01T16:23:00Z","title":"A Survey: Learning Embodied Intelligence from Physical Simulators and World Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00917","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"A survey: Learning embodied intelligence from physical simulators and world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2507.00917","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:e01d608c7fbc1178560e7822415d2dd3ae2a94ddf00e51a0e81c0860557b8ada","observation_id":"ca8f010c-7c01-4108-b8b2-330e2babfa19","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:164873f81e757cfbc7383154aaea6709160ab4aa060a114df4735eb3b9c55be3","observation_id":"2cfd7eff-2834-4579-ad67-7f2152fb55b2","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:f1c2ebe43acdd16eeb6d7b7a3130fa83075dceede285ad9d35c87229bc061e5c","observation_id":"4409df06-45ec-416e-ae33-22c6eb28bc74","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-08-16T18:06:24.201768Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations.arXiv preprint arXiv:2107.14483, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:a1481ada6d74d3b3dc3706c9553d249ec9553e9ffbf7dc7263d17ea230d55b37","observation_id":"453f219d-6670-4ee8-80d6-efd07f387f73","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-08-16T06:47:25.140028Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Robocasa: Large-scale simulation of everyday tasks for generalist robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:2716a5467b18a5e65ee6a1231f327e9ac3e2ab521e598b0666a1c47cf04cd615","observation_id":"cab8e87d-1bf4-4396-aa2f-186231b0206a","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:8a0f84ab10bccac5ea801524a61d756a0613fd1b86cf4bae49e42cce38f5770f","observation_id":"3ac46b97-7aae-419f-a1b4-56b2d380b00f","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Gpt image api","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:e4f35003af55be3763f8f60485deb786d08943b5e3a63597505fc481eed2b7da","observation_id":"2696929c-32f6-45d8-9165-8041f31334b9","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:d14a5474120c9be466934dd36f94b4e13e1305b82ca7a919fcee134cb001ab4a","observation_id":"3a1f785d-0ca8-4620-a1e5-47ce6260c783","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Genie 2: A large-scale foundation world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:459698c7c431fb243b6fa086985072e326a5a9d03950390beef235bac67030fc","observation_id":"32d835ba-d171-4bc2-8c5d-eaac82f9f34e","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:5b1bf185887c085da99086d9dcb99d9dd2690d1540c42125f0bb87d1d48183cb","observation_id":"9ba66005-3015-43db-96c3-45bffceb3259","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:770fe37f3333402140107be60b34ed8ff338aca4947b7390bd80dbf9c674725f","observation_id":"48887efc-c940-4fd8-b9d2-1e9935f3ec04","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09042","last_updated":"2025-06-18T17:37:28Z","snapshot_observed_at":"2026-08-18T03:37:37.984355Z","submitted_at":"2025-06-10T17:58:17Z","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09042","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Cosmos-drive-dreams: Scalable synthetic driving data generation with world foundation models.arXiv preprint arXiv:2506.09042, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2506.09042","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:7aaeb1a7ce69fc688ce6a1f92dfb2db6d734f34a376274024d48ec817ce6da98","observation_id":"a164c70f-4fc0-4b92-8fb8-b1f11254c5f3","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:144a789d0b246156522ff75bc31cdd8ad2a7658dc09c4c969f7240b6f0af2170","observation_id":"8b82af18-daa0-4297-99a7-f29fe7b1e0a4","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Worldarena: A unified benchmark for evaluating perception and functional utility of embodied world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:79a01cda8c0c5ab25f48b0a73a47e71c22a04d3fb78ea3174f360a9e36571f7e","observation_id":"a3e54ae5-c7fb-4dd3-b500-3b0f118587a4","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Roboscape: Physics-informed embodied world model.Advancesin Neural Information Processing Systems, 38:63674–63698, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:2804c6d91ed337ab759ea26c1da2b34880cd3c17c1f7b07f4b9ec3c4cda1837c","observation_id":"7b4eba0e-70fb-4e7a-83cc-82cd5264520a","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Scalable image tokenization with index backpropagation quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:165986c76d4fcfea4d9d21b90e147a754776db59a42e662bcdf22f425af62894","observation_id":"a914582d-f57a-4673-a7bd-fecb3df3bb63","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15110","last_updated":"2023-10-23T17:18:59Z","snapshot_observed_at":"2026-08-15T06:11:26.743203Z","submitted_at":"2023-10-23T17:18:59Z","title":"Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15110","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Zero123++: a single image to consistent multi-view diffusion base model.arXiv preprint arXiv:2310.15110, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2310.15110","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:3da1abf03acb5d331cf47188b8e12b93a2e8138643741beb039e4c5c7c8c2355","observation_id":"a388b8ac-8e5f-49dd-a918-47c58ae4a629","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Mvdream: Multi-view diffusion for 3d generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:67169b98fec58af57e78e387d8a5a6cf67514d699584c2e8de8dd0b84e984e84","observation_id":"eb11014d-7839-4daf-b455-225cfb1a84d8","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Mvdiffusion++: A dense high-resolution multi-view diffusion model for single or sparse-view 3d object reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:0192f1467756c941f54d814191c920c4fc376ff1e7b45d30d773f76f9e6f28a6","observation_id":"91d17572-b55c-49c0-ac59-0f10e985d8ad","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:c6b8dc8a131a2026aebdae1d30c070cc68ec494b97822f0d520f5e2f7f688d2e","observation_id":"ac68dd1a-6763-4cf3-a574-cd56f91116a1","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27792","last_updated":"2026-07-15T07:09:44Z","snapshot_observed_at":"2026-08-02T15:15:08.869109Z","submitted_at":"2026-04-30T12:34:44Z","title":"Motubrain: An Advanced World Action Model for Robot Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27792","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Motubrain: An advanced world action model for robot control.arXiv preprint arXiv:2604.27792, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2604.27792","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:091ddafabc0badd6de4da5c1f83eb6c5cbfc3e7313e5bf3fc80f7743420ae7d9","observation_id":"395e0ef3-5d90-4275-976c-8414b6cdcfb2","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Interndata-a1: Pioneering high-fidelity synthetic data for pre-training generalist policy","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:5318ee1963cf327ceb8d1c0ea68ce2af961ab465403cc7345a4fde67211b6b6d","observation_id":"3a860f55-7b1f-4cbd-a54e-27ebc8ac87ca","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:4f6c1bba42e4aa241d7dd10a009f2ff68c8fd8236190dbf0773d7fc77e7ab676","observation_id":"af4f344a-2ecc-4ca0-a6f4-90da90682ece","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:c80af9d024a3debb793f518bec5019708a9f597f9a24ef5f0e823ec6d228a4c3","observation_id":"0e83024b-49ed-4857-9cee-7161f90833f0","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:530da0ae60ad0480a8b0ab2eba335bc2fb48b2e4719c3790ea180af4efb25e5b","observation_id":"12ab3c7f-c963-4256-bc8d-8683f3172a30","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-08-15T09:21:12.808847Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:74764d2867cce98b9a39558628de097464938256bdcfea30b3f4e9c1a7bcc7da","observation_id":"3d9ecfba-994c-42ed-b49c-70e0514c56b2","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17441","last_updated":"2026-04-13T12:31:35Z","snapshot_observed_at":"2026-08-14T08:08:04.254754Z","submitted_at":"2025-11-21T17:39:22Z","title":"RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17441","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Robocoin: An open-sourced bimanual robotic data collection for integrated manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2511.17441","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:65e5862470309ada96a6ea368d709fc33b53400455bf9f62a42219eb04c2b97b","observation_id":"35487c09-54a4-41cb-a016-4cf73400acc3","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:28fc9991e6726dd110434ae8c4148cba3808b68441929b2ed17a731d25dd9262","observation_id":"7b472a61-80de-4110-89e4-5be009d9d89d","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:778c3150b21cbf3f41be32f0d71c200f6224941af26b65ecf719d753d81d6a71","observation_id":"17623436-a460-42a2-a002-4207ed47420a","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Gigaworld-policy: An efficient action-centered world–action model.arXiv preprint arXiv:2603.17240, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:41a73535e9c952d4eda4f93698d3b223ddda9451aa55e84debea7c2dbd1a4b43","observation_id":"91523548-53cd-4fba-bce7-be45c7218d8e","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"World action models are zero-shot policies.arXiv preprint arXiv:2602.15922, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:821f099ed75d671831b646da1bbf8d76ca40079ebbb367ca83b5f0d975d407c3","observation_id":"1cd938d0-8b01-4fec-b5fb-ddf04e83ae3b","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Imgedit: A unified image editing dataset and benchmark.Advancesin Neural Information Processing Systems, 38, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:b7bdc8b7cec55fef21ad5d541c47fa895d7b06671a71964cd8d84df226551e2f","observation_id":"095b6f19-669c-40ab-9002-e10522d2af12","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:ab3d127019416702afd457fc3b20b26a2deb1a3042cde1b9c42892f0ff0caea0","observation_id":"d30b35a0-19d2-46ba-91e1-3a2da8750ce7","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02078","last_updated":"2026-08-14T10:25:02Z","snapshot_observed_at":"2026-08-19T23:09:04.212289Z","submitted_at":"2026-01-05T12:59:39Z","title":"Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02078","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Genie sim 3.0 : A high-fidelity comprehensive simulation platform for humanoid robot, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2601.02078","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:4d004476e9e65209f413f6475e668ebf610023ac7b885f7196e6cc1968357418","observation_id":"5baae18b-f968-442e-8278-df941a27b82e","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-08-20T03:53:25.888886Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Fast-wam: Do world action models need test-time future imagination? arXiv preprint arXiv:2603.16666, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:ab3d72aa774a613deca8a3302d6e5a81ae78327d83ee01dd185d5579905ff6cc","observation_id":"aa6b7954-e39c-4c9a-87cd-5413fa3c06c8","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Scaling behavior cloning improves causal reasoning: An open model for real-time video game playing.arXiv preprint arXiv:2601.04575, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:f230f47616433856353bd04f35cb34644a32b46ff51dab94f133e19675ccff45","observation_id":"4955f32b-32ad-40b6-b654-5cf3c472f128","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-18T14:57:25.186447Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17030","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Qwen-robotworld technical report: Unifying embodied world modeling through language- conditioned video generation.arXiv preprint arXiv:2606.17030, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2606.17030","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:05da8dd0327d17b13d4ae6dcb8e8885ddcda1f9f21e71cc6d4a15de1f9b99634","observation_id":"63bed55b-4d07-4791-969a-7ee1d39e4990","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.09430","last_updated":"2026-05-12T03:20:13Z","snapshot_observed_at":"2026-08-12T22:45:19.762221Z","submitted_at":"2026-05-10T09:07:20Z","title":"FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.09430","snapshot_observed_at":"2026-07-14T04:10:14.360463Z","title":"Flashar: Efficient post-training acceleration for autoregressive image generation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T04:10:14.360463Z"},"links":{"cited_paper":"/paper/2605.09430","citing_paper":"/paper/2607.11643"},"observation_digest":"sha256:e43a4acbe5590a3576c7e5f3ba8d4ebae0b36ffde4285fc22aed4b70a43697ff","observation_id":"0414151a-9e34-412c-a634-0586e1233a1f","resolution":{"observed_at":"2026-07-14T04:10:14.360463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11643","last_updated":"2026-07-13T14:57:58Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-17T15:53:19.771334Z","submitted_at":"2026-07-13T14:57:58Z","title":"Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":73,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 4 inbound Pith citation observations for arXiv:2607.11643."}