{"as_of":"2026-08-09T16:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21abd543052286b392f2128d4df9aabdf71cdc6b4bd26b86bbd0a697a63a0f07","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:48:46.688889Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23909/citation-record","integrity":"/paper/2607.23909/integrity","json":"/paper/2607.23909/citation-record.json","paper":"/paper/2607.23909"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:44.751279Z","title":"R., Finn, C., Fusai, N., Galliker, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:44.751279Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:52ca8c950897713072daa93d0f8a0c6c6ed151e17f85f1f6d870ad3269ed066a","observation_id":"3b8ec4c4-1967-49d9-9ac9-c6d5269d1e55","resolution":{"observed_at":"2026-08-03T01:48:44.751279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:44.810098Z","title":"R., Finn, C., Fusai, N., Groom, L., Hausman, K., Ichter, B., Jakubczak, S., Jones, T., Ke, L., Levine, S., Li-Bell, A., Mothukuri, M., Nair, S., Pertsch, K., Shi, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:44.810098Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:b6440eaed0bd03751a2ec3f38f5c31d77eb7bce95d03eed26a83145b8eef5a60","observation_id":"45153cf7-ec1c-45b1-bf07-30562e48f280","resolution":{"observed_at":"2026-08-03T01:48:44.810098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:44.902169Z","title":"WorldVLA: Towards autoregressive action world model.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:44.902169Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:ef5a358386069d0bdfb3558b223044945999916eb5ccbf91a4f0fffb88fa9556","observation_id":"ba3868d5-24da-466b-82d7-0f207c555b02","resolution":{"observed_at":"2026-08-03T01:48:44.902169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:44.996042Z","title":"Unified diffusion VLA: Vision-language-action model via joint discrete denoising diffusion process.International Conference on Learning Representations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:44.996042Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:e563f942ec013a233c062d867a967b3072d3b844c06f8a608bb60af14ef70fa6","observation_id":"a7d8b37a-888e-4a5d-8373-bbd259ebc0f9","resolution":{"observed_at":"2026-08-03T01:48:44.996042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.080272Z","title":"C., and Song, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.080272Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:dcf771caa3b3057666f27bbc7c2ed6082b7c5312d6b8c8a217c1002978f59733","observation_id":"e17122ab-644a-4a89-a488-75c14e2f4b2f","resolution":{"observed_at":"2026-08-03T01:48:45.080272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.144789Z","title":"R., Pertsch, K., Black, K., Mees, O., Dasari, S., Hejna, J., Kreiman, T., Xu, C., Luo, J., Tan, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.144789Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:4d90c1d450cc1ecc43cfd50040b8ef93c0269f96bdf72617ebff9d12e363828c","observation_id":"8acfe0e2-1c4e-4599-be77-2487a6f9598b","resolution":{"observed_at":"2026-08-03T01:48:45.144789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.222319Z","title":"VLA-0: Building state-of-the-art vlas with zero modification.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.222319Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:2ab67697c22df8d4b1b5dc0473521e893e5f393ea4fff30b0a4bd8faa7283dfd","observation_id":"2c35f8f0-e87d-42cd-8646-a0b7c4f5fbdd","resolution":{"observed_at":"2026-08-03T01:48:45.222319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15959","last_updated":"2025-03-23T05:03:59Z","snapshot_observed_at":"2026-07-06T19:37:03.013065Z","submitted_at":"2024-10-21T12:43:54Z","title":"Diffusion Transformer Policy","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15959","snapshot_observed_at":"2026-08-03T01:48:45.306314Z","title":"Diffusion transformer policy.arXiv preprint arXiv:2410.15959, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.306314Z"},"links":{"cited_paper":"/paper/2410.15959","citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:b2ba4c788336e9a5e1b25538335b51bc3526870ee000048717bb3961e766f571","observation_id":"a27de74a-2002-4171-9da0-991a3d8d8f81","resolution":{"observed_at":"2026-08-03T01:48:45.306314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03434","last_updated":"2026-07-31T16:40:13Z","snapshot_observed_at":"2026-08-08T01:35:00.151253Z","submitted_at":"2025-10-03T18:53:12Z","title":"Paris: A Decentralized Trained Open-Weight Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03434","snapshot_observed_at":"2026-08-03T01:48:45.352980Z","title":"Paris: A decentralized trained open-weight diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.352980Z"},"links":{"cited_paper":"/paper/2510.03434","citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:747237baff35d9a7b7ce1ab4562dcf41a61856212e9b8b9e176820fc655c0a2e","observation_id":"6f0571ee-3b41-4206-a5c3-2c11a65a3369","resolution":{"observed_at":"2026-08-03T01:48:45.352980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.439223Z","title":"J., Finn, C., and Liang, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.439223Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:e73f05cdb7066e4ed6a09ff4f4f2206bc1be7b2c64059c9733ce6c7fd5bb44cf","observation_id":"b633aedd-3632-41ad-b5d5-2e1586d01c46","resolution":{"observed_at":"2026-08-03T01:48:45.439223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.509611Z","title":"J., Pertsch, K., Karamcheti, S., Xiao, T., Balakrishna, A., Nair, S., Rafailov, R., Foster, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.509611Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:ae6fb5abc2561a8f087189ff0ceb808db5a2b61181b75a70541c2e33db46c6b6","observation_id":"29e7a71a-5549-45db-b779-d31b8e816787","resolution":{"observed_at":"2026-08-03T01:48:45.509611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20072","last_updated":"2026-05-31T15:50:43Z","snapshot_observed_at":"2026-08-05T15:11:00.360328Z","submitted_at":"2025-08-27T17:39:11Z","title":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20072","snapshot_observed_at":"2026-08-03T01:48:45.578890Z","title":"Discrete diffusion VLA: Bringing discrete diffusion to action decoding in vision-language-action policies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.578890Z"},"links":{"cited_paper":"/paper/2508.20072","citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:f302b6dfb13ef4b6028728c7973e02c057c2919c042f3edc959a215ffa49c572","observation_id":"6bb4fb0c-7272-49b4-b31f-7e5a816ff1d5","resolution":{"observed_at":"2026-08-03T01:48:45.578890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.624419Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.624419Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:068db4a499d06e5e62f96bd2d870d8ee6f72e34b52f461a9462efad0573f92cd","observation_id":"259c3a9a-e7df-4788-bb35-7a53dc814f5e","resolution":{"observed_at":"2026-08-03T01:48:45.624419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.692505Z","title":"LIBERO: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.692505Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:23e7b0c8a60f8bb805e17b5983894dc1f78b923a8b229f49739a9db881ef357b","observation_id":"38b3f130-845f-4347-ad07-99edb075dc36","resolution":{"observed_at":"2026-08-03T01:48:45.692505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.757721Z","title":"Mmada-vla: Large diffusion vision-language-action model with unified multi-modal instruction and generation.arXiv preprint arXiv:2603.25406, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.757721Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:7ac14bcab082883c4d5a519d32f0593decae956fca9f0e01121c2d751fe6611c","observation_id":"3e3173bc-89e1-44be-a1a6-7269122dc9a8","resolution":{"observed_at":"2026-08-03T01:48:45.757721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-03T01:48:45.846693Z","title":"GR00T N1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.846693Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:77a696029c4798331417c5cdf93207b8490ecf89ce8d3a03eaea533ebbfe344c","observation_id":"2ea3062c-d515-45de-b4b4-5db61554f78d","resolution":{"observed_at":"2026-08-03T01:48:45.846693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:45.943231Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:45.943231Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:c26b88fe5961cfcb403918e35ea50e535b98c4a26747f6a4712442d6089dc2c1","observation_id":"e6558121-bae0-4e49-8ab2-877168dd385e","resolution":{"observed_at":"2026-08-03T01:48:45.943231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.003376Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.003376Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:49bffac24da102b1713c5be83c255d031f83c03ca9ef108020362ea15631e59d","observation_id":"41ca5027-2759-4b18-bdcb-81c2a97b4aed","resolution":{"observed_at":"2026-08-03T01:48:46.003376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26064","last_updated":"2026-05-28T12:35:02Z","snapshot_observed_at":"2026-08-04T02:40:33.640225Z","submitted_at":"2026-05-25T17:27:22Z","title":"Paris 2.0: A Decentralized Diffusion Model for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26064","snapshot_observed_at":"2026-08-03T01:48:46.099526Z","title":"Paris 2.0: A decentralized diffusion model for video generation.arXiv preprint arXiv:2605.26064, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.099526Z"},"links":{"cited_paper":"/paper/2605.26064","citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:751c1e1bdfe479e8ccb8d2d378c44a78de6334627f4fad0243100c5fa871cc67","observation_id":"dbb895a7-64ab-4688-b576-2323741e7465","resolution":{"observed_at":"2026-08-03T01:48:46.099526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.172625Z","title":"MemoryVLA: Perceptual-cognitive memory in vision-language-action models for robotic manipulation.International Conference on Learning Representations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.172625Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:38ec0a88d421dd22bc2ec3bac03bd911ad0d9843b4af9f7297c69e26b9710549","observation_id":"bd56e4d3-86c5-4ad8-b951-b70afd058b7e","resolution":{"observed_at":"2026-08-03T01:48:46.172625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.268663Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.268663Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:0ae69c4134a631cc9fc5da1050f1a5d0b0ebc3ca6e96db21e31b12b712e3971e","observation_id":"1ecd454f-c79d-4a3c-bb95-3fafd6fd2eb6","resolution":{"observed_at":"2026-08-03T01:48:46.268663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.335039Z","title":"Vla-adapter: An effective paradigm for tiny-scale vision-language-action model.Proceedings of the AAAI Conference on Artificial Intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.335039Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:e792fb0fede8a95ca9ab502b984034cc40c44d003fac0da658923aa1dae16c74","observation_id":"8604dc53-75cd-4b93-8ac6-651988149aa1","resolution":{"observed_at":"2026-08-03T01:48:46.335039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.394629Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.394629Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:c04884ca822ef5f40c6ecf1deed36a47f1e301432c14e063e74c32dc08d7b593","observation_id":"8de45522-a48c-44fc-8e40-d2efca39f49c","resolution":{"observed_at":"2026-08-03T01:48:46.394629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.449826Z","title":"Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge.Advances in Neural Information Processing Systems, 38:24195–24228, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.449826Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:121f228f95fdb63db045aa098aefe18506ea2ba8f9301e290720f7324a1b4005","observation_id":"98bf2814-8257-451f-ac1a-c06101b9c781","resolution":{"observed_at":"2026-08-03T01:48:46.449826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.540715Z","title":"J., Fu, Z., Zhang, Z., Wu, Y., Li, Z., Ma, Q., Han, S., Finn, C., Handa, A., Lin, T.-Y., Wetzstein, G., Liu, M.-Y., and Xiang, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.540715Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:5fdb3f326b23375e706c3e6578708b77983c3a984e86ee42413a8ffd81ab79d9","observation_id":"31f267a0-cefa-4dc3-b896-cb6c365b63c3","resolution":{"observed_at":"2026-08-03T01:48:46.540715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.620534Z","title":"Acot-vla: Action chain-of-thought for vision- language-action models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.620534Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:e64f0121d1c21e478bd5a79a0728a51ab8a5c887f947e73e515f441c7760e4db","observation_id":"b6391398-3ceb-43ec-8adc-a1d69bb62fcc","resolution":{"observed_at":"2026-08-03T01:48:46.620534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:48:46.688889Z","title":"FlowVLA: Visual chain of thought-based motion reasoning for vision-language-action models.arXiv preprint arXiv:2508.18269, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T01:48:46.688889Z"},"links":{"citing_paper":"/paper/2607.23909"},"observation_digest":"sha256:545b480afacb7421f693755b6406c1ec273fd8518080f21717870836706eabfe","observation_id":"f3a24a34-a7e9-4782-a231-0710918a6d66","resolution":{"observed_at":"2026-08-03T01:48:46.688889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23909","last_updated":"2026-07-31T13:02:33Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T19:35:04.807879Z","submitted_at":"2026-07-27T00:55:10Z","title":"WorldDiT: A Unified Diffusion Architecture for World and Action Modeling"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.23909."}