{"as_of":"2026-08-21T21:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13ae081153d798760462ac25d7df63ffde0658c3e6fb48dbea1bb03a3bbff718","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:38:33.644750Z","state":"measured"},{"denominator":117,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":117,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:46:41.112893Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T20:46:33.613525Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-09T10:56:57.864336Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02853","last_updated":"2025-05-13T03:02:42Z","snapshot_observed_at":"2026-08-19T16:39:30.796029Z","submitted_at":"2025-02-05T03:13:04Z","title":"Rethinking Latent Redundancy in Behavior Cloning: An Information Bottleneck Approach for Robot Manipulation","version":5},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T10:56:57.864336Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2502.02853"},"observation_digest":"sha256:6b3d0c3c31b1df4ca706973a624ebe422de7618c203b5398451e0fae9a1ab197","observation_id":"b144605a-384f-491c-9321-e6499167c0a6","resolution":{"observed_at":"2026-08-09T10:56:57.864336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:dcc9a0cf869f1b96e6e6fe069c3a33850a3423018687352c06a11f60c668d61b","observation_id":"3d779480-121c-4ae5-bfe9-f95b0201292d","resolution":{"observed_at":"2026-05-14T19:48:48.910288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2503.07608","last_updated":"2025-03-10T17:59:42Z","snapshot_observed_at":"2026-08-17T14:53:53.844304Z","submitted_at":"2025-03-10T17:59:42Z","title":"AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T20:06:27.136345Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2503.07608"},"observation_digest":"sha256:4abb92bae779c754949d145b751b81e817ba04cad0b5f182fdef62df5c718bc5","observation_id":"38067976-547d-4fc8-8882-fc257db786e3","resolution":{"observed_at":"2026-05-16T20:06:27.250851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-08-20T22:17:07.753340Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:01f0a3b5634451f6a20b664a4a5e4a600993a8979779f6f06a0c5a058320d92b","observation_id":"5305cc76-1475-4aa7-8624-537f17e4a68a","resolution":{"observed_at":"2026-05-15T22:00:48.879916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-16T04:46:41.112893Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01458","last_updated":"2026-06-09T09:31:25Z","snapshot_observed_at":"2026-08-18T00:26:05.992202Z","submitted_at":"2025-05-01T09:22:23Z","title":"A Survey of Robotic Navigation and Manipulation with Physics Simulators in the Era of Embodied AI","version":2},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-08-16T04:46:41.112893Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.01458"},"observation_digest":"sha256:c5e2de1949c2a97d9d5418f848bb652000a3e6d97afa5424b3712cf61a878a64","observation_id":"f2c9b90a-b4cf-4de9-8722-36443e179810","resolution":{"observed_at":"2026-08-16T04:46:41.112893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-15T21:01:53.625518Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11123","last_updated":"2025-05-16T11:14:22Z","snapshot_observed_at":"2026-08-18T17:34:43.622682Z","submitted_at":"2025-05-16T11:14:22Z","title":"Conditioning Matters: Training Diffusion Policies is Faster Than You Think","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:53.625518Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.11123"},"observation_digest":"sha256:a2efd05f3f22a40569dd4ef1e3321b24e81978c7d9b138444b82064e55762f43","observation_id":"795c6801-66d5-4d2a-8c02-557e8742822e","resolution":{"observed_at":"2026-08-15T21:01:53.625518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-15T21:01:28.377189Z","title":"Diffusion- VLA : Scaling Robot Foundation Models via Unified Diffusion and Autoregression , May 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-20T21:35:04.490407Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.377189Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:541d731c6aa8dc66c73c950cacb9bb51d80c1193e4b1ed24df5942299ee798da","observation_id":"21a7a0a9-4637-46e2-9892-ee2983bb4cba","resolution":{"observed_at":"2026-08-15T21:01:28.377189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2505.18780","last_updated":"2026-05-12T16:12:46Z","snapshot_observed_at":"2026-08-10T13:10:58.742737Z","submitted_at":"2025-05-24T16:33:44Z","title":"DreamPolicy: A Unified World-model Policy for Scalable Humanoid Locomotion","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T12:50:17.902979Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.18780"},"observation_digest":"sha256:7e26d0b4dcc3d04d033c6dbf831c447fb61dc8f3aaa3fcada1030529e04b0497","observation_id":"c555925c-c09e-4422-b2d3-13797fab3728","resolution":{"observed_at":"2026-05-19T12:52:17.848780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T13:43:03.455619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-16T18:25:37.104768Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.455619Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:5c50f348c685581f7466f0db9854353a6cea6f0bc79c635cd5a4f55cb2328480","observation_id":"d9b01b24-1d17-4365-b681-446034d39b78","resolution":{"observed_at":"2026-08-07T13:43:03.455619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T13:26:03.902047Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-21T02:53:10.596985Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.902047Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:d7fa861b35d0315217febd9df64928d558c36ac8a8dc6d18b260ee7f1bab5acb","observation_id":"e2f290be-f8a1-46c1-8e1c-654bbba7905d","resolution":{"observed_at":"2026-08-07T13:26:03.902047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T12:16:15.449497Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-16T11:17:25.346121Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.449497Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:47ad00eee0fe038035c6daa75ead2e3a568021721b5d64e5215fb119744b1954","observation_id":"e1d03a9a-3438-4690-a6a9-9da73d0da9e6","resolution":{"observed_at":"2026-08-07T12:16:15.449497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T12:11:53.176992Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-17T18:31:50.392129Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.176992Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:b7d07db7977fca13a7de5c971f826d196d472a2567733bbeddad578d832837d2","observation_id":"7ecbe182-66c7-4eb9-b7b9-233a0db0521f","resolution":{"observed_at":"2026-08-07T12:11:53.176992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T04:42:22.391752Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-17T20:47:45.784136Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.391752Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:7ea7026edcdd7007d2b34523b3941fcad5a1e0841c125c96dd795b764abaf228","observation_id":"086f3048-ec0e-44a0-a2fb-13ec3e1bccb0","resolution":{"observed_at":"2026-08-07T04:42:22.391752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T00:57:29.614110Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12374","last_updated":"2025-06-24T10:01:18Z","snapshot_observed_at":"2026-08-16T05:58:22.870564Z","submitted_at":"2025-06-14T07:11:44Z","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:29.614110Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.12374"},"observation_digest":"sha256:ecdb2a577cc968838a558c553500ef94bdfb0ba2933999edfe2e20e6c393520e","observation_id":"3c9762e3-034f-4bc4-9d83-b3e51d650d2b","resolution":{"observed_at":"2026-08-07T00:57:29.614110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2506.13456","last_updated":"2026-05-13T10:49:00Z","snapshot_observed_at":"2026-08-13T09:24:06.315929Z","submitted_at":"2025-06-16T13:14:58Z","title":"Block-wise Adaptive Caching for Accelerating Diffusion Policy","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T09:36:09.790248Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.13456"},"observation_digest":"sha256:0a1b31ae76f45fc5f6afc7fa83e4a312813699c258c84bd13eb2d58902b7296f","observation_id":"aae6aa57-c1ab-4931-96f6-b093dcdad595","resolution":{"observed_at":"2026-05-19T09:37:14.009891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-15T19:10:27.540220Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.540220Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:e90b9ca6dceb55746c4bdcb7700c97d572c031d17fbe1fe86a793a1bfd4f7f70","observation_id":"aa52847d-d72f-4257-a581-a7e6d0f8791a","resolution":{"observed_at":"2026-08-15T19:10:27.540220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T22:57:07.883617Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.21539"},"observation_digest":"sha256:3e47904237824ded29a69db4bbab770535a47901e86b78e99a325dd377094038","observation_id":"e9708aa9-d99f-4b06-b3be-99c2970666f6","resolution":{"observed_at":"2026-05-11T22:57:08.303232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-06T21:31:04.778023Z","title":"Diffusion-vla: Scaling robot founda- tion models via unified diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-19T22:31:35.698906Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.778023Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:d46abeed94e733b6933df1474b05b18ed18d78b5403bf054844dd062494b0674","observation_id":"af514658-c5c6-4e6b-b026-931977c0abe3","resolution":{"observed_at":"2026-08-06T21:31:04.778023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-08-20T23:30:19.416778Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":290,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:4200aea4f6823e094cd9360607309c51ef89c076b1f66ff807217ff8f319a38e","observation_id":"d23c1da5-a936-43db-a192-fa8f83e95956","resolution":{"observed_at":"2026-05-17T14:08:35.427922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-06T20:45:30.607811Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01961","last_updated":"2025-07-05T04:00:38Z","snapshot_observed_at":"2026-08-16T23:05:12.093933Z","submitted_at":"2025-07-02T17:59:54Z","title":"AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:30.607811Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2507.01961"},"observation_digest":"sha256:85dc3fa5a64b6d41d142297e095a555c419c12c8e588f0b8d4b78c3a8687384d","observation_id":"6118946c-2d91-49bd-abf4-c75788a0bb9e","resolution":{"observed_at":"2026-08-06T20:45:30.607811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-05T21:59:03.506693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-13T06:02:01.735059Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.506693Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:c9b4443af9d5942104ddd72a8965483fae7d14dc82685382c2aac7df378b9b19","observation_id":"8a3068a2-2413-4b17-893b-59a5f87d8200","resolution":{"observed_at":"2026-08-05T21:59:03.506693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-05T20:35:46.932257Z","title":"arXiv preprint arXiv:2412.03293 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-09T19:01:56.593721Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:46.932257Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:8b38603d47b9bb357e1a412945e670ed0c2adecdad9e1fb219c86ce17b940997","observation_id":"f71475a0-c916-477a-9efa-81b420fe9b5b","resolution":{"observed_at":"2026-08-05T20:35:46.932257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-05T20:38:44.250854Z","title":"arXiv preprint arXiv:2412.03293 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-15T15:50:24.676875Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:44.250854Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:9682ecd7b82e8f2c22ef83c073fc5bd8318f0b564d3d1f7d2e091db503073170","observation_id":"1bd6b839-6ce0-4d8e-92d6-093f9ec6d4b6","resolution":{"observed_at":"2026-08-05T20:38:44.250854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-05T20:31:54.311759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-17T18:39:16.964832Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":202,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:54.311759Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:12864e30cd4c9da70612848cce09124aeaf2309566223588efdc7d1a4192d677","observation_id":"fc906212-3aac-42d2-9d8e-004341d43b30","resolution":{"observed_at":"2026-08-05T20:31:54.311759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-15T17:20:58.951601Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.951601Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:cf6774dd46c07f735f85aa5a631a3be015409f5d17ff70e65cebd8cccd91264f","observation_id":"57d86c72-065c-4732-9470-a42dcad4b8be","resolution":{"observed_at":"2026-08-15T17:20:58.951601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-05T16:55:52.085685Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-08-19T06:18:36.723707Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:52.085685Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.17449"},"observation_digest":"sha256:2ddd981e0072b8205f2fe22d0f3fcb933bdb5883a62c9d1c54f2ecbf6406ae4d","observation_id":"91f54363-3107-412c-bd71-703477719c40","resolution":{"observed_at":"2026-08-05T16:55:52.085685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-04T17:00:45.116074Z","title":"Diffusionvla: Scaling robot founda- tion models via unified diffusion and autoregression,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11197","last_updated":"2025-09-14T09:54:20Z","snapshot_observed_at":"2026-08-13T10:14:57.766017Z","submitted_at":"2025-09-14T09:54:20Z","title":"DreamNav: A Trajectory-Based Imaginative Framework for Zero-Shot Vision-and-Language Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:00:45.116074Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2509.11197"},"observation_digest":"sha256:7e1b89b1be510251e8f259a547ea1e5c0976da0141c83d25be69282da37bd20e","observation_id":"0df86736-05d4-46ee-ac7d-78bfe38ee4d9","resolution":{"observed_at":"2026-08-04T17:00:45.116074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-08-11T01:19:54.645561Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:9bc605abdcedf31bf96669ab9897410bd80fafce782bcfd7e1a5cb7ec16c1b84","observation_id":"e5e2c21e-164c-4a1f-9e3c-9451662013ef","resolution":{"observed_at":"2026-05-17T21:30:18.333293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2601.20239","last_updated":"2026-05-13T12:53:21Z","snapshot_observed_at":"2026-08-13T15:42:02.097170Z","submitted_at":"2026-01-28T04:22:47Z","title":"TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance","version":6},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T11:06:23.555610Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2601.20239"},"observation_digest":"sha256:f2024428892c6553d8497e1c4295c3e48901a06ae54f22dfae58bc64ab967c76","observation_id":"7d87aa4e-6461-42e9-9273-272d44758ff9","resolution":{"observed_at":"2026-05-16T11:07:47.830757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2602.09023","last_updated":"2026-05-19T02:18:04Z","snapshot_observed_at":"2026-08-17T01:16:25.939712Z","submitted_at":"2026-02-09T18:59:52Z","title":"TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:53.818915Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2602.09023"},"observation_digest":"sha256:d57ef42441f6131e5877a41cfc019eb60f8f4bd0e367b2ffadb836105af07d75","observation_id":"23b91943-9cd2-4185-9a9d-0f1853a914b5","resolution":{"observed_at":"2026-05-21T13:14:10.882539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-11T13:04:08.180508Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T05:47:17.494531Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:c31bae4e4e159e61eeadf6ba28bf70ddb2a1217c1b5dd51af0b75fea678d01ce","observation_id":"ff9e5053-b10b-4e09-afd9-62bd655ea456","resolution":{"observed_at":"2026-05-12T10:31:30.125617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-11T13:04:08.180508Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T03:00:26.352130Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:88c04af107ec48061cb9b8845c22d09a0b7d349d3ecc2676bab5ce27516bfef7","observation_id":"5853d067-9cc7-4071-8963-0320d87bb4b7","resolution":{"observed_at":"2026-05-11T22:17:03.723898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-12T23:04:14.451687Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:43.222818Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:52816db52217ee3ff830e4fc9fb3275f8600cf32eb762f652f6d3fc39ca6e8e6","observation_id":"a26384c0-ff05-4852-bd17-6c093afdb86c","resolution":{"observed_at":"2026-05-12T06:36:25.650502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-02T14:26:02.341925Z","title":"Diffusion-vla: Generalizable and interpretable robot foundation model via self-generated reasoning.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-12T23:04:14.451687Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T14:26:02.341925Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:be5a77cd0df53b4ee721432e4ce6b4361d553b29634a669365303c26594759fb","observation_id":"889590f4-6d3c-4e1b-b2a3-3c0cdee70821","resolution":{"observed_at":"2026-08-02T14:26:02.341925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2605.10942","last_updated":"2026-05-11T17:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:59:56Z","title":"HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T03:28:18.730751Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2605.10942"},"observation_digest":"sha256:aa3279f6ff07ea4e1492e950ac21bf262bec008145c83aa23c366b945c803d55","observation_id":"975ceea2-8c42-4770-8a5e-878814d0c7ff","resolution":{"observed_at":"2026-05-12T07:21:24.315613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":269,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:de6a3016e2379db5935dcf5b50a2da6a79311574c2b62a1316198568d7d8e086","observation_id":"865d3931-e91c-49d1-9d11-336a5f39757b","resolution":{"observed_at":"2026-05-13T05:07:18.129736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:ed84b0608d681df939993086529985166aef2daf6f931da961b38bc91bfd296b","observation_id":"edab43d3-6724-4e1e-8d86-c5198978556e","resolution":{"observed_at":"2026-05-14T17:57:33.179561Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2606.06155","last_updated":"2026-06-04T13:28:51Z","snapshot_observed_at":"2026-07-29T15:22:02.359291Z","submitted_at":"2026-06-04T13:28:51Z","title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T01:23:02.576098Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2606.06155"},"observation_digest":"sha256:17f8e2581de9fcce7bfd2ac0c0a8e626f8c81cb52c6b0cdc5a42d28bf3d81d5e","observation_id":"143f74b6-e385-4553-b953-ccb3bc3f422c","resolution":{"observed_at":"2026-07-02T13:16:59.255359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2606.11019","last_updated":"2026-06-09T15:56:41Z","snapshot_observed_at":"2026-08-07T21:21:09.657100Z","submitted_at":"2026-06-09T15:56:41Z","title":"Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T13:14:28.378548Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2606.11019"},"observation_digest":"sha256:f9ff1d606b5ed5c2a63e0ba191c7ce0e70374f5dd952d355b3eef82320e24b4f","observation_id":"cb00d7cb-1c93-4ede-bd6e-2617738df0b7","resolution":{"observed_at":"2026-07-03T05:27:40.190980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2606.21088","last_updated":"2026-06-19T04:35:18Z","snapshot_observed_at":"2026-08-06T05:03:39.968585Z","submitted_at":"2026-06-19T04:35:18Z","title":"MV-WAM: Manifold-Aware World Action Model with Value Augmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T14:36:42.051049Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2606.21088"},"observation_digest":"sha256:fee9378fc644f46100b8caf7228e3e580720fc8904c5111bf9c00b0c1105b56d","observation_id":"74a36b4d-891e-4346-9e6c-f687633bd2f7","resolution":{"observed_at":"2026-07-04T06:19:38.129392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2606.22794","last_updated":"2026-06-22T03:10:19Z","snapshot_observed_at":"2026-08-04T03:01:53.810285Z","submitted_at":"2026-06-22T03:10:19Z","title":"UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T08:57:01.861091Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2606.22794"},"observation_digest":"sha256:2ca90eb672e76ceedb369f15dae244e2c642872197773977138b79c00867d847","observation_id":"266c8a36-4ae2-4add-b35d-0d376db6bc53","resolution":{"observed_at":"2026-07-04T10:19:47.613178Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2606.23685","last_updated":"2026-06-22T17:59:52Z","snapshot_observed_at":"2026-08-07T19:05:41.229782Z","submitted_at":"2026-06-22T17:59:52Z","title":"LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T07:58:17.225491Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2606.23685"},"observation_digest":"sha256:f679694b8a8ed62f3e4e14029c244a059a18458460beee6980cf0c30d81c0969","observation_id":"e7f4277e-4c42-4440-8bf2-80fdf02602d3","resolution":{"observed_at":"2026-07-04T11:29:50.765620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2606.30686","last_updated":"2026-06-28T14:03:57Z","snapshot_observed_at":"2026-08-21T10:37:56.792783Z","submitted_at":"2026-06-28T14:03:57Z","title":"Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-01T06:56:45.197407Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2606.30686"},"observation_digest":"sha256:48b90b9da1f3c5b82cde78aa7b3fff9c53c11a7712d990f1a7075dd8478a4b15","observation_id":"08fc0924-eb0a-4e2f-bf69-e288d02483ab","resolution":{"observed_at":"2026-07-01T08:55:35.797302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2607.06564","last_updated":"2026-07-07T17:59:47Z","snapshot_observed_at":"2026-08-15T02:18:03.269130Z","submitted_at":"2026-07-07T17:59:47Z","title":"Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T01:41:34.889711Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2607.06564"},"observation_digest":"sha256:c70e9e4397cee860f1457703319bd783accedc3a75462aed1d2447b6c6474acf","observation_id":"e6bf9257-e101-4579-9ee1-11f270853ae2","resolution":{"observed_at":"2026-07-08T01:44:26.114231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":"2412.03293","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-07-09T20:46:33.613525Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression","venue":"cs.RO","work_id":"5bef7734-f190-42cb-8a33-21c9d3e0f5b0","year":2024},"citing_paper":{"arxiv_id":"2607.07076","last_updated":"2026-07-08T07:08:11Z","snapshot_observed_at":"2026-08-14T17:38:02.654754Z","submitted_at":"2026-07-08T07:08:11Z","title":"PriGo: Test-Time Primitive Guidance to Diffusion and Flow Policies for Adaptive Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T20:38:38.404267Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2607.07076"},"observation_digest":"sha256:6d0b8ccd38b4ac55c88333e92e3f958d4268ca1d981b2072faf748340568144b","observation_id":"ebaeb5c1-0c0e-475e-a0b0-6f9c90292ac6","resolution":{"observed_at":"2026-07-09T20:46:33.614832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03293/citation-record","integrity":"/paper/2412.03293/integrity","json":"/paper/2412.03293/citation-record.json","paper":"/paper/2412.03293"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:30.677122Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.677122Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:d6999d376db4b9eaa2a924404bb2f0d734e73568c612befd3516b4ba94b28176","observation_id":"c5b610e7-3050-4ca6-b99e-e6c9d8e90ca9","resolution":{"observed_at":"2026-08-11T22:38:30.677122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T22:38:30.780478Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.780478Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:31853a3bf5e015d998838f3579819227ac6fb5b4c62a93ddff7c72d3a7654c01","observation_id":"ce9a55c8-ad49-4df3-9f67-45d492791481","resolution":{"observed_at":"2026-08-11T22:38:30.780478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-11T22:38:30.790927Z","title":"Rt-h: Action hierarchies using language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.790927Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:9941a109aa2eccd79c79b95c859429dfa3ecb71c5fba0667b6f9a5025009ea84","observation_id":"8988af72-8f17-4956-ac21-e4a0369244b4","resolution":{"observed_at":"2026-08-11T22:38:30.790927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-11T22:38:30.804831Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.804831Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:642fa59b7c05a2ffb8aea9feef1f4eaab58cf80481f12f6e848414f0a95309a6","observation_id":"3b40a6d0-53fa-410d-b026-b300f2b34edf","resolution":{"observed_at":"2026-08-11T22:38:30.804831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-11T22:38:30.833183Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.833183Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:d7ebaa66cc57bb88881ad47f74d49822708925b38b6455b97feb8c9a2552337a","observation_id":"f7238fea-80b6-48ba-9b36-354643bcb841","resolution":{"observed_at":"2026-08-11T22:38:30.833183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-11T22:38:30.854034Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.854034Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:6aeaeacb2667e95b4e3ef336c1b26863c6760e2c7dc4c4f45a72fe960cef3363","observation_id":"23ae1d4e-49e5-45dc-9e27-42b8c999e053","resolution":{"observed_at":"2026-08-11T22:38:30.854034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-11T22:38:30.884902Z","title":"X., Tanner, J., Vuong, Q., Walling, A., Wang, H., and Zhilinsky, U","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.884902Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:0437bbd28f58ccacb12a39a0c0d8cc0910c5bfe71654fd2dcab1696352fc1e47","observation_id":"35e41f25-e935-4706-8940-c9fb962d7cfa","resolution":{"observed_at":"2026-08-11T22:38:30.884902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-11T22:38:30.927195Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.927195Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:9bb0891682de45e9dce4471b2b4fecf83de2231d54ec21efa56971e9a9497121","observation_id":"411c4de9-b80d-4448-872c-95df520308b6","resolution":{"observed_at":"2026-08-11T22:38:30.927195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T22:38:30.997068Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.997068Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:831e43f9f357b72c8f7724a5df8bc415bb13c2049501dc00a73ccd44c2d1c769","observation_id":"d68b3fe0-05ac-4fab-8d7e-8ada58bf5b1b","resolution":{"observed_at":"2026-08-11T22:38:30.997068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-16T18:26:33.270093Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-11T22:38:31.106963Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.106963Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:67fce35235af457caac938859dbb37a00bb648fc757c127587ccf281c232dbee","observation_id":"47eed8d6-771b-4ac5-9787-1e1476d55680","resolution":{"observed_at":"2026-08-11T22:38:31.106963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-11T22:38:31.192316Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.192316Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:b53c9456e383c6f962e8686a7c7c84e8181a29b6338f2201cd1c5f7fb3373a6b","observation_id":"9673ca89-e7cd-428f-9f80-c7345940c207","resolution":{"observed_at":"2026-08-11T22:38:31.192316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10088","last_updated":"2024-10-14T02:02:54Z","snapshot_observed_at":"2026-08-18T19:46:57.991314Z","submitted_at":"2024-10-14T02:02:54Z","title":"The Ingredients for Robotic Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10088","snapshot_observed_at":"2026-08-11T22:38:31.198772Z","title":"K., and Levine, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.198772Z"},"links":{"cited_paper":"/paper/2410.10088","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:1a0c6f2fd0477c003e3201d7424d9673ae97d4a53b38c8d67b302f7acce1211f","observation_id":"8654041c-5c7d-4c37-9c60-69beb8382a0e","resolution":{"observed_at":"2026-08-11T22:38:31.198772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-08-15T12:54:53.410743Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-08-11T22:38:31.204174Z","title":"Z., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.204174Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:9c94a09656d8643b607dcc4fb27058d7175e64da015df04c08713948219ab3fa","observation_id":"623c01a6-f16f-46ce-9487-72eee06c3eae","resolution":{"observed_at":"2026-08-11T22:38:31.204174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-11T22:38:31.228000Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.228000Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:98fea80f66678db3b670a724e377e3e473746abc6bfe8394b7473fc9849fa394","observation_id":"b8eb4d62-afb3-4f65-aa95-4ab6f8efb091","resolution":{"observed_at":"2026-08-11T22:38:31.228000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-16T14:46:11.532367Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-11T22:38:31.238409Z","title":"G., Rao, K., Yu, W., Fu, C., Gopalakrishnan, K., Xu, Z., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.238409Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:0570097eeb5e88395c0b6ee84bec0efd58cfe26b872735a12775743762def70a","observation_id":"729ec95a-3061-4e01-b25e-5522133fa68b","resolution":{"observed_at":"2026-08-11T22:38:31.238409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:31.249751Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.249751Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:c0ce94a8121dd590951b877077e4d5e430d8f93d6552b9587240714bf570fa53","observation_id":"d0f9babd-24e9-4389-9d6a-4355895f37f1","resolution":{"observed_at":"2026-08-11T22:38:31.249751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:31.283882Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.283882Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:1732e51bc15703760248265fbb5d69a186da6165d9b25eb460526621a5cc31eb","observation_id":"05ff5274-167d-419d-a797-5fe3016b3c56","resolution":{"observed_at":"2026-08-11T22:38:31.283882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T22:38:31.298023Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.298023Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:a351ef98d1c1615d8af45505aeb3238a9e1f45535947fdf5ee1eac344eddc9d1","observation_id":"964c2fcc-c986-4efa-b198-81242e1d7217","resolution":{"observed_at":"2026-08-11T22:38:31.298023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:36.659661Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"80cedf68-f6ed-4d5f-918d-55965eeff31f","year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.306907Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:bae637ae2e86c28a53ce6b13221c3bd586af13a81aba2522d71f5235136f25ce","observation_id":"c08b0fd2-20f8-4d08-811a-73c50dc8f6c3","resolution":{"observed_at":"2026-08-11T22:38:36.794770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:31.377236Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.377236Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:f45a97a609477065ea203baa1a762de2a2be4b15bc2eb1199edcf89b121567e1","observation_id":"bf710902-d1d2-4757-9f14-db4d63a31fe9","resolution":{"observed_at":"2026-08-11T22:38:31.377236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:36.613800Z","title":"Mail: Improving imitation learning with selective state space models","venue":null,"work_id":"61ae2a9d-7489-4234-ae98-feaac2962aa3","year":null},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.496666Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:04edac25a58e9126d7fae029a32beaaa3cb642d2ba4b0ccb80b271391e2bd595","observation_id":"cd54b650-a9a3-425b-a5f5-d1666ebb84ba","resolution":{"observed_at":"2026-08-11T22:38:36.630936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-16T16:26:20.587132Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-11T22:38:31.617037Z","title":"Vima: General robot manipulation with multimodal prompts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.617037Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:31e153c5462dee69e88c65d00e4626240efc1ee5c3ff05c3bd4913520223cdbc","observation_id":"25b8a85c-1538-4133-ad85-961a276b187e","resolution":{"observed_at":"2026-08-11T22:38:31.617037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-11T22:38:31.632303Z","title":"3d diffuser actor: Policy diffusion with 3d scene representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.632303Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:49a085d31b0bb605035b8c9b65a25e840ff608d07d30ddbfba7816f07e4ea0b5","observation_id":"a119d026-f345-4dc6-893d-48081e5e0530","resolution":{"observed_at":"2026-08-11T22:38:31.632303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-11T22:38:31.658250Z","title":"K., Chen, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.658250Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:bcc91405a1c939053eacabad8220014ca3d8dc2c5146fce78292200433561bf7","observation_id":"6e24741e-ea5a-4186-bf5d-19ea7199672a","resolution":{"observed_at":"2026-08-11T22:38:31.658250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:36.506673Z","title":"J., Pertsch, K., Karamcheti, S., Xiao, T., Balakrishna, A., Nair, S., Rafailov, R., Foster, E., Lam, G., Sanketi, P., et al","venue":null,"work_id":"e6c18585-6823-4fc3-bcc1-505bb812b289","year":null},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.672368Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:913ca3727da0364be58c05b61495e1b445bb60eb3d469fa75a6f9e5c64a8a715","observation_id":"1f2a28fa-9b09-4a85-b7cf-71318b4067c3","resolution":{"observed_at":"2026-08-11T22:38:36.584821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:31.725170Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.725170Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:c91cb67da95142f64b7e90dc86a3a0b9524965e52b7191b006071258b4f4b010","observation_id":"d32c8843-2d7d-400c-9ccb-e39b87bb0c2b","resolution":{"observed_at":"2026-08-11T22:38:31.725170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-11T22:38:31.816900Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.816900Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:e8c59f9d11c7b93ef0cd384c1fd9470db53e150b179e8f86b30e3add5add12ab","observation_id":"78c6b8e2-337b-4e65-ae44-19436bcf22b3","resolution":{"observed_at":"2026-08-11T22:38:31.816900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-11T22:38:31.911890Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.911890Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:be25891b342618217e60ae0f6fee2b1e48dc143aa3fcd1e061f99275fea33aa3","observation_id":"f0b01fca-0b7e-41a6-924d-06e2317b4e49","resolution":{"observed_at":"2026-08-11T22:38:31.911890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-17T09:33:59.536762Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-11T22:38:31.939665Z","title":"Towards generalist robot policies: What matters in building vision-language-action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.939665Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:3c9c73c799db6aa34c9bf0a42e221553e38c07cedcc35922a3f1041717ea3e22","observation_id":"b8749297-084a-438f-8c1f-37bc88f77115","resolution":{"observed_at":"2026-08-11T22:38:31.939665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:31.958422Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.958422Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:f793c3f02d89f29c1ab57ecdd9a56aa848dec84ec5fc450ff34c5b48b0c40ca3","observation_id":"57d67beb-2b20-48d3-9fc5-fac67a0ce124","resolution":{"observed_at":"2026-08-11T22:38:31.958422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18647","last_updated":"2026-06-26T02:30:53Z","snapshot_observed_at":"2026-08-19T04:08:17.011634Z","submitted_at":"2024-10-24T11:19:30Z","title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18647","snapshot_observed_at":"2026-08-11T22:38:31.978533Z","title":"Data scaling laws in imitation learning for robotic manipulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:31.978533Z"},"links":{"cited_paper":"/paper/2410.18647","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:78799271f194ed507455e8fe1d9a153fe4e283060a8c2df6ab813c6d04c72e43","observation_id":"574eb622-8a13-44cd-b9f1-184eec9a40c3","resolution":{"observed_at":"2026-08-11T22:38:31.978533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T22:38:32.001601Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.001601Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:e67e4686b0f477fb3416c7039e0f1c50eac7eb623524b6d09fea3f9b19785d4c","observation_id":"b90df923-f651-4c32-af31-887263ad173b","resolution":{"observed_at":"2026-08-11T22:38:32.001601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:36.336986Z","title":null,"venue":null,"work_id":"c22a3abf-ec17-4363-aac6-a808b8510cc2","year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.017289Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:7a1c8d741bdda142252112d9c3eae413c11d8d565fd186d692bf0108edaa1f76","observation_id":"5bed63dd-9dda-4841-96c2-a033fb293541","resolution":{"observed_at":"2026-08-11T22:38:36.390407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-08-20T09:40:44.825072Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-11T22:38:32.131516Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.131516Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:aba580d197da065f5025cda4471ab9d78494d45b9243a93a01d5f458fa3f8492","observation_id":"36796e7f-eca3-4d49-8091-0668e16b3ff7","resolution":{"observed_at":"2026-08-11T22:38:32.131516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:32.189701Z","title":"N., Zhu, S.-C., and Gao, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.189701Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:1d4a078450e3fd861d2524b6f749fc6a3da8828fe4b6f0b617546842427457f8","observation_id":"7d16bbeb-4fed-4692-b251-d78ef42bd36c","resolution":{"observed_at":"2026-08-11T22:38:32.189701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:32.200125Z","title":"Y., Sanketi, P., Vuong, Q., Xiao, T., Sadigh, D., Finn, C., and Levine, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.200125Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:4c5e2ab1394101dd579a4d2bd203bb572a423bdbeb7aa00e41e2974cb45f508e","observation_id":"39c46c55-c681-42a3-af14-3de9732f17b1","resolution":{"observed_at":"2026-08-11T22:38:32.200125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-11T22:38:32.234754Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.234754Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:41e2864ebd6d80b8252824a35bb97c8a618e695e41e4c2d1f6ea36c29f379565","observation_id":"41a92526-83c9-4872-8aa4-498af23715c5","resolution":{"observed_at":"2026-08-11T22:38:32.234754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:32.284752Z","title":"and Xie, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.284752Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:ef22f932f5537a5c1a16a0a8f482762c01c5d771086960686d6f70dbe23106ca","observation_id":"55809c25-28cf-4000-bcf3-7b3f96836adc","resolution":{"observed_at":"2026-08-11T22:38:32.284752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:32.319035Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.319035Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:d9d39b245f2574ba354694fa37e3e9f4dac62a3bdfe82a6ace50549cccf436ee","observation_id":"4f816274-f3f3-484c-a2d6-b6e43a843cb7","resolution":{"observed_at":"2026-08-11T22:38:32.319035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-08-21T05:15:36.931588Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-11T22:38:32.344745Z","title":"Fast: Efficient action tokenization for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.344745Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:1e05f4585501caf7c676b3243047cb38775dc4de3b7b7dc98e6c10ff061cd4aa","observation_id":"d1de3bde-3460-42c2-bcbc-12872c3c58c5","resolution":{"observed_at":"2026-08-11T22:38:32.344745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T22:38:32.442886Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.442886Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:3b379c8e4a4aee588d7a017bdec15bbf9fb6e07f26d4bd197fa2ea3f4cfa49f9","observation_id":"f61ff552-8b34-40d9-bba2-222cee5191ff","resolution":{"observed_at":"2026-08-11T22:38:32.442886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07503","last_updated":"2024-06-28T21:56:25Z","snapshot_observed_at":"2026-08-19T08:19:59.136599Z","submitted_at":"2024-05-13T06:53:42Z","title":"Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07503","snapshot_observed_at":"2026-08-11T22:38:32.583543Z","title":"Consistency policy: Accelerated visuomotor policies via consistency distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.583543Z"},"links":{"cited_paper":"/paper/2405.07503","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:fc5d098a43322e70bd7ae6d10df582c636e3a580bd6b1a4ab9795680c3e4819a","observation_id":"916c612b-97a2-4976-810c-6842b1377aef","resolution":{"observed_at":"2026-08-11T22:38:32.583543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:36.198698Z","title":"E., Wenzel, F., and Lioutikov, R","venue":null,"work_id":"0589974b-556b-4406-aff0-382fb224a360","year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.645819Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:53a0bfc60ba96c95d677330b68ac6dba02ba3a92da1c2dcfa37347b9330f22de","observation_id":"8714406a-b6bf-4b22-801a-89beb6803205","resolution":{"observed_at":"2026-08-11T22:38:36.245525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:32.663912Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.663912Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:f8cee7251d32f975cab64b7be1e3485ce065590355a0e0a3e2f6f6be06117dc3","observation_id":"cd6de92d-f06e-4ef0-a863-ba345ebf67cc","resolution":{"observed_at":"2026-08-11T22:38:32.663912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12910","last_updated":"2024-03-19T17:08:24Z","snapshot_observed_at":"2026-08-16T14:08:19.225762Z","submitted_at":"2024-03-19T17:08:24Z","title":"Yell At Your Robot: Improving On-the-Fly from Language Corrections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12910","snapshot_observed_at":"2026-08-11T22:38:32.675853Z","title":"X., Hu, Z., Zhao, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.675853Z"},"links":{"cited_paper":"/paper/2403.12910","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:dd9af5337e7b9466632498fe8077cdf3aa6192b100968fd60d6967e64e48837a","observation_id":"f5d58f4a-9bc9-4950-8a4e-1632028ae561","resolution":{"observed_at":"2026-08-11T22:38:32.675853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-11T22:38:32.693520Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.693520Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:abb018ed27a929456c7420ba6c354c6d5653709a40e1a7be83fd3f4b648c208d","observation_id":"db9df151-978d-49b7-9617-02bd0b28fde2","resolution":{"observed_at":"2026-08-11T22:38:32.693520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T22:38:32.711089Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.711089Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:81fdaef830aab7ffa21b2119064048d7f951c7b9ead2ab2446a9d1c43112c839","observation_id":"488b31cd-c809-40dd-9f10-9f37ae859311","resolution":{"observed_at":"2026-08-11T22:38:32.711089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T22:38:32.724782Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.724782Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:94a6f24427178137dd2aadfe8f2c8bb9cbfb27349a3a14e07f048706b8598f72","observation_id":"f18134a4-7b39-41be-9825-d72caaa54dc3","resolution":{"observed_at":"2026-08-11T22:38:32.724782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T22:38:32.736703Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.736703Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:7baad73b90aa220ebb6a9bdfd52bb6d794934c2d18c1f0abf710f0787aacecc4","observation_id":"b0bf8ac0-ff76-475f-8ffc-1f571d04549f","resolution":{"observed_at":"2026-08-11T22:38:32.736703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15194","last_updated":"2024-02-28T09:21:46Z","snapshot_observed_at":"2026-08-20T07:42:16.420034Z","submitted_at":"2024-02-23T08:54:42Z","title":"Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15194","snapshot_observed_at":"2026-08-11T22:38:32.747952Z","title":"L., Tseng, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.747952Z"},"links":{"cited_paper":"/paper/2402.15194","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:3e6324f9a3b8dc13e7e4f3936e05a75839a160746e952137a52c39e74874289d","observation_id":"df6887dc-8750-4568-a4cd-1e143c92e2e0","resolution":{"observed_at":"2026-08-11T22:38:32.747952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16359","last_updated":"2024-07-18T08:21:54Z","snapshot_observed_at":"2026-08-18T00:57:36.382309Z","submitted_at":"2024-02-26T07:24:32Z","title":"Feedback Efficient Online Fine-Tuning of Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16359","snapshot_observed_at":"2026-08-11T22:38:32.763447Z","title":"L., Tseng, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.763447Z"},"links":{"cited_paper":"/paper/2402.16359","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:be6b18363b8bbafdd17b2b5d24f100aed1e4d4864dc507affd622f9b06730b17","observation_id":"34b7d7b6-4968-4407-88e5-aca06de7a728","resolution":{"observed_at":"2026-08-11T22:38:32.763447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01812","last_updated":"2024-10-15T14:50:29Z","snapshot_observed_at":"2026-08-16T13:37:56.835987Z","submitted_at":"2024-07-01T21:23:26Z","title":"Equivariant Diffusion Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01812","snapshot_observed_at":"2026-08-11T22:38:32.856741Z","title":"Equivariant diffusion policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.856741Z"},"links":{"cited_paper":"/paper/2407.01812","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:18a627862b91a2f417cf359848cd98010dd72b5e16765bd524c8c44dbca961bb","observation_id":"c4662172-1294-4182-9055-36e4792b23c4","resolution":{"observed_at":"2026-08-11T22:38:32.856741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T22:38:32.964702Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:32.964702Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:0d8f38ec1fa086d33b940f61db505bf34bf91f96de15e1c1b476537b8287d8b1","observation_id":"2346503c-9fd5-4f7a-9c83-69900fa373b1","resolution":{"observed_at":"2026-08-11T22:38:32.964702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T22:38:33.037973Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.037973Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:06a686fef3b036e2904b74e94a57f03a5687e25f61104437fb39d3508267d052","observation_id":"9e683b69-97cc-406d-8b30-eb47bdb315b9","resolution":{"observed_at":"2026-08-11T22:38:33.037973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01531","last_updated":"2024-10-24T22:01:44Z","snapshot_observed_at":"2026-08-21T00:56:32.980564Z","submitted_at":"2024-07-01T17:59:56Z","title":"Sparse Diffusion Policy: A Sparse, Reusable, and Flexible Policy for Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01531","snapshot_observed_at":"2026-08-11T22:38:33.057294Z","title":"Sparse diffusion policy: A sparse, reusable, and flexible policy for robot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.057294Z"},"links":{"cited_paper":"/paper/2407.01531","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:f3983404d0699ed83b4c50b2695f2986ea3ec3fea7b46c157615acc4c3243750","observation_id":"c52154f4-3eb1-433f-889b-9d861161e450","resolution":{"observed_at":"2026-08-11T22:38:33.057294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21257","last_updated":"2024-10-28T17:54:31Z","snapshot_observed_at":"2026-08-20T01:36:05.617817Z","submitted_at":"2024-10-28T17:54:31Z","title":"One-Step Diffusion Policy: Fast Visuomotor Policies via Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21257","snapshot_observed_at":"2026-08-11T22:38:33.067036Z","title":"One-step diffusion policy: Fast visuomotor policies via diffusion distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.067036Z"},"links":{"cited_paper":"/paper/2410.21257","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:f180d31cfc25e3c068e496381176faaa0efca7ebad99b286ee9fd7feacd61350","observation_id":"7f209aeb-04a0-4d37-bd5f-97b90186db77","resolution":{"observed_at":"2026-08-11T22:38:33.067036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-21T21:05:25.248896Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-11T22:38:33.084810Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.084810Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:a83b27cf27e08d72f99b6aaec3850b631a35c03afb895ba15c616dfa3a782b65","observation_id":"08132ec9-081a-49e1-945e-bb61426d9ae3","resolution":{"observed_at":"2026-08-11T22:38:33.084810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-11T22:38:33.162000Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.162000Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:c52764078c9726aebb61b73d4ba180ffc7262daa52d9e96baefd649dc7ba6b98","observation_id":"482c0842-30e5-42dd-b13b-d4c2ea8d7a12","resolution":{"observed_at":"2026-08-11T22:38:33.162000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-11T22:38:33.263595Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.263595Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:980e23cc38d4dc0c3479f959df692d800b032815eef4698f536a1517d06046fc","observation_id":"4bccf384-dd94-4b41-96d2-0b78fb3acc59","resolution":{"observed_at":"2026-08-11T22:38:33.263595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-11T22:38:33.276125Z","title":"J., Wang, W., Lin, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.276125Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:df600976e301ba5cb9ed31e94c165124581c7f66fee9d2f4e3562ed78d15dd68","observation_id":"b223495b-6eb9-4353-8289-ee0d35baeb16","resolution":{"observed_at":"2026-08-11T22:38:33.276125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04115","last_updated":"2024-03-08T09:56:47Z","snapshot_observed_at":"2026-08-16T14:12:08.182636Z","submitted_at":"2024-03-07T00:09:07Z","title":"DNAct: Diffusion Guided Multi-Task 3D Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04115","snapshot_observed_at":"2026-08-11T22:38:33.292167Z","title":"Dnact: Diffusion guided multi-task 3d policy learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.292167Z"},"links":{"cited_paper":"/paper/2403.04115","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:78cf6a904245800b8ffa1330bdcdc4da2849cdbc1c76531968cc08abf8a6a98e","observation_id":"4cf806c9-31f0-40a4-a1fb-bfea83757858","resolution":{"observed_at":"2026-08-11T22:38:33.292167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15815","last_updated":"2024-10-23T05:32:34Z","snapshot_observed_at":"2026-08-19T08:19:59.451287Z","submitted_at":"2024-07-22T17:29:02Z","title":"Learning to Manipulate Anywhere: A Visual Generalizable Framework For Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15815","snapshot_observed_at":"2026-08-11T22:38:33.305761Z","title":"Learning to manipulate anywhere: A visual generalizable framework for reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.305761Z"},"links":{"cited_paper":"/paper/2407.15815","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:6e8109c599eb1022096370a7033491cad593b394fabfcaecf816591fdd3bc2f4","observation_id":"e425115c-9b20-484f-b73e-69965c97da97","resolution":{"observed_at":"2026-08-11T22:38:33.305761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-11T22:38:33.311794Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.311794Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:1168d9447fe40d39c996bf89534c82524aaac7df71d2ac00e360892e9413bdbd","observation_id":"62c0834a-6852-4d4d-a3b6-1e7d257da7a8","resolution":{"observed_at":"2026-08-11T22:38:33.311794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-08-19T08:16:36.548910Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-08-11T22:38:33.319212Z","title":"B., and Wu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.319212Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:0c9e31340146091a2b88447b9cfaf82d050c5bc9683f04615d36f8fd5d817999","observation_id":"c19f2071-5ad0-4411-89f7-3ea4765360d0","resolution":{"observed_at":"2026-08-11T22:38:33.319212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:35.942253Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":"29b60292-bf79-4194-95d5-3a4b4c96e741","year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.335420Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:01c75fe501f2ad048ad52a81b97995fe9fba9f525d17c31b223ba7e2f98bf97a","observation_id":"cc3f6a21-794c-443d-80db-8c870a4fdca3","resolution":{"observed_at":"2026-08-11T22:38:36.100844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:33.373560Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.373560Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:9c864797cbb40f4944cc36d27c1c46417090dbe2e2010498c44ce206b51fbeb8","observation_id":"3d2d6e36-aafd-4c04-93f0-f236c19e2e5c","resolution":{"observed_at":"2026-08-11T22:38:33.373560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-08-19T09:44:23.019197Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-11T22:38:33.391932Z","title":"Grape: Generalizing robot policy via preference alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.391932Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:d4b9f56c22984fce985971c003f8efaddb92def7aac6a16babcfa74e5ff916b3","observation_id":"83c7d9b3-d2d0-41d6-bf33-e4f2503b24f9","resolution":{"observed_at":"2026-08-11T22:38:33.391932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16280","last_updated":"2024-09-24T17:51:04Z","snapshot_observed_at":"2026-08-16T13:15:46.020505Z","submitted_at":"2024-09-24T17:51:04Z","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16280","snapshot_observed_at":"2026-08-11T22:38:33.407074Z","title":"Monoformer: One transformer for both diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.407074Z"},"links":{"cited_paper":"/paper/2409.16280","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:93d08ac17f4a80db837ade91eb7ed5d6e9fc0ede0655c6a945072548be4c8ca4","observation_id":"4b1abf3e-2b42-4f9a-84d7-5855e4419e12","resolution":{"observed_at":"2026-08-11T22:38:33.407074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:38:35.864599Z","title":"Z., Tompson, J., Driess, D., Florence, P., Ghasemipour, S","venue":null,"work_id":"a0e26e56-0659-4692-bb48-8fcbf33e9f5b","year":null},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.455476Z"},"links":{"citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:eb90413e3d3c160339927cd783cce2057f17cb85b5764d5c6328d0018411d1bf","observation_id":"485b140b-6911-4e63-bb00-6b4b2a2b7266","resolution":{"observed_at":"2026-08-11T22:38:35.887897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-08-14T09:40:41.520844Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10105","snapshot_observed_at":"2026-08-11T22:38:33.482273Z","title":"Universal actions for enhanced embodied foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.482273Z"},"links":{"cited_paper":"/paper/2501.10105","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:2853215071472727bfcc707965124741b831276471bc9b92b5115ef6e8efef34","observation_id":"953d36f1-aa1a-472b-8fdf-077e28448eec","resolution":{"observed_at":"2026-08-11T22:38:33.482273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-11T22:38:33.554833Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.554833Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:d4cea36bbc9bcff913fde2f8fc0a3f07e3a4ed8e96cb10461dd9147ef15016bc","observation_id":"a913c615-beab-43be-b4f5-77e54065cd16","resolution":{"observed_at":"2026-08-11T22:38:33.554833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14411","last_updated":"2024-11-14T11:59:09Z","snapshot_observed_at":"2026-08-19T12:41:13.721929Z","submitted_at":"2024-09-22T12:14:16Z","title":"Scaling Diffusion Policy in Transformer to 1 Billion Parameters for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14411","snapshot_observed_at":"2026-08-11T22:38:33.644750Z","title":"Scaling diffusion policy in transformer to 1 billion parameters for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:33.644750Z"},"links":{"cited_paper":"/paper/2409.14411","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:36f7169eba4478364f539383fedb5b14de9b27ede961650b05f5dc75806f5834","observation_id":"52850c6a-4a89-44d5-a47e-d46e82a0af22","resolution":{"observed_at":"2026-08-11T22:38:33.644750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 45 inbound Pith citation observations for arXiv:2412.03293."}