{"as_of":"2026-08-21T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15f691cc511d68682ba93cb76c1f7ba5462ff82e4df27360fc472774e2bce109","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:55:30.083174Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:40:57.389819Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T18:57:16.674514Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-08-11T01:19:54.645561Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:23694e087fe13eea5ce97e2edd583e345520d9c130401d2f7f0998864e875b2e","observation_id":"44b1ebeb-e89f-47ee-8e4d-539be1f87c66","resolution":{"observed_at":"2026-05-17T21:30:18.361832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2602.12978","last_updated":"2026-05-17T13:09:20Z","snapshot_observed_at":"2026-08-18T10:19:01.743570Z","submitted_at":"2026-02-13T14:56:06Z","title":"Learning Native Continuation for Action Chunking Flow Policies","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T12:38:26.522838Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2602.12978"},"observation_digest":"sha256:f4922851893ef02fefdfa3c6632d12de09d0fc994b88cf7ac985dabc94fb8ec5","observation_id":"8e4532ff-525b-4139-a226-2159f597f3c9","resolution":{"observed_at":"2026-05-21T12:40:08.711965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-08-12T18:40:27.785502Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T17:58:17.880199Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:7ace240961dc91d803cbbd7dda06f4620bb3846ea48c1c68ca7c94b343052b2c","observation_id":"330c185c-d790-4c7b-9afb-5e05ed1e8b2b","resolution":{"observed_at":"2026-05-11T05:45:55.785103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2604.08302","last_updated":"2026-05-15T04:19:14Z","snapshot_observed_at":"2026-08-12T18:40:27.785502Z","submitted_at":"2026-04-09T14:35:42Z","title":"DMax: Aggressive Parallel Decoding for dLLMs","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-19T16:46:56.743268Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2604.08302"},"observation_digest":"sha256:19eb98eb679a62229e5ae7a7913d1fbbb432ff1a409d09defffdb73615d2c33c","observation_id":"6c60f7ac-ceee-4c7e-a488-72c09becbfa4","resolution":{"observed_at":"2026-05-19T16:47:40.177584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2604.22152","last_updated":"2026-04-24T01:50:53Z","snapshot_observed_at":"2026-08-07T19:37:35.121381Z","submitted_at":"2026-04-24T01:50:53Z","title":"dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T11:45:18.081248Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2604.22152"},"observation_digest":"sha256:1657d3e641dc803602024e92cc66c665171258236c94b6aaa497b1cb762199f2","observation_id":"23710f52-11e2-4168-bf37-59b1a4154203","resolution":{"observed_at":"2026-05-11T19:31:09.570974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2604.25050","last_updated":"2026-06-03T06:10:32Z","snapshot_observed_at":"2026-08-11T17:17:49.475070Z","submitted_at":"2026-04-27T23:04:03Z","title":"DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T02:30:30.319810Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2604.25050"},"observation_digest":"sha256:ad904714105207005d28e4e59b9f9929e087b72eb6c125456166a93349c917ab","observation_id":"dc0ba0de-1cfe-4be6-8aec-411d9070a164","resolution":{"observed_at":"2026-05-11T22:46:11.943493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2604.25050","last_updated":"2026-06-03T06:10:32Z","snapshot_observed_at":"2026-08-11T17:17:49.475070Z","submitted_at":"2026-04-27T23:04:03Z","title":"DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T08:32:26.160039Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2604.25050"},"observation_digest":"sha256:c12bb19afb69a2f41d0bf3280732d17f1858a7257a396ec88299c1c0e3ffdb54","observation_id":"1daa436e-d978-42e4-9a26-9d4a7e1cb41b","resolution":{"observed_at":"2026-07-01T08:35:33.394169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2605.04647","last_updated":"2026-05-12T01:59:41Z","snapshot_observed_at":"2026-08-11T16:28:12.523302Z","submitted_at":"2026-05-06T08:52:32Z","title":"ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-08T16:06:47.108382Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2605.04647"},"observation_digest":"sha256:40fb8f9ad93fc17de4831280f8b8937e951cb3169b3d59f2dc9a419d2d962712","observation_id":"041378e5-c6ad-4bf7-b1c3-d12d8b8e1160","resolution":{"observed_at":"2026-05-11T18:26:08.254357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2605.04647","last_updated":"2026-05-12T01:59:41Z","snapshot_observed_at":"2026-08-11T16:28:12.523302Z","submitted_at":"2026-05-06T08:52:32Z","title":"ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving","version":2},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-13T01:48:36.105389Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2605.04647"},"observation_digest":"sha256:6cb8bcac098a2d5189d0651d3a692dbb79bd3db98f8198343b53b8955dcf0dfa","observation_id":"0bbce6bd-145a-4d92-bf6d-0fc52d895c1c","resolution":{"observed_at":"2026-05-13T01:52:05.456030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2605.07381","last_updated":"2026-05-08T07:35:24Z","snapshot_observed_at":"2026-08-20T17:56:28.297163Z","submitted_at":"2026-05-08T07:35:24Z","title":"Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T02:25:23.710842Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2605.07381"},"observation_digest":"sha256:d40e4b2a40bb764b15b33f57376e2c81c280ae7204fd28dceb82781f88cef54c","observation_id":"6d02ba59-5586-42d7-a183-625286c931f5","resolution":{"observed_at":"2026-05-11T02:25:52.956411Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2605.13382","last_updated":"2026-05-13T11:37:51Z","snapshot_observed_at":"2026-08-21T08:11:12.812327Z","submitted_at":"2026-05-13T11:37:51Z","title":"BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T17:51:48.905620Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2605.13382"},"observation_digest":"sha256:2a3afecba37e2ac4c5bf023c46b09f24661394ca65708b4b3aa6f2da4fec846b","observation_id":"9815f35e-d1e3-4d66-a9a3-0a8281aec955","resolution":{"observed_at":"2026-05-14T17:52:32.946824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2605.19282","last_updated":"2026-05-19T03:00:26Z","snapshot_observed_at":"2026-08-15T18:15:28.071598Z","submitted_at":"2026-05-19T03:00:26Z","title":"Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:14:31.613251Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2605.19282"},"observation_digest":"sha256:43dc9efa463487106ef4abbe1ff5d9861d75c6b10f271f07eb3c096175be4ea4","observation_id":"d0f6ce09-66d8-47c1-922a-148f392f0383","resolution":{"observed_at":"2026-05-20T07:18:07.249303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":"2509.06932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-02T18:57:16.674514Z","title":"Llada-vla: Vision language dif- fusion action models","venue":null,"work_id":"a0a2d268-560d-4085-a4e7-ddd82d9cd062","year":2025},"citing_paper":{"arxiv_id":"2606.07895","last_updated":"2026-06-05T23:10:43Z","snapshot_observed_at":"2026-08-15T14:00:55.666180Z","submitted_at":"2026-06-05T23:10:43Z","title":"TBD-VLA: Temporal Block Diffusion Vision Language Action Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T21:49:20.600217Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2606.07895"},"observation_digest":"sha256:8a7f0b7bfd71d9b10d89e15488023ce40042eb78d4f516608429f2236880935c","observation_id":"f21a925f-5d06-4557-9dc5-f13b11143ef7","resolution":{"observed_at":"2026-07-02T18:57:16.676386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-11T16:29:25.372250Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04609","last_updated":"2026-07-06T02:32:10Z","snapshot_observed_at":"2026-08-15T16:00:22.709565Z","submitted_at":"2026-07-06T02:32:10Z","title":"SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-11T16:29:25.372250Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2607.04609"},"observation_digest":"sha256:50580ce71de3ccff4e0186a2cf09ab368b19117207db963e8543512eede72e39","observation_id":"d3914466-a61f-4704-821b-c51cb2ed65c4","resolution":{"observed_at":"2026-07-11T16:29:25.372250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Llada- vla: Vision language diffusion action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-18T03:21:33.659260Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:56571cf27f7191f5ad93bd393ad1c7809ebd50aa6421d2a2ab64e4a856e176e5","observation_id":"edc2f0b6-8ead-423b-8773-7cadbacbc3cd","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-08-02T05:17:46.836377Z","title":"Llada-vla: Vision language diffusion action models.ArXiv preprint, abs/2509.06932, 2025b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13431","last_updated":"2026-07-15T04:23:22Z","snapshot_observed_at":"2026-08-19T13:31:13.752284Z","submitted_at":"2026-07-15T04:23:22Z","title":"Discrete Diffusion Models: A Unified Framework from Tokenization to Generation","version":1},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-08-02T05:17:46.836377Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2607.13431"},"observation_digest":"sha256:b91ca360be5924b9d15001d2993359e574f754421a23c29cd26ef398811d9eb3","observation_id":"07535b9a-00bd-4064-8cbd-ddd0c529edfd","resolution":{"observed_at":"2026-08-02T05:17:46.836377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-08-06T00:40:57.389819Z","title":"arXiv preprint arXiv:2509.06932 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01035","last_updated":"2026-08-18T16:33:30Z","snapshot_observed_at":"2026-08-21T22:11:30.479961Z","submitted_at":"2026-08-02T06:45:16Z","title":"WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T00:40:57.389819Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2608.01035"},"observation_digest":"sha256:156a7d0704dd7a7f816fa3eaf4609a93d104a59f185a0071a074a1cff94aaf22","observation_id":"1e4549db-746d-45e5-9b47-f66c91c1b066","resolution":{"observed_at":"2026-08-06T00:40:57.389819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06932/citation-record","integrity":"/paper/2509.06932/integrity","json":"/paper/2509.06932/citation-record.json","paper":"/paper/2509.06932"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:29.795379Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.795379Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:d0c0cafdda5f782d5fcac458d0e156d5a6cb6815cec7de7808b18628dba027b0","observation_id":"4142e92e-1dd3-4b2d-9b39-eb19daa1a4d6","resolution":{"observed_at":"2026-08-04T22:55:29.795379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-04T22:55:29.800466Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.800466Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:68c87da792a29f85d68a0ddbf8642d7e10d2ac357de71bd82a9d34b4be7749a2","observation_id":"d6f912d7-fa1a-47df-9997-d36ecd9e562b","resolution":{"observed_at":"2026-08-04T22:55:29.800466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-04T22:55:29.806153Z","title":"Rt-h: Action hierarchies using language.arXiv preprint arXiv:2403.01823, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.806153Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:ec30280c52fc30fc4364db8044c8a576ed02f9bd7266e0a35ece5bd346896fa6","observation_id":"9a350bb7-8093-45da-abd5-ae7485eb0426","resolution":{"observed_at":"2026-08-04T22:55:29.806153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T22:55:29.811254Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.811254Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:07e47672e6b7ce5b4ae4c7fb75c33586af967a3ce9e73b217849ce251f51d2b8","observation_id":"50b658f0-973b-4902-9b3b-55aff3ec7ea7","resolution":{"observed_at":"2026-08-04T22:55:29.811254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-04T22:55:29.816460Z","title":"Zero-shot robotic manipulation with pretrained image- editing diffusion models.arXiv preprint arXiv:2310.10639,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.816460Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:614fa202b334071fd119626f76bf67d5badb7ca3bd71ea65b0cd1ed24f34d0cd","observation_id":"20987eae-33ed-43e8-8b6a-f52c970e3692","resolution":{"observed_at":"2026-08-04T22:55:29.816460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-04T22:55:29.820716Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.820716Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:1be6e00110c0c879361347bcf69c225f8917b3f0e74b528cf425b79fdd8a7766","observation_id":"656b043a-7311-4424-9a7f-351e32c9f4b6","resolution":{"observed_at":"2026-08-04T22:55:29.820716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-04T22:55:29.826083Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.826083Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:b24c291aed1008ba4590533414f86999c9aeb59fba1b128db907e4fb394d4073","observation_id":"909c812e-2adb-4629-b094-ec1a00797727","resolution":{"observed_at":"2026-08-04T22:55:29.826083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-19T04:14:38.173722Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-04T22:55:29.831085Z","title":"Analog bits: Generating discrete data using diffusion models with self-conditioning.arXiv preprint arXiv:2208.04202, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.831085Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:668511594b6eb1c71cf2bcd58ab0cfbc799d51ccc96eca63434df7eab66bc2df","observation_id":"d000b2f0-3e47-4c7b-bc31-a64b339ac0cb","resolution":{"observed_at":"2026-08-04T22:55:29.831085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:29.836178Z","title":"Llada-medv: Exploring large language diffusion models for biomedical image understanding.arXiv preprint arXiv:2508.01617,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.836178Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:6361c0d48b9665447fedb98e3835ed8987cf93aaa010a42d36d65850389c02ff","observation_id":"66c5254f-5912-42c1-8737-569342e25af1","resolution":{"observed_at":"2026-08-04T22:55:29.836178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-04T22:55:29.842053Z","title":"Palm- e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.842053Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:c934a5872919196b3fd0c4b8ac53264c380d6a9d73dd73cd846fd635191c4afc","observation_id":"954b007b-ede4-4b02-9005-42aca895a98e","resolution":{"observed_at":"2026-08-04T22:55:29.842053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:29.847048Z","title":"Fast ecot: Ef- ficient embodied chain-of-thought via thoughts reuse.arXiv preprint arXiv:2506.07639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.847048Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:194ee6ca66aac9644b368240d4594888fc71fe445a5e6e2c0572a6e3903b3288","observation_id":"b0953557-05f1-4f14-9b5d-0872d9268d10","resolution":{"observed_at":"2026-08-04T22:55:29.847048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:29.851292Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.851292Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:2a88c077140b5fa1a231f3ff611f63903d968f00d74124cba48a6169896a58d9","observation_id":"d3d937d0-5e6b-4569-b6bd-b77581ce8987","resolution":{"observed_at":"2026-08-04T22:55:29.851292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17891","last_updated":"2025-05-31T07:01:57Z","snapshot_observed_at":"2026-08-15T09:00:05.244407Z","submitted_at":"2024-10-23T14:04:22Z","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17891","snapshot_observed_at":"2026-08-04T22:55:29.856347Z","title":"Scaling diffusion language models via adaptation from autoregressive models.arXiv preprint arXiv:2410.17891, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.856347Z"},"links":{"cited_paper":"/paper/2410.17891","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:5800abd3d830ac129300a484eb890eae7ff0595ef9ddc2c3310c2007d9208ae5","observation_id":"0bb9d8e2-3a41-4661-b693-729f8af382ec","resolution":{"observed_at":"2026-08-04T22:55:29.856347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08933","last_updated":"2023-02-14T06:45:49Z","snapshot_observed_at":"2026-08-16T19:48:42.861675Z","submitted_at":"2022-10-17T10:49:08Z","title":"DiffuSeq: Sequence to Sequence Text Generation with Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08933","snapshot_observed_at":"2026-08-04T22:55:29.860611Z","title":"Diffuseq: Sequence to sequence text generation with diffusion models.arXiv preprint arXiv:2210.08933, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.860611Z"},"links":{"cited_paper":"/paper/2210.08933","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:29a401c06c4be3ee19ac093b7d004f0e4fe9ad4f97283b005905dab74a148833","observation_id":"586c3571-f432-46e4-9273-cfc6db6d6fb7","resolution":{"observed_at":"2026-08-04T22:55:29.860611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08545","last_updated":"2024-06-12T18:00:01Z","snapshot_observed_at":"2026-08-16T13:43:37.560927Z","submitted_at":"2024-06-12T18:00:01Z","title":"RVT-2: Learning Precise Manipulation from Few Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08545","snapshot_observed_at":"2026-08-04T22:55:29.864667Z","title":"Rvt-2: Learning precise manipulation from few demonstrations.arXiv preprint arXiv:2406.08545, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.864667Z"},"links":{"cited_paper":"/paper/2406.08545","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:bc07ccf4cfba31ebb4255fe96c0251c2322d224438367451c9debf934c1f342a","observation_id":"5dd79bc2-2a4c-4bfe-8968-c395034aee31","resolution":{"observed_at":"2026-08-04T22:55:29.864667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:31.013209Z","title":"Rvt: Robotic view transformer for 3d object manipulation","venue":null,"work_id":"d080efd7-9158-4162-bb53-070c0fff3d1e","year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.869969Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:d6c0cfcef14f8968b851db14246269f6733fde23fd557be01c00a90839b83fb7","observation_id":"1f313bcc-e224-45ff-8c89-d765a66d81ee","resolution":{"observed_at":"2026-08-04T22:55:31.017539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:29.874931Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.874931Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:1eb8f155775e24360758931519627187370595ee05ecda8d4ce1b42ebf4f551b","observation_id":"70913e5f-3e36-4174-93ca-164a576ae6ca","resolution":{"observed_at":"2026-08-04T22:55:29.874931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.988928Z","title":"Coarse-to-fine q-attention: Efficient learn- ing for visual robotic manipulation via discretisation","venue":null,"work_id":"35785c42-fe7c-46ab-8d89-ad30122064c3","year":2022},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.879059Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:87c2f39a21d3f16a0b4afb4fac3457eff808a99e2d268bd243d4f89aa54ff571","observation_id":"06a8ee21-23d6-4c63-86b9-ada4b365d3b9","resolution":{"observed_at":"2026-08-04T22:55:30.993708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.974917Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":"c07af746-7d53-47de-b20a-b60f14152a95","year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.882988Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:1d3701e94cb97251c250d609bd8052e17d8fbe5c1562adb68681aee0fdca6076","observation_id":"980d009c-05d2-40eb-bf9f-fefe05f94e80","resolution":{"observed_at":"2026-08-04T22:55:30.979290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-16T16:26:20.587132Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-04T22:55:29.888945Z","title":"Vima: General robot manipulation with multimodal prompts.arXiv preprint arXiv:2210.03094, 2(3):6, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.888945Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:3c0ced26d69437eb8888207fc4ccd9bdba6776eefa6009a1e6c2c400c637602d","observation_id":"af9b2363-d8fc-4031-942b-21afc472065a","resolution":{"observed_at":"2026-08-04T22:55:29.888945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.960257Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"56eb052c-7e2c-49fc-afc9-39f1435e3b3f","year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.893458Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:4a024871c825abf6362b2b7d37303edc9d7e664d19085a1a75739d05ac3f4a9f","observation_id":"d9bdfeeb-eae7-49cb-860a-dad72780a7d4","resolution":{"observed_at":"2026-08-04T22:55:30.964722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-04T22:55:29.897295Z","title":"3d diffuser actor: Policy diffusion with 3d scene rep- resentations.arXiv preprint arXiv:2402.10885, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.897295Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:4d480fce2d79c1e23d4847d39abb2a6ae2c191b56aee09948f972c3687ab6d03","observation_id":"946783db-520c-4f30-9663-d3b14a69564b","resolution":{"observed_at":"2026-08-04T22:55:29.897295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T22:55:29.902536Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.902536Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:2afb6ff676f3b7af5bc561d0014fcb0326440a0b392827be8b6ad081ea33e03c","observation_id":"49a66a05-45a4-48d8-8c9a-f22a3697f4a9","resolution":{"observed_at":"2026-08-04T22:55:29.902536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T22:55:29.906742Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.906742Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:e3cc2673303c6832b90019d1b46e949eb5e3c760aa78263113084a9a23805db6","observation_id":"15359c25-1e11-4a3a-a8f0-7f3d52c6286f","resolution":{"observed_at":"2026-08-04T22:55:29.906742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-04T22:55:29.910947Z","title":"Cogact: A foundational vision- language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.910947Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:4183d4f85d16b34359c091a05cd7cb8ac3a9f183063c11f374c79486bf63f1db","observation_id":"61f7c985-98fe-43a7-b0bc-9ab6bd81d5d7","resolution":{"observed_at":"2026-08-04T22:55:29.910947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-14T13:42:27.582012Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16839","snapshot_observed_at":"2026-08-04T22:55:29.915607Z","title":"Lavida: A large diffu- sion language model for multimodal understanding.arXiv preprint arXiv:2505.16839, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.915607Z"},"links":{"cited_paper":"/paper/2505.16839","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:3994edaae61073aa0af33ee0e367e1fda7183e6300cdfac38089e0974d0331e7","observation_id":"56f009d3-a24e-48b5-a52f-14a884af83c9","resolution":{"observed_at":"2026-08-04T22:55:29.915607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-04T22:55:29.920247Z","title":"Evaluating real-world robot manipulation policies in simulation.arXiv preprint arXiv:2405.05941, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.920247Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:9c709738fc74e9a3f6b83714eda0f8626d0943a3c2a62f8d61bd9e920240334a","observation_id":"7fc5df73-d66f-4695-8f61-a270c864fd79","resolution":{"observed_at":"2026-08-04T22:55:29.920247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-17T09:33:59.536762Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-04T22:55:29.925406Z","title":"Towards generalist robot policies: What matters in building vision-language-action models.arXiv preprint arXiv:2412.14058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.925406Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:a778fcae3f86e91332abc2af1c61f92b00a93e77f65eacc9f23d277e84bec193","observation_id":"6887cc6b-0618-4f86-a323-39a4b08a9c20","resolution":{"observed_at":"2026-08-04T22:55:29.925406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-04T22:55:29.929977Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.929977Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:cb735b74ba9c28a25143ba42825fe38998be3ffc518c661f3fa2bb880ccbf928","observation_id":"1a5b98ee-3931-467c-b4b6-6d209502f48d","resolution":{"observed_at":"2026-08-04T22:55:29.929977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20072","last_updated":"2026-05-31T15:50:43Z","snapshot_observed_at":"2026-08-15T16:46:32.902409Z","submitted_at":"2025-08-27T17:39:11Z","title":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20072","snapshot_observed_at":"2026-08-04T22:55:29.938569Z","title":"Discrete diffusion vla: Bringing dis- crete diffusion to action decoding in vision-language-action policies.arXiv preprint arXiv:2508.20072, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.938569Z"},"links":{"cited_paper":"/paper/2508.20072","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:01eea5e422bd5af742b7fc018d2a3cabbd3850431df717ca358b3504276e577c","observation_id":"6e0c8d87-bb01-4e80-bf68-19b7a6e696be","resolution":{"observed_at":"2026-08-04T22:55:29.938569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.945356Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"afd2ffda-f686-4de6-a60e-9554e9b17be9","year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.943261Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:8ceb801a43102763dd8078a818bf03f196254bbf115f1f377eab89fc321cc998","observation_id":"5d7f7e4c-f1e9-4c8e-9d55-74b90e094a75","resolution":{"observed_at":"2026-08-04T22:55:30.950127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:29.947483Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.947483Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:292fda910587058f31283aaa5a1353f998c895b0a43ef9ea8b9d281d4b460dc1","observation_id":"ff9079db-8d75-4718-afbc-436168d2ba48","resolution":{"observed_at":"2026-08-04T22:55:29.947483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:29.951918Z","title":"Longllada: Unlocking long context capabilities in diffusion llms.arXiv preprint arXiv:2506.14429, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.951918Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:9df739e2e58da0cd024f11795d6dadc2976be80dfa23818d5d4245d1bdc7e916","observation_id":"65e53d20-3824-404a-bb40-255f876bf00a","resolution":{"observed_at":"2026-08-04T22:55:29.951918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06295","last_updated":"2026-06-06T06:01:00Z","snapshot_observed_at":"2026-08-18T01:58:21.472807Z","submitted_at":"2025-05-17T15:50:46Z","title":"dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06295","snapshot_observed_at":"2026-08-04T22:55:29.956571Z","title":"dllm-cache: Accelerating diffusion large language models with adaptive caching.arXiv preprint arXiv:2506.06295,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.956571Z"},"links":{"cited_paper":"/paper/2506.06295","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:16f77de55359bc5bc4b15ad1b347c5217ab9cc1e3856803c67963a72f98f3098","observation_id":"b60e2aac-c39e-4358-873e-532117bedf33","resolution":{"observed_at":"2026-08-04T22:55:29.956571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-08-14T20:57:18.809821Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-04T22:55:29.961227Z","title":"Discrete diffusion modeling by estimating the ratios of the data distri- bution.arXiv preprint arXiv:2310.16834, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.961227Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:41f7980e28c34877d529c225e25607fd018a59e740e2a05284d959f555701f73","observation_id":"d6db1e3d-f177-4498-b7b4-303f588ee69c","resolution":{"observed_at":"2026-08-04T22:55:29.961227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08379","last_updated":"2024-02-21T00:06:20Z","snapshot_observed_at":"2026-08-17T09:30:36.627120Z","submitted_at":"2023-05-15T06:33:45Z","title":"TESS: Text-to-Text Self-Conditioned Simplex Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08379","snapshot_observed_at":"2026-08-04T22:55:29.966504Z","title":"Tess: Text-to-text self-conditioned simplex diffu- sion.arXiv preprint arXiv:2305.08379, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.966504Z"},"links":{"cited_paper":"/paper/2305.08379","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:9516d1631611194f604a4897354404f0b137d3c626c79688aa56f44b0f08eb47","observation_id":"73c5d6c0-1179-48aa-bec2-020b03d38623","resolution":{"observed_at":"2026-08-04T22:55:29.966504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.920894Z","title":"Octo: An open- source generalist robot policy","venue":null,"work_id":"79159d4d-d5bb-487e-8376-563e00e2dcb4","year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.972204Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:fbb48267f21be7a34c0801d86f8ab8c43cd201c264f802ba5a2c81f279777852","observation_id":"1be22e55-c035-406e-9265-841f9c47b9c9","resolution":{"observed_at":"2026-08-04T22:55:30.925638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.906042Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manip- ulation tasks.IEEE Robotics and Automation Letters, 7(3):7327–7334, 2022","venue":null,"work_id":"21c2529e-d179-4893-abe8-f8d494da53a8","year":2022},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.976637Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:96b960c43f7761993220aa1d92452b1733ee7ee37af438f6ac0bb176ef30d8d7","observation_id":"a3d3fb8f-f93f-4361-a4ad-bdf459571e02","resolution":{"observed_at":"2026-08-04T22:55:30.910871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-04T22:55:29.981892Z","title":"Large language diffusion models.arXiv preprint arXiv:2502.09992, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.981892Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:dcfc561600c87fdae73767e18e45c409f49cf7a339a76d60f832a8b2ee45bd04","observation_id":"2fe57455-9b4f-4db2-b7f4-889f5eb850c1","resolution":{"observed_at":"2026-08-04T22:55:29.981892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.890555Z","title":"Llarva: Vision-action instruction tuning enhances robot learning","venue":null,"work_id":"40e11378-85f6-4187-bded-ca25680f1ca6","year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.986337Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:aa3a0815cb73b465aa978357ed8be12d18911b420fb1ac84afae4a900354e449","observation_id":"c04f1ee4-3dc9-45e2-afbe-3ef261826171","resolution":{"observed_at":"2026-08-04T22:55:30.895605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03736","snapshot_observed_at":"2026-08-04T22:55:29.991033Z","title":"Your absorbing dis- crete diffusion secretly models the conditional distributions of clean data.arXiv preprint arXiv:2406.03736, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.991033Z"},"links":{"cited_paper":"/paper/2406.03736","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:3311304c97ea37714f995b529d15dddb03ff0b8cb18bfefadaf2e088fd7e992f","observation_id":"ccffb727-f5e1-46de-8b1e-1d179e75304b","resolution":{"observed_at":"2026-08-04T22:55:29.991033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:29.995928Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.995928Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:4904ed4e1d1852abf3fcfa13e863775f9b1b0e03a6f14d8cc3a87e7b408e151a","observation_id":"36ab77d8-b68f-419d-8f80-e576c4ff9d51","resolution":{"observed_at":"2026-08-04T22:55:29.995928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.865442Z","title":"Robot learning with sen- sorimotor pre-training","venue":null,"work_id":"091b6285-f96d-48b8-b7df-53ff03cf7885","year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.000327Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:2567954458ec5d1e85254a3417d0d2db16b9740ee7be9940c68da76372cf880d","observation_id":"582c7308-4847-4f6b-9c7a-99376c836ab2","resolution":{"observed_at":"2026-08-04T22:55:30.869928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.008701Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.008701Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:d6deb1b3c18ca7f7f4aa729780949b4c41f1a026ff11780646b23768bb0c505f","observation_id":"68264fe8-9500-4ae4-bdb2-50bc0070022d","resolution":{"observed_at":"2026-08-04T22:55:30.008701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.841653Z","title":"Simple and effective masked dif- fusion language models.Advances in Neural Information Processing Systems, 37:130136–130184, 2024","venue":null,"work_id":"c36457b5-55f1-41b9-868f-8caff6c39c43","year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.013198Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:fb2b4c00ee6710b7a3b583b5bd7e025f7e6ff2574308834ebd07b32505ad4592","observation_id":"f3c6487c-b3d1-4aa9-9df0-68751ad22874","resolution":{"observed_at":"2026-08-04T22:55:30.846072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.826747Z","title":"Simplified and generalized masked diffu- sion for discrete data.Advances in neural information pro- cessing systems, 37:103131–103167, 2024","venue":null,"work_id":"c29c8280-b25a-498a-adcf-9dbb415cac13","year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.019309Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:22d5ede51e12dbe28ba90c4bece77cdd19a33e8861532a753ef9f27bf78ba70b","observation_id":"244008f8-0252-400b-9e77-ce6a53cd11ff","resolution":{"observed_at":"2026-08-04T22:55:30.831101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.811774Z","title":"Perceiver- actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":"9ec41dc7-7d4a-48c6-8789-1f9cf1d39497","year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.023735Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:e878ee2926ff3d56cfd34c99a8865fa4b549f96119059de05dfe1ccc7bb0a9b1","observation_id":"82e8cb2f-0cb5-404d-9a1f-a75baf94c705","resolution":{"observed_at":"2026-08-04T22:55:30.816526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-04T22:55:30.028421Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.028421Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:a9184386325a717209c3f55089d81c9e18a8e6083d2882777eaa735b93e3adc4","observation_id":"32838acf-7e27-4e86-8596-0da07954ce89","resolution":{"observed_at":"2026-08-04T22:55:30.028421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-04T22:55:30.032889Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.032889Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:40d6d49ab7efd7086ed757205625f406b86356e10792ecb0bf0b5cf24fc53a81","observation_id":"b02b9883-2625-4d38-ba88-13ecf12f90ac","resolution":{"observed_at":"2026-08-04T22:55:30.032889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.793750Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":"c4f514f6-83ff-4be4-89ef-e35fcc05bc4e","year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.039381Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:8af6bbb6ea8daea78d805eb728b026cc32cb70ac0b4cd5183d23375db672aa3d","observation_id":"21e50e02-f01a-4006-91ff-5e59b2eb6a3d","resolution":{"observed_at":"2026-08-04T22:55:30.799714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-04T22:55:30.043529Z","title":"Unleashing large-scale video generative pre- training for visual robot manipulation.arXiv preprint arXiv:2312.13139, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.043529Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:bf4e6a0693ad703d424bade890fcdfea527f634d6f5a2d7ba16224bb87b495ba","observation_id":"f42e7f92-73d4-4fcd-8413-493de7130406","resolution":{"observed_at":"2026-08-04T22:55:30.043529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-16T07:03:45.766617Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-04T22:55:30.049252Z","title":"Mmada: Mul- timodal large diffusion language models.arXiv preprint arXiv:2505.15809, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.049252Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:e3d3ee374af54be4360b97d6368359bc8b98d4dfb258377a9862f5431c447aa7","observation_id":"e237fcef-4e3d-4e62-8ca6-2cb1b17b89ff","resolution":{"observed_at":"2026-08-04T22:55:30.049252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-08-14T18:38:02.862463Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-04T22:55:30.054877Z","title":"Dream 7b: Diffusion large language models.arXiv preprint arXiv:2508.15487, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.054877Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:4e6daa52ae0ab39e08a44c2286a3028b60029c280e7e3143a9253e131eb21a52","observation_id":"5386cecc-3486-4735-a8bd-edc25ccff9eb","resolution":{"observed_at":"2026-08-04T22:55:30.054877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10025","last_updated":"2024-05-01T02:58:30Z","snapshot_observed_at":"2026-08-16T15:54:06.181138Z","submitted_at":"2023-02-20T15:14:46Z","title":"DINOISER: Diffused Conditional Sequence Learning by Manipulating Noises","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10025","snapshot_observed_at":"2026-08-04T22:55:30.059429Z","title":"Dinoiser: Diffused conditional se- quence learning by manipulating noises.arXiv preprint arXiv:2302.10025, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.059429Z"},"links":{"cited_paper":"/paper/2302.10025","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:a4d32c3a993e9deda40212209307328d7ee8a8e623c2d4e14be0a63895c48340","observation_id":"d0b276d1-3ab8-4f95-884a-a1c333866093","resolution":{"observed_at":"2026-08-04T22:55:30.059429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16933","snapshot_observed_at":"2026-08-04T22:55:30.063762Z","title":"Llada-v: Large language diffusion models with visual instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.063762Z"},"links":{"cited_paper":"/paper/2505.16933","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:be00a78866da2ccecf0bbd18e5b53cba06254845a37a6b54775af538f3f8d497","observation_id":"072f861c-8656-4bc4-935d-2ad3398040cc","resolution":{"observed_at":"2026-08-04T22:55:30.063762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-04T22:55:30.068480Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.068480Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:efa1b6b1109a138f469b75ae2b040a2109572dac33a935fa817a18572c693ed4","observation_id":"0d40a83e-56b0-41a9-876b-a924ce0b0b26","resolution":{"observed_at":"2026-08-04T22:55:30.068480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:55:30.074334Z","title":"Diffa: Large language diffusion models can lis- ten and understand.arXiv preprint arXiv:2507.18452, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.074334Z"},"links":{"citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:3e2698a0ec009fc8e5d35ee351cd06476b15b7a5a6b82582db51a637ca16ebd5","observation_id":"fb3247b9-c507-442d-99a3-adf9be5b9ed0","resolution":{"observed_at":"2026-08-04T22:55:30.074334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14420","last_updated":"2025-02-21T07:28:36Z","snapshot_observed_at":"2026-08-20T00:02:56.415565Z","submitted_at":"2025-02-20T10:16:18Z","title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14420","snapshot_observed_at":"2026-08-04T22:55:30.078793Z","title":"Chatvla: Unified multimodal un- derstanding and robot control with vision-language-action model.arXiv preprint arXiv:2502.14420, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.078793Z"},"links":{"cited_paper":"/paper/2502.14420","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:141717f3ce456b01e67c6aefd4c858d57f638ffed7a1f0f1d8e5c141511f0ec5","observation_id":"ee066cac-abb4-4331-9d3d-4ca7f09bc4e9","resolution":{"observed_at":"2026-08-04T22:55:30.078793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19223","last_updated":"2025-10-12T15:42:47Z","snapshot_observed_at":"2026-08-09T15:57:47.133628Z","submitted_at":"2025-05-25T16:36:20Z","title":"LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19223","snapshot_observed_at":"2026-08-04T22:55:30.083174Z","title":"Llada 1.5: Variance-reduced prefer- ence optimization for large language diffusion models.arXiv preprint arXiv:2505.19223, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:30.083174Z"},"links":{"cited_paper":"/paper/2505.19223","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:94bc4220bf57686be680d2cbe058c420a301af44cb553636c2ffd9de8f781aab","observation_id":"6cb97916-0353-40f0-b242-8e89eafffa7b","resolution":{"observed_at":"2026-08-04T22:55:30.083174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 17 inbound Pith citation observations for arXiv:2509.06932."}