{"as_of":"2026-08-06T13:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:229d7104b1249515e6f874708cdee9c2cc06c3dde14b7596262e4a2e7560414e","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:00:48.172438Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T22:22:57.515817Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T04:09:35.372388Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2512.14234","last_updated":"2026-04-14T19:54:15Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-16T09:41:21Z","title":"ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-16T22:04:07.403410Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2512.14234"},"observation_digest":"sha256:2ab62222d988f4cfe8940944cba15588386d7aea0f9010674477fa1b74c04401","observation_id":"a1b749c4-fc25-452f-abfa-6aecfe15734e","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T14:50:12.804707Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2601.16163"},"observation_digest":"sha256:d3d885179e1537e6c593c379b18a08662faadc0891ddaa035086730107614c0e","observation_id":"88b916c2-e2cc-44d5-a27c-2c4b8992c4bb","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-11T16:18:15.003371Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2602.15922"},"observation_digest":"sha256:f84378346f2e2dd1a06a4fa2aa08b4790c135add599555e7fa5c97f63740064e","observation_id":"b5c46c76-bf57-419e-a747-94e7625a8a7f","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T01:57:29.753735Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2603.16666"},"observation_digest":"sha256:3421bfb5a5fa17a7bd00a559d2defa7feed43a44325595f023b89d608788acda","observation_id":"96b6dee1-172f-43e1-94f9-b09c71c70ee1","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2604.09330","last_updated":"2026-04-10T13:59:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T13:59:54Z","title":"VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:31.378588Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2604.09330"},"observation_digest":"sha256:210d63e0d36c3ef3dd02a1de0d87bfcca1d507536dc17ade6c233df6aa121afb","observation_id":"a0729ffa-837f-4672-bc4f-6d0e7cf66b5c","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-07T16:06:10.595164Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:2e00f4bb34aee48b47195d2c9f82800b49b4232bd32cd22f6c34e0dbb645725a","observation_id":"0f281ee1-c735-4eb8-bae8-d163e34277d2","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":2},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-05-08T19:02:19.756092Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:b0c480ada2584e631461c2a2350cca2a0b1429b22d2c93e2e0f29ee60e057892","observation_id":"3a164519-be3e-4db6-aed4-cf123fe18cc1","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2605.10942","last_updated":"2026-05-11T17:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:59:56Z","title":"HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T03:28:18.730751Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2605.10942"},"observation_digest":"sha256:c579dae69b230cb0e4a6a6547664f143622a97bd33a95a011bde11109ebf7d26","observation_id":"c7321da2-609e-46e7-91df-c5fbc8ddaa54","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:ea4c6dd561d320cb724cffc86cbc06926e720cbc1d34b42db7feba2526469108","observation_id":"6f68adc5-ad17-4443-a28f-c243e88d430f","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2605.12162","last_updated":"2026-05-12T14:13:06Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:13:06Z","title":"X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:07.792757Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2605.12162"},"observation_digest":"sha256:f31d26ae9d31c5d98ee75f2701f5221a85c429c8f4d3490b40765d68eb51f6af","observation_id":"d1756185-b4f1-4a41-8fdd-bea0b2f35d18","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2605.23856","last_updated":"2026-05-22T17:08:37Z","snapshot_observed_at":"2026-07-06T23:33:59.210165Z","submitted_at":"2026-05-22T17:08:37Z","title":"Point Tracking Improves World Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T03:51:10.921839Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2605.23856"},"observation_digest":"sha256:aa2fb3d87192db636ed8a7990f93e3970f8cc055511e96f3efe4ee7b4be82bf5","observation_id":"d9a28dc9-a6ed-4b2a-a428-e0d1bd845a0d","resolution":{"observed_at":"2026-05-29T02:04:58.522203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.00113","last_updated":"2026-05-27T05:32:17Z","snapshot_observed_at":"2026-08-01T09:58:43.654749Z","submitted_at":"2026-05-27T05:32:17Z","title":"World Models for Robotic Manipulation: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T12:24:18.025364Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.00113"},"observation_digest":"sha256:548c96d34516522ef13d27a879b09a76a54bbb53b5e6dcf66b84834262da30a0","observation_id":"2ec89e32-5612-46ea-bdf7-5cf57c296e4e","resolution":{"observed_at":"2026-06-29T12:33:25.043319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.01955","last_updated":"2026-06-01T09:14:51Z","snapshot_observed_at":"2026-08-03T02:17:56.167011Z","submitted_at":"2026-06-01T09:14:51Z","title":"WALL-WM: Carving World Action Modeling at the Event Joints","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T14:15:14.454649Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.01955"},"observation_digest":"sha256:4d4adea777f3936a7d40717085090f2a50449e6b07278cbeaa757d3a1a6c455c","observation_id":"aaaf0dfb-a2e0-4c18-9125-e261cee57598","resolution":{"observed_at":"2026-07-01T23:36:22.390546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.11187","last_updated":"2026-06-09T17:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T17:59:22Z","title":"Next Forcing: Causal World Modeling with Multi-Chunk Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:53.905704Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.11187"},"observation_digest":"sha256:7c1e006e91de255c4447e6b5da5783c066b77d9a31becc2d0fe547b717538643","observation_id":"7a54e59b-80dc-4fd0-aae0-964e75e15e52","resolution":{"observed_at":"2026-07-03T04:57:38.466847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.12217","last_updated":"2026-06-10T15:31:25Z","snapshot_observed_at":"2026-08-02T10:56:16.670279Z","submitted_at":"2026-06-10T15:31:25Z","title":"Making Foresight Actionable: Repurposing Representation Alignment in World Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:54.963759Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.12217"},"observation_digest":"sha256:07990af562c142b40f4714032350025834be97984185e7b43e6518c16995caba","observation_id":"99f314d7-3ead-4642-aa27-b6946760aa0d","resolution":{"observed_at":"2026-07-03T11:08:03.388045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.12403","last_updated":"2026-06-10T17:59:08Z","snapshot_observed_at":"2026-08-01T17:35:24.729614Z","submitted_at":"2026-06-10T17:59:08Z","title":"World Pilot: Steering Vision-Language-Action Models with World-Action Priors","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:02.137152Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.12403"},"observation_digest":"sha256:f456eb7d519796c7a5178552dc81f71b430c48a7071d9e292064ffc731f49259","observation_id":"d07178fc-7b55-4ba4-b038-3c950f608f1c","resolution":{"observed_at":"2026-07-03T11:18:03.351218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:782ed92683d265f1111230db4aeec0749578320415f5bed4ed34278edecf9789","observation_id":"cc3bc517-242b-425e-b212-a123e059d14d","resolution":{"observed_at":"2026-07-03T14:48:32.842966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.16533","last_updated":"2026-07-03T04:30:36Z","snapshot_observed_at":"2026-07-12T13:47:19.539499Z","submitted_at":"2026-06-15T10:37:42Z","title":"Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI","version":2},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-06-27T04:02:53.110012Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.16533"},"observation_digest":"sha256:2b135a7155d14856425d2e8f1d9d5d82bab2828d2eb7b7ba349252b4c90cafec","observation_id":"9d166564-449c-40cf-9737-b0f787255849","resolution":{"observed_at":"2026-07-03T17:28:44.992670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-03T05:46:19.564000Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:12.686936Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.20781"},"observation_digest":"sha256:b4c8c3f7d2f528ea2268b0ad5e9f90bab650da8ee82ea735ff252d51ee860393","observation_id":"7edcb786-9da0-4025-b9f2-220881f800bd","resolution":{"observed_at":"2026-07-04T04:09:35.374151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-11T10:36:56.968032Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04978","last_updated":"2026-07-06T12:12:50Z","snapshot_observed_at":"2026-07-11T10:36:56.412676Z","submitted_at":"2026-07-06T12:12:50Z","title":"Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T10:36:56.968032Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2607.04978"},"observation_digest":"sha256:9b7fef83645c9ecf92a2e946d11a1d1d4b1bddea94094eac3f1c5a8cb465ee18","observation_id":"694347b4-43b9-4633-a04e-80a7d8ec6aeb","resolution":{"observed_at":"2026-07-11T10:36:56.968032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-11T08:19:04.131379Z","title":"Dual-stream diffusion for world-model augmented vision-language-action model.arXiv preprint arXiv:2510.27607, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05133","last_updated":"2026-07-06T14:18:18Z","snapshot_observed_at":"2026-08-04T03:35:43.340219Z","submitted_at":"2026-07-06T14:18:18Z","title":"UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T08:19:04.131379Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2607.05133"},"observation_digest":"sha256:87eaaa56536885490507855e17ee2dc186d4289cd29e2838c260e9e69ba86f9a","observation_id":"3d2c49e2-5f48-40c0-993c-b9314e9ac0ae","resolution":{"observed_at":"2026-07-11T08:19:04.131379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-31T22:22:57.515817Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24159","last_updated":"2026-07-27T08:37:35Z","snapshot_observed_at":"2026-08-06T03:25:05.846925Z","submitted_at":"2026-07-27T08:37:35Z","title":"DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T22:22:57.515817Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2607.24159"},"observation_digest":"sha256:9f2e984f4bca7d869b91d146be64b9ab8ebdcf5e18f9028aac486c5615513e2f","observation_id":"6eecc954-fad2-4ecf-b563-8cbb4475a9dc","resolution":{"observed_at":"2026-07-31T22:22:57.515817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.27607/citation-record","integrity":"/paper/2510.27607/integrity","json":"/paper/2510.27607/citation-record.json","paper":"/paper/2510.27607"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-04T07:00:45.901236Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:45.901236Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:35a214d4694cd373e23820b9ad3e63ee0aa869138a75382c51515c1ae001e909","observation_id":"6df8e2d7-5b34-4efc-bbd4-3b7d601b151c","resolution":{"observed_at":"2026-08-04T07:00:45.901236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:00:46.060097Z","title":"Enerverse: Envisioning embodied future space for robotics manipulation.arXiv preprint arXiv:2501.01895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.060097Z"},"links":{"citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:690330f05e475578c506269198ac178d30c07394686cf4e3d2b3ae26d2ef0060","observation_id":"a0cefecb-96fe-4570-833e-a39278f44d64","resolution":{"observed_at":"2026-08-04T07:00:46.060097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T07:00:46.231397Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.231397Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:6c446ff7c008eaeb1e143df81479d9d0c4e776f20167ab4fce9d503c2b8bf745","observation_id":"e1b77faa-ffaf-447f-86f0-50c9ae4f7756","resolution":{"observed_at":"2026-08-04T07:00:46.231397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:00:47.963775Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.963775Z"},"links":{"citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:a0a1bb6dc9501d26b4dd65ce8a3f36550f6a9ba12b123f5c4175c58c1a596ae8","observation_id":"32ec8f49-49da-4f6e-8e9d-b268b49409eb","resolution":{"observed_at":"2026-08-04T07:00:47.963775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-04T07:00:46.695032Z","title":"GR00T N1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.695032Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:4851723cb2e6d3f66f81a0e6cbb1d412510422c3fd7e0f94356fa0de2a5de236","observation_id":"fd1067cb-fee6-469e-a104-84c13e6da7a7","resolution":{"observed_at":"2026-08-04T07:00:46.695032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T07:00:46.799936Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.799936Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:573fb52d2ac9f056cde64fbf2f4a875b5f700f83f75b1e7b5dd0294d8d3c3fb2","observation_id":"3f52d05e-4059-46fa-9a42-e8e09518940d","resolution":{"observed_at":"2026-08-04T07:00:46.799936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-04T07:00:46.893433Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics.arXiv preprint arXiv:2506.01844,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.893433Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:0373bfbc7c388fda464992cdfdbd03cf41209a18ff412cfc10b12c87f920d2f1","observation_id":"c6bbb80e-455e-4326-b6c8-5b277c9c80eb","resolution":{"observed_at":"2026-08-04T07:00:46.893433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-04T07:00:47.062153Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.062153Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:9548b41e5b7af4c5ce81971ba2827e7dc17ed0a9923527e3ed0e136d7d74d66b","observation_id":"3bddf48f-d85e-4084-a283-4d9b984e5ff2","resolution":{"observed_at":"2026-08-04T07:00:47.062153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:00:47.375007Z","title":"Genie centurion: Accelerating scalable real-world robot training with human rewind-and-refine guidance.arXiv preprint arXiv:2505.18793,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.375007Z"},"links":{"citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:55987d3e92ee38efe08f343984791b2a2815d346a72f555842ca338974233381","observation_id":"dbf338ef-eadf-4f53-90f2-7ef1640b41f8","resolution":{"observed_at":"2026-08-04T07:00:47.375007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-07-06T18:44:57.578408Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-04T07:00:47.457905Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.457905Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:825b0d9ee14c5fe1c3f73ce4f4fc733cfca008d2906e10be8c03324c4a834bc8","observation_id":"fcaf861b-f407-475b-98a7-80f134dbf97c","resolution":{"observed_at":"2026-08-04T07:00:47.457905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-04T07:00:47.591114Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.arXiv preprint arXiv:2304.13705,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.591114Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:ffde83a69c0948d69bcb83c52503a4103ebc4e434e09d531be2e726f0847b8ee","observation_id":"1f89afb5-6bc5-496d-a056-6dc01b81b31c","resolution":{"observed_at":"2026-08-04T07:00:47.591114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-08-04T07:00:47.749003Z","title":"Flare: Robot learning with implicit world modeling.arXiv preprint arXiv:2505.15659,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.749003Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:e3322ad702ed46d0c9cd8a97f967f254e398fb966db03796fd84748a13a44071","observation_id":"16f87478-21fb-4e43-baed-96286917918a","resolution":{"observed_at":"2026-08-04T07:00:47.749003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04983","snapshot_observed_at":"2026-08-04T07:00:47.904165Z","title":"Dino-wm: World models on pre-trained visual features enable zero-shot planning.arXiv preprint arXiv:2411.04983,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.904165Z"},"links":{"cited_paper":"/paper/2411.04983","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:547fe3a7bf577cec22203e6beee6d96913cc7cfcd604d385ea93493182bcb388","observation_id":"cb2975b3-4393-4e7f-bb87-a867b40fcd6c","resolution":{"observed_at":"2026-08-04T07:00:47.904165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:00:48.083925Z","title":"Image observations include 3 viewpoints from the left, right, and wrist","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:48.083925Z"},"links":{"citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:c9530b90d17b0034f6affeb202a478641c5e65f9003d97b2fe2b1092e7785ea0","observation_id":"6e5be1c8-6589-4dd6-835e-2f62be821ac1","resolution":{"observed_at":"2026-08-04T07:00:48.083925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:00:48.172438Z","title":"The simulated robot is a GR-1 humanoid robot with Fourier dexterous hands, enabling fine-grained grasping and manipulation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:48.172438Z"},"links":{"citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:66283dcd064e1fcd13357b911c91af31ee41dfbb503aeebeba419841df3bb3e6","observation_id":"67dcb501-5c7f-46b8-b48c-f4c26ca48b8d","resolution":{"observed_at":"2026-08-04T07:00:48.172438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-04T07:00:47.154975Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.154975Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:1c855352dfb1877973a91d581ae755a95e6cd6d7f3745241ace8a9c71a3555f2","observation_id":"4d37e046-644e-4868-8bf3-105848765b48","resolution":{"observed_at":"2026-08-04T07:00:47.154975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-07-06T22:00:23.912390Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T07:00:46.531852Z","title":"Being-h0: Vision-language-action pretraining from large- scale human videos.arXiv preprint arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.531852Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:b82fa4159f3b284cade702070076463794aeb34bd79b435af476e870b87a51e7","observation_id":"8ea14750-e58d-4048-b56d-b8b74d8d3eb6","resolution":{"observed_at":"2026-08-04T07:00:46.531852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05530","last_updated":"2025-05-18T04:20:01Z","snapshot_observed_at":"2026-07-06T18:42:43.011995Z","submitted_at":"2024-07-08T00:28:41Z","title":"This&That: Language-Gesture Controlled Video Generation for Robot Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05530","snapshot_observed_at":"2026-08-04T07:00:47.260541Z","title":"This&that: Language-gesture controlled video generation for robot planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:47.260541Z"},"links":{"cited_paper":"/paper/2407.05530","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:421070b0425e48c4b97db7a63d7bf0272266bdb90237fe3a11f94bc0fb1d729d","observation_id":"2e2927a6-ed44-434f-9df3-2c89bc35768f","resolution":{"observed_at":"2026-08-04T07:00:47.260541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-04T07:00:46.400140Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.400140Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:a14daa3e7742e2d03090d0235e42dd9e837e92b4a4e37922a3bf00edc5d7890c","observation_id":"6b2874ea-6c8b-49ce-8efa-7104d79a790e","resolution":{"observed_at":"2026-08-04T07:00:46.400140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-04T07:00:45.804069Z","title":"Rt- 2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:45.804069Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:bf9641e77dbbc9bf97b89594a51d73c3dbb89be843d67f71513e0a805354eee5","observation_id":"90529829-446a-46ba-b581-2aed5cffbc7e","resolution":{"observed_at":"2026-08-04T07:00:45.804069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 22 inbound Pith citation observations for arXiv:2510.27607."}