{"as_of":"2026-08-06T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24f19d9e29e1ba90c88d82fdcc2358f82ef517869c02e817414f27587bfd4f2a","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T04:33:32.677434Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.24622/citation-record","integrity":"/paper/2604.24622/integrity","json":"/paper/2604.24622/citation-record.json","paper":"/paper/2604.24622"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"691b6a2e-d57d-4dc8-ad56-faa14b37bf3c","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:9c68ceeabb53586955491fd7a70b46d05ba670d7c579a1f3b11a62966b955e29","observation_id":"c4db0091-02fb-4af6-9b52-4c4e6797b2ca","resolution":{"observed_at":"2026-05-26T20:48:21.511304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:67519b742e19831056a0591a2aec5f6f16a79410c6fdde3b165759cc4f497b8f","observation_id":"cc8a1bdc-262e-4d06-b904-113e05806cab","resolution":{"observed_at":"2026-05-11T21:41:17.595310Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:6322da81148363b3f9f6962786ce58eb5495fef8d2f5db3475f2f24f9c15464d","observation_id":"fa00c6a2-7811-4707-849c-0c81c10ad620","resolution":{"observed_at":"2026-05-11T21:41:17.603111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":"2505.06111","doi":"10.48550/arxiv.2505.06111","metadata_source":"pith","pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","venue":"cs.RO","work_id":"e05d654d-db73-48f6-9318-381b6798bac9","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:87054bcd6188f1157f47b02da3f92e1276984e6b9b46aaf911ea2020782885ee","observation_id":"d044066d-e0eb-4774-bf9e-e2cac14d96e5","resolution":{"observed_at":"2026-05-12T15:28:07.265740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e72b1d8-a41a-4962-bd91-d1acaabb1969","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:687f125fdf1cdc7271927f10b74b97d46112556884d98149fdbd5e46232b6465","observation_id":"95565bb6-4325-4a47-aaa2-d5dc7ae27ad5","resolution":{"observed_at":"2026-05-26T20:48:21.514523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07366","last_updated":"2019-12-14T02:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-06-19T17:50:12Z","title":"Neural Ordinary Differential Equations","version":5},"cited_work":{"arxiv_id":"1806.07366","doi":"10.48550/arxiv.1806.07366","metadata_source":"pith","pith_arxiv_id":"1806.07366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Ordinary Differential Equations","venue":"cs.LG","work_id":"d9298290-3e2a-4cb1-b26b-f4c4fcb3e744","year":2018},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/1806.07366","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:9e65d1c004af6c0fbc43d2ec1f6a4864e1b72cdf6bdb4618b4e8e8d26a5b1130","observation_id":"a44099be-7509-4a0c-a065-0062ec0113d5","resolution":{"observed_at":"2026-05-15T13:00:58.588645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-03T14:38:10.182979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T14:38:10.182979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-03T00:02:57.373313Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":"2303.04137","doi":"10.48550/arxiv.2303.04137","metadata_source":"pith","pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","venue":"cs.RO","work_id":"2dce18e6-f07a-4f57-8a81-e71c3e6a293c","year":2023},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:973a444e3cf49610dbe8ca34b3a87478c25d7ee5ae386909a952896b20785d9c","observation_id":"8e4f56d7-0f47-4011-8e16-bc6c8fea8bdf","resolution":{"observed_at":"2026-05-13T00:20:30.996755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05397","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:45:46.180162Z","title":"Everydayvla: A vision-language-action model for affordable robotic manipulation","venue":null,"work_id":"3b68eb43-b5c3-4fcf-ae1e-294164079093","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:da1a3c52e97d759a2561fd8d3cf339833cc710ad71c0887bf5a232c33847cffb","observation_id":"461bc3a3-8e83-4df4-9c90-c073b557e7c2","resolution":{"observed_at":"2026-05-11T21:41:17.378626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cd403dc2-6ac0-431a-b924-321ba004efda","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:f08712ce3ad187419ce95bc7ba984ee5e1ebaabeb4e4ff4e2fde052cf46925e9","observation_id":"ac936cdf-ca40-4529-8ad1-52c65c94325c","resolution":{"observed_at":"2026-05-09T00:04:27.600547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15959","last_updated":"2025-03-23T05:03:59Z","snapshot_observed_at":"2026-07-06T19:37:03.013065Z","submitted_at":"2024-10-21T12:43:54Z","title":"Diffusion Transformer Policy","version":6},"cited_work":{"arxiv_id":"2410.15959","doi":"10.48550/arxiv.2410.15959","metadata_source":"pith","pith_arxiv_id":"2410.15959","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion transformer policy.arXiv preprint arXiv:2410.15959","venue":"cs.RO","work_id":"b0dc2bff-c2c1-45b0-afd0-123efb64a327","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2410.15959","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:697712625b0917ebda334b3c988475a23a9c1c5d865053c6f1c90ddb5213140f","observation_id":"fd72977d-f9bd-4527-96bd-9e79208691d1","resolution":{"observed_at":"2026-05-11T21:41:17.441942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3695053.3731099","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"17ba4e98-a65f-4588-a8a7-b3727382f565","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:6494bf43bbd02d78a585f07039dc38fa681e95f3dcb48d82934f55126f6d68ea","observation_id":"095c613e-c21c-443e-8a60-13fc10ea80f3","resolution":{"observed_at":"2026-05-09T00:04:27.587044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11528","last_updated":"2025-09-12T13:58:52Z","snapshot_observed_at":"2026-07-06T21:25:13.481613Z","submitted_at":"2025-05-13T04:42:14Z","title":"LaDi-WM: A Latent Diffusion-based World Model for Predictive Manipulation","version":6},"cited_work":{"arxiv_id":"2505.11528","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11528","snapshot_observed_at":"2026-07-04T19:20:05.944664Z","title":"Ladi-wm: A latent diffusion-based world model for predictive manipulation.arXiv preprint arXiv:2505.11528","venue":null,"work_id":"846f9484-c8e6-4053-b0c6-e864262097b0","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2505.11528","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:03e185be06f1e199ce64bc240c5d32fe36fd1df8701a7c728c852afa1feecd58","observation_id":"7a01f14a-cc69-404d-9562-ea6970dc1cb3","resolution":{"observed_at":"2026-05-11T21:41:17.468112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad8ac2cb-72a5-40fe-a22e-29a43fa30d59","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:8b5b744723b0146896a1f3680f67acaaa9ffdcd74082a2aa14b96aa2d17aa0c5","observation_id":"19d4402e-75a9-4e94-a305-cc1192d31fdd","resolution":{"observed_at":"2026-05-26T20:48:21.497620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:90ec03a0facd84359acc1d764a629c9952a3c541ff094bfbada92ecfaad2c657","observation_id":"0777bc97-bac7-4a89-884d-d64394c78e23","resolution":{"observed_at":"2026-05-11T21:41:17.336064Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/sym18030394","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Symmetry","work_id":"0aa86bd1-0839-477a-9f87-53ca1e483d1d","year":2026},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:bbf14b9c9cb1abeb01feed1dbd2b5acbcc4c4ea1cb2fd6559c6be557b61b1825","observation_id":"8e820b19-1c1c-45eb-a04d-77ac4cddb05e","resolution":{"observed_at":"2026-05-09T00:04:27.607003Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11013","last_updated":"2024-12-17T22:14:33Z","snapshot_observed_at":"2026-07-06T19:33:26.078722Z","submitted_at":"2024-10-14T19:05:38Z","title":"Incorporating Task Progress Knowledge for Subgoal Generation in Robotic Manipulation through Image Edits","version":2},"cited_work":{"arxiv_id":"2410.11013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.11013","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5ab591eb-0838-49bf-bca5-ec7672a17b82","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2410.11013","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:a9754fcaf432d6d9267cd52c4d37460a5543e440df6ebb978062ad2c6673b0c4","observation_id":"ec6b7c93-a076-41e3-85e4-11f7cedf296b","resolution":{"observed_at":"2026-05-11T21:41:17.362544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"85299f88-b71e-4d27-a5bd-51f2b83bec89","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:82947ab50348fd057959354c161e46425eb33c33183e5a2c7167a416472b6a7d","observation_id":"985a483f-720c-47d0-bfee-64795c6762e6","resolution":{"observed_at":"2026-05-26T20:48:21.494424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/access","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:17:00.973004Z","title":"IEEE Access8, 199523–199538 (2020) https://doi.org/10.1109/ACCESS","venue":null,"work_id":"7cbffc3e-26d4-4a7c-a518-eafcd09cbecb","year":2020},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:3bc918172a47e446729fcf5f21b34bcccfd7f44a10d0c4d10d5fbeade0db4f9b","observation_id":"da674afa-b932-40e8-ad81-fa030b02b84f","resolution":{"observed_at":"2026-05-09T00:04:27.591736Z","resolver_source":"doi","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:55fd4d0e6aba50631f699100cc553e8cc73e4d1d35c5261695d0faaa7e3556b6","observation_id":"6a480ba9-be12-4ea3-acf4-34753c1b6b6e","resolution":{"observed_at":"2026-05-11T21:41:17.372080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":"2601.16163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-10T18:47:31.583000Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","venue":"cs.AI","work_id":"3d63039f-41b0-4a31-af31-6fc10f5c1b1b","year":2026},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:14708dceacb4ba6ed035e088ab1a53de6bec669341f21f4f41792b8cb0866f6a","observation_id":"27dfbcfc-33d2-40f5-9794-3827c4c897c4","resolution":{"observed_at":"2026-05-12T14:50:13.054714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:d237d808179a553515133d28234c9b8cb05805bc8fdcaa46ec16f80dcee386bd","observation_id":"849cac78-29b2-4cee-a8c2-88c98a2135f0","resolution":{"observed_at":"2026-05-11T21:41:17.129070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:6c7387d473bcb1a366aa12312675e27d58a43ef716cd25a308542e293be02359","observation_id":"27f610aa-a74b-46e3-8728-570d184afe15","resolution":{"observed_at":"2026-05-14T23:35:23.409560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19681","last_updated":"2025-01-08T06:56:19Z","snapshot_observed_at":"2026-07-06T18:53:05.207665Z","submitted_at":"2024-07-29T03:53:14Z","title":"Motion Manifold Flow Primitives for Task-Conditioned Trajectory Generation under Complex Task-Motion Dependencies","version":3},"cited_work":{"arxiv_id":"2407.19681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.19681","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a01851d8-7354-44f2-8c1e-80db4c82f715","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2407.19681","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:15ae073a0d969e8137a4456641d281989b44581ccb5a79a2430a7de8daa3a892","observation_id":"79d9053d-eb92-4e87-938a-fed39f189647","resolution":{"observed_at":"2026-05-11T21:41:17.247334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19816","doi":"10.48550/arxiv.2506.19816","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling, October 2025","venue":"arXiv (Cornell University)","work_id":"98421727-12e6-4220-9a07-01a1e8870d40","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:6b1ba7e02f49f59d834f6b175cc1d32e24302cdc22b2de7643eac5345504f40b","observation_id":"35f991a9-c143-45d4-8d1c-0f96dc745542","resolution":{"observed_at":"2026-05-11T21:41:17.137638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:969d53b23a4fe5753adde0e79d4aa437bdd94da11ea4053535cfcfec72a93245","observation_id":"5de76cfd-694b-4aa1-8eb5-614911f7d18b","resolution":{"observed_at":"2026-05-11T21:41:17.220370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":"2306.03310","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-07-10T23:17:45.328655Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","venue":"cs.AI","work_id":"662203ad-084f-42c4-8e60-977b3173755b","year":2023},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:4fd3510296790cee0d6cef098eaa64056d8244258d45c78a0fa3430d0dffbbe0","observation_id":"031a9715-2d42-4456-bbb6-a70638520db9","resolution":{"observed_at":"2026-05-12T21:04:42.196761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"210082f5-4683-4b00-bc45-122441a707b9","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:d38114cfa379cc71ea0dceae570b1a200007c00ec6ac159891a8a370b1ad87f7","observation_id":"1cfd74bd-31e6-4b2c-a57a-0cc27c0ca102","resolution":{"observed_at":"2026-05-26T20:48:21.488117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18977","last_updated":"2024-09-12T03:24:58Z","snapshot_observed_at":"2026-07-06T18:37:47.471616Z","submitted_at":"2024-06-27T08:13:33Z","title":"RoboUniView: Visual-Language Model with Unified View Representation for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2406.18977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18977","snapshot_observed_at":"2026-07-03T11:48:04.895968Z","title":"Robouniview: Visual-language model with unified view representation for robotic manipulaiton","venue":null,"work_id":"8b54fef9-2376-4785-a768-e6a663456618","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2406.18977","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:d0e54e3450287daed62468f8601ecfacdab0da1fdfe3dbec36deac4d6f96e4bb","observation_id":"17bb1c14-c5c0-484e-bfaa-89b3807347e0","resolution":{"observed_at":"2026-05-11T21:41:17.483455Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02826","last_updated":"2026-04-10T06:54:03Z","snapshot_observed_at":"2026-07-30T04:40:51.868176Z","submitted_at":"2025-12-02T14:34:10Z","title":"From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity","version":3},"cited_work":{"arxiv_id":"2512.02826","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.02826","snapshot_observed_at":"2026-07-02T16:07:09.013207Z","title":"From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity","venue":"cs.LG","work_id":"4f00e55c-c617-41a0-bcbf-ed2860987273","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2512.02826","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:60e0ac47bc963b5f62afd0e8e205e1a510552086c7df75204c01d5d7843864e4","observation_id":"f9998e60-4259-450d-9ad7-0cbd19e30a84","resolution":{"observed_at":"2026-05-11T21:41:17.316875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00927","last_updated":"2022-10-13T12:04:36Z","snapshot_observed_at":"2026-08-03T02:03:48.954468Z","submitted_at":"2022-06-02T08:43:16Z","title":"DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps","version":3},"cited_work":{"arxiv_id":"2206.00927","doi":"10.48550/arxiv.2206.00927","metadata_source":"pith","pith_arxiv_id":"2206.00927","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dpm-solver: A fast ode solver for diﬀusion probabilistic model sampling in around 10 step s","venue":"cs.LG","work_id":"5a71e28c-3c07-4f30-bfe2-17ea2361df24","year":2022},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2206.00927","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:c01b242a26a03b7af701b3519e26354df47318ca1bd0c8fa7126d92720836056","observation_id":"267efd11-25d1-447a-9d35-80655bf77735","resolution":{"observed_at":"2026-05-11T21:41:17.310361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01911","last_updated":"2023-03-08T11:00:55Z","snapshot_observed_at":"2026-08-03T13:15:59.959552Z","submitted_at":"2022-10-04T21:16:48Z","title":"Grounding Language with Visual Affordances over Unstructured Data","version":3},"cited_work":{"arxiv_id":"2210.01911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.01911","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding language with visual affor- dances over unstructured data","venue":null,"work_id":"88e74a2f-4029-4b50-a23c-515ed4688dd0","year":2022},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2210.01911","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:76ff52fa5f1c4126e6738de409bed389d19adee2f7c030eb85e2451a55aee078","observation_id":"d3c496a3-870e-44d0-940f-25dfc6f85ba2","resolution":{"observed_at":"2026-05-11T21:41:17.237636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06252","last_updated":"2022-08-30T12:10:35Z","snapshot_observed_at":"2026-07-06T12:59:53.480496Z","submitted_at":"2022-04-13T08:45:32Z","title":"What Matters in Language Conditioned Robotic Imitation Learning over Unstructured Data","version":2},"cited_work":{"arxiv_id":"2204.06252","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.06252","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What Matters in Language Conditioned Robotic Imitation Learning over Unstructured Data","venue":null,"work_id":"e3cd9daf-5a7f-4d95-b6ff-79470d306786","year":2022},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2204.06252","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:0484af2fa76a23b85b4f1e7cd0caafe64fa37c6c430a54498f229fdfd8028fbc","observation_id":"3d8d5d28-d80b-4154-80df-c2812abfc048","resolution":{"observed_at":"2026-05-11T21:41:17.275614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03227","last_updated":"2022-07-13T12:15:04Z","snapshot_observed_at":"2026-07-06T12:15:51.240057Z","submitted_at":"2021-12-06T18:37:33Z","title":"CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks","version":4},"cited_work":{"arxiv_id":"2112.03227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.03227","snapshot_observed_at":"2026-07-04T00:49:19.054441Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks","venue":null,"work_id":"6d6b973c-e3e7-430b-a541-0693f332aa15","year":2022},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2112.03227","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:d1463590803e04328aa6bcb41512e6d1c9d8d0f1828ea6a16950eab9de6d2478","observation_id":"9c884ffd-5d0e-405c-90ba-168aecccae11","resolution":{"observed_at":"2026-05-11T21:41:17.301807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01809","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:19:43.461685Z","title":"Much ado about noising: Dispelling the myths of gener- ative robotic control","venue":null,"work_id":"cab94379-b09c-4084-8de9-d49329d27cd0","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:cd7896c21d789c9c89425abf16f6bf90b1867a1134540bd357a089ea577936e0","observation_id":"82265426-da11-4e7f-8d4c-6d791e5b6363","resolution":{"observed_at":"2026-05-11T21:41:17.356378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-08-05T05:48:44.865688Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"cited_work":{"arxiv_id":"2509.04996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04996","snapshot_observed_at":"2026-07-04T13:09:50.096907Z","title":"E., Otto, F., and Lioutikov, R","venue":null,"work_id":"6e9d4312-6717-4e93-9f60-25ede1afe157","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2509.04996","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:1227f49dafbc70952e222db6c2581fafecdcb5d862ea19048547acceda360872","observation_id":"213be866-abb3-4160-b188-6d28d09b6f19","resolution":{"observed_at":"2026-05-11T21:41:17.347821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"32f34483-f724-40c9-896c-15304ca2fcb1","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:c85e50f13fc3f887f337f0df19f58bb95d53e9f2d1e7c0317ad1578a3666f172","observation_id":"79d3b403-90e9-4519-925a-b5dbc414507e","resolution":{"observed_at":"2026-05-26T20:48:21.491387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:2b377f2bc3a6e2cd0ecafb2af04c43a0587e8341cbe2539a3f04cd244fc5eb5d","observation_id":"931e186a-74ee-431a-a788-864391bcccf0","resolution":{"observed_at":"2026-05-11T21:41:17.564383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:f461bec02bda1ff4e3f3299cb7328309331b7e212e1909acad10fc43ecdc1637","observation_id":"8bf41518-4f59-4004-becd-6e4b7b41af3f","resolution":{"observed_at":"2026-05-11T21:41:17.323334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"cited_work":{"arxiv_id":"2508.13073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13073","snapshot_observed_at":"2026-07-08T05:54:33.623543Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","venue":"cs.RO","work_id":"bcbdae00-80a0-4488-a280-7eaf3c5336bb","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2508.13073","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:7bee5ec1cdca6c835d52f3149d3be1aefcd1096d56cbc3e74a6d7fd3c68c4929","observation_id":"21c40d15-e509-44f4-8d61-8348ce8861c8","resolution":{"observed_at":"2026-05-17T20:28:16.822386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2508.19236","doi":"10.48550/arxiv.2508.19236","metadata_source":"pith","pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"921d4c77-1e8b-489d-987a-1c0c990e5ce8","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:738a132a92f539dfa08e53a681792a431606f10e7a7642ce49d60ad35e14930c","observation_id":"18ed64d7-1c73-4de1-933b-a949d8e30391","resolution":{"observed_at":"2026-05-15T20:43:24.547911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3d6a5072-c1f1-4606-a99e-14a2da239db8","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:a4284908c5de426efa3b7460b2b71a08920646028684cfa346ecd7672aed1993","observation_id":"4ef7912e-fb32-432b-a927-c6692122d21c","resolution":{"observed_at":"2026-05-26T20:48:21.507966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.16845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nina: Normalizing flows in action","venue":null,"work_id":"76c4c9fc-16c6-4b4a-aaa0-96c0fad6e807","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:cf77b09cf005f9197284cde8308cad98edc2eb5ae53b92a6ff1f6d396a77c3c2","observation_id":"daf749a8-fbe9-494a-a599-14d7e314287b","resolution":{"observed_at":"2026-05-11T21:41:17.421654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-04T07:40:05.703158Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:0a1ea2d15bb572a3e70739e4f63dbeb703a5e4f2834a1132dcf4e37ccee048c9","observation_id":"c7bcba76-6aee-4ecf-aa5d-2dfe5acc0bf6","resolution":{"observed_at":"2026-05-11T21:41:17.572350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08438","last_updated":"2025-07-14T11:02:41Z","snapshot_observed_at":"2026-07-06T21:07:51.837833Z","submitted_at":"2025-04-11T11:01:11Z","title":"Diffusion Models for Robotic Manipulation: A Survey","version":3},"cited_work":{"arxiv_id":"2504.08438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08438","snapshot_observed_at":"2026-06-29T20:53:58.333906Z","title":"Diffusion models for robotic manipulation: A survey","venue":null,"work_id":"c1c92fca-23e1-4b87-8272-d276b6b6f181","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2504.08438","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:6f689018246edca27022e8ddededf9dde2c67dcdb4b1cf7c4732fb233c530caf","observation_id":"e3371cd5-dfda-4a41-8872-d76a8e449280","resolution":{"observed_at":"2026-05-11T21:41:17.198471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00697","last_updated":"2025-08-01T15:14:39Z","snapshot_observed_at":"2026-08-06T06:01:04.118420Z","submitted_at":"2025-08-01T15:14:39Z","title":"On-Device Diffusion Transformer Policy for Efficient Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2508.00697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00697","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On-device diffusion transformer policy for efficient robot manipulation","venue":null,"work_id":"c3c11bdb-a6d0-4a15-8267-c898a7cfbc7a","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2508.00697","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:dbb83be575ef63fd9258991dd84d5da1f6b68e7b6e08d0409d382735dff595aa","observation_id":"a2e36438-1fc2-412a-85f8-9d385d47290d","resolution":{"observed_at":"2026-05-11T21:41:17.268531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2621ba38-7985-4a6a-b55d-b5aa7afbb375","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:b1d05a257b64726e67c0bd59e2c54ec1a9e2f975845b449bf66895e45b9d4dd7","observation_id":"ee2f2627-f23f-440b-8582-7bceab4bb8de","resolution":{"observed_at":"2026-05-26T20:48:21.501678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.02175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:51.185429Z","title":"arXiv preprint arXiv:2502.02175 (2025)","venue":null,"work_id":"42035afc-a335-4f4d-89f8-649709fa3bce","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:4c28d7c49907831454a6a1c8d5ed438ffc208640f57b4d9544db62ac47572cd7","observation_id":"b827fd55-e022-45e9-9adb-ecf942e9ee43","resolution":{"observed_at":"2026-05-11T21:41:17.253696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.07215","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:06:48.049855Z","title":"RoboTron-Mani: All-in-one multimodal large model for robotic manipula- tion","venue":null,"work_id":"c2bf682d-681a-4775-9548-79bb95a455fa","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:f212eead8fdf579413276e3fd038bef8980eaac10c15690f8f9fe30fdc0e8695","observation_id":"a857de87-181b-40e2-b008-7fb6990aeebc","resolution":{"observed_at":"2026-05-11T21:41:17.543056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.17520","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:16:48.695703Z","title":"Instructvla: Vision-language-action instruction tuning from understanding to manipulation","venue":null,"work_id":"66890618-d3a5-4d24-b379-ac9f40186769","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:e8d67f7f155efdf4250cd78524b5c536886d02a89caa0cfb4c80f1f9611f0081","observation_id":"c1ac4bea-1027-461d-aa7a-388bbc8d7f6f","resolution":{"observed_at":"2026-05-11T21:41:17.228657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":"2602.11236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-07-08T07:14:45.378913Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","venue":"cs.CV","work_id":"30745958-0491-4e57-a989-e53b1a7fe19f","year":2026},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:95fceae9b94da2b044d0eb43cee108c1ecc3bc101ea344eb0631460ef6fb8af3","observation_id":"c171cee7-8765-4db5-ace2-30fc0e93c3c8","resolution":{"observed_at":"2026-05-11T21:41:17.552448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22896","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T02:17:34.393548Z","title":"Dysl-vla: Efficientvision-language-action model inference via dynamic-static layer-skipping for robot manipulation.arXiv preprint arXiv:2602.22896","venue":null,"work_id":"d62358c2-3fa7-46d1-8ab7-835b187076fd","year":2026},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:5b82d20c04a2e924f804c1f38de66eb591fe90f40f8b62c13e39aa8c52df86a6","observation_id":"3bfa6642-5f83-4cc1-8284-2ff754ee907a","resolution":{"observed_at":"2026-05-11T21:41:17.513281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:19:47.599866Z","title":"arXiv preprint arXiv:2510.24795 (2025)","venue":null,"work_id":"91f872e2-5996-425c-a11e-e11db03ecb08","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:ea1361b0daa3b0b6976e31f047864babc0c3985522a4f29d692455aaf7540f47","observation_id":"408fe971-2d02-4c9d-8dbd-edd5e82aa782","resolution":{"observed_at":"2026-05-11T21:41:17.523744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02359","last_updated":"2024-11-04T18:26:08Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T18:26:08Z","title":"DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution","version":1},"cited_work":{"arxiv_id":"2411.02359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02359","snapshot_observed_at":"2026-07-08T01:44:26.118057Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution","venue":"cs.RO","work_id":"eaa5003c-8fc8-4134-badf-23c33ae3764c","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2411.02359","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:1e7af216fcc0f698e9007fbdd55487e58bdd2776d4d7252318ed3ac571fd1a98","observation_id":"7b9b3274-5c39-4ca7-89eb-1146134812dc","resolution":{"observed_at":"2026-05-11T21:41:17.536187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15629","last_updated":"2024-12-09T02:49:04Z","snapshot_observed_at":"2026-08-05T01:56:04.822780Z","submitted_at":"2022-10-27T17:20:50Z","title":"Language Control Diffusion: Efficiently Scaling through Space, Time, and Tasks","version":4},"cited_work":{"arxiv_id":"2210.15629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.15629","snapshot_observed_at":"2026-07-04T13:09:50.158362Z","title":"Language control diffusion: Efficiently scaling through space, time, and tasks.arXiv preprint arXiv:2210.15629","venue":null,"work_id":"7a41d417-f80d-40b6-952c-527601a00bb1","year":2022},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2210.15629","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:5bc7d1723ed9cf5564b799ff582e5447cce0435e7e08e57e8af0c8a20823f0c2","observation_id":"eabca663-b967-4b56-a2d6-a3eaed0216fe","resolution":{"observed_at":"2026-05-11T21:41:17.578376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":"2507.04447","doi":"10.48550/arxiv.2507.04447","metadata_source":"pith","pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","venue":"cs.CV","work_id":"830b1108-8122-404f-a791-f926fbc48669","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:b22b63186b183ac0bd94f4a434f15a5f8b738fb6c63f07e22d6fe019c02ac74f","observation_id":"3f77fe12-352e-4ab7-8edf-5b23af1a12b1","resolution":{"observed_at":"2026-05-16T15:42:41.804405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8faffe84-9a7b-4a2f-bea1-73a7c3f93fda","year":null},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:b3b2ca5fe440aff31a3a225a3ce9edb0fdd58fe5387557b5ff5ac3908d0f5687","observation_id":"06e6e170-3532-48a5-8649-73579ce0f612","resolution":{"observed_at":"2026-05-26T20:48:21.504681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-07-06T20:22:23.609336Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":"2501.10105","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10105","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal actions for enhanced embodied foundation models","venue":null,"work_id":"2efa306c-e95c-4a8d-965d-f4f79e0c4879","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2501.10105","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:c35d6ecea2730c0754860be0a2a6b7813b6b3c82363d3932114f36494ad40692","observation_id":"47295cb1-c337-4dff-aff8-44590b897454","resolution":{"observed_at":"2026-05-11T21:41:17.452556Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2510.10274","doi":"10.48550/arxiv.2510.10274","metadata_source":"pith","pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","venue":"cs.RO","work_id":"13faca8d-e96d-4e6c-a441-9f2683d11934","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:5af30884d1cf67a8e420ea37e50b0c0d78c93beb7dd57670a392e2d85c329df0","observation_id":"1f5889d6-edf2-415f-a17f-a7265e30ec36","resolution":{"observed_at":"2026-05-12T14:57:47.957311Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":2,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":9,"verified_exact":41,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2604.24622."}