{"as_of":"2026-08-05T23:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f722a09b8ef3a77f9b1c85f3ad479ad0ea4e383b6a0a99403819dfca25f05203","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:57:19.195413Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07107/citation-record","integrity":"/paper/2606.07107/integrity","json":"/paper/2606.07107/citation-record.json","paper":"/paper/2606.07107"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:a6f6b8269dd4fa374ed3eb3ebde4228cd104deaa150bf2c48926b99c476c19ed","observation_id":"a9bb6995-54bd-44cb-9ff1-96059cd9f1ad","resolution":{"observed_at":"2026-06-27T22:01:20.703357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:56a528a64d4e774c1ad7c8870667022c490b4527eb45d0cdea83070a95e73040","observation_id":"4897fa89-cbff-45be-87a6-f46d47f3e0a6","resolution":{"observed_at":"2026-06-27T22:01:20.725705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:599e819c9e1a57401cd24f64c43f29cb0ac5c9412ba77f9551c00fa35a237a9c","observation_id":"9a2e5326-7c02-4ac6-b128-7b4c6cbb397d","resolution":{"observed_at":"2026-06-27T22:01:20.768630Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:4e56837892f79e507e2580ff282b810034aedff963a5f60c1e0327c6a71eca12","observation_id":"16016c91-8334-4dd2-91e2-ffb59c3081df","resolution":{"observed_at":"2026-07-02T17:37:14.623922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:818e1a37ec77a5c996272a14f38072d3c042d73a1e93bbe153b4a5c3a453e308","observation_id":"38c9908d-a2b6-464c-870c-1bb929500512","resolution":{"observed_at":"2026-06-27T22:01:20.721156Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:57:19.195413Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:a59952089a3544d4d0e36d4c9a3ba468cfb12391353baa21d185136b6ca26369","observation_id":"d008da2a-006b-461b-a7ce-379f144634a9","resolution":{"observed_at":"2026-06-27T21:57:19.195413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:57:19.195413Z","title":null,"venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:0f3d8550683109364b189b86ba3ca13cf33f6d0534665f7d1453afbdd377849e","observation_id":"99307e44-80f7-406a-8eb8-74061ffd298f","resolution":{"observed_at":"2026-06-27T21:57:19.195413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:57:19.195413Z","title":null,"venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:3e7b8616731a4cc54313f08fb8b964d955ca81885daebe09fe7f0209aa13fe00","observation_id":"6279852b-6c4a-4993-9ba4-7daba0e6d855","resolution":{"observed_at":"2026-06-27T21:57:19.195413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-07-06T18:44:57.578408Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":"2407.08693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-07-10T13:37:06.920040Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","venue":"cs.RO","work_id":"bbe96698-686e-4b4a-9f7f-ed5054e61cca","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:4f8877aaac64ac4ffaf4f246ed0f3de259351f3fc2f4d9c910cf50f0e59327ff","observation_id":"9645646a-0ddf-4871-88aa-a1bf17a65926","resolution":{"observed_at":"2026-07-02T17:37:14.626466Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":"2507.16815","doi":"10.48550/arxiv.2507.16815","metadata_source":"pith","pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","venue":"cs.CV","work_id":"a5c17d1f-5739-41bd-bd90-0faf9424af13","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:770ecacbf4a3aa770ec077458a336a2b615f1d55c3fc8aa93a75ad50154735b4","observation_id":"4edeea87-c77f-445b-bad2-aabcdd6115b2","resolution":{"observed_at":"2026-06-27T22:01:20.728151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.22020","doi":"10.48550/arxiv.2503.22020","metadata_source":"pith","pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","venue":"cs.CV","work_id":"14a3cf4d-f3aa-46dd-a613-bb5253154921","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:a1b567d5c589e4e2030a0317b64b283ff4d57ec8f76d5a322aa76ffbdc5d7e9a","observation_id":"44f3d4b8-227c-4aec-ac46-5a2a1eeb1b4f","resolution":{"observed_at":"2026-07-02T17:37:14.619272Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":"2507.04447","doi":"10.48550/arxiv.2507.04447","metadata_source":"pith","pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","venue":"cs.CV","work_id":"830b1108-8122-404f-a791-f926fbc48669","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:e248dc4a0235ff6cf18f723c4f57a9f8079d120603186f643a843a085af5bd6a","observation_id":"91d61383-15fe-4595-9ede-964d610e8358","resolution":{"observed_at":"2026-06-27T22:01:20.764920Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:a6bc59c2d46c6c5671fe06246f99298d43b35d4d586935cd67cf5e371fd1cb04","observation_id":"1e31fea4-f51e-4b12-8c63-cfc7eb6a24bf","resolution":{"observed_at":"2026-06-27T22:01:20.743184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-05T21:58:58.897913Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:d6347020b3da6757aff5ef96187a0973d4a5f037b2464523b8d4727275aafac0","observation_id":"8af57b5b-6e93-4cc6-9456-acc96e48fe0f","resolution":{"observed_at":"2026-06-27T22:01:20.749485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:5f010c2d77a7ac91b7b5898ded1e30280bd2670a225a24dce743b9aabc8933bb","observation_id":"f4fa4270-f393-406b-97a6-4c89cde07725","resolution":{"observed_at":"2026-06-27T22:01:20.762517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:2c45dab40a51741b4aec951aed64ee5e83501405e2d61e32445465744636e948","observation_id":"ec8a25c0-aee4-49ad-8533-127a21b188e5","resolution":{"observed_at":"2026-06-27T22:01:20.746406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:9c6c153bcfe238ea42f173beb65f075cc3c1bf80afe9d4303d639f136d08c5bd","observation_id":"7f25fbfc-b49d-4ba4-883e-d50f60f590e1","resolution":{"observed_at":"2026-06-27T22:01:20.773449Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:cc217c7d53a490e7fa8c5a60492341cc67bc59d3ecb6f8e57a655dd8331fb4b4","observation_id":"8f122590-c670-496b-a2a2-14824805ff12","resolution":{"observed_at":"2026-06-27T22:01:20.772681Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:5575e564907ea2dfd0e0d1a51cdc0dcb36e833116eb4f20fe7f12c25448e8512","observation_id":"926e4efc-8352-42cc-a1fe-1c4dbb09b2af","resolution":{"observed_at":"2026-06-27T22:01:20.737020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":"2605.02881","doi":"10.48550/arxiv.2605.02881","metadata_source":"pith","pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","venue":"cs.RO","work_id":"0b0ada39-bb8d-4c7b-8df0-4863621a3a5b","year":2026},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:2cf26436cb99abe0f24354076a947ac71673556e88cc72ecc548aae0e409898d","observation_id":"04e7d929-150b-4cb2-a099-c465f3a27b73","resolution":{"observed_at":"2026-06-27T22:01:20.760224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.11404","doi":"10.48550/arxiv.2601.11404","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2601.11404 (2026)","venue":"arXiv (Cornell University)","work_id":"07fc5efd-b9a2-45fa-a83a-dcb137a3fcc5","year":2026},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:7af5bf29fb11e76d0ddb7bef62bd85583a55bc899f1f3b6443ba8295b17a6f38","observation_id":"bf1a8ed5-9f26-48af-9c64-eebdc85e1e95","resolution":{"observed_at":"2026-06-27T22:01:20.761649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04952","doi":"10.48550/arxiv.2512.04952","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Faster: Toward efficient autoregressive vision language action modeling via neural action tokenization.ArXiv, abs/2512.04952","venue":"ArXiv.org","work_id":"8fb5c8e4-6a2e-429a-a6f4-60b96b099a06","year":2026},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:67d9ef49c8d5fb805b1a8136e5fce9f084f5bb2aadfb8a61ac9bda40f3114e7d","observation_id":"f41e98b5-53e6-4130-bd62-7feefc8246ad","resolution":{"observed_at":"2026-06-27T22:01:20.756209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15397","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:59:37.871518Z","title":"Actioncodec: What makes for good action tokenizers.arXiv preprint arXiv:2602.15397","venue":null,"work_id":"5afe5df5-957c-4172-97be-a5b53f197ef9","year":2026},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:e99716f168b6ea9366dc293ff727b4acf014abbe46aae67dc7fd6af399923a26","observation_id":"232efa58-117f-4077-bde8-4426a6e8855b","resolution":{"observed_at":"2026-07-02T17:37:14.621693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:57:19.195413Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:581a72f468e802084e323557a744864e5b0fc32a56ed8c3e13c7ff4c8242348e","observation_id":"01a4335b-2900-401b-8c06-630d8b31b941","resolution":{"observed_at":"2026-06-27T21:57:19.195413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:57:19.195413Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:3085c18d6782fd4481429a132bd86fbc9f578e9f14cf1794aa54389770a515c0","observation_id":"37fba301-a5d6-47aa-a04d-16a4e0c5ced1","resolution":{"observed_at":"2026-06-27T21:57:19.195413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":"2405.05941","doi":"10.48550/arxiv.2405.05941","metadata_source":"pith","pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","venue":"cs.RO","work_id":"7f4ca6cb-1b94-454c-9623-b52441b74b61","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:2e3dec38178c67bbfba664dadb7296bfd6709822f5f6274f9fc690204ace0a1d","observation_id":"040e54ee-2b64-4b1b-9e13-d34a780fe6d5","resolution":{"observed_at":"2026-07-02T17:37:14.615015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":"2506.01844","doi":"10.48550/arxiv.2506.01844","metadata_source":"pith","pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","venue":"cs.LG","work_id":"0c5e9314-5fa7-4613-ad12-605a71d561d2","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:d7c9d09b66246228cea5031c7edc23355f32ba81d39dad3008455ce9b0b1ca82","observation_id":"f19d74f4-2ba4-4ce4-81e1-5cc6b53c9472","resolution":{"observed_at":"2026-06-27T22:01:20.777960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:07362f8823666f2b960298547a4400b4e9dbd2b2c2f3c4e70abbf227d9d2c3ff","observation_id":"c965ed27-7ec9-4dfb-b139-1d319a49130c","resolution":{"observed_at":"2026-06-27T22:01:20.757668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":"2506.21539","doi":"10.48550/arxiv.2506.21539","metadata_source":"pith","pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldVLA: Towards Autoregressive Action World Model","venue":"cs.RO","work_id":"d8c0c873-b2fc-44a5-a0c8-0d4a698783fb","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:d22c360c200411cabd7b08047f2cc13a803fac066408177154e6053b2a058c23","observation_id":"ef511a5a-743d-4a74-a90c-d9e233d771e4","resolution":{"observed_at":"2026-06-27T22:01:20.718614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2506","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.667133Z","title":"K., Garcia Lambas, D., Ruiz, A","venue":null,"work_id":"c63d2b15-197c-4d28-9923-1b35f7cc7b73","year":2012},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:fe71c5b56a5f93b85137b4679179aaf581a29e4c25a2d93c83097543fea456cd","observation_id":"d2d9b6ec-0354-4764-9f33-6aa42cd3b73a","resolution":{"observed_at":"2026-06-27T22:01:20.726052Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-16T20:51:43.947698+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T20:51:43.947698+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":"2509.06951","doi":"10.48550/arxiv.2509.06951","metadata_source":"pith","pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","venue":"cs.RO","work_id":"0557ae67-ef52-4cba-a579-208458bc2bbc","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:572a3889f5ce563657a5984a5b4196536588f505d63a848757de785dc144cf8b","observation_id":"7005dc0b-6eb1-4b6d-8f74-24dde036a48c","resolution":{"observed_at":"2026-06-27T22:01:20.782776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01718","doi":"10.48550/arxiv.2511.01718","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified diffusion vla: Vision-language-action model via joint discrete denoising diffusion process","venue":"arXiv (Cornell University)","work_id":"9f99a8d5-3a09-44c6-ac96-e81d09b7d387","year":2026},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:77e0c2fe835adc0868917f16f318a8f8b20433afd7bc23a096e1197526740bb9","observation_id":"917dd0ad-218a-45aa-bc73-c05360fef635","resolution":{"observed_at":"2026-06-27T22:01:20.764361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2411.19650","doi":"10.48550/arxiv.2411.19650","metadata_source":"pith","pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","venue":"cs.RO","work_id":"4b158d3e-3dff-4412-85cd-baa879465a5e","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:b10679ef637e4ff947c3ea4daf79c7f1081e08304167b38bc97cc0d91d9cbc01","observation_id":"821a1f20-b7a2-439b-b412-9ad8fa46ab38","resolution":{"observed_at":"2026-06-27T22:01:20.719795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2402","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:56:38.370412Z","title":"Quantum error thresholds for gauge-redundant digitiza- tions of lattice field theories","venue":null,"work_id":"fe54368a-46a7-407d-be53-6236d622919e","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:7cda264b69d558d93fcade66e25cdb448654e770629738ba53e78beed2fd1976","observation_id":"ea87c927-a87d-41f3-94bf-c292af01f3ba","resolution":{"observed_at":"2026-06-27T22:01:20.721570Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:59.713726+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:59.713726+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":"2112.00114","doi":"10.48550/arxiv.2112.00114","metadata_source":"pith","pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","venue":"cs.LG","work_id":"a05b1e60-8e76-4f26-9bea-28927a5f8620","year":2021},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:e2c43140475a72586bcb7218913e496d490a6d3c85c2684dbd49cbaad4d6dcb9","observation_id":"aca34776-cf08-404e-9da6-0cec71cc4f5a","resolution":{"observed_at":"2026-06-27T22:01:20.748977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:23.975867+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:23.975867+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:e3eb77a26cd6ac28c0908834ccfdbbcf32ec597a8b2451d08eea0486f6e36fd6","observation_id":"4f2499e8-72ad-42ee-af9b-32b77c4e75f0","resolution":{"observed_at":"2026-06-27T22:01:20.766938Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:5f499bd00b59eeed9e187700d03a8dca74b35928eff9a1ad3971e6220839ffe6","observation_id":"7a9eac4a-74fb-4c34-8054-3bb219dba706","resolution":{"observed_at":"2026-07-02T17:37:14.616849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-02T23:50:48.668259Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":"2308.12952","doi":"10.48550/arxiv.2308.12952","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":"arXiv (Cornell University)","work_id":"a7522d2b-ba04-44df-978a-84e147c5549c","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:396acbd36dd105ad43051f1ae5bbbfa5c18044ed4849958c175c46279e48c1a2","observation_id":"bd2c1745-37b5-4354-a252-71231dd433c7","resolution":{"observed_at":"2026-06-27T22:01:20.775416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.10293","last_updated":"2018-11-28T02:40:54Z","snapshot_observed_at":"2026-08-02T20:30:39.614115Z","submitted_at":"2018-06-27T04:34:30Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"1806.10293","doi":"10.48550/arxiv.1806.10293","metadata_source":"pith","pith_arxiv_id":"1806.10293","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","venue":"cs.LG","work_id":"9a64fd9b-aa3d-48af-ac99-b368b857a6e0","year":2018},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/1806.10293","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:6911a5516aa36b88516bbdda301c7def2858a25d60a6f787c5579e12d1a43f78","observation_id":"bb9e507e-cf42-4f5c-b0f5-634804e9c5ab","resolution":{"observed_at":"2026-06-27T22:01:20.745662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:e305820863c66e73cdc6a13724cc667672d9ea2b18a86771b6b9b401fc8e2053","observation_id":"3004bb29-fde7-40c0-a8a4-c2a449acc20c","resolution":{"observed_at":"2026-07-02T17:37:14.614096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:64b636e85938e9c1f5e6f0d82ec4855cc61491b4992c6ca7d3acde63a76c5407","observation_id":"7f0660c6-30ee-4e8e-bc1f-ce78cd106158","resolution":{"observed_at":"2026-06-27T22:01:20.770758Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":3,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":5,"verified_exact":27,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2606.07107."}