{"as_of":"2026-08-06T14:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5851e6b784fa21403839577b1c33e0575c40d43aff4157527486a5f5808a541f","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T06:19:36.625269Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.21862/citation-record","integrity":"/paper/2605.21862/integrity","json":"/paper/2605.21862/citation-record.json","paper":"/paper/2605.21862"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:15481390503464a27caf89efef2b71f044b5fcde356be1951bd65df3d8aefccf","observation_id":"1b4af943-3622-40a0-9045-eaaa66aaa8fc","resolution":{"observed_at":"2026-05-22T06:21:10.608332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":"8dd89c5c-960c-4b9d-b0e9-e8f915ca2b8a","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:96b9076b139ee14c4547384e70a33384f59fa96225b31a9617368d72b0818691","observation_id":"41aac3fe-8c8b-4d22-a717-537cb41b89e4","resolution":{"observed_at":"2026-05-22T06:21:11.730016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"04674989-58c3-4c1d-bb06-160b9f530eef","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:269d655e33ace1d4f2161b655bc03acdb35e999d279890c0c0f2d3cfe4327e9c","observation_id":"6321eaad-2be1-4f2b-836f-daf98a98081a","resolution":{"observed_at":"2026-05-22T06:21:11.695330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:a21c1fec85bece9c42d0815657d55319268317540ea51695a05bd470fcb22456","observation_id":"9c9e8924-05c9-4d17-a779-44fcf326b546","resolution":{"observed_at":"2026-05-22T06:21:10.594971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"b6f54c38-db86-4fe5-8883-1451093d6abb","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:b5b9e3de5b0db04f0a80b4fa2dc62b4eabb94a2ad2e265f7388c22f6098c7abd","observation_id":"f34672aa-8a32-4f77-8f47-a7b48fc17bcf","resolution":{"observed_at":"2026-05-22T06:21:11.683633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.11478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:39:37.125714Z","title":"Embodied-SlotSSM","venue":null,"work_id":"a927a628-3962-4885-b681-0b7de34ea9f1","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:b3b55d131550efacc13f52d362013ba8ea0d303edc608933aae7bfce5e202967","observation_id":"9c43ed15-875c-477e-9062-228970b3fb27","resolution":{"observed_at":"2026-05-22T06:21:10.430495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tenenbaum, Dale Schuurmans, and Pieter Abbeel","venue":null,"work_id":"a052d1e8-3f8f-49dc-9808-eebd1b42ddec","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:f3d9f037ef5093ebcb77adcdd8c1f1963d4cc1007700a0b003f79762b03079d4","observation_id":"787d98c8-0caf-436a-96cb-99c83ea64977","resolution":{"observed_at":"2026-05-22T06:21:11.699157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RVT: Robotic view transformer for 3d object manipulation","venue":null,"work_id":"89618803-8ce6-428c-b4f8-29b448002e97","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:8ac6dc6643f7a6c68245c841a621e404ecabb027c99551089cc05e7d23c41b3f","observation_id":"547833f9-5ab7-49e8-aa61-ffba752bf852","resolution":{"observed_at":"2026-05-22T06:21:11.679878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08545","last_updated":"2024-06-12T18:00:01Z","snapshot_observed_at":"2026-07-06T18:29:53.755897Z","submitted_at":"2024-06-12T18:00:01Z","title":"RVT-2: Learning Precise Manipulation from Few Demonstrations","version":1},"cited_work":{"arxiv_id":"2406.08545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08545","snapshot_observed_at":"2026-07-04T11:09:47.137557Z","title":"RVT-2: learning precise manipulation from few demonstrations","venue":null,"work_id":"88df1da8-0634-4e47-898e-14226fa69a01","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2406.08545","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:ffc38b808d047d0d993785134f8823434b19197769474e0d7318de56e8a221f7","observation_id":"890f44b6-bd64-44d4-98ae-386abc5485fd","resolution":{"observed_at":"2026-05-22T06:21:10.571277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:4c26db8da5bddda583c70cb72af73fb52057c53d519adbc1def2081173e4faaf","observation_id":"1f7d4da7-e2ce-4d8c-bc68-2d3a8d95bfc4","resolution":{"observed_at":"2026-05-22T06:21:10.496219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":"2412.14803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-10T12:47:05.518340Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","venue":"cs.CV","work_id":"62dbe235-8473-4190-8686-17e7437de50f","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:12e795efdf14ed618aecac1b15d6b5cbba97a261f3225b543a03dbae464a6b30","observation_id":"d62711b2-fdd5-432f-9682-ce01363f15d2","resolution":{"observed_at":"2026-05-22T06:21:10.466796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-06T11:26:06.418969Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"cited_work":{"arxiv_id":"2509.00576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.00576","snapshot_observed_at":"2026-07-08T07:14:45.460259Z","title":"Galaxea open-world dataset and G0 dual-system VLA model","venue":"cs.RO","work_id":"568af32f-f647-4c11-a106-65ddfa305082","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2509.00576","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:a34d6c3a2a5cf2753d2f79b83c0c30e55cd1cbfce917f8176283c17ed200ad48","observation_id":"58331888-189e-430c-a99a-e94316e8943f","resolution":{"observed_at":"2026-05-22T06:21:10.461423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:52885d3c1352a4c4491ba0590c0bc000221dae331ec70cdd5395746a8d2ffa0c","observation_id":"269d1c92-213f-489c-af37-210e436168df","resolution":{"observed_at":"2026-05-22T06:21:10.446926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tenenbaum","venue":null,"work_id":"fb5bf5e3-6dfc-4365-b901-6201dea767ad","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:7f5a595eb4924fa5a2f92fa17c54c58b96880f567437f936444bf74e003600e6","observation_id":"7be3712a-c6bc-47dd-8b30-9a7d870055d8","resolution":{"observed_at":"2026-05-22T06:21:11.722533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00695","last_updated":"2026-04-15T17:01:03Z","snapshot_observed_at":"2026-08-02T05:56:54.763312Z","submitted_at":"2025-10-01T09:15:52Z","title":"HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy","version":3},"cited_work":{"arxiv_id":"2510.00695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00695","snapshot_observed_at":"2026-07-10T23:37:42.713726Z","title":"HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy","venue":"cs.RO","work_id":"4a945e96-4e00-4739-9671-ddd02c7f5cfa","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2510.00695","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:c9426af171cc98ec2587c0c8d5f84ccc7de27830a8a4b2d203753dce50170493","observation_id":"e237c64d-1304-4124-839e-68cae4e12638","resolution":{"observed_at":"2026-05-22T06:21:10.601738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09756","last_updated":"2024-06-14T06:46:30Z","snapshot_observed_at":"2026-08-05T10:08:23.730170Z","submitted_at":"2024-06-14T06:46:30Z","title":"Grounding Image Matching in 3D with MASt3R","version":1},"cited_work":{"arxiv_id":"2406.09756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09756","snapshot_observed_at":"2026-07-03T15:08:32.534743Z","title":"Grounding image matching in 3d with mast3r","venue":null,"work_id":"bc219327-fe47-4a7d-b2de-43dd11edecd2","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2406.09756","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:78b3e75f17381344a8d4b28a53eb3b25e509b5e4d0c6e929f44910b121203bbf","observation_id":"3517652f-03e1-4d0e-b3fe-fa357c5bec38","resolution":{"observed_at":"2026-05-22T06:21:10.565270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.394965Z","title":"Spatial forcing: Implicit spatial representation alignment for vision- language-action model","venue":null,"work_id":"0de0fc11-052f-4fee-af32-850d60b54a52","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:c025e9a9b7ff921a8d53b1c1fadc21696902b3a4bd35c0d64d6341508b5fd466","observation_id":"d02ce6f4-6bcd-4fea-99f9-6b1a3edc0caf","resolution":{"observed_at":"2026-05-22T06:21:10.424582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3DS-VLA: A 3d spatial-aware vision language action model for robust multi-task manipulation","venue":null,"work_id":"475322d7-b598-4c1a-85fc-0b836dadd1e1","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:af04b0763694c149b1895960ce18317520317f2f992602171503b913870a7dd3","observation_id":"472685a3-1123-4af7-8378-e0579f1e9710","resolution":{"observed_at":"2026-05-22T06:21:11.725971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-05T03:01:04.996856Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.14836","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14836","snapshot_observed_at":"2026-07-02T06:36:44.054110Z","title":"QDepth-VLA: Quantized depth prediction as auxiliary supervision for vision-language-action models","venue":"cs.CV","work_id":"3a7cb628-5f74-4a22-ba4f-f6b954b37010","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2510.14836","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:46525c9bde00d7768a74c01d99d7cce76a3ff240666fe43c15ab481dc3b1685c","observation_id":"88162eca-9fb0-4881-8637-1cb534b1082c","resolution":{"observed_at":"2026-06-10T02:11:41.992691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2512.09928","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09928","snapshot_observed_at":"2026-07-10T23:37:42.946031Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","venue":"cs.RO","work_id":"ab5475cd-79c5-4c4b-995e-0c61ba1e8143","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2512.09928","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:ab093785727330facc09f233fb917925b9fbb3c95ba24854e0085a066c1cda61","observation_id":"acdc685e-6e97-44f7-a8ff-508261dc1bbb","resolution":{"observed_at":"2026-05-22T06:21:10.501618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:22.523881Z","title":null,"venue":null,"work_id":"152db407-f03e-4e13-b0d4-21b4fd6cdacc","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:98085d676f07a0803d425989bdd2cd62f836215cfed1c769665612718b68eade","observation_id":"0ca4ce47-d39e-4fd4-b2aa-e2506905621f","resolution":{"observed_at":"2026-05-22T06:21:11.691373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":"2410.07864","doi":"10.48550/arxiv.2410.07864","metadata_source":"pith","pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","venue":"cs.RO","work_id":"12319725-bc7d-4c32-a229-ad270a7460bc","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:3f24d25e8ab1ce298823935d97d2f70595c6952dbf001f3a0e03797ab19eb36f","observation_id":"ac988911-b83c-4a8c-808a-b02abb33336a","resolution":{"observed_at":"2026-05-22T06:21:10.436146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"e11482ac-ad7e-4c34-bcfb-f78713a86f66","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:7ca626c32385b55ff74d16e910375edb0fc6f610e2fe8b129fee99243b2402f3","observation_id":"d22eaa47-ad22-4abd-92e8-fe05abb6e1d7","resolution":{"observed_at":"2026-05-22T06:21:11.703305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08321","last_updated":"2024-07-18T04:45:47Z","snapshot_observed_at":"2026-07-06T17:43:48.464015Z","submitted_at":"2024-03-13T08:06:41Z","title":"ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2403.08321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08321","snapshot_observed_at":"2026-07-02T11:06:52.495304Z","title":"Mani- gaussian: Dynamic gaussian splatting for multi-task robotic manipulation","venue":null,"work_id":"8ce35436-5552-4b98-bb80-31cabfb5439d","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2403.08321","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:a6d2f50faf2cbc788f061ebf7cee06a725cc8d2cc7cf4bab220d21c563b57dc8","observation_id":"c281c2df-4646-4c05-868b-6901462a7856","resolution":{"observed_at":"2026-05-22T06:21:10.478952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02920","last_updated":"2025-04-16T17:31:39Z","snapshot_observed_at":"2026-07-06T19:10:34.393689Z","submitted_at":"2024-09-04T17:59:52Z","title":"RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)","version":3},"cited_work":{"arxiv_id":"2409.02920","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.02920","snapshot_observed_at":"2026-06-29T17:23:44.895969Z","title":"RoboTwin: Dual-arm robot benchmark with generative digital twins","venue":null,"work_id":"4083e7d6-a2ac-4347-8dae-fed378b42744","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2409.02920","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:aea422952c664a55f3b000f36d0050dd8868db4528edf5ccd9a43abcf5550447","observation_id":"8e5ad554-843e-47de-9721-19f2ee3f4dda","resolution":{"observed_at":"2026-05-22T06:21:10.491006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:7bf153c2718c92353a80f03280cc22a1a87c85b5c69c312b1102b977d3ecd09c","observation_id":"e78f844a-9646-42d4-857a-dcbb3e0cd5d6","resolution":{"observed_at":"2026-05-22T06:21:10.559150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07503","last_updated":"2024-06-28T21:56:25Z","snapshot_observed_at":"2026-08-03T03:05:11.541168Z","submitted_at":"2024-05-13T06:53:42Z","title":"Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation","version":2},"cited_work":{"arxiv_id":"2405.07503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.07503","snapshot_observed_at":"2026-07-04T09:19:43.439393Z","title":"Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation, June 2024","venue":null,"work_id":"0c91f4bb-d262-450d-947a-97b9b6f11037","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2405.07503","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:3e1195cf85fdcb31c7cfbb7eba6b73fe0b9a206dacb69e16b97074125bfa4fee","observation_id":"0cecc5cd-f439-41cd-98aa-b64294b6fe75","resolution":{"observed_at":"2026-05-22T06:21:10.547729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:def875acfc6c43ec0618ba593759f28cabd15d19a0a07e346d5a0ece29597c47","observation_id":"96f59bfe-79a7-4bbf-bf34-17f734923c11","resolution":{"observed_at":"2026-05-22T06:21:10.576633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LingBot-Depth: Masked depth modeling for spatial perception","venue":null,"work_id":"bc1d0bd8-744f-4393-8045-e058a1b3f440","year":2026},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:4b1c28ff3ae8718c7b7d3062057cf2b2c7bb4d813bc44e614de4f2af60c30aba","observation_id":"d887257e-67bf-484a-9866-0ce9d80db026","resolution":{"observed_at":"2026-05-22T06:21:11.707248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2508.19236","doi":"10.48550/arxiv.2508.19236","metadata_source":"pith","pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"921d4c77-1e8b-489d-987a-1c0c990e5ce8","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:cd3703cd3dea97fb1460510bdc17c4210746101be60d7e069e981fd98253bb62","observation_id":"a3ee32f6-99ec-454d-a117-600dc8fd5af0","resolution":{"observed_at":"2026-05-22T06:21:10.524426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceiver-actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":"186f054b-5e7d-4ad5-b184-625acb018cb0","year":2022},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:b0ffbfe59c41a048b09512bb12f70002bfcab71ed29261de206cf89f7dee2c97","observation_id":"12e7e65e-93f3-4bb5-8f2b-5226cc30d3fc","resolution":{"observed_at":"2026-05-22T06:21:11.687414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.17895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.200325Z","title":"Masked depth modeling for spatial perception","venue":null,"work_id":"6d4dd327-8cbb-4f65-9e5d-05dede7aa19f","year":2026},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:648316400996912c76e8a7f9e03b386c388e2e5a9d67e83aede0479a190932b3","observation_id":"578df43c-2afb-47ab-92c1-72d2621b825b","resolution":{"observed_at":"2026-05-22T06:21:10.518794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20537","last_updated":"2024-09-30T17:39:41Z","snapshot_observed_at":"2026-08-06T05:51:58.189896Z","submitted_at":"2024-09-30T17:39:41Z","title":"Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers","version":1},"cited_work":{"arxiv_id":"2409.20537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.20537","snapshot_observed_at":"2026-07-10T18:47:31.692653Z","title":"HPT: Scaling proprioceptive-visual learning with heterogeneous pre-trained transformers","venue":"cs.RO","work_id":"e4234afa-03a8-4242-b9eb-38020b653cd2","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2409.20537","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:8cf852a0bf9c9ae3ab2c17883545f91261a55c7cf81715ca2ad39b79aa114f72","observation_id":"1faea9da-a788-4ede-8cad-2fbd5945db07","resolution":{"observed_at":"2026-05-22T06:21:10.589464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12387","last_updated":"2025-01-21T18:59:23Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:59:23Z","title":"Continuous 3D Perception Model with Persistent State","version":1},"cited_work":{"arxiv_id":"2501.12387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12387","snapshot_observed_at":"2026-07-01T19:16:00.367749Z","title":"Continuous 3d perception model with persistent state","venue":null,"work_id":"8d986612-4394-40fe-9f03-67dc1da1fad8","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2501.12387","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:55c7e3e5283b944718ac997eb58732970fb49ac445eb968c3f62a2a34a0f0c10","observation_id":"135b38bf-bec1-4d3a-b423-7176233ac7b9","resolution":{"observed_at":"2026-05-22T06:21:10.472626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DUSt3R: Geometric 3D vision made easy","venue":null,"work_id":"70837b4b-b107-490e-98b1-3ccf7346ae00","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:a45b493f12017761d57ec5b7095e6c1771ff8702ab08099cce75025bcbe420ac","observation_id":"b0fee89f-9cce-4e95-a2b9-5bdbb17ca504","resolution":{"observed_at":"2026-05-22T06:21:11.710952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"π3: Permutation-equivariant visual geometry learning","venue":null,"work_id":"dd5ead6e-2354-4f55-89d0-a4eaed8b5dcb","year":2026},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:9f5f2b8c013cdbcfaef88b226701637127783baedcd863d32f285fa6cc8f70f6","observation_id":"0abca758-46eb-4a5b-879b-d6435cfb7421","resolution":{"observed_at":"2026-05-22T06:21:11.715360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":"2401.00025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-07-10T18:47:31.639635Z","title":"Any-point Trajectory Modeling for Policy Learning","venue":"cs.RO","work_id":"0c843c6a-ce05-4ca4-992b-e25516f490db","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:42ea17abbbf35105787c4326ce5567348526349706158a8d75b23143b8e1961f","observation_id":"479f12e8-81d6-49ad-afc0-cbe64a856f4c","resolution":{"observed_at":"2026-05-22T06:21:10.541114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2312.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-07-04T21:00:09.556391Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","venue":"cs.RO","work_id":"e92c2c13-4330-45fe-8231-34a6002626bd","year":2023},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:7388df04408b1b8b7447ff4d9e3959b629a80208715df32d0a4dc19b0a7df350","observation_id":"2cd015e3-e856-4b58-9457-904d05bbcd49","resolution":{"observed_at":"2026-05-22T06:21:10.535310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Day- Dreamer: World models for physical robot learning","venue":null,"work_id":"7b56ed91-b6e2-4f90-876d-c093b3d3969a","year":2022},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:6ac926afd478756097f8cc67969b716ab5ea7c3bf4acfec02ceeee87bada9fbd","observation_id":"b305d754-4fcd-4bd4-b506-59363a0340e4","resolution":{"observed_at":"2026-05-22T06:21:11.719057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":"2601.18692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-07-10T07:26:54.460833Z","title":"A Pragmatic VLA Foundation Model","venue":"cs.RO","work_id":"9b5a37fb-5c5d-4fbb-a804-d518173f2011","year":2026},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:c9403e9c2ed3ab03545226340edda3a8b4d397a2fcf4f1c342ee078e38197772","observation_id":"65d13b52-8b43-4fbd-ba34-c742cb265758","resolution":{"observed_at":"2026-05-22T06:21:10.529535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-05T07:51:27.008234Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"cited_work":{"arxiv_id":"2511.18960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18960","snapshot_observed_at":"2026-07-10T10:07:00.768440Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","venue":"cs.LG","work_id":"22f868eb-7b0a-4d8c-a030-4c8faf138b90","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2511.18960","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:518cfa1eae6bfd826aca7f0b4faaf7f665cc96c2c3cb0d39e2b5d6d4a15671e7","observation_id":"bf068ccd-44a0-49f5-9a66-38f6484c1cff","resolution":{"observed_at":"2026-05-22T06:21:10.512927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":"2403.03954","doi":"10.48550/arxiv.2403.03954","metadata_source":"pith","pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","venue":"cs.RO","work_id":"bded01e1-c070-4537-a75a-ace4c75d0c95","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:8c4ba57254e921e80a240f3ee0bc2843986e91382825d5189abc76fbd3104c7f","observation_id":"f30414af-78cd-4bf0-a9a4-5e3dcc8270ec","resolution":{"observed_at":"2026-05-22T06:21:10.484831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:e1c226ab522e03f39d95d52b8a0133ffd49f71d84d3982a1522827d314e1934d","observation_id":"a7ccadef-7dfe-4e6e-8a80-ae221c8a6dec","resolution":{"observed_at":"2026-05-22T06:21:10.582695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":"2412.10345","doi":"10.48550/arxiv.2412.10345","metadata_source":"pith","pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","venue":"cs.RO","work_id":"56a1dd5b-7094-408b-8742-b80a424a62bb","year":2024},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:aaa47edd20b4d77443586c079151e450df1db62e972523915a99f2692b6afcb0","observation_id":"fef3418d-5137-47cb-b0f4-afc761ec4358","resolution":{"observed_at":"2026-05-22T06:21:10.553383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":"2505.15659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-07-10T12:47:05.520966Z","title":"FLARE: Robot Learning with Implicit World Modeling","venue":"cs.RO","work_id":"0734908a-7122-4eeb-ba5d-944092bb8897","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:4701603c60e1ff4f909f1a1ff0a9b4eaa54b21c7f680c33fa76f556aa3a05b45","observation_id":"b3fcbc44-cc6d-46b5-937e-7c36c648c063","resolution":{"observed_at":"2026-05-22T06:21:10.441559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.17199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VLA-4D: Embedding 4d awareness into vision- language-action models for spatiotemporally coherent robotic manipulation","venue":null,"work_id":"e55dd65f-f152-44a5-bb74-89cb1ea63d56","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:068aa55c182baf913a93bd99259f500454ad005072a5168a36ec4148688243aa","observation_id":"ef1d76e6-e3de-470d-bd0c-f96496c23003","resolution":{"observed_at":"2026-05-22T06:21:10.453584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":31,"verified_fuzzy":13},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2605.21862."}