{"as_of":"2026-08-12T11:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e8d731f6496cdaa2f283a0ef56d35b73c2c81ccca3fabb1b60b92fefdd8a16d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":55,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:35:33.987020Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T04:16:48.663138Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:5163f6ea706270039b974318b22fe29516d94b4c0ab157b4483139d127b556c2","observation_id":"740f90a9-fd72-4524-a61a-0cb9f27d7acf","resolution":{"observed_at":"2026-05-24T01:25:54.573510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-05T20:32:47.040368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.040368Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:963889d6c26483abd5815a51f674c87e7aeb3f70ab4dad9435fc7ff1beb4897d","observation_id":"35480d38-3d8d-435c-a75a-6db8a4a4b601","resolution":{"observed_at":"2026-08-05T20:32:47.040368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:d97311ae8393d2892a6d2fe8e873e2a09ff85c562ea712a4a2904ee21ac007b2","observation_id":"2d23d0d7-e8a3-41e0-bbc4-277c8bdf65e2","resolution":{"observed_at":"2026-05-17T20:28:16.143162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-05T17:12:57.859388Z","title":"Unified vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16943","last_updated":"2026-07-07T19:32:44Z","snapshot_observed_at":"2026-08-07T11:49:52.809585Z","submitted_at":"2025-08-23T08:23:14Z","title":"LHM-Humanoid: Long-Horizon Human Motion Control for Continuous Object Transport in Cluttered Scenes","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:12:57.859388Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2508.16943"},"observation_digest":"sha256:f3ca90dad0bc20cf62c2099944dc5e40d1067a8d8105f5c58c5db0f257720c85","observation_id":"cb223d44-20aa-48b3-af85-73896e5f6ff4","resolution":{"observed_at":"2026-08-05T17:12:57.859388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T12:42:46.978148Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2509.06951"},"observation_digest":"sha256:c56755d2db1c3809c80f9325a5f2da3f56f77b010d17e66d02d702f3adf43005","observation_id":"2ec0e7ea-4a8b-4ff6-b753-ca79fcb00ab2","resolution":{"observed_at":"2026-05-16T12:42:47.075327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:b150395343c34a4cc4915f358744c1d1cea7ef8c1701e282b7deae3775dab31f","observation_id":"4044bc7b-f83c-48b7-8182-ae80c3942219","resolution":{"observed_at":"2026-05-14T20:09:40.041366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-04T09:08:13.692307Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:13.692307Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:0fbc96b02d481caced97b808238da9eb8aa37672478791fdad00277ff4f14b69","observation_id":"7a4cab14-b8d7-443e-8de5-6a34809b66cf","resolution":{"observed_at":"2026-08-04T09:08:13.692307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-11T21:22:03.633630Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:aa53fc44fc218227f4a153a2388e63c7cf9af20b151313c786a6449fbe632899","observation_id":"c4569fcf-d0ab-4f00-9262-a77197c27da2","resolution":{"observed_at":"2026-05-17T06:29:09.967252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-03T20:32:29.361062Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19433","last_updated":"2026-05-29T16:37:52Z","snapshot_observed_at":"2026-08-08T17:47:52.404594Z","submitted_at":"2025-11-24T18:59:51Z","title":"Mixture of Horizons in Action Chunking","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:32:29.361062Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2511.19433"},"observation_digest":"sha256:ab86ef0b7080d33f04629e300b8068cf88e969c51cef22d42b55fe8480c16aae","observation_id":"83fcaaeb-26c8-4395-90d0-f07501b58f5c","resolution":{"observed_at":"2026-08-03T20:32:29.361062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-08-11T00:28:59.148492Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T23:01:13.910539Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2512.09928"},"observation_digest":"sha256:311b8676355889b4163b6d96c1bc8465fbe3788e0c9fc274ba14cbabbd4d3be5","observation_id":"7b6fea4d-07a6-4972-92d1-cbe45c9df9aa","resolution":{"observed_at":"2026-05-16T23:01:20.332076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T13:53:52.188890Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2601.21998"},"observation_digest":"sha256:238789060e124e794bbc948472536b11a854a88e855ebfd4b33872cfdbc292c2","observation_id":"e3b59dde-b461-40da-b899-03f301ec01a7","resolution":{"observed_at":"2026-05-12T13:53:52.389656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-03T04:23:45.812263Z","title":"Unified vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05233","last_updated":"2026-06-26T06:02:43Z","snapshot_observed_at":"2026-08-05T00:47:39.586138Z","submitted_at":"2026-02-05T02:49:52Z","title":"MobileManiBench: Simplifying Model Verification for Mobile Manipulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T04:23:45.812263Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2602.05233"},"observation_digest":"sha256:61012a05b11db55dc3f8f46064069d38967703d3dd71eb1f2678a7186d588be8","observation_id":"290bd683-3ae9-4992-81a2-33e6ab46285a","resolution":{"observed_at":"2026-08-03T04:23:45.812263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-02T22:14:30.135571Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-11T12:44:14.562608Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:30.135571Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:3710e726d889fb9068d2d182fe827db085a5d2aaf722da1525c724b9f1b9999b","observation_id":"60360840-9f9a-46e7-bb28-410e232a71ad","resolution":{"observed_at":"2026-08-02T22:14:30.135571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2603.00110","last_updated":"2026-04-23T12:54:44Z","snapshot_observed_at":"2026-08-10T22:29:48.430468Z","submitted_at":"2026-02-18T14:58:18Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T21:22:41.935691Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2603.00110"},"observation_digest":"sha256:05e11ce5cac838ac1754f240fd1719d340933b83666b9309de8465d365802488","observation_id":"1394df3e-c321-4484-8a4e-b39177d036cd","resolution":{"observed_at":"2026-05-15T21:30:20.954689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-02T19:35:38.523434Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01766","last_updated":"2026-05-27T06:18:12Z","snapshot_observed_at":"2026-08-07T22:53:12.657766Z","submitted_at":"2026-03-02T11:48:24Z","title":"Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T19:35:38.523434Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2603.01766"},"observation_digest":"sha256:273c681c2332f5ead2e776626cdf27a11cb86d3b473a29fbda4d9d3df28c26e4","observation_id":"d04fda09-55f1-434f-8131-9139b03cbe07","resolution":{"observed_at":"2026-08-02T19:35:38.523434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-15T13:48:22.524177Z","title":"Unified vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06480","last_updated":"2026-06-25T16:53:18Z","snapshot_observed_at":"2026-08-09T21:45:34.699638Z","submitted_at":"2026-03-06T17:03:16Z","title":"History-Conditioned Spatio-Temporal Visual Token Pruning for Efficient Vision-Language Navigation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-15T13:48:22.524177Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2603.06480"},"observation_digest":"sha256:eebe74adda4fa7b5471554634ff449353462fc87f84c319fc838d748e9d3e184","observation_id":"133f9c06-ab77-4dcd-8a2e-422ef9694f65","resolution":{"observed_at":"2026-07-15T13:48:22.524177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-08-11T09:31:44.872758Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:134569cfbba64a6296253d4d2f928d12a4a8cffb834002b4cff3bef2428c1dcd","observation_id":"c7bcba76-6aee-4ecf-aa5d-2dfe5acc0bf6","resolution":{"observed_at":"2026-05-11T21:41:17.572350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T10:40:04.767657Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2604.26694"},"observation_digest":"sha256:4cd9e968d4c52bd3d23f53e2d08b973811bd91fdeac8450d6b16564cc36d451c","observation_id":"7a5dfea7-4534-44d5-821d-af2a7f0a68b6","resolution":{"observed_at":"2026-05-12T09:31:26.384271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T03:20:04.435904Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2604.26694"},"observation_digest":"sha256:4579f6fca409b5fdceabba334bf56453dd005727b12b1b73b66924221d2e7d6f","observation_id":"89faec9a-5620-4c9d-be02-6942e9af5b20","resolution":{"observed_at":"2026-05-11T22:11:12.234668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.00438","last_updated":"2026-05-01T06:15:43Z","snapshot_observed_at":"2026-08-11T01:06:59.009953Z","submitted_at":"2026-05-01T06:15:43Z","title":"Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T19:51:05.220627Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.00438"},"observation_digest":"sha256:ee4b5ebdc6f9e9974720c027787eda9bc3b7e375266d66ab09bcf3b0023ea202","observation_id":"598b4953-0f3a-4c91-b086-01c75764fc8b","resolution":{"observed_at":"2026-05-11T15:31:07.202750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-07T16:06:10.595164Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:73ad2c4c6d81853f25f2589839e31a49f5dbdad6914ad017c06149eebc423604","observation_id":"777055cf-9ac9-48db-a2c4-5098a9a3d26e","resolution":{"observed_at":"2026-05-12T10:51:30.868908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-08T19:02:19.756092Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:d7dad1a3d1b5e7c4ab1ce797453861241d99e988d18041692cdd5ed95bb5b113","observation_id":"cd6730fa-b2b6-4168-87df-a0da8ee9ca5a","resolution":{"observed_at":"2026-05-09T06:05:34.928333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.06481","last_updated":"2026-05-07T16:06:08Z","snapshot_observed_at":"2026-08-11T07:38:44.239882Z","submitted_at":"2026-05-07T16:06:08Z","title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-08T08:52:07.545191Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.06481"},"observation_digest":"sha256:2f9634a5083a3ebd75c27796d7229d4a345cf3460e479b60efc065a53980b806","observation_id":"3801cb71-65e2-46bc-8bd0-82fb2858dfe2","resolution":{"observed_at":"2026-05-11T20:31:11.089901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.08215","last_updated":"2026-06-04T07:39:54Z","snapshot_observed_at":"2026-08-11T00:43:54.510228Z","submitted_at":"2026-05-06T11:21:25Z","title":"Test-Time Training for Visual Foresight Vision-Language-Action Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T01:33:30.939425Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.08215"},"observation_digest":"sha256:e5bb06ee1ec7485954b4215b9644196f613c03cea3d10fcb086856524919fd2a","observation_id":"a146e105-e257-450b-bd03-d69e71862306","resolution":{"observed_at":"2026-05-12T07:51:48.668131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.08215","last_updated":"2026-06-04T07:39:54Z","snapshot_observed_at":"2026-08-11T00:43:54.510228Z","submitted_at":"2026-05-06T11:21:25Z","title":"Test-Time Training for Visual Foresight Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T00:17:58.955835Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.08215"},"observation_digest":"sha256:5d3c4e189bc6c013cee0a94d28a93c3e618b6b61da263bbfd58d594f628580ad","observation_id":"8ae03021-5ce3-4e7f-8c2b-4c6594346514","resolution":{"observed_at":"2026-07-01T00:25:09.775680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.13632","last_updated":"2026-07-21T08:04:45Z","snapshot_observed_at":"2026-08-02T14:10:02.956697Z","submitted_at":"2026-05-13T14:58:29Z","title":"Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:31:09.883545Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.13632"},"observation_digest":"sha256:a485f77feee36fd76e53ba5084f64f7498512eabc03b77263dda54043ec586d0","observation_id":"053bd747-96f1-4063-b084-19f93aeab42e","resolution":{"observed_at":"2026-05-14T18:32:34.405866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-02T14:10:07.016537Z","title":"arXiv preprint arXiv:2506.19850 (2025) 9","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.13632","last_updated":"2026-07-21T08:04:45Z","snapshot_observed_at":"2026-08-02T14:10:02.956697Z","submitted_at":"2026-05-13T14:58:29Z","title":"Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T14:10:07.016537Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.13632"},"observation_digest":"sha256:98a3ebcc098b5cf63ae27f386d52e769cca49f7ee2da320f1ab9c3a0b73c51dc","observation_id":"49cd27f8-16ba-4051-82a3-d5fb648e8d3e","resolution":{"observed_at":"2026-08-02T14:10:07.016537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.14696","last_updated":"2026-05-14T11:12:23Z","snapshot_observed_at":"2026-08-11T20:33:14.733871Z","submitted_at":"2026-05-14T11:12:23Z","title":"EponaV2: Driving World Model with Comprehensive Future Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T05:14:28.714494Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.14696"},"observation_digest":"sha256:ecd308c5ce0124b5b884c9c7f8a12308eeaf6dfd0b77b7380c0811089345a4c7","observation_id":"5bda2089-fd48-483b-9c49-b3b519d8bc53","resolution":{"observed_at":"2026-05-15T05:15:02.541356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.15120","last_updated":"2026-05-15T11:07:11Z","snapshot_observed_at":"2026-07-31T03:54:36.293193Z","submitted_at":"2026-05-14T17:32:18Z","title":"CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T20:57:06.455108Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.15120"},"observation_digest":"sha256:2dd0ab6c6053d05ee0c87f68b8621f025513f71fa5e0f91efb8261e8be099205","observation_id":"0abff421-cff0-4b99-8fbe-300cd05bce3e","resolution":{"observed_at":"2026-05-20T20:59:01.691669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:5fd17032c62b38c6d36c4d70e7963cae3b2df79b4d597575c7c393da890d387d","observation_id":"8d9aed89-8314-4974-815b-6ecdb9d97484","resolution":{"observed_at":"2026-05-20T04:53:04.974302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.23270","last_updated":"2026-05-22T06:17:35Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T06:17:35Z","title":"ChainFlow-VLA: Causal Flow Planning with Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T04:37:56.487048Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.23270"},"observation_digest":"sha256:dd6e218aa8ecd19352037385dda7288988dafd7a0cf9c4a25c2c63817a8f2ffa","observation_id":"ea7158fc-6c61-4ae3-80f8-d051d1b3c218","resolution":{"observed_at":"2026-05-25T04:40:23.842498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.23856","last_updated":"2026-05-22T17:08:37Z","snapshot_observed_at":"2026-07-06T23:33:59.210165Z","submitted_at":"2026-05-22T17:08:37Z","title":"Point Tracking Improves World Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T03:51:10.921839Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.23856"},"observation_digest":"sha256:fd0d0d53c50664522d4c5c5fe048c124d432e30636cae1b04c1e4db2f537b01a","observation_id":"dbba18dc-66ca-4180-bd02-66cb42fef98a","resolution":{"observed_at":"2026-05-25T03:56:37.138179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.25829","last_updated":"2026-05-25T13:28:33Z","snapshot_observed_at":"2026-08-02T07:58:35.491806Z","submitted_at":"2026-05-25T13:28:33Z","title":"OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T21:27:26.682689Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.25829"},"observation_digest":"sha256:96c72935a93ed89184b8da7699e462108b70d4bd8701134b08a22e594916702b","observation_id":"023294ce-a3c6-4703-bb55-836769d19cf3","resolution":{"observed_at":"2026-06-29T21:33:59.302091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:0f8f1d2ce08341c3e1accbd2dbd14b06171a5dbabb1a7ed79842dccbfd8f0f74","observation_id":"c087c14f-7309-451f-ab3e-31e832e2427d","resolution":{"observed_at":"2026-06-29T13:43:28.871097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.00110","last_updated":"2026-05-27T03:38:15Z","snapshot_observed_at":"2026-08-06T22:19:24.528783Z","submitted_at":"2026-05-27T03:38:15Z","title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-06-29T13:33:03.368006Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.00110"},"observation_digest":"sha256:6acd203ac1d6e312835dc36e3cc44d790536ffd1a5cc344ec2b8e3de25859f0b","observation_id":"01ab5dfb-8e37-4b87-987f-45a99ffe4a0b","resolution":{"observed_at":"2026-06-29T13:33:27.830310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.01241","last_updated":"2026-06-02T03:11:27Z","snapshot_observed_at":"2026-08-07T02:28:05.002889Z","submitted_at":"2026-05-31T13:43:23Z","title":"OneVLA: A Unified Framework for Embodied Tasks","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:08.124096Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.01241"},"observation_digest":"sha256:f92751e9c200ce6a62f1a75c2b089871cf30ee3e1b94fd92026e717d1c6ab116","observation_id":"f875f143-b957-43f9-82a7-4df1734eb19e","resolution":{"observed_at":"2026-07-01T21:26:14.048938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.02735","last_updated":"2026-06-08T17:19:24Z","snapshot_observed_at":"2026-08-04T14:14:05.900644Z","submitted_at":"2026-06-01T18:02:07Z","title":"See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T14:04:43.270155Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.02735"},"observation_digest":"sha256:34643bfd3fd62010c100f2f2678be104ebc8b58099ade65341e20cfae2c9274e","observation_id":"1dd09f7c-acf4-452d-9574-ee945187fe57","resolution":{"observed_at":"2026-07-01T23:36:24.018891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.03943","last_updated":"2026-06-02T17:30:50Z","snapshot_observed_at":"2026-08-04T20:12:09.441666Z","submitted_at":"2026-06-02T17:30:50Z","title":"PointAction: 3D Points as Universal Action Representations for Robot Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T10:09:48.280446Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.03943"},"observation_digest":"sha256:cd152ca6f1c5b0a3a8a45cebb7c0305ee4c5a2f4666cf18ea904ad637b76b394","observation_id":"501e6f11-2725-4b97-b708-156fd4598da2","resolution":{"observed_at":"2026-07-02T03:16:34.956886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.05979","last_updated":"2026-06-04T10:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T10:23:01Z","title":"World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T01:05:26.382826Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.05979"},"observation_digest":"sha256:1cc59e7cdc371a2e7f17b21d527861247342a65a115b007d4beba86e34a841b8","observation_id":"df4ccc11-83d6-4e41-b137-b58af8f3162d","resolution":{"observed_at":"2026-07-02T13:46:58.933519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.06245","last_updated":"2026-06-04T14:48:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T14:48:44Z","title":"MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T01:10:20.066545Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.06245"},"observation_digest":"sha256:acb7aae7069e2d893b574c0c8b638be2fc2a2ce3045b9b44efd2d466a9e93c68","observation_id":"187c603b-3dfc-40e3-becf-c82124ea6d0d","resolution":{"observed_at":"2026-07-02T13:36:59.243423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.07170","last_updated":"2026-06-05T11:39:27Z","snapshot_observed_at":"2026-08-07T00:00:02.585695Z","submitted_at":"2026-06-05T11:39:27Z","title":"Test-Time Trajectory Optimization for Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T21:53:02.554405Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.07170"},"observation_digest":"sha256:22cef4124084af4aa17b73c7125a65eb8328ddc6852bc34575b8560ab4db50a5","observation_id":"c40d48a5-4484-48c9-b08c-0b7937045748","resolution":{"observed_at":"2026-07-02T17:47:17.899646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.07895","last_updated":"2026-06-05T23:10:43Z","snapshot_observed_at":"2026-08-06T00:27:16.284109Z","submitted_at":"2026-06-05T23:10:43Z","title":"TBD-VLA: Temporal Block Diffusion Vision Language Action Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T21:49:20.600217Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.07895"},"observation_digest":"sha256:91dfb895949844eb0cf720a72065e847a97b3a55bc43934211900cd1ed275894","observation_id":"6c1ea0c2-47a8-4187-a1ea-dd764e601de9","resolution":{"observed_at":"2026-07-02T18:57:16.673533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-02T11:22:19.744983Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.15587","last_updated":"2026-07-15T04:55:13Z","snapshot_observed_at":"2026-08-07T05:34:11.340890Z","submitted_at":"2026-06-14T04:15:29Z","title":"Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T11:22:19.744983Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.15587"},"observation_digest":"sha256:8a2b25a03027b076605563b0bd7688f33b968206d741f3f7cc7abb2df119941e","observation_id":"1e221957-2a6b-4ecd-b5bb-341d38b16780","resolution":{"observed_at":"2026-08-02T11:22:19.744983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.17937","last_updated":"2026-06-16T13:45:17Z","snapshot_observed_at":"2026-08-05T17:52:24.121984Z","submitted_at":"2026-06-16T13:45:17Z","title":"ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T00:51:05.494085Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.17937"},"observation_digest":"sha256:8b4acd1b73f7529fa49925ad4ed1ea00d7bf9c8756a8bc4a20306be5f09b43e0","observation_id":"480057ea-12ef-494b-8d7a-29072ff6bc27","resolution":{"observed_at":"2026-07-03T21:08:58.672755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-08-11T12:40:35.808331Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:8cbc3e613a8f90e19c781b62c92f0745d24f07a633d1d28b46ba91b36a5acbde","observation_id":"c25c564c-8273-4211-9a7e-a372c55ad769","resolution":{"observed_at":"2026-07-04T00:39:17.478757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.20999","last_updated":"2026-06-19T00:19:53Z","snapshot_observed_at":"2026-08-02T02:39:42.396834Z","submitted_at":"2026-06-19T00:19:53Z","title":"Inductive Generalization for Robotic Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T14:52:15.202629Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.20999"},"observation_digest":"sha256:ba0f9e6eddc15bf6618a546d25875c941a1f57a334b46393507190db617cad93","observation_id":"2ab186b7-f130-47a7-bc97-51d946774f12","resolution":{"observed_at":"2026-07-04T06:09:36.791150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-08-10T23:41:47.312099Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:6a22882f0120828df31d4e588c88a38bca73d9d54b3dd4f7a3795fb6d6df5335","observation_id":"a5102fc2-e695-4665-8e37-989022e009ae","resolution":{"observed_at":"2026-07-04T06:29:37.521710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Unified vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:90159a7dbb4bcf10a9e704ac99be36d346d3cc4c96b66484a98498f8ced41f46","observation_id":"4f5f818d-5c17-4041-a84e-1a7f4a14072d","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-11T14:23:57.266710Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05468","last_updated":"2026-07-06T07:10:22Z","snapshot_observed_at":"2026-08-12T05:58:00.322849Z","submitted_at":"2026-07-06T07:10:22Z","title":"Learning 4D Geometric Priors for Inference-Efficient World Action Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-11T14:23:57.266710Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2607.05468"},"observation_digest":"sha256:05e59b2b261710553cf8a2c9c1314c992491feb951b856dd6387532e6b54b053","observation_id":"5647610d-2f1d-43ae-b7ce-0f628088b26e","resolution":{"observed_at":"2026-07-11T14:23:57.266710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-07-11T23:20:16.411671Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:7121681f4f83f33e223bb98ad40cc79fa9a62d616c0d3a6786de6181c14906a2","observation_id":"d0a44ef8-cb7c-4f95-afad-eb9faee15b42","resolution":{"observed_at":"2026-07-09T05:36:01.201663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-10T04:12:29.153764Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:3fb4046c57d6072475fd6fe486a900eeef9f4792a1a3c4e081c3ed9460cd7e93","observation_id":"593091f1-a278-4ee3-b6cf-f5cef74062cb","resolution":{"observed_at":"2026-07-10T04:16:48.664420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-02T07:53:43.506974Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:43.506974Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:d07c45f7d53e04e8ef9d1a0db09e5807e42d1cc67c57f5b6e518e889b8a2adc3","observation_id":"53f81131-c0f2-4389-a5d1-33932b1f6dde","resolution":{"observed_at":"2026-08-02T07:53:43.506974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-01T02:21:23.625183Z","title":"The Fourteenth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25487","last_updated":"2026-07-28T09:24:17Z","snapshot_observed_at":"2026-08-10T23:06:58.735363Z","submitted_at":"2026-07-28T09:24:17Z","title":"CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T02:21:23.625183Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2607.25487"},"observation_digest":"sha256:f00a2557aaf7656bcbc1beb045f31d993eef590d47a296a97a81519794e19279","observation_id":"9ebb8a0b-fd17-4ff9-8878-e3d4c6ab1d5c","resolution":{"observed_at":"2026-08-01T02:21:23.625183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-10T10:29:55.335648Z","title":"Unified vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T11:12:56.310231Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.335648Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:5cb66a242c83f9a65d69db9c68ecd5c4d96004fe328ff505c66285fb102fea46","observation_id":"c0d5ca24-f249-4b16-aee9-1bbd471e85db","resolution":{"observed_at":"2026-08-10T10:29:55.335648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-11T00:35:33.987020Z","title":"arXiv preprint arXiv:2506.19850 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07596","last_updated":"2026-08-06T08:12:32Z","snapshot_observed_at":"2026-08-12T10:13:10.247528Z","submitted_at":"2026-08-06T08:12:32Z","title":"LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T00:35:33.987020Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2608.07596"},"observation_digest":"sha256:2276b053093f4b1116e1c003fbe48f8fc72fbf6f8d62d04c20a8fb9ec4a49991","observation_id":"ae01dba0-592c-4607-8fed-b77e1323147c","resolution":{"observed_at":"2026-08-11T00:35:33.987020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19850/citation-record","integrity":"/paper/2506.19850/integrity","json":"/paper/2506.19850/citation-record.json","paper":"/paper/2506.19850"},"outbound":[],"paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 55 inbound Pith citation observations for arXiv:2506.19850."}