{"as_of":"2026-08-04T08:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca426bcfef17675438648a246ca7e409647e20a7781e07589ba87ca8f4be884b","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T13:22:16.242427Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:21:28.231732Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T10:19:47.638604Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2602.20200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.20200","snapshot_observed_at":"2026-07-04T10:19:47.638604Z","title":"arXiv preprint arXiv:2602.20200 , year=","venue":"cs.RO","work_id":"44d84cfb-9409-411b-bf8f-0a41ce79311f","year":2026},"citing_paper":{"arxiv_id":"2605.05126","last_updated":"2026-05-06T16:55:44Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:55:44Z","title":"ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T16:40:19.057979Z"},"links":{"cited_paper":"/paper/2602.20200","citing_paper":"/paper/2605.05126"},"observation_digest":"sha256:af7d17c57841fcaf5df0aefeb81281b8ce4db20c25d24bccc7bdf7231a8c0af8","observation_id":"d64ebffc-673f-48f0-b3af-27509d2fe77b","resolution":{"observed_at":"2026-05-20T00:04:26.381581Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2602.20200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.20200","snapshot_observed_at":"2026-07-04T10:19:47.638604Z","title":"arXiv preprint arXiv:2602.20200 , year=","venue":"cs.RO","work_id":"44d84cfb-9409-411b-bf8f-0a41ce79311f","year":2026},"citing_paper":{"arxiv_id":"2605.10921","last_updated":"2026-05-11T17:54:49Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:54:49Z","title":"RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T03:50:18.706396Z"},"links":{"cited_paper":"/paper/2602.20200","citing_paper":"/paper/2605.10921"},"observation_digest":"sha256:a1f85680b890110531942469b093218e44d089fe567d1e56a3ca277ec46f32e9","observation_id":"c34fc912-f8fd-41a6-af73-f7b58750e817","resolution":{"observed_at":"2026-05-20T00:04:26.381581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2602.20200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.20200","snapshot_observed_at":"2026-07-04T10:19:47.638604Z","title":"arXiv preprint arXiv:2602.20200 , year=","venue":"cs.RO","work_id":"44d84cfb-9409-411b-bf8f-0a41ce79311f","year":2026},"citing_paper":{"arxiv_id":"2606.12497","last_updated":"2026-06-10T13:26:40Z","snapshot_observed_at":"2026-08-02T09:43:06.891977Z","submitted_at":"2026-06-10T13:26:40Z","title":"$\\mu$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T10:50:55.866910Z"},"links":{"cited_paper":"/paper/2602.20200","citing_paper":"/paper/2606.12497"},"observation_digest":"sha256:fbd5ec2a7217eee070f0cbc61877c026a29161ac905e585ce2fe67929377cae7","observation_id":"3cafd5e3-bee0-4479-8b13-815daa6d21a4","resolution":{"observed_at":"2026-07-03T08:17:45.666875Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2602.20200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.20200","snapshot_observed_at":"2026-07-04T10:19:47.638604Z","title":"arXiv preprint arXiv:2602.20200 , year=","venue":"cs.RO","work_id":"44d84cfb-9409-411b-bf8f-0a41ce79311f","year":2026},"citing_paper":{"arxiv_id":"2606.22794","last_updated":"2026-06-22T03:10:19Z","snapshot_observed_at":"2026-08-04T03:01:53.810285Z","submitted_at":"2026-06-22T03:10:19Z","title":"UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T08:57:01.861091Z"},"links":{"cited_paper":"/paper/2602.20200","citing_paper":"/paper/2606.22794"},"observation_digest":"sha256:57fb11ce0c72e95ee413af3b754774f332f911ad156155349ebeb14f6bc2ed70","observation_id":"e51edb37-ed75-4a39-936a-e3de65548c87","resolution":{"observed_at":"2026-07-04T10:19:47.640060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.20200","snapshot_observed_at":"2026-08-01T02:21:28.231732Z","title":"arXiv preprint arXiv:2602.20200 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25487","last_updated":"2026-07-28T09:24:17Z","snapshot_observed_at":"2026-08-03T21:58:14.419860Z","submitted_at":"2026-07-28T09:24:17Z","title":"CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T02:21:28.231732Z"},"links":{"cited_paper":"/paper/2602.20200","citing_paper":"/paper/2607.25487"},"observation_digest":"sha256:69e8d6428fa2c6341c197a2536c85f9bf7877a68b1ace054d0e31c1ae1f2c688","observation_id":"e15d5c37-b752-4ab5-9b42-521937032fc4","resolution":{"observed_at":"2026-08-01T02:21:28.231732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.20200/citation-record","integrity":"/paper/2602.20200/integrity","json":"/paper/2602.20200/citation-record.json","paper":"/paper/2602.20200"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T00:07:42.817654Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:71405e40303c29ecaa7bcbc324bd7a8a635bd4e8d667ae93264a5da12aa0307d","observation_id":"c36938f3-25c1-48c7-bbf1-d04605fb7022","resolution":{"observed_at":"2026-05-21T13:24:11.189417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-07-31T06:28:31.585022Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2410.08001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-07-07T14:03:48.543161Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation.arXiv preprint arXiv:2410.08001","venue":"cs.RO","work_id":"a5778918-075a-4d6c-8034-ef58683350dd","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:5361b2432ebbb277ac6fb2497537f26afd2d024961f9c6da0be7ae4ac0c747bd","observation_id":"cfb9c089-2ee1-4949-a5ad-ebba25ab8930","resolution":{"observed_at":"2026-05-21T13:24:11.205486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":"2505.06111","doi":"10.48550/arxiv.2505.06111","metadata_source":"pith","pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-10T23:37:43.249067Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","venue":"cs.RO","work_id":"e05d654d-db73-48f6-9318-381b6798bac9","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:e08b9c15afccaad0bf56b1c727dd79205e518f985bf4eca0db1b813073b84804","observation_id":"6889f253-dfc8-4dcd-a448-0c93cc281b4f","resolution":{"observed_at":"2026-05-21T13:24:11.178582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowledge","venue":null,"work_id":"bbbd7d6a-a0a2-4b67-b060-e388f39038ca","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:ca7359c70e47d69afff528fbc7a412a56f77799629d950856444a0b5bdb910ba","observation_id":"a3c147d8-c0db-40ed-9a30-ce7d1de15001","resolution":{"observed_at":"2026-05-21T13:24:11.910409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-10T23:17:45.135806Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:97e91a9a8a63ab53322d1c46331b4da0a0f16d006a176698655290118bc9bfa8","observation_id":"c5b74ff7-c0e0-4a79-8cb2-5640795465aa","resolution":{"observed_at":"2026-05-21T13:24:11.116156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action dif- fusion.The International Journal of Robotics Research, 44 (10-11):1684–1704","venue":null,"work_id":"6336d5c6-6f0f-4457-946b-0aaf036bdf57","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:2af580c858a89916d30777e5d2c5e80536179711a613bd3bb6b00f40cf879041","observation_id":"03741836-0b9e-43b2-b70f-2cc24e2faa48","resolution":{"observed_at":"2026-05-21T13:24:11.913419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":"2505.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-07-09T20:46:33.635100Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","venue":"cs.RO","work_id":"0575c08a-597a-4420-9cbd-e33ef136c900","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:9ca12e55427a6664d58f49cb034643b7a00242ec3e9f64918b859ac402a0bb9d","observation_id":"9ed80f28-0240-40c4-9ae9-0c40f03559de","resolution":{"observed_at":"2026-05-21T13:24:11.163597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.02152","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:32:43.960280Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image-text instructions","venue":null,"work_id":"075f5a82-0e41-48b4-8632-6b5105d0048c","year":2017},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:f1b34e19cfe2fc586ccc7828d4627ed3befbffaee4b1f6892984550402ed29d8","observation_id":"d4bc80f0-0a42-42c3-8262-92a482562e0c","resolution":{"observed_at":"2026-05-21T13:24:11.178405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mamba: Linear-time sequence mod- eling with selective state spaces","venue":null,"work_id":"2f97fd29-d5bd-4df0-bc96-6683278eec44","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:6cfc6c9bb209b202f9e1b206ae6ec036112f936825e0e1b353ac762e47fdd5ff","observation_id":"e126d505-56f0-48d2-be18-992373d08f99","resolution":{"observed_at":"2026-05-21T13:24:11.904026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":"2412.14803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-10T12:47:05.518340Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","venue":"cs.CV","work_id":"62dbe235-8473-4190-8686-17e7437de50f","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:51bdbefbb7b91f944885ff5682f4189604b45893ca75cda6ec699b79ea75ae60","observation_id":"36515dd8-4490-48dc-befb-56f4de6bc702","resolution":{"observed_at":"2026-05-21T13:24:11.185798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-02T11:57:50.333488Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":"2311.12871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-07-08T02:44:27.664173Z","title":"An Embodied Generalist Agent in 3D World","venue":"cs.CV","work_id":"2c1392ae-d82d-4f8f-aef7-75a5ff0e5d2e","year":2023},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:2bdcfb6549f137f66579149c3d35260a0c5ac9c76d2df8ac050f13e0186e8c87","observation_id":"8467f861-361f-4b42-b5a7-ebd69db3e302","resolution":{"observed_at":"2026-05-21T13:24:11.080578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:3d48389ce911c1a3fc232402fb18be7caab3da66d32e2573b611c0894a670463","observation_id":"92826e6a-2113-45d5-840c-7794690bd75e","resolution":{"observed_at":"2026-05-21T13:24:11.161214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vima: General robot manip- ulation with multimodal prompts","venue":null,"work_id":"7a46a0d1-b0dc-451e-8290-99c6600211bf","year":2022},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:81f8413496f9893944a7c62f24d18f67c91e50f132f52f6bba892be029f4df36","observation_id":"e1cd81eb-75cf-4725-9244-0eb46bf1966c","resolution":{"observed_at":"2026-05-21T13:24:11.906703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:ef90156e0328bc5cd8ec5aa906a1cbe70736a4caeb9d33be8f09ce2a638cf130","observation_id":"a7c8f85c-63f3-42e1-b441-8cbdeda8e98a","resolution":{"observed_at":"2026-05-21T13:24:11.198218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-10T23:37:42.946293Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:1f9914df0f154f72a867e11584f32826e82aaffeacade96b949697fd3620a7a4","observation_id":"3e512f60-c9d7-414f-a56a-fa636be755ec","resolution":{"observed_at":"2026-05-21T13:24:11.135802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Star: Learning diverse robot skill ab- stractions through rotation-augmented vector quantization","venue":null,"work_id":"a97b5082-d979-444d-bd04-c2ba1b93c5f6","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:610d810eeb7be256db2f46058a9dabedf8337161194e138aed6a833a36f02d34","observation_id":"ae2fb953-5677-4694-8c96-a38ec29182c7","resolution":{"observed_at":"2026-05-21T13:24:11.916269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2411.19650","doi":"10.48550/arxiv.2411.19650","metadata_source":"pith","pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-07-10T23:07:48.078477Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","venue":"cs.RO","work_id":"4b158d3e-3dff-4412-85cd-baa879465a5e","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:e07d769b7dc9cdd89c1393ebbfe8db91b046c5ba70a4d3c429a1dcf1c332d871","observation_id":"69740d5b-f5af-4cf8-a247-527255dc14e6","resolution":{"observed_at":"2026-05-21T13:24:11.201565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-07-06T22:20:12.486939Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"cited_work":{"arxiv_id":"2508.21046","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.21046","snapshot_observed_at":"2026-07-04T10:19:47.614294Z","title":"CogVLA: Cognition-aligned vision-language-action model via instruction-driven routing & sparsification.arXiv preprint","venue":"cs.CV","work_id":"6efe3ab7-f5b1-4c53-83c4-40d9f18e3b56","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2508.21046","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:a741be3591071e66e5212997be12c1bc2a1f3b801525f44dfacbfded7c3cbf74","observation_id":"8eec5656-5317-4d5f-8da4-dde412307071","resolution":{"observed_at":"2026-05-28T02:04:09.707556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semanticvla: Semantic-aligned sparsification and enhancement for effi- cient robotic manipulation","venue":null,"work_id":"7f898aac-fad2-471c-be0c-1f5e409412ac","year":2026},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:ee3cabe37f0fc32af763419abdbd3631d29aa79f3cdde79433f9c2c3584bb739","observation_id":"1a1a5060-f768-4905-a509-fc1a6fa2f401","resolution":{"observed_at":"2026-05-21T13:24:11.897875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:ef574e3abd484972cc4859568384fac1412209d5cbc234f469305cf76b720b74","observation_id":"3248ea7c-a93b-453a-b155-b54935d2e0af","resolution":{"observed_at":"2026-05-21T13:24:11.195439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03615","last_updated":"2024-10-21T11:05:27Z","snapshot_observed_at":"2026-07-06T18:57:48.065595Z","submitted_at":"2024-08-07T08:16:32Z","title":"Optimus-1: Hybrid Multimodal Memory Empowered Agents Excel in Long-Horizon Tasks","version":2},"cited_work":{"arxiv_id":"2408.03615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.03615","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks","venue":null,"work_id":"b6ccc95d-755a-4992-9866-f9c969e4a69e","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2408.03615","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:2b8023c7c4aae268f6f0df2dfb0ded827b51d74339eabff295f3d15fe187d402","observation_id":"22555f50-e36e-4cc4-a59f-c14e83dbfb50","resolution":{"observed_at":"2026-05-21T13:24:11.100723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T16:54:58.237980Z","title":"Optimus-3: Towards generalist multi- modal minecraft agents with scalable task experts.arXiv preprint arXiv:2506.10357, 2025f","venue":null,"work_id":"11abec7f-a314-449e-a018-cd48bb4153d0","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:87c9af3101a00a14bb0cf05b72fcf233db75cbb5aa540532294f54e9dff977c8","observation_id":"268df47c-f363-4d13-9491-846643828fb9","resolution":{"observed_at":"2026-05-21T13:24:11.108246Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimus-2: Multimodal minecraft agent with goal-observation-action conditioned policy","venue":null,"work_id":"c6b5d265-efa4-4199-9bed-a834d668874e","year":null},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:0043df73baaaa5acb6bdf09854e6b31a414ce521495cf9a3da18bcbab7dda597","observation_id":"5435e479-3ab4-4038-8cea-ce6a44324272","resolution":{"observed_at":"2026-05-21T13:24:11.895060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:7bb962f72bba6164eac18dcfc9816d2453b40d264381805f7099eab83c15c7a5","observation_id":"560d6cc9-c24c-4395-8197-9ffa9b06767c","resolution":{"observed_at":"2026-05-21T13:24:11.170701Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Libero: Benchmarking knowl- edge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791","venue":null,"work_id":"62a1637d-87a4-47db-9d4d-850e614fc268","year":2023},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:532a73e0dc256b68765c5d3067d2579430671d42949a8c2662aa7b7b6a618cf4","observation_id":"12423316-0a45-4a43-9215-ef136d276862","resolution":{"observed_at":"2026-05-21T13:24:11.883955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36","venue":null,"work_id":"942361f4-c89f-40be-8a75-f95db6df83eb","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:6a445f54e3083c466b9f7ebad6eb8c654fcf5f8b3b180ff266edd9ea2c921abc","observation_id":"c79dc206-a108-4f70-bbe8-062edc62ad09","resolution":{"observed_at":"2026-05-21T13:24:11.880264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards generalist robot policies: What mat- ters in building vision-language-action models","venue":null,"work_id":"13c44087-7caf-43b6-99cd-cbed671ed709","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:d7283c0838d84fbeaf567bd5fa0bc067feb892493f5b40fe45506db18e508a32","observation_id":"bc46999c-8e9b-4670-80bc-cba205012ee1","resolution":{"observed_at":"2026-05-21T13:24:11.886754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards generalist robot policies: What mat- ters in building vision-language-action models","venue":null,"work_id":"872f7f00-91cf-4324-97c1-08c6a036d7d3","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:eaf21d1423e1a2986c6630b47c8235af2d347ba7fe2d8c7254450586b2a87592","observation_id":"65913c17-6396-4754-8d7c-dd5542ba1599","resolution":{"observed_at":"2026-05-21T13:24:11.889683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2503.10631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-07-10T23:07:48.060771Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","venue":"cs.CV","work_id":"ecac5f06-a68f-4fff-a89a-a89358afb649","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:f6bb6c260ae359ba9f6f4828f8b9ab2fa0882601766b7d56cb3a919273551ca6","observation_id":"99a8d1b0-6843-436d-bb04-5566eb15c7ec","resolution":{"observed_at":"2026-05-21T13:24:11.175324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":"2410.07864","doi":"10.48550/arxiv.2410.07864","metadata_source":"pith","pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-07-10T19:47:32.618055Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","venue":"cs.RO","work_id":"12319725-bc7d-4c32-a229-ad270a7460bc","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:108ec42023b57a2f9cd15c1f9003811e010c38fbafbc7f0509cc76e25bfad976","observation_id":"1a2feb2c-5b28-462f-8172-6a7e755df62b","resolution":{"observed_at":"2026-05-21T13:24:11.201236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-07-10T17:37:26.212817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:b4928d6bce3c72ffcba943b012cd2978da366425e6e5af4d4ff66fee85787efe","observation_id":"7b3933e7-42fd-40c8-acf8-a37fcb7ca00c","resolution":{"observed_at":"2026-05-21T13:24:11.197847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Puma: Layer-pruned language model for efficient unified multimodal retrieval with modality-adaptive learning","venue":null,"work_id":"b4cbab13-63ef-49bd-a84e-5a750e4b5d76","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:581fa651ae2e11265a6293e3d4ad5a4319c8442e232ed408271d3ea368ccc85f","observation_id":"8eeca8bb-fd18-4e3c-b03a-7443b11eab27","resolution":{"observed_at":"2026-05-21T13:24:11.874915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical diffusion policy for kinematics-aware multi- task robotic manipulation","venue":null,"work_id":"44739ad0-518c-40e1-a2d5-f330565e0a71","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:2633b06cb2bbe3633328d91654ab44ca180c547e1dc83ce4b18aca6349cb7138","observation_id":"d7ff144e-b594-459b-a49a-3fd014be0709","resolution":{"observed_at":"2026-05-21T13:24:11.872206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manip- ulation tasks.IEEE Robotics and Automation Letters, 7(3): 7327–7334","venue":null,"work_id":"9265bee6-a516-4827-b2c8-821c4204e69c","year":2022},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:3a74e3cb94d1b4f82356ac056cf04c1865f2aa2f2563dadcbbb08a2dbe5016d9","observation_id":"8cc85b31-ddc2-41d8-8af8-e4037b105c9c","resolution":{"observed_at":"2026-05-21T13:24:11.877656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-based framework to estimate robot configuration and kinematic constraints","venue":null,"work_id":"e882f8f6-24a8-4a50-9487-c0b7ff1a34d4","year":2018},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:876f21c68b5d4746778ff0fd8d6f644b605ddee368897e2a0fe49a402c35e55f","observation_id":"b0457362-ecb4-480e-87f0-0b02f5e9d0d2","resolution":{"observed_at":"2026-05-21T13:24:11.892303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-10T11:47:02.947207Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:2013e49a42453536b138a38bb30a1ff128b7a1befad33d11151713d5d6ba84ed","observation_id":"23e97b66-5306-47be-8230-9a484a30460b","resolution":{"observed_at":"2026-05-21T13:24:11.167016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:e669b512df2d91fa7ae7528084d506dcd4d194532e4340dc27be02c821bd6ff4","observation_id":"1a2c6248-809f-41f4-a7bd-8e9016fe2289","resolution":{"observed_at":"2026-05-21T13:24:11.150059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-adversarial discriminative deep domain generalization for face presentation attack detection","venue":null,"work_id":"3aff7a59-ddff-4d73-884e-069de332b2a1","year":2019},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:3296404d8c48a2c5e3b5c0d02e1c00a5da4ebb08ca8d4c12b94cb80ca86154b0","observation_id":"86fed208-8d76-4852-be0c-cd5ab6d1b360","resolution":{"observed_at":"2026-05-21T13:24:11.860328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting and grounding multi-modal media manipulation","venue":null,"work_id":"f9e07c35-7f33-4fb1-ae86-452e77c8930f","year":2023},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:f5d62e6722dfb73b9f50b61bcb6da80ed8c2fde1b9cdee4be686c83d7f6dffed","observation_id":"d54a68db-5012-4b0a-822d-c90371397bd0","resolution":{"observed_at":"2026-05-21T13:24:11.864451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting and grounding multi-modal media manip- ulation and beyond.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"9a649669-9dab-4623-b7a5-d077d08a3f57","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:af7a53693d6d36ce0d8cdfbc94f6730fd78e4b2e02e1988b417efb4753210767","observation_id":"d0ec3246-ea55-4ac6-9286-42f13e2cf9f5","resolution":{"observed_at":"2026-05-21T13:24:11.861627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"cited_work":{"arxiv_id":"2508.13073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13073","snapshot_observed_at":"2026-07-08T05:54:33.623543Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","venue":"cs.RO","work_id":"bcbdae00-80a0-4488-a280-7eaf3c5336bb","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2508.13073","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:29f468d064e2381474026939aa36fcb2f21444cc50f93fdadf7690665e4947cc","observation_id":"25273529-c0a6-4d7e-b3b8-4655cd7ff9d9","resolution":{"observed_at":"2026-05-21T13:24:11.186177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2508.19236","doi":"10.48550/arxiv.2508.19236","metadata_source":"pith","pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-07-10T23:37:43.221441Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"921d4c77-1e8b-489d-987a-1c0c990e5ce8","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:25b0e1fccd66034b8f10cd82101e84cd07f907f13246e33a0d3ce8a4cbbc0049","observation_id":"dabd7e79-f8e3-4ab5-908a-f41f7b0cb269","resolution":{"observed_at":"2026-05-21T13:24:11.163984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.02310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:09:43.358185Z","title":"Accelerating vision-language-action model integrated with action chunking via parallel decoding","venue":null,"work_id":"69a1f66e-8307-4bd0-9607-3cb94a94cc12","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:b2ceede055eea2f29b6f3abb4318c9f0db72431d742aa47e7743707a6c41bc0b","observation_id":"04b328bb-984c-41b3-aa2e-30daf4076e18","resolution":{"observed_at":"2026-05-21T13:24:11.104987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-07-06T22:12:45.562271Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":null,"work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:74357f6c7ae310962d646c7f23c3d4d4a97347757e7671a0676833ddc620e806","observation_id":"fa147f79-109b-48ed-8d65-e62d9182f7f1","resolution":{"observed_at":"2026-05-21T13:24:11.084402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-07-10T10:07:00.871229Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:0a56e1ee83859e38fdda4c20c86d340a2cc0d61ed09d8eb2bcb378949e44cedd","observation_id":"29591d5d-bcda-4ac1-aa91-922df8fbbd3f","resolution":{"observed_at":"2026-05-21T13:24:11.169651Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2412.15109","doi":"10.48550/arxiv.2412.15109","metadata_source":"pith","pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-07-10T11:47:02.955029Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","venue":"cs.RO","work_id":"50911eef-b866-4e23-b501-1b4c4bfd1a78","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:9924d966a69b53b063fd68aaa9110fcf1b59701e1b7f24319aac47fb68b61ee2","observation_id":"da44e4ee-eb70-4808-9b8a-531ca00c7d85","resolution":{"observed_at":"2026-05-22T14:38:25.165602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"3f0a1aa9-c725-4584-bd17-ce39daa330d4","year":null},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:995c8852d40b7a9d69975fe3f964d7e394d0532d9ced698b5c3ce5ba0e2d5749","observation_id":"fcf1428c-b943-469f-8db4-0501335a499a","resolution":{"observed_at":"2026-05-21T13:24:11.864229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07530","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T05:36:01.195561Z","title":"Bitvla: 1-bit vision-language-action models for robotics manipulation.arXiv preprint arXiv:2506.07530","venue":null,"work_id":"7c28e41e-f878-4a0a-be94-00fd05e27e6b","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:eff6bee302026c1426c181448be275bd02934d1c062b5be7529b2edb9abb2520","observation_id":"c09fb7b5-11e2-4a40-bbab-303e06716379","resolution":{"observed_at":"2026-05-21T13:24:11.148294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09372","doi":"10.48550/arxiv.2509.09372","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Vla-adapter: An effective paradigm 10 for tiny-scale vision-language-action model","venue":null,"work_id":"3a5ccb46-7c4b-4722-a692-4da07c94d2b1","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:205f81bbb1a79a51882bb3bf963967a1dc73eb15fa6871348d98561c04dc0e44","observation_id":"7a373401-68f9-4793-a618-b3787c3f6b97","resolution":{"observed_at":"2026-05-21T13:24:11.172579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tinyvla: Towards fast, data-efficient vision- language-action models for robotic manipulation.IEEE Robotics and Automation Letters","venue":null,"work_id":"225111c6-30fd-4392-87cf-3864bbf01e4d","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:aa6b07d66d1e30dcebc6de1ac586007f9cf8f60a072ced68a46f8d922dd0e4e6","observation_id":"081862ef-3547-4637-a3b0-b37c748d350f","resolution":{"observed_at":"2026-05-21T13:24:11.919460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":"2403.03954","doi":"10.48550/arxiv.2403.03954","metadata_source":"pith","pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","venue":"cs.RO","work_id":"bded01e1-c070-4537-a75a-ace4c75d0c95","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:66c0bb30c63f2bbac4c81f2016fe0bf627d36ea2435c4b47df6e4007fdde35b9","observation_id":"1307338c-d422-4ffc-9c28-35f999134ecd","resolution":{"observed_at":"2026-05-21T13:24:11.189681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:5c8c2d05e7a252536532acd4101791a4a6d91fa7377d9a5f2717813b00cc63c3","observation_id":"a5932355-278d-421b-aec1-1ead141326b3","resolution":{"observed_at":"2026-05-21T13:24:11.167790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flowpolicy: Enabling fast and robust 3d flow-based policy via consistency flow match- ing for robot manipulation","venue":null,"work_id":"f89bf9a2-9753-4749-884c-828d7f2e91da","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:87a2b47e437e4c21a5033154385894b30b9c301a191d21ed31117e636ce92de1","observation_id":"e843d8a9-ef1a-4a6e-b895-d146ec04b0f2","resolution":{"observed_at":"2026-05-21T13:24:11.901013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Falcon: Resolv- ing visual redundancy and fragmentation in high-resolution multimodal large language models via visual registers","venue":null,"work_id":"d763323c-d162-4db5-a268-972d79941a1b","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:a14a1ce94218810b72a4906d1040cc6501274e40ee479c136658a3631cf7b21d","observation_id":"918a5376-5ae0-43a9-8086-5803079a16b1","resolution":{"observed_at":"2026-05-21T13:24:11.858971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":"2507.04447","doi":"10.48550/arxiv.2507.04447","metadata_source":"pith","pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-07-10T23:37:43.070930Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","venue":"cs.CV","work_id":"830b1108-8122-404f-a791-f926fbc48669","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:a3fe2ce6a1d4366430db0d6dea47ab844c449f1132c4ab02cc437f6c04b53b04","observation_id":"11b810bb-8db2-4bb7-a497-8c2121b4a601","resolution":{"observed_at":"2026-05-21T13:24:11.193217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-07-10T19:47:32.593829Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:b4f8e1fca8b146a6118df2f85ffaebec7fdaf468de92523d0fa86d88b90ebcf6","observation_id":"c64e0994-e7e7-4b8d-94dc-2a69484b31de","resolution":{"observed_at":"2026-05-21T13:24:11.152024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":"2412.10345","doi":"10.48550/arxiv.2412.10345","metadata_source":"pith","pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-07-10T14:37:16.085256Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","venue":"cs.RO","work_id":"56a1dd5b-7094-408b-8742-b80a424a62bb","year":2024},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:c5ac43e26590036557a6e67987bd36b8e38cf86c9bdbaa4b82fede935ecd661a","observation_id":"68c8f3e0-eeb5-416f-b3a2-f951d32269d2","resolution":{"observed_at":"2026-05-21T13:24:11.192512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hiconagent: History context-aware policy optimiza- tion for gui agents","venue":null,"work_id":"3859249f-7e48-4780-ae1d-6ca26af19c20","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:f092c5515caae25cc9ccc1145cead31ffb80e12c6c6636493a1389394f120e3e","observation_id":"a4fd4e77-e2d6-450e-b6be-13cb9e44ee71","resolution":{"observed_at":"2026-05-21T13:24:11.143272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H-gar: A hierarchical interaction framework via goal-driven observation-action refinement for robotic manipulation","venue":null,"work_id":"aca2c135-3975-4b73-b57c-8ba904f6a41a","year":2026},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:fe680b567b27a355cff3ef9c1fd3f09a454cd573b29199c8a87d961f2dd46d6a","observation_id":"074b22af-c00e-45dc-af7c-ed6ca4a05a06","resolution":{"observed_at":"2026-05-21T13:24:11.866903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"4e320988-8ded-4b8d-af9b-fc0bc41c5917","year":2023},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:32b788342f60bdc4f71a34d259492e92f8499a0ec0f4e996d4614b8b416f10f9","observation_id":"1de2ed2c-ed6f-4d6c-8006-06f02068c351","resolution":{"observed_at":"2026-05-21T13:24:11.869605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":24},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 5 inbound Pith citation observations for arXiv:2602.20200."}