{"as_of":"2026-08-04T08:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca1b93bc05a4d44105bfa4e47746dcb3df195f898da43924d3b1605f2fcf853b","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:11:21.596611Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T06:57:41.245418Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T07:23:13.398570Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"cited_work":{"arxiv_id":"2605.12369","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12369","snapshot_observed_at":"2026-06-29T07:23:13.398570Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","venue":"cs.RO","work_id":"85923d25-9652-4581-ade9-8efc9fa558ab","year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2605.12369","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:bd0070607e2215dbae6b5dbf9a44f7a06f3a6214651a70cc0cad8fcdffad4244","observation_id":"ca51edbe-f8d4-4f05-ba83-c7afb2962e2e","resolution":{"observed_at":"2026-06-29T07:23:13.400609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.12369/citation-record","integrity":"/paper/2605.12369/integrity","json":"/paper/2605.12369/citation-record.json","paper":"/paper/2605.12369"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-07-10T13:37:06.821716Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:6dec0b7148f68e5934c0f88ce9afe89619baeb237b13be2fb7b0c79d012fa009","observation_id":"dc2a593c-80c5-40ad-b0bc-599497373c1e","resolution":{"observed_at":"2026-07-01T14:15:46.768212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:531b24821e2d6b70f5737da1e5c34e429dae67d9913a2618bbaf52211ca67ba2","observation_id":"907794c5-0769-4fb1-8f13-fee97b8c8c09","resolution":{"observed_at":"2026-07-01T14:15:46.752028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-07-10T23:37:43.136584Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:3c6298e2b98174659b674dcb7ce2e8877c2f55366b840be55e51af67f2f1f5e7","observation_id":"f65455d5-38c7-49b0-99e0-6171b4ea0117","resolution":{"observed_at":"2026-07-01T14:15:46.744841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.820608Z","title":"3d cavla: Leveraging depth and 3d context to generalize vision language action models for unseen tasks","venue":null,"work_id":"10a5d041-6d20-404d-a379-a0782b16f45e","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:bd1e7fa3949da1566a448172db33dee13605d2c0afca15e6897a3ca274be4da9","observation_id":"abda6cf9-8281-44b4-936c-7d0965dcaf16","resolution":{"observed_at":"2026-07-01T14:15:46.721570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-10T23:07:47.672265Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:2dfb651df79a5f25b42c3834ac507eb19fb31798d12ed83be6585d529a8cc4c7","observation_id":"c382d61c-c90a-406c-877b-012fe65853ff","resolution":{"observed_at":"2026-07-01T14:15:46.747659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.761279Z","title":"In9th Annual Conference on Robot Learning","venue":null,"work_id":"2712f9b3-1773-44ae-abc2-2ecb82121c6b","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:e75ac7c46d3bea120a1ecd0b9dd0ce3a8e9e8a618c2aea5e008557dda545cf24","observation_id":"36a9286f-4481-4d43-a7cf-b7108fd59050","resolution":{"observed_at":"2026-07-07T14:43:52.762299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.764615Z","title":"InRSS","venue":null,"work_id":"e001457a-f686-47ca-9de7-079e51e8cc63","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:6d3bd635f2b4bdc219ac6b4781c872be456332a8ee3d0da2aa28699e4412e59f","observation_id":"5aca3279-be2c-4130-8f72-277c3af3d875","resolution":{"observed_at":"2026-07-07T14:43:52.765784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"cited_work":{"arxiv_id":"2506.07339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.07339","snapshot_observed_at":"2026-07-10T19:47:32.556301Z","title":"Real-Time Execution of Action Chunking Flow Policies","venue":"cs.RO","work_id":"a1af107b-7760-4a6c-858c-9ad27ce9eed2","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2506.07339","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:9a6379a0e3ba651f14b02a6d09e3d871f074a2ec29cf9cd1ee4250782deef542","observation_id":"bf6cb1ad-f015-40b1-9f32-f64204dfd787","resolution":{"observed_at":"2026-07-01T14:15:46.761147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-11T00:07:42.794081Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:7fdf7f0a4b26bcaf819fc81f96caf9632165e384a30aeae1bdd8c835a247998f","observation_id":"66cd4033-5063-4a39-8746-44f5c99b5beb","resolution":{"observed_at":"2026-07-01T14:15:46.659268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":"2505.06111","doi":"10.48550/arxiv.2505.06111","metadata_source":"pith","pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-10T23:37:43.249067Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","venue":"cs.RO","work_id":"e05d654d-db73-48f6-9318-381b6798bac9","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:eb80c2d87f1835e0dcd6c1827f8ff8359a1d13aa83ca22a6fe9d83480cb20680","observation_id":"0205eb4e-a35b-4fbc-ab84-9bf1061acbd5","resolution":{"observed_at":"2026-07-01T14:15:46.727871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":"2506.21539","doi":"10.48550/arxiv.2506.21539","metadata_source":"pith","pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-07-10T23:37:42.965894Z","title":"WorldVLA: Towards Autoregressive Action World Model","venue":"cs.RO","work_id":"d8c0c873-b2fc-44a5-a0c8-0d4a698783fb","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:f2138b576e2613442b3b2547fa9416f2db04045349bf1b5e20cd8d64fc8428a7","observation_id":"4fcdae89-cf79-434d-91d1-eb06871ca981","resolution":{"observed_at":"2026-07-01T14:15:46.757983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20381","last_updated":"2026-06-25T10:25:16Z","snapshot_observed_at":"2026-08-03T07:19:49.661356Z","submitted_at":"2026-01-28T08:46:04Z","title":"STORM: Slot-based Task-aware Object-centric Representation for robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2601.20381","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.20381","snapshot_observed_at":"2026-07-01T14:15:46.732039Z","title":"Storm: Slot-based task-aware object-centric rep- resentation for robotic manipulation","venue":"cs.RO","work_id":"f04cd91e-90f1-4232-ac40-f09cee01e594","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2601.20381","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:8098818abe74a95489ad24f96f7395f2e8ef0f217790951623022636d08c1bd9","observation_id":"fe976080-1848-4161-8805-2ac4693fa229","resolution":{"observed_at":"2026-07-01T14:15:46.734179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01718","doi":"10.48550/arxiv.2511.01718","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Unified diffusion vla: Vision-language-action model via joint discrete denoising diffusion process","venue":null,"work_id":"9f99a8d5-3a09-44c6-ac96-e81d09b7d387","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:2a3f6b5c1a1f993c6b6c61fade84058f97c17e5b3be35506015e8f46e4710248","observation_id":"3e0a94e2-c7fd-49de-b8d3-70363e7a1287","resolution":{"observed_at":"2026-07-01T14:15:46.803303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19313","last_updated":"2026-07-22T22:14:13Z","snapshot_observed_at":"2026-08-02T21:43:05.758047Z","submitted_at":"2026-02-22T19:25:48Z","title":"TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics","version":2},"cited_work":{"arxiv_id":"2602.19313","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.19313","snapshot_observed_at":"2026-07-24T01:23:05.692011Z","title":"TOPRe- ward: Token probabilities as hidden zero-shot rewards for robotics","venue":null,"work_id":"86fd64c2-9c2a-4cb8-bdbc-d8032ff200b9","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2602.19313","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:f327b49004b17007ec52adc9050e821bdd39f30f213d3ccb9366eaafaead0961","observation_id":"c1c9e977-2617-446a-9622-4c579efbbdff","resolution":{"observed_at":"2026-07-24T01:23:05.692011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-10T23:17:45.135806Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:22517113372032b56b705519111169dc6011270c73af62f0711f6b80427682ad","observation_id":"f7ac345a-fff2-4351-9276-ad895e2992b7","resolution":{"observed_at":"2026-07-01T14:15:46.680888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:56:59.021683Z","title":"Moe-dp: An moe-enhanced diffusion policy for robust long-horizon robotic manipulation with skill decomposition and failure recovery","venue":null,"work_id":"d8a43b2e-03b6-4f80-a587-f6c495027017","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:05d880e6c42a0e0cb72f4237a4696fc8fdd1965340f0ab1b5e3e4c7193209844","observation_id":"0eab96a9-07cf-4109-9690-748843fe3d67","resolution":{"observed_at":"2026-07-01T14:15:46.755305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.768832Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, 44(10-11):1684–1704","venue":null,"work_id":"909f85e0-9e50-4779-bb20-b39b94b345a7","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:e9114c716c350a12394d5a95e87a3c9d42e792f531b074c9de8e467bbabd9fbf","observation_id":"20fa5fa8-2a7d-4e44-9604-17af9a37af51","resolution":{"observed_at":"2026-07-07T14:43:52.770074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08113","last_updated":"2025-08-11T15:53:23Z","snapshot_observed_at":"2026-07-06T22:11:14.687647Z","submitted_at":"2025-08-11T15:53:23Z","title":"AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies","version":1},"cited_work":{"arxiv_id":"2508.08113","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.08113","snapshot_observed_at":"2026-07-09T20:16:29.400812Z","title":"Aimbot: A simple auxiliary visual cue to enhance spatial awareness of visuomotor policies","venue":"cs.RO","work_id":"280795c5-9817-455d-b91b-6ff9476c0456","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2508.08113","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:97b5f41a101cfef2c1d6d3c9bf18f33b550d8f8beaa0ffd67bfad575076a686c","observation_id":"80bc0e30-54ac-474b-a87c-e3285ae2f55d","resolution":{"observed_at":"2026-07-01T14:15:46.771008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11215","last_updated":"2020-01-02T06:26:37Z","snapshot_observed_at":"2026-07-06T08:31:59.314616Z","submitted_at":"2019-10-24T15:20:03Z","title":"RoboNet: Large-Scale Multi-Robot Learning","version":2},"cited_work":{"arxiv_id":"1910.11215","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.11215","snapshot_observed_at":"2026-07-04T08:59:42.026927Z","title":"RoboNet: Large-Scale Multi-Robot Learning","venue":"cs.RO","work_id":"a19770ba-65e3-409a-8ef4-98ed438c113b","year":2019},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/1910.11215","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:8d7de274447a467a22c316fa8c555a0e2497d0db11cca1101fd6504c9765a22f","observation_id":"daa4452f-bd03-4453-a140-ff5f26d2f238","resolution":{"observed_at":"2026-07-01T14:15:46.702470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.765283Z","title":"Causal confusion in imitation learning.Advances in neural information processing systems, 32","venue":null,"work_id":"fc55558a-62e3-4053-a905-5a828955c93c","year":2019},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:0119a5c087db93a76c9ed352e7f747998298cd94055c3a573c0cd4e689561701","observation_id":"1f3b432a-a490-4b19-9950-73688370d0e8","resolution":{"observed_at":"2026-07-07T14:43:52.766514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:c837abcbe50217c2a517eb274e4e146a50244c9d5e00fc7514270e7c7da80333","observation_id":"e57183a7-40e2-4b37-981a-ad9601eefce0","resolution":{"observed_at":"2026-07-01T14:15:46.683779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.757264Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":"9d6a8f45-72b7-4c58-a1a7-778c516327e7","year":2023},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:3d9b0ccca723dca329272f546048a45b02ce82cfa1695066f1de5702edff0dc0","observation_id":"6a89c519-2d95-49e3-8222-22cb4b3e4e34","resolution":{"observed_at":"2026-07-07T14:43:52.758776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-02T23:50:48.668259Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":"2308.12952","doi":"10.48550/arxiv.2308.12952","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"a7522d2b-ba04-44df-978a-84e147c5549c","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:51e660bcd57d027c7dc47d2c9f42ab9d89dbb66b691f70ba0659d32fc3fc589c","observation_id":"62b3164c-147c-4f20-b68d-4fb83836f7eb","resolution":{"observed_at":"2026-07-01T14:15:46.668471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.753596Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image- text instructions","venue":null,"work_id":"6c48dbae-7ee2-4d61-bc68-8df3ac34e88f","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:9105ddc0ca47f7d4bcb740541b9c5cadc71b056b7823878f447a4022c38e84dc","observation_id":"8874bb89-180b-43d9-a346-e09e726c0e52","resolution":{"observed_at":"2026-07-07T14:43:52.754829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.17885","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T06:07:41.729993Z","title":"Peafowl: Perception-enhanced multi-view vision-language-action for bimanual manip- ulation","venue":null,"work_id":"8a900947-d22c-424c-9f4a-d76fab0c00a2","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:2bff1ef6a8a8777855a164c427927c4cb6841e2571d54d24428f2fc1301c26cd","observation_id":"98673013-3de8-477c-aed5-d633874f3ff1","resolution":{"observed_at":"2026-07-01T14:15:46.808781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20052","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:15:46.647632Z","title":"Learning skills from action-free videos","venue":null,"work_id":"acda6618-d90a-42be-9f52-511ce5caba75","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:7c0eac4461ab4e9a852d925d0802f72afe69371d4e9ed1879bdce41778b30e1a","observation_id":"01391be9-7701-4855-9166-e2133a39f239","resolution":{"observed_at":"2026-07-01T14:15:46.649296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:2c65da2f89865039237d7d49813f01f5bdbb733548f00be40add2881bd365841","observation_id":"5e721c90-c723-4252-bba0-12935dd8fd43","resolution":{"observed_at":"2026-07-01T14:15:46.639681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.750873Z","title":"Imagenet-trained cnns are biased towards texture; increasing shape bias improves accuracy and robustness","venue":null,"work_id":"50c212ce-3fd9-4ce8-ae05-fccbfabf2967","year":2018},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:e71b3847bdd917c03d498f5f91d9741f1148c918358f9948d2148f259103ba9d","observation_id":"e45e44cd-981e-4a39-85c6-90e86a0ccfd3","resolution":{"observed_at":"2026-07-07T14:43:52.752205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.755020Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2 (11):665–673","venue":null,"work_id":"48b63492-6c67-4417-967c-31a840750390","year":2020},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:df2741eb9f7f7722ff44db5ea7dff3ebbdad5c7932eac86db9bc3ca82d695941","observation_id":"5685341c-247a-4456-8774-86bd645646a9","resolution":{"observed_at":"2026-07-07T14:43:52.756557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.744846Z","title":"Octo: An open- source generalist robot policy","venue":null,"work_id":"2af3cf53-bd22-4a26-b15a-852f8f37deaa","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:6d31174eac69de63380541934097a25346fa1065e2243b95627f9ea3b3d38f9e","observation_id":"2a215a6f-e48c-4746-9891-8fc8fee02c31","resolution":{"observed_at":"2026-07-07T14:43:52.746001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20391","last_updated":"2025-02-27T18:59:18Z","snapshot_observed_at":"2026-08-04T07:20:18.038554Z","submitted_at":"2025-02-27T18:59:18Z","title":"Point Policy: Unifying Observations and Actions with Key Points for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2502.20391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.20391","snapshot_observed_at":"2026-07-10T18:47:31.653765Z","title":"Point policy: Unifying observations and actions with key points for robot manipulation","venue":"cs.RO","work_id":"c7bb66c8-0ed5-4673-a7c5-d82216e8d36e","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2502.20391","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:048760f5299033febcfea4ef32eb80455a7454648cc85ca42b8d1a084c8d16fc","observation_id":"ffddb4f1-8409-4a8a-8282-ef865607fb61","resolution":{"observed_at":"2026-07-01T14:15:46.695797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/icra55743","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T06:25:27.239009Z","title":"In: 2025 IEEE International Conference on Robotics and Automation (ICRA), pp","venue":null,"work_id":"63f82d22-a9ba-4311-93f2-91f6f611a735","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:5a3b11b113440b4355f288efbd2cb5d1c1e586198b4463a9acb62621babf024a","observation_id":"8a2be12c-a90e-4163-b932-3ace62d835b1","resolution":{"observed_at":"2026-06-30T22:15:06.230574Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:23:35.649971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:23:35.649971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.751587Z","title":"Lora: Low-rank adaptation of large lan- guage models.ICLR, 1(2):3","venue":null,"work_id":"1f59e942-d15e-46af-931d-904a9a2572b0","year":2022},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:2e756d80ee5da6ad52a59b9ad2297151a98cdbd2cd2dbe7673896453d7e4e1d6","observation_id":"9793bf6b-f90b-4a80-8771-821d4e32338f","resolution":{"observed_at":"2026-07-07T14:43:52.753061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.11266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.235751Z","title":"arXiv preprint arXiv:2601.11266 (2026)","venue":null,"work_id":"282f6569-7d7f-4c1b-93b6-1bf8a0194651","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:61961ad1bcbf52e1322e1a0b2b60dd589f81062e0f15ef7c83db1530a77cdccf","observation_id":"41cabbca-8318-45c0-9878-268868b632ad","resolution":{"observed_at":"2026-07-01T14:15:46.698964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.755369Z","title":"Rekep: Spatio-temporal rea- soning of relational keypoint constraints for robotic manipulation","venue":null,"work_id":"03b26500-7af3-425c-954a-bee064258bf6","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:40a1af8efe88ce87ffbfb397da34322416cb9833631adaf348d4e783ceb20dad","observation_id":"385c36c4-b23e-4695-929c-3085d1fbd09c","resolution":{"observed_at":"2026-07-07T14:43:52.756741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.03782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.636493Z","title":"arXiv preprint arXiv:2601.03782 (2026)","venue":null,"work_id":"13d28a56-ef0f-4caa-9fa7-9f494d91f062","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:5860f4a3880bf4fa90fbc4f6df2914fc2f84ec8fcd27314a60eaba90ee3276a3","observation_id":"41c0716e-5d90-487b-b39c-932016bf342f","resolution":{"observed_at":"2026-07-01T14:15:46.811947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2504.19854","doi":"10.48550/arxiv.2504.19854","metadata_source":"pith","pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","venue":"cs.RO","work_id":"1e89a464-b414-4d5c-a974-b2cb8be33053","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:80e6a013ef7c12b27b7b2de6ac1d19548bd69146b637f378d5d43d4d3ca2035f","observation_id":"4afbb126-945a-4ee8-afd7-f2e474b63c54","resolution":{"observed_at":"2026-07-01T14:15:46.711751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.766998Z","title":"Rlbench: The robot learning bench- mark & learning environment.IEEE Robotics and Automation Letters, 5(2):3019–3026","venue":null,"work_id":"9a96243b-8450-4c14-8192-5a0a2307ae87","year":2020},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:1dc6991c6aeb579f7ad99d377079fd92e5e4cdb86ed5e2b79ff52da802a316b0","observation_id":"f27f4d53-0503-475b-9945-4b8f4c8ed231","resolution":{"observed_at":"2026-07-07T14:43:52.768283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-07-06T22:21:09.483995Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"cited_work":{"arxiv_id":"2509.00576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.00576","snapshot_observed_at":"2026-07-08T07:14:45.460259Z","title":"Galaxea open-world dataset and G0 dual-system VLA model","venue":"cs.RO","work_id":"568af32f-f647-4c11-a106-65ddfa305082","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2509.00576","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:456fc5f240fc79a2d5370d0556ee8b2f4256e7807d8ebbb768ddc699c10f4ce3","observation_id":"91c22306-6ef1-4d04-aabb-822e51183444","resolution":{"observed_at":"2026-07-01T14:15:46.820592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2511.14148","doi":"10.48550/arxiv.2511.14148","metadata_source":"pith","pith_arxiv_id":"2511.14148","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","venue":"cs.RO","work_id":"67f401a6-ce42-469a-ba83-c40caf6767da","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2511.14148","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:01d9061d1c57b435bdf8e59b2519a390bb7fa7f2952e785512a1b7024aea2975","observation_id":"813fccc6-3acb-4a32-8fe8-ece4f6c704e5","resolution":{"observed_at":"2026-07-01T14:15:46.779848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-07-06T14:01:25.012788Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2210.03094","doi":"10.48550/arxiv.2210.03094","metadata_source":"pith","pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Jiang, A","venue":"cs.RO","work_id":"7b5f6cce-bbaa-40ed-8b09-7330832dd736","year":2022},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:035b162dca65d61671860014fc19afa35514cbf160abfa898bd4629c1295c868","observation_id":"23151c02-dbba-4a7e-a20a-c68fe51985fb","resolution":{"observed_at":"2026-07-01T14:15:46.737758Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-07-10T23:17:45.234457Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:71001d16d6f34e92f5de2265b290b7e625887e0d96311f719207d40c7bb4e088","observation_id":"964b6e31-659f-406c-b6a4-6dce8e440a36","resolution":{"observed_at":"2026-07-01T14:15:46.785105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-10T23:37:42.946293Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:30401f99d7422ea5a8f765420717fe858e99401247ef8ea592d3cdcc8e04a184","observation_id":"1194d431-83ae-4828-8a93-0d3773786eca","resolution":{"observed_at":"2026-07-01T14:15:46.774050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.766409Z","title":"Openvla: An open-source vision-language- action model","venue":null,"work_id":"622524b1-bc89-4084-966c-9fa95d1b222c","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:c240922af078af51b334d4fa0091ef4eb76c5cfcd77b23d1ad8110c7379aeec0","observation_id":"cb9c0ab5-33aa-4577-ad49-d5bfd8952f85","resolution":{"observed_at":"2026-07-07T14:43:52.767652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.711720Z","title":"Trace- gen: World modeling in 3d trace space enables learn- ing from cross-embodiment videos","venue":null,"work_id":"3698786b-d9fd-400d-99bf-c0a47f5680c0","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:65ee51b262de8eeee657316ffaee0d223c7c35126760628748481ef6a30937f4","observation_id":"9a4e08dd-7356-4480-9b19-d54ee8b7d561","resolution":{"observed_at":"2026-07-01T14:15:46.705494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.734397Z","title":"Spatial forcing: Implicit spatial repre- sentation alignment for vision-language-action model","venue":null,"work_id":"661af783-416b-46ea-9e07-5b5e4263a096","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:23a4fc7ebe9d0dbd5864b26791156b18cf53c94b6423ad3fcbe3025a21a480e2","observation_id":"f7e82ceb-08de-4048-895e-5aa71e945c92","resolution":{"observed_at":"2026-07-07T14:43:52.735897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11920","doi":"10.48550/arxiv.2505.11920","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.659611Z","title":"H2r: A human-to-robot data augmentation for robot pre- training from videos","venue":null,"work_id":"762e40ad-e06b-414a-8451-01b0079c0dd2","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:73e820f52e0205effad190eabed5aee75f3b5693c07c67bc4d635d605c67af31","observation_id":"8fc40c16-c0f9-4902-b206-f2cfbc94713c","resolution":{"observed_at":"2026-07-01T14:15:46.693021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.736429Z","title":"Language-guided object-centric diffusion policy for generalizable and collision-aware manipulation","venue":null,"work_id":"5ddfb8da-91c4-47fe-bb88-9e318e2907a5","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:5bbf3bba86e9a9889648d359f1f5759b9bba80472d72165a8c636f4e76b52531","observation_id":"c588b211-cab8-4135-aaa8-63d180fc080a","resolution":{"observed_at":"2026-07-07T14:43:52.737565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.738327Z","title":"Coa-vla: Improving vision-language-action models via visual-text chain-of- affordance","venue":null,"work_id":"7f124451-9cf7-44b5-acd2-854ea4c75768","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:4f766ef19ee77a5839547a31a611de44fd11d4dc215350706566aba5c87654be","observation_id":"f2e55135-e957-4b1b-8334-404550414357","resolution":{"observed_at":"2026-07-07T14:43:52.739543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.726323Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"6b48634f-b23f-47f9-83bb-e0654c3523d9","year":2023},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:3ada633f99048d2eebe27f3be2aa251c6d3cd8d403a84fdff0312133dc1d4213","observation_id":"e5a625ed-7125-469c-b74b-6676af214999","resolution":{"observed_at":"2026-07-07T14:43:52.727904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:30:00.489574Z","title":"Bridgevla: Input-output alignment for efficient 3d manipulation learning with vision-language models","venue":null,"work_id":"2cc19a78-3f94-4f0d-a6d5-3a516a9770e2","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:4d50f35d16990e85deb8163d691dcba01febb22566e366c528b68f7b97bb7bbe","observation_id":"dc46ab99-7999-47bc-8701-123f54108435","resolution":{"observed_at":"2026-07-01T14:15:46.791195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03724","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:15:46.762245Z","title":"Posa-vla: Enhancing action generation via pose-conditioned anchor attention","venue":null,"work_id":"3d7757ef-d6c6-4857-834b-306566d09a32","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:c2788d541be8c62fe71b9da85514144eced31d9cb667dbda2181e46237a469be","observation_id":"11ae13b6-56c3-4c1a-871a-68da35c742d4","resolution":{"observed_at":"2026-07-01T14:15:46.764609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.722265Z","title":"Skilldiffuser: Interpretable skill planning for latent diffusion-based manipulation","venue":null,"work_id":"44ddef1a-76a3-4572-8c39-3531af407af7","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:ff3494e2b2276604d317f6d73cab23e738dac311cc34e54cbf242b827a806dc6","observation_id":"3b04815d-efec-4187-a60d-6ead98fb6da2","resolution":{"observed_at":"2026-07-07T14:43:52.723782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20072","last_updated":"2026-05-31T15:50:43Z","snapshot_observed_at":"2026-07-06T22:19:38.462418Z","submitted_at":"2025-08-27T17:39:11Z","title":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","version":4},"cited_work":{"arxiv_id":"2508.20072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.20072","snapshot_observed_at":"2026-07-04T10:59:46.979599Z","title":"Discrete diffu- sion vla: Bringing discrete diffusion to action decod- ing in vision-language-action policies","venue":"cs.CV","work_id":"33a64891-124d-4530-ab4c-056d66b706d6","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2508.20072","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:ec1fdae8ef66a98fded40eb904adec68edc9dab4fd4a2dd5d3cde62cfb45ce90","observation_id":"ed43a84d-712b-4023-b276-d850142d72b1","resolution":{"observed_at":"2026-07-01T14:15:46.642975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01586","last_updated":"2025-09-06T02:40:42Z","snapshot_observed_at":"2026-07-31T19:12:58.292888Z","submitted_at":"2024-06-03T17:59:23Z","title":"ManiCM: Real-time 3D Diffusion Policy via Consistency Model for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2406.01586","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01586","snapshot_observed_at":"2026-07-08T11:44:51.167925Z","title":"arXiv preprint arXiv:2406.01586 (2024)","venue":"cs.RO","work_id":"1553dc4a-626c-4c67-a1e8-2c617a370d8f","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2406.01586","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:8a5782808a03683ef81d67824eee4ebc4e7961add5ac10bdead5e8ccffa8c12e","observation_id":"ca914e65-27ce-432c-bed6-778cf7540a44","resolution":{"observed_at":"2026-07-01T14:15:46.690012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":"2511.10647","doi":"10.48550/arxiv.2511.10647","metadata_source":"pith","pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-07-11T02:27:48.889599Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","venue":"cs.CV","work_id":"0a54b500-1e9d-46c2-85eb-8e16cbac8461","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:840ce0c817cdfc856c94930c14f9a848e11e593ad62c387bb9e5bca786a4b8f3","observation_id":"ded24e10-4128-4875-80d8-7abad477e59d","resolution":{"observed_at":"2026-07-01T14:15:46.687056Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.718237Z","title":"Constraint-preserving data generation for one- shot visuomotor policy generalization","venue":null,"work_id":"b7d163dc-15d8-415f-b878-ffbcd795e4ff","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:5b58bb9946547e379723caf9144de0176db8cca503aefa38b70008203842a32f","observation_id":"8a29bcc9-0e99-4b03-914a-a10e5f48866c","resolution":{"observed_at":"2026-07-07T14:43:52.719403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.724278Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Ad- vances in Neural Information Processing Systems, 36: 44776–44791","venue":null,"work_id":"c3f43f3e-bf9e-4853-aebe-8c2b6a15ed03","year":2023},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:d61810abe603ef9c908f6130f86cdacf91b7987a774ad368c0e909e55adf880b","observation_id":"0259c7f2-4635-43f3-bae9-0feeff25ac83","resolution":{"observed_at":"2026-07-07T14:43:52.725829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.728382Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":"19abe84e-9b2d-4f22-a10c-2f18ea4425f6","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:4d877c5bffd3dba49f2ab79c507eb2836a8551bbdb36e0a18614a4dc25b25b11","observation_id":"4cae5174-5271-46f1-a013-9ff83c5e5f5e","resolution":{"observed_at":"2026-07-07T14:43:52.729660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.740424Z","title":"Hierarchical diffu- sion policy for kinematics-aware multi-task robotic ma- nipulation","venue":null,"work_id":"22a11b0d-b9d7-4191-9d4c-3e19c1636ec6","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:f8e993236e80b5959c6aa3dfb8a575c938e072bbaee7faeaf3d0694292e44b6d","observation_id":"49a110b2-f129-42e4-ba87-ffc0bdd773d9","resolution":{"observed_at":"2026-07-07T14:43:52.741856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.26742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:58.791267Z","title":"arXiv preprint arXiv:2510.26742 (2025)","venue":null,"work_id":"e2977815-a329-4ec1-9225-0daa2e302606","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:e56b7953992b450700642fcc3e2a3ba452ed3ba8770b9bdbdc23451ac3644d8f","observation_id":"d2fe6d8f-68c0-4e08-82b5-60bc7443f24e","resolution":{"observed_at":"2026-07-01T14:15:46.665706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.710434Z","title":"Roboturk: A crowdsourcing platform for robotic skill learning through imitation","venue":null,"work_id":"e81cc52c-180a-4eb4-b6a2-648e361a0025","year":2018},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:84a21f14dae5a0062fe204b11ff34375c687de2328cc2a0be1a83da67b842d86","observation_id":"8b13eaf6-778b-4801-a7ad-cfce6ebfcbe0","resolution":{"observed_at":"2026-07-07T14:43:52.711525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.717886Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot ma- nipulation tasks.IEEE Robotics and Automation Let- ters, 7(3):7327–7334","venue":null,"work_id":"5b947b85-01e7-4166-b9fc-07e01b788008","year":2022},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:b3436b2c12910da9122d1fca7ff69b338cc36caaf6280e77245d13e6663451a5","observation_id":"339471e0-9a20-4f9a-960c-50f5a63e568a","resolution":{"observed_at":"2026-07-07T14:43:52.719162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2203.12601","doi":"10.48550/arxiv.2203.12601","metadata_source":"pith","pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-07-10T18:47:31.679039Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":"cs.RO","work_id":"1fb6c1b7-913d-4a89-bbad-842fdb5fca1d","year":2022},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:7e850a19ce40e66f4474e33886690ee0a77ff73862c06203c421dee40eeda3b5","observation_id":"9be1d31f-8128-44da-9b4f-b5941e5a0b82","resolution":{"observed_at":"2026-07-01T14:15:46.646323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15530","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:39:45.517996Z","title":"Vo-dp: Semantic-geometric adaptive diffusion policy for vision- only robotic manipulation","venue":null,"work_id":"0adb5dc2-f3eb-42b9-8a1e-7092714a663b","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:1c0bcd7725797d14d05495094278a21aa78d5abbc0b0cfeaa134df4761fd3168","observation_id":"b9cae7b2-75fc-445a-9f48-faeea0ba6504","resolution":{"observed_at":"2026-07-01T14:15:46.636813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.714174Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collabo- ration 0","venue":null,"work_id":"5ff6d696-6776-49df-b4d1-efa8f42e2793","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:19f6e41c9399b21763ecad14afdc1f21ed0388b5f96f0c6feaf00e548c6e0bec","observation_id":"08ccf904-cfac-4c24-872c-2f44a7dbd42f","resolution":{"observed_at":"2026-07-07T14:43:52.715382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.762742Z","title":"Omnimanip: Towards general robotic manipulation via object-centric interac- tion primitives as spatial constraints","venue":null,"work_id":"403f080e-4e1f-4f19-b506-7f01024d84d0","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:5c025b8f77e2e4aebf6159578fcd553fca4014dd219274c1f6e271a5f71a9d4c","observation_id":"5ea24653-d07f-4a96-a24e-b9b3554ebe16","resolution":{"observed_at":"2026-07-07T14:43:52.763919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-10T11:47:02.947207Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:4e7d03599a5e2834dd57c81c6c9cb94be03e56d4eaae95d3d09847651d91278d","observation_id":"34755786-5e2d-44f1-a6e3-5db2611a8ba6","resolution":{"observed_at":"2026-07-01T14:15:46.718648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16811","last_updated":"2026-04-07T13:11:17Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:51:42Z","title":"GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation","version":2},"cited_work":{"arxiv_id":"2512.16811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.16811","snapshot_observed_at":"2026-07-09T20:16:29.403258Z","title":"GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation","venue":"cs.CV","work_id":"4e0b601f-16b5-488d-8c8a-70ef8daec6e8","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2512.16811","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:105e16bf746c58379429e7322a8dc2f7eb3f11b0bab7828d6fadde39c4be60b1","observation_id":"3e860926-4124-47f6-9d5f-98c7f60f4118","resolution":{"observed_at":"2026-07-01T14:15:46.708138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.702011Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":"0ada880e-3176-4c0c-b083-ad87402cf090","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:169e3002959d1d183cfa37185fb84c2a73f133c089d36e5b191d18d3191411cd","observation_id":"6bea0502-d20c-421f-b337-877abb3cecf2","resolution":{"observed_at":"2026-07-07T14:43:52.703474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.706704Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":"d2c2f2a0-1ce7-4136-9d8f-49f6746cd5dd","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:94fb6d1e63ff568c257fc1b76e438953edd45f97dfb56fed5d34ed4ece72e34a","observation_id":"94d9e78a-f3b4-4ea6-ac23-7ca1baafa546","resolution":{"observed_at":"2026-07-07T14:43:52.707922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.722103Z","title":"Grounded sam: Assembling open-world models for di- verse visual tasks","venue":null,"work_id":"055596f9-fde4-44ac-8171-be68ad0dea3e","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:09e5c1b2f0f9d43d5d8d1368fdbb001f8b3264ce85233650ba73355893690ccd","observation_id":"51dbcf3e-eac4-4d55-99a9-fbd9bc24c6c9","resolution":{"observed_at":"2026-07-07T14:43:52.723342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09512","last_updated":"2026-05-15T10:27:07Z","snapshot_observed_at":"2026-07-06T22:41:43.594456Z","submitted_at":"2026-01-14T14:23:42Z","title":"CLARE: Continual Learning for Vision-Language-Action Models via Autonomous Adapter Routing and Expansion","version":2},"cited_work":{"arxiv_id":"2601.09512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.09512","snapshot_observed_at":"2026-07-03T21:18:58.740003Z","title":"Clare: Continual learning for vision-language-action models via autonomous adapter routing and expansion","venue":"cs.RO","work_id":"bcc7afd2-cdc6-430c-b944-81af8456deee","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2601.09512","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:879a796ebf0d68d51fe08247cb4e7550bd6c7d29a102d96e6ea741e404361c6d","observation_id":"f0261b67-3f12-40b1-95f3-0cd89980cdf9","resolution":{"observed_at":"2026-07-01T14:15:46.788366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:59:55.366158Z","title":"Expertise need not monopolize: Action-specialized mixture of experts for vision-language-action learning","venue":null,"work_id":"3a623ec8-362d-4909-bf0b-47c0a3fc9191","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:9ed9f5f989fac02fdfe1e0708e735717dc96061996ab83e59dcc298bf2b76901","observation_id":"afb30d02-6fdf-4379-bac1-0ad5836eb951","resolution":{"observed_at":"2026-07-01T14:15:46.806175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-07-06T22:11:52.522787Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:6eb3581d409c89b0d81347edea0d0fbab86883ed5a1f17bdc40e2bb6bf8a142d","observation_id":"02fd77d4-1ee8-499e-9500-af46074635e6","resolution":{"observed_at":"2026-07-01T14:15:46.741680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.17016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-07-04T20:50:12.325218Z","title":"Interactive Post-Training for Vision-Language-Action Models","venue":"cs.LG","work_id":"1ad0b2af-71bb-415b-b955-e3350f1a1ae8","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:5575faac01b1c73efb825cce690998864f0c482cd30a684ee82b369b3275e4d0","observation_id":"f744ab31-d85d-42e9-b602-e1a92a3b1570","resolution":{"observed_at":"2026-07-01T14:15:46.782239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-07-10T23:07:47.582320Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:afd3f23fa6cc38f52d2a2c44609759bb5f6e94d8a6dee200ee62788618f31370","observation_id":"424f01bf-4196-4d42-9636-179e6ebaa185","resolution":{"observed_at":"2026-07-01T14:15:46.730823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:932e2fef4a60c44628b113b84a94697af73a2c9d7803807fc1947a26ee96d910","observation_id":"856ce5a5-da23-4465-af5c-050e10ea4607","resolution":{"observed_at":"2026-07-01T14:15:46.814311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.696246Z","title":"Attention is all you need","venue":null,"work_id":"6ad69da7-3f73-4c4c-89ad-1c58eba3aa3d","year":2017},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:02df317ce62c155e647c244db8f276049a04962a6b2f0d759d60bf8d01c1f5f2","observation_id":"8f495e66-b840-4698-ae55-51a91a413d0e","resolution":{"observed_at":"2026-07-07T14:43:52.697454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.719925Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"b6e28509-52a5-4d9f-bc80-0133262b65c6","year":null},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:4c69c78c8719c1d68c208c1c3789000c05412b811dc5945f7d75340061f77e93","observation_id":"59576cda-2c6b-49f8-8301-01283c491aef","resolution":{"observed_at":"2026-07-07T14:43:52.721376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/icra57147","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:07:27.414544Z","title":"Aerial Tensile Perching and Disentangling Mechanism for Long-Term Environmental Monitoring","venue":null,"work_id":"56a49a8b-40d2-4115-b187-318d0565d1e9","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:181fab95f97bfe74feff36a2f71fa7d9227a8514755f2b007d7d32fe1f45b72e","observation_id":"e56ff89c-c3b8-4864-9d4c-a5edd6a83c77","resolution":{"observed_at":"2026-06-30T22:15:06.243272Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T12:50:07.502144+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T12:50:07.502144+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":"2402.10885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-07-10T14:37:15.931790Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","venue":"cs.RO","work_id":"68b58508-d209-4c82-b5da-88ed1178eaaa","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:a42eb3fd01ce0aacd280d701822c864d4c0c3907f5f1b39a689f0e9e256da4d1","observation_id":"0869ef57-6046-4d22-b3fd-92bac388203d","resolution":{"observed_at":"2026-07-01T14:15:46.817348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i22.38931","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T22:15:06.225280Z","title":"Vla-adapter: An effective paradigm for tiny-scale vision-language-action model","venue":null,"work_id":"f70f94cc-ac11-411a-9ff2-212b73f81147","year":2026},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:bb89066f1fedfc774ccb9d433fe54af7d4db07c278a4575c482959887c1f2e94","observation_id":"0e35531d-9595-42b1-88bd-421b28ba7fb2","resolution":{"observed_at":"2026-06-30T22:15:06.228055Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-07-06T21:50:40.454777Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:1a4ad62a91ee573d31206d5adb36030bb6e02416b616e2b9e7fd3df09569404e","observation_id":"6a8e3e34-85de-437e-998b-533c131989ae","resolution":{"observed_at":"2026-07-01T14:15:46.671785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:50.498934Z","title":"dvla: Diffusion vision-language-action model with multimodal chain-of-thought.arXiv preprint arXiv:2509.25681","venue":null,"work_id":"d492f2ec-989a-40de-b7f0-d47a4f04d004","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:6da2b09775d9c4cc6cd012399f44d04ad5cfe6e54a1e0a9eadecd2c62f326e89","observation_id":"b4de4511-e01f-4789-b99e-83ddd771bac2","resolution":{"observed_at":"2026-07-01T14:15:46.652581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":"2502.05855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-07-10T04:16:48.719609Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","venue":"cs.RO","work_id":"3564a757-5726-4b2a-a28e-114a4a467dfb","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:e847aed6fe7e3ef1e2213d0ad824aabb2cf8ed1708c73681f78091a32b4a0bb9","observation_id":"b66ab7d4-3561-4fae-a941-c696d553740e","resolution":{"observed_at":"2026-07-01T14:15:46.777011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.702181Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation.IEEE Robotics and Automation Letters","venue":null,"work_id":"8cdab9a3-1e3f-4714-bed2-2133bfe78de3","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:0abd875afa3189d0680d5f3159e6828d7839da80415a7a37f2fd1a6e53454b1f","observation_id":"1dbd3003-1750-4132-a549-57ddf7480848","resolution":{"observed_at":"2026-07-07T14:43:52.701481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.697943Z","title":"Af- forddp: Generalizable diffusion policy with transferable affordance","venue":null,"work_id":"119cb811-b20d-44d3-9579-4ddb5d2c1f26","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:2cbeaff798d86d83c5990c354ab6edf6910dda1bddc495e172cff853171a7aec","observation_id":"cde63f61-20ea-48e5-a2de-24e30f251151","resolution":{"observed_at":"2026-07-07T14:43:52.699383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16278","last_updated":"2026-05-18T09:58:49Z","snapshot_observed_at":"2026-08-01T11:49:26.764186Z","submitted_at":"2025-05-22T06:23:04Z","title":"DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2505.16278","doi":"10.48550/arxiv.2505.16278","metadata_source":"pith","pith_arxiv_id":"2505.16278","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving","venue":"cs.CV","work_id":"4ac9d612-065c-475b-80c6-e307b1ae4128","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2505.16278","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:75623318b9aa4e103390ffd0a4054c80d166ad1a22661413eeebfa3494f2ff8c","observation_id":"2a0facf7-99d6-4d0d-bc8a-f0bc42d61b7b","resolution":{"observed_at":"2026-07-01T14:15:46.793658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:52:59.664485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:52:59.664485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:48:32.854377Z","title":"Point what you mean: Visually grounded instruction policy","venue":null,"work_id":"743162b0-2d8c-4c05-b372-b2af9d2db447","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:44e2db21d0ab1ac12232f5a844c3ad7e59fdef0cf3c27475cda00e7902072840","observation_id":"9d7b9c21-80f2-43ea-be59-0829da473950","resolution":{"observed_at":"2026-07-01T14:15:46.799926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.726022Z","title":"Meta-world: A benchmark and evaluation for multi- task and meta reinforcement learning","venue":null,"work_id":"b85fd2de-9921-4371-b0ec-ac50dd52bd40","year":2020},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:03181c7dc8b8946dabfd667c5b8bf93848d4978841beec5e74cf8f4b8b92cfd5","observation_id":"326f7b51-42f0-4f96-a899-adb782c0fcc2","resolution":{"observed_at":"2026-07-07T14:43:52.727232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.350063Z","title":"Depthvla: Enhancing vision-language-action models with depth-aware spatial reasoning","venue":null,"work_id":"16c300ae-4c10-4266-aa06-0541694dec38","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:ab7dc6f60589ed203f575dfeb1e4739ce5d80396b5434824d4289d20de922f57","observation_id":"d6a3858a-c0a8-44ca-b3e0-d605277de5a6","resolution":{"observed_at":"2026-07-01T14:15:46.715584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2024.xx.067","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T22:15:06.222251Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":"abe541bb-03fc-47ee-b8e0-2b43dc5ff137","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:143001061dcdcc84b20bed181d9e641cdf49cf7306e74dd8e8aab7356f0cb509","observation_id":"a81d98b1-e7d0-40c8-92b7-7a122807adc8","resolution":{"observed_at":"2026-06-30T22:15:06.224416Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.861683Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"3168d701-c64b-4fb9-808f-b1e9e35b1bf5","year":2023},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:905bc53a271cc1b124ef74d957e9c981a8f4a1de2d11665c04cfd99b2fb7b337","observation_id":"d050c9eb-8992-4aea-ae9b-536123d17ea7","resolution":{"observed_at":"2026-07-07T14:43:52.733442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.768495Z","title":"Dreamvla: a vision- language-action model dreamed with comprehensive world knowledge","venue":null,"work_id":"9cb0bc43-06af-4478-8b24-e5b37af61204","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:8406d770b505b83714b70a0d349b8102988b4910e40bd4b95e6efa4fb582a13a","observation_id":"c3714327-8f08-43f1-aaf2-60a7276a7e08","resolution":{"observed_at":"2026-07-07T14:43:52.769693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16617","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:15:46.794877Z","title":"Mos-vla: A vision-language-action model with one-shot skill adaptation","venue":null,"work_id":"986991ed-4f86-4201-ab01-7a58474c910f","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:bcbb0dc71cb07591a2379212f948e321f10dfa794b17fd66a0eb71f90512f484","observation_id":"4265e98b-0429-462b-aca4-56206e8184c2","resolution":{"observed_at":"2026-07-01T14:15:46.796815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-07-10T19:47:32.593829Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:2ce7c73b5da717043ccaa451df0bcebb4c764072e21d31c2675ae706e0d21248","observation_id":"2464386f-1ff1-42d0-83e5-a098f9a40105","resolution":{"observed_at":"2026-07-01T14:15:46.674610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:09:33.955922Z","title":"arXiv preprint arXiv:2512.24673 (2025)","venue":null,"work_id":"fdc9d6ca-ab89-41b2-94c4-b85fa4154321","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:b7a6dff55db95a6b7f59d7542b1802156ecdb784d00d296bea2531cda1e7fb0b","observation_id":"5cb8089d-27e2-4331-8fe5-61276a61e83e","resolution":{"observed_at":"2026-07-01T14:15:46.655539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:43:52.759283Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":"1f95ee7e-55a8-4142-ada7-71c9d56bf67d","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:a1be8a80093f3fe75ff96feab0dfdc0a5d8dd2ede43beb8a76ca4b878bc9712a","observation_id":"ea800739-84e0-446d-bba8-b640f159be34","resolution":{"observed_at":"2026-07-07T14:43:52.760735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":"2412.10345","doi":"10.48550/arxiv.2412.10345","metadata_source":"pith","pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-07-10T14:37:16.085256Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","venue":"cs.RO","work_id":"56a1dd5b-7094-408b-8742-b80a424a62bb","year":2024},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:8d4ea15b90d662b824e1c23fc130b3c86a0ac31b8078c13298102eca12b2b549","observation_id":"a4a46732-8e89-4f04-a48b-0583ab9006b2","resolution":{"observed_at":"2026-07-01T14:15:46.662542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":58,"verified_fuzzy":37},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 1 inbound Pith citation observation for arXiv:2605.12369."}