{"as_of":"2026-08-09T20:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f93ea4df0001535eeccc0c64e339d3c0b3316a5c7a6187a1751e693dbcc4016","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:51:05.564651Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:08:36.570832Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:29:30.514537Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-08-06T14:05:28.900178Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19817","last_updated":"2025-07-26T06:18:15Z","snapshot_observed_at":"2026-08-09T06:14:13.393441Z","submitted_at":"2025-07-26T06:18:15Z","title":"Ag2x2: Robust Agent-Agnostic Visual Representations for Zero-Shot Bimanual Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:05:28.900178Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2507.19817"},"observation_digest":"sha256:2d45999323a2c491bcc4aef9816981de8c213962c07738ff5cb4266b0a007790","observation_id":"d33b1b39-c1fc-4205-be93-e74a269e4339","resolution":{"observed_at":"2026-08-06T14:05:28.900178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-08-04T10:43:40.991161Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09036","last_updated":"2026-06-24T10:18:59Z","snapshot_observed_at":"2026-08-06T06:48:09.190707Z","submitted_at":"2025-10-10T06:15:42Z","title":"RoDyn: Taming Interactive Robot-Dynamic 2.5D World Model for Robotic Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T10:43:40.991161Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2510.09036"},"observation_digest":"sha256:7588feb1d804163caf3ec5a58b19b15beda17cc37049a13c1ab18a275458e586","observation_id":"fff67d24-b737-4cff-8fe2-ff062d4198d9","resolution":{"observed_at":"2026-08-04T10:43:40.991161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2511.06754","last_updated":"2026-05-06T07:00:01Z","snapshot_observed_at":"2026-07-29T01:21:11.279990Z","submitted_at":"2025-11-10T06:33:44Z","title":"SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T00:22:41.611893Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2511.06754"},"observation_digest":"sha256:b344d65d7cde6692058a0c94033e219bbd77c5e68209ce54d005567d1443c9b9","observation_id":"028fdbbe-87a4-4252-9064-713e605b5d95","resolution":{"observed_at":"2026-05-18T00:25:32.979738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2604.05484","last_updated":"2026-04-07T06:24:41Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:24:41Z","title":"CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:12.286456Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2604.05484"},"observation_digest":"sha256:d744e7eb9106139a7bd8468c93e36fa523ad319b8dfcee5826d9d79626c3879d","observation_id":"8fc455d9-e6c7-44c4-8e69-2d599f1370b6","resolution":{"observed_at":"2026-05-10T22:55:52.618248Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2604.17876","last_updated":"2026-04-20T06:38:01Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T06:38:01Z","title":"OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T04:50:33.134927Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2604.17876"},"observation_digest":"sha256:6d93e6e0b8f8f824ebe7da590fcd13adbd4b4fc830bbc2f82c8ed6c7c6d88f3d","observation_id":"b58a1dcb-a01d-4e5f-a51f-6b8a8fc1da92","resolution":{"observed_at":"2026-05-10T11:35:19.021480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2604.23121","last_updated":"2026-04-25T03:18:07Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T03:18:07Z","title":"Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T08:07:47.793895Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2604.23121"},"observation_digest":"sha256:d3376b8d754ce230ccb6712e7b6d21c7326ac0a1185bf410899f48d96cffba05","observation_id":"c4febba7-8387-4ccb-bdd3-5d0ebb6ffe1f","resolution":{"observed_at":"2026-05-11T20:46:11.595737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2605.12236","last_updated":"2026-05-12T15:07:04Z","snapshot_observed_at":"2026-08-03T01:51:28.024049Z","submitted_at":"2026-05-12T15:07:04Z","title":"TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T04:22:07.953637Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2605.12236"},"observation_digest":"sha256:df8e485badde6a4f81597011501506dcec898581b1e5b1a6f3808c7b421b2c98","observation_id":"5813eb5c-32b6-470d-a900-9fd4888a5281","resolution":{"observed_at":"2026-05-13T04:22:14.583427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:2b80ba10551db439a4216b7f24039d17a3f49420afe1f1316e118e33a8602235","observation_id":"ed470334-f0ba-422c-922a-939f8f57033f","resolution":{"observed_at":"2026-06-29T07:23:13.455458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:9975d63c15042f1663189ac3c194749061bbdcf57287f818b695e7f50b78699b","observation_id":"27e3a5be-f2fb-4e2c-aae8-907fc7f80c20","resolution":{"observed_at":"2026-07-03T14:48:32.825517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2606.14752","last_updated":"2026-06-28T06:47:31Z","snapshot_observed_at":"2026-08-05T17:35:14.456940Z","submitted_at":"2026-06-07T09:39:39Z","title":"X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T11:23:36.941801Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2606.14752"},"observation_digest":"sha256:b0aa34206a758681e6074308af72741b6c84d95b1ceb661a1855248a3452fff8","observation_id":"19db67d5-ffa5-443a-90d6-5beb6bb7b0f7","resolution":{"observed_at":"2026-06-30T11:24:37.882421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2606.20867","last_updated":"2026-06-18T18:54:51Z","snapshot_observed_at":"2026-08-03T13:52:03.831619Z","submitted_at":"2026-06-18T18:54:51Z","title":"FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:08.616612Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2606.20867"},"observation_digest":"sha256:e5b148ddf3c098399970cee50a94e4893758d33d56c365446f8941d1e37ba6a9","observation_id":"b2fab49c-65e1-4a40-94a3-3accfa9d07fb","resolution":{"observed_at":"2026-07-04T03:29:30.517227Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-08-07T20:08:36.570832Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05970","last_updated":"2026-08-06T12:46:13Z","snapshot_observed_at":"2026-08-09T20:13:08.951031Z","submitted_at":"2026-08-06T12:46:13Z","title":"SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T20:08:36.570832Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2608.05970"},"observation_digest":"sha256:5ee3fff06ac7bfd75967521f44264b54f0ad5f495a1e45680e9bcf55d67bf5d5","observation_id":"49371b32-4dc8-43cc-a7d5-2b9dd8e113be","resolution":{"observed_at":"2026-08-07T20:08:36.570832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16211/citation-record","integrity":"/paper/2506.16211/integrity","json":"/paper/2506.16211/citation-record.json","paper":"/paper/2506.16211"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-08-06T23:51:04.845336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:04.845336Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:1618e23d0b5c44f6d00b045de47ac45278d081b7c81339385bddb5e7edcf702e","observation_id":"53acf680-4cd6-42a3-9738-8f482421420f","resolution":{"observed_at":"2026-08-06T23:51:04.845336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.409166Z","title":null,"venue":null,"work_id":"84afb696-45d0-47ce-8f05-aeb766cb96f0","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:04.971311Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:9915dee49c1228b722cd594964cb1d44a5778d30b3e182e0afad6a4d6192c3e2","observation_id":"24b6b7d9-3775-4067-854b-24b403a0edea","resolution":{"observed_at":"2026-08-06T23:51:06.413572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-06T23:51:05.020892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.020892Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:4c50ffccde88847382487b572bcee828bc13e4f8ed356e1604f34089cd9f593d","observation_id":"3743e857-a31c-4f6b-9dbd-c97790271b1d","resolution":{"observed_at":"2026-08-06T23:51:05.020892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.393799Z","title":null,"venue":null,"work_id":"f9f2a6a8-62ae-43d4-b3be-72e5eb86bf53","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.148613Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:e613b21381ec5c99ef4088bfb285f72f75558a50eff6efbb6e74ffdb6a10a326","observation_id":"10ec7206-8122-40ec-aca1-ab548f5291da","resolution":{"observed_at":"2026-08-06T23:51:06.398694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18369","last_updated":"2025-06-22T01:43:26Z","snapshot_observed_at":"2026-07-06T19:58:00.412286Z","submitted_at":"2024-11-27T14:17:43Z","title":"G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18369","snapshot_observed_at":"2026-08-06T23:51:05.241297Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.241297Z"},"links":{"cited_paper":"/paper/2411.18369","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8b5120e92764be11489cc16f8cee009a33319fbb7b0a149903ee40e312151558","observation_id":"6709822b-3d59-42e6-a973-a5af90811532","resolution":{"observed_at":"2026-08-06T23:51:05.241297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.379691Z","title":null,"venue":null,"work_id":"2ddbb965-bedf-410e-863a-bc2556e18ebf","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.305317Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:06445b9b54a15b83be327d51cc1eb4addd54632095d1f64608738d819e939ea1","observation_id":"aa23ab53-82a4-434d-8ab1-a3de0f8373d6","resolution":{"observed_at":"2026-08-06T23:51:06.384171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00965","last_updated":"2025-05-13T19:03:52Z","snapshot_observed_at":"2026-08-09T12:44:47.925654Z","submitted_at":"2024-11-01T18:32:23Z","title":"SPOT: SE(3) Pose Trajectory Diffusion for Object-Centric Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00965","snapshot_observed_at":"2026-08-06T23:51:05.310332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.310332Z"},"links":{"cited_paper":"/paper/2411.00965","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:0c4dbc9f9ddf20896228d2893fbacdde518002de45053baad1eb841729bf3fba","observation_id":"f102da75-3367-41a3-bebf-4a1a35638799","resolution":{"observed_at":"2026-08-06T23:51:05.310332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10329","last_updated":"2024-03-06T00:11:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-15T21:11:50Z","title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10329","snapshot_observed_at":"2026-08-06T23:51:05.315137Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.315137Z"},"links":{"cited_paper":"/paper/2402.10329","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:2298312e7c602421f522fd4a758a0e3b2a8f2104fcbd2f5bcbe95620a316832d","observation_id":"b9edca07-ac70-4075-a75c-2eb00d38d7b1","resolution":{"observed_at":"2026-08-06T23:51:05.315137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.365540Z","title":null,"venue":null,"work_id":"db6c7585-97d3-4f18-ae20-4efa7cf53d02","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.320125Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:5fbf0136b1d9f039b002cf5d4bebc6111dcb93a195acfb4085d6533555c977c4","observation_id":"12c2b4c4-c24b-4818-bc06-6557efe69113","resolution":{"observed_at":"2026-08-06T23:51:06.370196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24185","last_updated":"2025-03-06T05:34:17Z","snapshot_observed_at":"2026-08-03T14:12:29.992356Z","submitted_at":"2024-10-31T17:48:45Z","title":"DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24185","snapshot_observed_at":"2026-08-06T23:51:05.324527Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.324527Z"},"links":{"cited_paper":"/paper/2410.24185","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:2a534e16ce7047b34eeb5744c0ef5288ff2938e89bb9ca4d1ac849db5ecc9759","observation_id":"fb141498-28bc-4ab8-8223-bd5e1e935b2a","resolution":{"observed_at":"2026-08-06T23:51:05.324527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T23:51:05.329116Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.329116Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:ad67d8ef0aee99e5a118f2f38cd157921f333441b96db19013c3bfb722840cb9","observation_id":"b67b89f6-dba4-4c1d-859a-a2eb8a8d0e91","resolution":{"observed_at":"2026-08-06T23:51:05.329116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.350480Z","title":null,"venue":null,"work_id":"741192f3-dfd5-411a-a615-08d23d47a007","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.333582Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:a6602244f1f4559a75b36e0c786025fe4304036f511e1acf2b28f8f2f0019183","observation_id":"5434ca92-d28a-4d43-a5bf-a5ffb9011982","resolution":{"observed_at":"2026-08-06T23:51:06.355296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.335990Z","title":null,"venue":null,"work_id":"8203fa29-f41c-49df-b99b-d0c7213414a9","year":2025},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.337888Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:589e06d6d344bb9016d360bb9b10cb11cdfe5f018df818d7d1307086c65572b7","observation_id":"2920bfd2-698c-417d-b44f-3398e71fae21","resolution":{"observed_at":"2026-08-06T23:51:06.340945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.321398Z","title":"Huang, S","venue":null,"work_id":"df94eefc-853d-4d35-a620-dab73627e217","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.341678Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:f279bc4c4dd45604f2570ac9c6cf9874a84c797ed65cd315683916556097e1a8","observation_id":"0a42fde1-05fa-4965-9ab9-194ad301421d","resolution":{"observed_at":"2026-08-06T23:51:06.326178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.307188Z","title":null,"venue":null,"work_id":"70d643e2-ffeb-406a-9733-06334ffdf774","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.345758Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:a4425f2dc7ac4e7f859d507d1863cb5e2f32aec5c3e8c0a209c216488324b60a","observation_id":"44ca8117-ffa3-4ba3-8b2f-4f61a5c76260","resolution":{"observed_at":"2026-08-06T23:51:06.311543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.292839Z","title":null,"venue":null,"work_id":"d11eadfe-2f0f-4234-8fae-ca86af62c587","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.349416Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:357760224eeaff671c2ac8ef341132bbd13c43cdd5a781078cc4373bba17ee32","observation_id":"e36abc5f-663f-4985-9208-3b9a1bc7c1bd","resolution":{"observed_at":"2026-08-06T23:51:06.297310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-08-09T09:28:00.163287Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-08-06T23:51:05.353073Z","title":"Torne, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.353073Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:4966bf96f8ef9074f382458d172ba8fc4367db5bafcf38b9821c78bb62b3c012","observation_id":"6a6d9936-f27f-4121-9e17-6715b23cb50f","resolution":{"observed_at":"2026-08-06T23:51:05.353073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17596","last_updated":"2023-10-26T17:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-26T17:17:31Z","title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17596","snapshot_observed_at":"2026-08-06T23:51:05.357203Z","title":"Mandlekar, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.357203Z"},"links":{"cited_paper":"/paper/2310.17596","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:b99f0f9e4a25cea04e4a82960cc97a2004a35ff7f813cc86d004673f8e249f72","observation_id":"998ae332-334f-448f-b49c-6788db8aa696","resolution":{"observed_at":"2026-08-06T23:51:05.357203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02920","last_updated":"2025-04-16T17:31:39Z","snapshot_observed_at":"2026-07-06T19:10:34.393689Z","submitted_at":"2024-09-04T17:59:52Z","title":"RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02920","snapshot_observed_at":"2026-08-06T23:51:05.361677Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.361677Z"},"links":{"cited_paper":"/paper/2409.02920","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:582b8a70b9a14a0f814d961ea5ceb35ec2cb5ba49d75569db4df210e3dbfdb33","observation_id":"ffc1e156-24ae-42ec-920f-4664b4d2668e","resolution":{"observed_at":"2026-08-06T23:51:05.361677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.365914Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.365914Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:887e3ac6d5f00d31aedbf145f12b4eb38e90e06c77538d30cb7c06117a7a5e4e","observation_id":"ae9e3d4e-b8a2-4919-a1c5-79bbf547d64a","resolution":{"observed_at":"2026-08-06T23:51:05.365914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.370129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.370129Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:2bfa968ea8f45d55fe881f9e9a24ec22cc1b6fa65dd0c554b589953c64ced208","observation_id":"71d98caf-432d-4063-afd0-bcbc680928d3","resolution":{"observed_at":"2026-08-06T23:51:05.370129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T23:51:05.373806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.373806Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:e8dfdfc7bd5355fc965794ab387ed0a819b9320468b12772509e805bfa71012b","observation_id":"781c4e61-c402-41b0-8f99-a5c44169bc12","resolution":{"observed_at":"2026-08-06T23:51:05.373806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T23:51:05.377722Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.377722Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:d84794958f906b34a3ee31a916b79fa81bdc608d65a8afc359eac595092405f2","observation_id":"c6baf59e-1106-4231-aad2-8e8aeb2c6d45","resolution":{"observed_at":"2026-08-06T23:51:05.377722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T23:51:05.382153Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.382153Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8093fbdf22a50d6c5148019f4ff0127e2dd4542ea8d34e7293acc840d000536a","observation_id":"6f9c26fd-89b7-4d39-851d-3702d09d5286","resolution":{"observed_at":"2026-08-06T23:51:05.382153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-06T23:51:05.386011Z","title":"O’Neill, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.386011Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:119ac7b9d6dd83d0c338c74c0aa449c32999594397295df1c77d67578522f42a","observation_id":"2089d7f5-93ce-4dec-9f61-c58a2b0a3e7e","resolution":{"observed_at":"2026-08-06T23:51:05.386011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T23:51:05.390144Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.390144Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:b806335c5f885bca740194b13c553113eda8bafe9102f78a9533607c2f42cec8","observation_id":"e4106095-b4d8-467f-8a49-324fed201f2e","resolution":{"observed_at":"2026-08-06T23:51:05.390144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.261885Z","title":null,"venue":null,"work_id":"7c6b0380-dcbc-4177-8f8e-e71b60a914ec","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.394404Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:a3fa4995319d7b308222133183a10f33ebe1f0bc18ace05340c4247bc0ca8274","observation_id":"a7eefe94-574b-4443-8831-d84e432eb660","resolution":{"observed_at":"2026-08-06T23:51:06.266276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.398711Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.398711Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8abdf67eb0657f7dd656bad438e9c239d9097045045e67a046abd58c796f6d9b","observation_id":"2776f220-336c-4073-b42a-25e4523a694b","resolution":{"observed_at":"2026-08-06T23:51:05.398711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05268","last_updated":"2024-12-06T18:55:09Z","snapshot_observed_at":"2026-07-06T20:02:57.733746Z","submitted_at":"2024-12-06T18:55:09Z","title":"DenseMatcher: Learning 3D Semantic Correspondence for Category-Level Manipulation from a Single Demo","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05268","snapshot_observed_at":"2026-08-06T23:51:05.402554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.402554Z"},"links":{"cited_paper":"/paper/2412.05268","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:053143cd8614c3a024d93cb12dd4921e3640d039297fa0feca30f55ee72bc051","observation_id":"31347ab5-89e4-4054-9245-a85a0314e0e4","resolution":{"observed_at":"2026-08-06T23:51:05.402554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10790","last_updated":"2018-09-27T22:45:53Z","snapshot_observed_at":"2026-08-09T11:03:11.134683Z","submitted_at":"2018-09-27T22:45:53Z","title":"Deep Object Pose Estimation for Semantic Robotic Grasping of Household Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.10790","snapshot_observed_at":"2026-08-06T23:51:05.406504Z","title":"Tremblay, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.406504Z"},"links":{"cited_paper":"/paper/1809.10790","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:321478d5107e8644d7b5adacb7041e8894feb7f4355756fb1f6e9204048a17a8","observation_id":"57f1110b-73d2-4ee7-99aa-ea5662ce3d31","resolution":{"observed_at":"2026-08-06T23:51:05.406504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.240422Z","title":"Tyree, J","venue":null,"work_id":"87e9b363-b05a-4214-b9ea-e2382fbde71b","year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.410625Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:6833efab274eded0f41b155d0ec337585b16ef6c43dfffddd5046a4275515ac3","observation_id":"ab0881a8-66fa-4b01-8888-c298d62784f4","resolution":{"observed_at":"2026-08-06T23:51:06.244679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.414591Z","title":"Migimatsu and J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.414591Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:1d20d34fbf04392a5827670d50e4440475e89037f62dda00d10ad3e04d2ae5b5","observation_id":"6027aae2-becb-4268-bb2f-2747a4bc7ac8","resolution":{"observed_at":"2026-08-06T23:51:05.414591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.217906Z","title":null,"venue":null,"work_id":"d357e99d-a47f-46d5-b6bb-73d09586baf9","year":2019},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.418384Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:48beaac5960a67fc1fbb0aec9b82137d0feec9f85c9391cdb60f0fa079b00956","observation_id":"69e1497f-f748-45fe-a3b9-700c6d65cb3c","resolution":{"observed_at":"2026-08-06T23:51:06.222540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.204415Z","title":"Devin, P","venue":null,"work_id":"91c925a1-751e-47b7-a560-1c9948fefb55","year":2018},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.423236Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:e50bbc261cf0ca2115badf953143973c1f8d3e88fde9eb1fcfba6781a1fa1caa","observation_id":"37e04de4-db34-4e8a-a077-eb8902a63ecb","resolution":{"observed_at":"2026-08-06T23:51:06.208714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.190325Z","title":"Locatello, D","venue":null,"work_id":"e2855232-6187-4552-aaa7-9952dad6ad52","year":2020},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.427977Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:e9fbd6b50d5226d5e1de4a8bac4327763c8550692dfd86092af836ff263add0a","observation_id":"6644594f-06b5-4192-9696-e405ca079be9","resolution":{"observed_at":"2026-08-06T23:51:06.194944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-06T23:51:05.432378Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.432378Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:3de2f99ae7f86b64303f8ede19ad6e80d94c390ae46f973ac18b8ea168da3e53","observation_id":"11d0a78b-0401-4773-bed6-2bbd59e90b06","resolution":{"observed_at":"2026-08-06T23:51:05.432378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.176089Z","title":null,"venue":null,"work_id":"02ee5672-2ebf-4e30-914f-6b6a1ba32370","year":2021},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.437120Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:377430ac40c7fbc9413e75ff12e40251cd5cea8a317bb29314cabe095c2ddbef","observation_id":"c012871e-e0af-44e4-895a-ac63d00c216a","resolution":{"observed_at":"2026-08-06T23:51:06.180647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.162725Z","title":"Heravi, A","venue":null,"work_id":"6e2fc80b-4453-416e-b7ea-c3f9349dd9f0","year":null},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.441912Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8f0da833a52d1b2e979ad46235cc3360f157bc2f133b414115881a9bfee29cfd","observation_id":"7b2b6983-52c7-419e-bb41-46b3f5252e36","resolution":{"observed_at":"2026-08-06T23:51:06.166949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09162","last_updated":"2024-08-17T10:37:07Z","snapshot_observed_at":"2026-08-03T11:40:17.551311Z","submitted_at":"2024-08-17T10:37:07Z","title":"Zero-Shot Object-Centric Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09162","snapshot_observed_at":"2026-08-06T23:51:05.446892Z","title":"Didolkar, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.446892Z"},"links":{"cited_paper":"/paper/2408.09162","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:73a3f418d2a789773c63a9b3a05b2c0446fe2d03881a3c11e3380c6ba80ca1f9","observation_id":"168b2c4f-2d25-4599-86bd-93423394dbd9","resolution":{"observed_at":"2026-08-06T23:51:05.446892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04419","last_updated":"2023-06-12T06:29:22Z","snapshot_observed_at":"2026-08-08T04:47:07.138332Z","submitted_at":"2023-02-09T03:11:21Z","title":"An Investigation into Pre-Training Object-Centric Representations for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04419","snapshot_observed_at":"2026-08-06T23:51:05.452350Z","title":"Yoon, Y .-F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.452350Z"},"links":{"cited_paper":"/paper/2302.04419","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:cc71200a8ab172b0a0657888e121dbdca3c5bfdb9ec5a15c028df2c6f5c7a4ec","observation_id":"45466b54-eaf7-4a98-8d1b-44323e663ace","resolution":{"observed_at":"2026-08-06T23:51:05.452350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.146627Z","title":null,"venue":null,"work_id":"8dc40930-b3ac-4c09-9f4f-18d289d5206f","year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.457334Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:d9034757ff86942dd52d423035c3ed5b808a32f32e09e58ef4573881908d6cf9","observation_id":"5ae50293-7817-4635-aab7-310d03f9b75f","resolution":{"observed_at":"2026-08-06T23:51:06.152241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.131172Z","title":null,"venue":null,"work_id":"18c4408d-61d2-4374-8209-514ed2f0419e","year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.462541Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:36bde41431dffa20b1a119c00069abaeaff4ca42eb9a87e276ddcd7e66f110d2","observation_id":"1c96920f-812b-42e0-bed5-ede0ebce4e50","resolution":{"observed_at":"2026-08-06T23:51:06.135773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.116981Z","title":"Stable diffusion v1.5 model card.https://huggingface.co/runwayml/ stable-diffusion-v1-5, 2022","venue":null,"work_id":"adb6c5cf-f2a1-403c-af30-4ee767073bde","year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.467010Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:d58993342c09b942f932ae9f0922c06146778f433f5e207fcd8931e14ac33b7c","observation_id":"9c1fbef4-b8ec-4ff8-882d-0f8b321c677c","resolution":{"observed_at":"2026-08-06T23:51:06.122138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.102411Z","title":null,"venue":null,"work_id":"5a5493fd-d3bc-433a-9709-c1c7b9a70f23","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.471119Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:85aeaea227beca9973a1601b4a9d7c7341ff8c157331856efd4162d5ec2a884a","observation_id":"9d5454d4-9a24-4458-9b93-c7625e4d3ee2","resolution":{"observed_at":"2026-08-06T23:51:06.107327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06573","last_updated":"2024-08-12T14:52:49Z","snapshot_observed_at":"2026-07-06T16:59:56.350207Z","submitted_at":"2023-12-11T17:58:06Z","title":"ControlNet-XS: Rethinking the Control of Text-to-Image Diffusion Models as Feedback-Control Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06573","snapshot_observed_at":"2026-08-06T23:51:05.475594Z","title":"Zavadski, J.-F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.475594Z"},"links":{"cited_paper":"/paper/2312.06573","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:cb6c3d422fac196c709b1df2c1c9ffaf04f1311e6c47f3a63794152a19b2a5c7","observation_id":"c1a03e2e-f18d-46e2-be08-e8a6d00adf5b","resolution":{"observed_at":"2026-08-06T23:51:05.475594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.088034Z","title":null,"venue":null,"work_id":"88e1b531-1533-41eb-aee4-ab20892cb741","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.480005Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:d61ae914e1256dd982621b0133164a324eefba685436b239faa028d16559f009","observation_id":"6802722f-9f79-47f5-bd9f-89530512801f","resolution":{"observed_at":"2026-08-06T23:51:06.092961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.072369Z","title":null,"venue":null,"work_id":"ee414252-3bbf-42b9-a991-0180a1ad73a0","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.484539Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:76692f624745bf38660ff1734078133e4ab5c89e681761cf454f25662c97ec4f","observation_id":"08c6105a-ee10-4731-8c6c-afa6600bf20b","resolution":{"observed_at":"2026-08-06T23:51:06.077473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.488962Z","title":"Bar-Tal, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.488962Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:270f9afe0d53b784254f561d5e3121affc74f3976313f0a9ee0c42cf1aa6ab8d","observation_id":"73232784-6260-411b-a695-60a0ac9a5d2d","resolution":{"observed_at":"2026-08-06T23:51:05.488962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.049002Z","title":"Dai, L.-H","venue":null,"work_id":"dc0e723e-a040-4ec1-8675-09cf194dccf5","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.493365Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:5c0dce5f029ea2cc3c6bc082cff247178873a5c1d3198955ccad36cce84206a7","observation_id":"8814db4c-fa02-4477-bad9-47d83a39da8b","resolution":{"observed_at":"2026-08-06T23:51:06.053967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:06.034072Z","title":null,"venue":null,"work_id":"453280fd-b5a0-4e71-9ff0-6c9127455ec6","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.498683Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:2886bd7426308d3600c4663abbe0b9218919648e9de4f1d3016f9bf743f29eb2","observation_id":"1fef668c-b1ef-4f1a-87a7-07fbe2a7171d","resolution":{"observed_at":"2026-08-06T23:51:06.039106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.503078Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.503078Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:4b2e4446c22399a8d60d089981701950bb61ffbfbd94a863eaa9092834d1e16b","observation_id":"094b105c-41c1-4408-b040-87c109eb108f","resolution":{"observed_at":"2026-08-06T23:51:05.503078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.508411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.508411Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:6b59b5ea715eb7620722861cb47971d3569d9a849df2b99e83405b8aabd29709","observation_id":"0eda8c59-061c-45c6-a4ad-bc6afc8f021f","resolution":{"observed_at":"2026-08-06T23:51:05.508411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T23:51:05.512735Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.512735Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:812200c0d65917e81ece4b3f5c5183adfb0c47f1924a30d6467b57b84896d460","observation_id":"257b6e7f-9da2-416b-8d1d-dd1e5d1e21de","resolution":{"observed_at":"2026-08-06T23:51:05.512735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.516993Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.516993Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:7a0802e7aadca5688dd93fab6f4899c81e3a962854ff8534720ae2732914d058","observation_id":"d5638925-aebe-47b4-9048-97992808df66","resolution":{"observed_at":"2026-08-06T23:51:05.516993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.522115Z","title":"Krizhevsky, I","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.522115Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:652b930a2406e31fbe7e7caae5cb77ea7bbffcc47255efc75d4af001f09408bd","observation_id":"cb770695-661f-42d0-b598-c3c1fbeca1ab","resolution":{"observed_at":"2026-08-06T23:51:05.522115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T23:51:05.527593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.527593Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:5c0e95832fe93dcf0bf0b0f96776d4e15313d3e13abc80a39238c6c154060ccf","observation_id":"9f592a5a-79e5-4b5f-9741-1bc67c350e3d","resolution":{"observed_at":"2026-08-06T23:51:05.527593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.985262Z","title":null,"venue":null,"work_id":"d8e8993a-4e4e-4a11-a225-5f32db5356c9","year":2022},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.533167Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:fbb6405d668ded22a6c88de0437c77fdb45c7f90162360782628698fcfcb840b","observation_id":"a31165a0-14fc-47c0-90b5-3d49cf2f0175","resolution":{"observed_at":"2026-08-06T23:51:05.990154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.538786Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.538786Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:34fbbbaae435b30be629f30672bfca12e5c26ad5c6e3c21af3c277a8930e43f1","observation_id":"cb1f02cd-b236-4b34-b417-427e5d224f48","resolution":{"observed_at":"2026-08-06T23:51:05.538786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.543711Z","title":"Khazatsky, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.543711Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:3644a4a86ae8aa69a9dbb92dd559192e2f7d1ad1ddf11ab1963ae655b1bc8e23","observation_id":"53e4b447-c84d-4971-a6ea-afd045c95f2a","resolution":{"observed_at":"2026-08-06T23:51:05.543711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.549380Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.549380Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:8c3171a7e1dc2b61ca9c29af4dfc57d74e65180c30f0ce43eafb0beb76ea1eee","observation_id":"a145d811-0bbc-4c71-9008-28c2e2228016","resolution":{"observed_at":"2026-08-06T23:51:05.549380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.945985Z","title":"Campos, R","venue":null,"work_id":"02196cdc-bea1-4d5d-b125-1d881a9dfa95","year":2021},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.554756Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:43806929c3c2d5535d1b62e9a99d0b4cb7b8a6ba901a286a6cf06451c3432b9e","observation_id":"02556ad7-f4c2-421b-99d0-8e270d441f1f","resolution":{"observed_at":"2026-08-06T23:51:05.950992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.931113Z","title":"Meta Quest: Virtual Reality Headset.https://www.meta.com/ quest/, n.d","venue":null,"work_id":"66b71197-d1e0-4b37-bd9d-eaaa68cf6dce","year":2025},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.559399Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:1e38165a3b51deb65b70747dd93a80cc484d13e64546b941b96f26f85c65d9fe","observation_id":"6177047f-aa54-44f6-aea6-ef3cb1efdf54","resolution":{"observed_at":"2026-08-06T23:51:05.936241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:51:05.913929Z","title":"Astribot S1: AI Robotic Partner.https://www.astribot.com/ product-en, 2024","venue":null,"work_id":"ba201aa6-ee24-4ddd-bfaa-27f004b1eaa5","year":2024},"citing_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.564651Z"},"links":{"citing_paper":"/paper/2506.16211"},"observation_digest":"sha256:e30598d0c65d3790bb38a7d297e5be7a8ee1593d9a7efb7a6a9f1b58eedd9d33","observation_id":"5fdcae0a-3e61-4d20-a971-52375e32b597","resolution":{"observed_at":"2026-08-06T23:51:05.920767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T16:15:57.996509Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 12 inbound Pith citation observations for arXiv:2506.16211."}