{"as_of":"2026-08-05T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:041c4f7d05eac823a96cfc1259a297797bd30450a14bbe8b2397a5e5e628d522","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:00:20.896966Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-07T12:28:21.318505Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T12:33:45.452965Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-07-13T09:40:35.215938Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T20:21:45.365156Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:2e0c89093e3c7f78b4e45d31d2f63ad27444babe910c302505f399460e6f238c","observation_id":"29bcc586-fdd6-4570-a3f1-1810b5506305","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T17:53:44.901684Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:9e89486fcd342de481ff9adc73c6523caf171ee19c615294163404e041484660","observation_id":"ff9f8454-ac41-4d72-a36f-9a1ebc423a2c","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T00:59:54.787472Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.02881"},"observation_digest":"sha256:cbe6f7f1a6e9852e69e4c69d274f586d498ba29d7ff4f6d7c8d877cf8eb8503c","observation_id":"5f5dc25b-ad35-4b5c-8263-6d52775a873b","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T03:57:10.338617Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:5a5f5aa4a028b6b9a0b5e7b6fc5ab4f2915a9e38227d635187c87a2444cf7f5e","observation_id":"f801e2ea-02e8-4226-a404-f3f954eb394a","resolution":{"observed_at":"2026-06-29T02:14:23.857212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:c837abcbe50217c2a517eb274e4e146a50244c9d5e00fc7514270e7c7da80333","observation_id":"e57183a7-40e2-4b37-981a-ad9601eefce0","resolution":{"observed_at":"2026-07-01T14:15:46.683779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2605.14950","last_updated":"2026-05-14T15:21:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T15:21:36Z","title":"Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T21:39:15.662180Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2605.14950"},"observation_digest":"sha256:6b9e4f4ed759b98c6f404db7ef1e17432bcebe52193fea231321abca06e27989","observation_id":"a7561048-f502-4d09-aaf8-2992e5b5d62a","resolution":{"observed_at":"2026-07-01T14:25:46.196481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2606.02274","last_updated":"2026-06-06T05:27:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T14:01:11Z","title":"Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T14:41:50.084254Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2606.02274"},"observation_digest":"sha256:9b78289f34f3e2836c89f2f8d58919c6a0f9a87cf6412afc142cd11f44259726","observation_id":"d484f26f-42dd-4851-aad3-6662d8f9ab1b","resolution":{"observed_at":"2026-07-01T23:06:20.378897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2606.10862","last_updated":"2026-06-09T13:39:49Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:39:49Z","title":"LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T13:47:28.832078Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2606.10862"},"observation_digest":"sha256:eb44114c10ecaeeddaad5f97e198398ff9df6fd0de9a42789e1e848294988988","observation_id":"a7e3c69d-5d32-4bf0-8d84-b30f4260f15e","resolution":{"observed_at":"2026-07-03T04:37:37.072871Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2606.29384","last_updated":"2026-06-28T13:19:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-28T13:19:11Z","title":"Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T07:01:48.330369Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2606.29384"},"observation_digest":"sha256:bee1c638a834cbe90cea3332f511d47069cfc8f7ffe89f6f1879af67ea64a3d2","observation_id":"b1ebb169-2504-4e9d-ba44-7e4680adbf17","resolution":{"observed_at":"2026-06-30T07:04:21.054350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":"2512.21970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-07-07T12:33:45.452965Z","title":"Stereovla: Enhancing vision- language-action models with stereo vision","venue":"cs.RO","work_id":"b25d079e-87f4-491d-8b92-8050c3264d0d","year":2025},"citing_paper":{"arxiv_id":"2607.05396","last_updated":"2026-07-06T17:59:59Z","snapshot_observed_at":"2026-07-09T23:18:26.152841Z","submitted_at":"2026-07-06T17:59:59Z","title":"From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-07T12:28:21.318505Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2607.05396"},"observation_digest":"sha256:4751a6f16b57bf4a28849bf18360a1676cb281dfb6f6177ef974eaa8e0f4789d","observation_id":"edf36261-3759-4659-977e-f093520ed7b4","resolution":{"observed_at":"2026-07-07T12:33:45.454775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.21970/citation-record","integrity":"/paper/2512.21970/integrity","json":"/paper/2512.21970/citation-record.json","paper":"/paper/2512.21970"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-04T10:58:38.750074Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-03T14:00:20.737775Z","title":"Paligemma: A versatile 3b vlm for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.737775Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:1d3d99a5cf6e2ccdbe06ca17aef5d7f847cdd5564d9263d1e9831f7601f42822","observation_id":"46c1f415-e2de-4090-84b6-4c84f4b9f9bc","resolution":{"observed_at":"2026-08-03T14:00:20.737775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T14:00:20.741580Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.741580Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:0f6ffe2b6b6b25da993cb7612f2322474ef632563e833dcd367ab39d0bb38f78","observation_id":"f57f7164-e780-41dd-b100-7eae2098dd6f","resolution":{"observed_at":"2026-08-03T14:00:20.741580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-03T14:00:20.744666Z","title":"Open- vla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.744666Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:9733381a11f4ebccdf8618732de85b395ae0751082393241777887f8dcbfb962","observation_id":"fc92c517-4865-4452-bc7b-95c19d52efc7","resolution":{"observed_at":"2026-08-03T14:00:20.744666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T14:00:20.747597Z","title":"π0. 5: a vision- language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.747597Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a0ebab36e6f20bc90f6803c7c3528ea2a3b4ae2fd85cb2e40c6f2ed1579852e1","observation_id":"ba07debc-8ef5-439a-8209-c1b2b6bdb2a3","resolution":{"observed_at":"2026-08-03T14:00:20.747597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-03T14:00:20.750637Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.750637Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:90b2ad6f4e0856a4ea5030f6275290f0e1fa48ff3f1fbc77e66c8d71d1602988","observation_id":"f730debf-8187-427d-967b-d0a5525fe6cd","resolution":{"observed_at":"2026-08-03T14:00:20.750637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-03T14:00:20.753591Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.753591Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:2f2e016a4fde56df3c44466dbc49cab760fb86b612bde246ca2c03ad2f3a0469","observation_id":"6825f712-3351-4e25-aa62-63d2296ebe0f","resolution":{"observed_at":"2026-08-03T14:00:20.753591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.756756Z","title":"Rvt: Robotic view transformer for 3d object manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.756756Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:30a801c069ec083575a3fe165af9e4fc134e06001f9c168adeb55a320f2498e9","observation_id":"03fd8ee7-6853-4824-ae1f-c8df13e08116","resolution":{"observed_at":"2026-08-03T14:00:20.756756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-03T14:00:20.759135Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.759135Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:6c3f033b31a72e42fe85399d8208d174c30e8d89b705e10998f3c696b919a5a8","observation_id":"662f0ae5-f798-498d-9708-7c14a6018916","resolution":{"observed_at":"2026-08-03T14:00:20.759135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-03T14:00:20.761836Z","title":"Graspvla: a grasping foundation model pre-trained on billion-scale synthetic action data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.761836Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a99d61761a8477256303224874d52e07f20f74a8f7dacff617ac393c746925fa","observation_id":"d0453c9e-7fcb-4835-9a80-0b48797b0afe","resolution":{"observed_at":"2026-08-03T14:00:20.761836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03659","last_updated":"2023-07-07T15:26:03Z","snapshot_observed_at":"2026-07-06T15:51:31.792957Z","submitted_at":"2023-07-07T15:26:03Z","title":"Decomposing the Generalization Gap in Imitation Learning for Visual Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03659","snapshot_observed_at":"2026-08-03T14:00:20.764446Z","title":"Decomposing the generalization gap in imitation learning for visual robotic manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.764446Z"},"links":{"cited_paper":"/paper/2307.03659","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:136efa1b7feda7e607698dc06de2bd7a04e81e47c68f67be88bc3a0415309171","observation_id":"6c12eae7-0785-4216-8443-8ed0825365d4","resolution":{"observed_at":"2026-08-03T14:00:20.764446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-03T14:00:20.767550Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.767550Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a6f965ebb51fdfeb29a20c66683a10075db0b1a5e2320114556d3222768d6bca","observation_id":"6e4c4c3a-4b9b-426e-968a-47eabbdc959b","resolution":{"observed_at":"2026-08-03T14:00:20.767550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.770358Z","title":"Foundationstereo: Zero-shot stereo matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.770358Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:9208828a7b600dc73221edec6abd04e03a8a4c304dca70a1bff88a3d6399d80d","observation_id":"181423dd-04dc-410a-99c6-a4bc3b9677ba","resolution":{"observed_at":"2026-08-03T14:00:20.770358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.772653Z","title":"Prismatic vlms: Investigating the design space of visually- conditioned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.772653Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:34a7a9c3c2715138bbf40da6c2f531f161a0bfd5722b6690f987f8a0b0372ed3","observation_id":"554549d3-8d71-4939-8218-cd4de7077f43","resolution":{"observed_at":"2026-08-03T14:00:20.772653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.775125Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.775125Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:6a3ae3be4f8ca9126edb31215e509f8d338f6eefe57cb0490c0dadbcf2da10be","observation_id":"39029919-013e-4d46-853b-efa44f1a2299","resolution":{"observed_at":"2026-08-03T14:00:20.775125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16858","last_updated":"2024-06-30T15:03:25Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:11Z","title":"EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16858","snapshot_observed_at":"2026-08-03T14:00:20.777481Z","title":"Eagle-2: Faster infer- ence of language models with dynamic draft trees,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.777481Z"},"links":{"cited_paper":"/paper/2406.16858","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:40232e6f541eac4a78b213416c593d0b589d9c50c0f25cfe7c9836249094af1f","observation_id":"4f73e351-04a5-481c-834b-d809dec0f86a","resolution":{"observed_at":"2026-08-03T14:00:20.777481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T14:00:20.780838Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.780838Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:c41976c3a295a464e8055844b970d08e367cae2a49f1d2be92e305b94cb85df6","observation_id":"b43e69d0-a3c6-4f6e-aa8b-bb178e9ae143","resolution":{"observed_at":"2026-08-03T14:00:20.780838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.784051Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.784051Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:9454ae3361cd8ab756e48d7a50b7a72a217ee824258a2600efcb0c8fadd6bd49","observation_id":"3a851f77-53a9-486b-bb2e-7e3a89c5e85a","resolution":{"observed_at":"2026-08-03T14:00:20.784051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-03T14:00:20.788875Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.788875Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:670f3ddc254d2aeac96474d54709ec5f5520d75e4473911ca4b26b5834eddb91","observation_id":"382014e7-f9dc-47f3-9831-1d1944bc0ead","resolution":{"observed_at":"2026-08-03T14:00:20.788875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-07-06T15:49:23.374270Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-03T14:00:20.791509Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.791509Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:e5871604b19a6e5b098ba367e9489823022e54988c183f99bcc1a690fed76e52","observation_id":"44ed9fe0-4171-4711-b7d2-4fd74768c3e7","resolution":{"observed_at":"2026-08-03T14:00:20.791509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-08-03T14:00:20.794026Z","title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.794026Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:4bfb346d0b517a20f8146994fdd8bf1200f7fe94d4d17e649775ab8c36a9b9ce","observation_id":"fea9d4a4-1c36-40ec-9b5f-a6275e93d73d","resolution":{"observed_at":"2026-08-03T14:00:20.794026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.796749Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.796749Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:1adf57707a96c45b833c93ee813a348e7fa07651349237aa97e7f0eb47dffeb8","observation_id":"eca535a6-128e-4486-811c-d410d44d37d1","resolution":{"observed_at":"2026-08-03T14:00:20.796749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T14:00:20.799400Z","title":"pi0: A vision- language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.799400Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:191d62260b32837a8a4ffd3285ec2b3041ba55c63eaabda3930e1c650311698b","observation_id":"f056f3fc-099d-46af-bbbc-0f95a73d027b","resolution":{"observed_at":"2026-08-03T14:00:20.799400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T14:00:20.802389Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.802389Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:449b6619a94a660f2c9e3f407426088a1948234acb240c99e278278a251e45dc","observation_id":"a8884fcb-8c89-4f58-b5b6-ee2dd654999b","resolution":{"observed_at":"2026-08-03T14:00:20.802389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-03T14:00:20.804995Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.804995Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:af5e2fe530836e007087aac26038242c08fde21e1fc763d5a2e34e6fdbd5ff64","observation_id":"6fbd01ba-5fc9-444c-8fa7-850c96c17140","resolution":{"observed_at":"2026-08-03T14:00:20.804995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-03T14:00:20.807558Z","title":"Hybridvla: Collaborative diffusion and au- toregression in a unified vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.807558Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:13aea52680f0ab064b62680e4dd139f6bb67b548577a2d33c00afaa114941f1f","observation_id":"b00390d9-18ec-48ce-a580-866cfea3d4fd","resolution":{"observed_at":"2026-08-03T14:00:20.807558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-03T14:00:20.810263Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.810263Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:9fef59191eb97762338d77a523092ce775e57d164231c99bfd006de053523f5e","observation_id":"97dccf5f-d256-472f-b89a-48a53538c6ff","resolution":{"observed_at":"2026-08-03T14:00:20.810263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.812858Z","title":"Internvla-m1: Latent spatial grounding for instruction-following robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.812858Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:51eed392f09b36f1fa656d3268a88f7916dd8a94334c850044a1c3582faf4ad0","observation_id":"f0450714-5eae-4d4f-8f1f-276e0e82d94a","resolution":{"observed_at":"2026-08-03T14:00:20.812858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.815149Z","title":"Tinyvla: Toward fast, data-efficient vision-language-action models for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.815149Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:06eab5e992d7c16f0a6d9e0106c76e1fc053621d4cf25019580eafaae9cecac3","observation_id":"bd8ee129-bbb4-4602-bcb2-e0b2d8c276ad","resolution":{"observed_at":"2026-08-03T14:00:20.815149Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-03T14:00:20.817485Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.817485Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:711fd4a319fd1e60c1cbb07b854ba4026e0f14cf3ec5159a528a7603d2a186fb","observation_id":"0c17244c-5f64-4dec-9b5d-a7bd080a0504","resolution":{"observed_at":"2026-08-03T14:00:20.817485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-08-03T14:00:20.820085Z","title":"Generalizable humanoid manipulation with 3d diffusion policies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.820085Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:2e5364ef2ec2961349f9f84fd19d807127f7157c2be49eca0c86afbb8e402d73","observation_id":"fbe30e33-4bb9-4f8f-a2f5-80d8c2b5d870","resolution":{"observed_at":"2026-08-03T14:00:20.820085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-03T14:00:20.822651Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.822651Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:8ebe79a20039124baaf4f495e915ce852a41ac2961481c3477919e2eb3c347cd","observation_id":"60ae4b1e-e783-49a8-8fe4-ca8fa6d8090e","resolution":{"observed_at":"2026-08-03T14:00:20.822651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-07-06T20:50:00.422560Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-03T14:00:20.825243Z","title":"Pointvla: Injecting the 3d world into vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.825243Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:6632af57d6abd197eeca17c2ae43cc2e4a0519a1349e5bbd8fd0a6db61bba814","observation_id":"68888964-eab6-4441-904e-4ebba7a9d12e","resolution":{"observed_at":"2026-08-03T14:00:20.825243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.827780Z","title":"Bridgevla: Input-output alignment for efficient 3d manipulation learning with vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.827780Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:9e0e056714762d7b8538a2880a4ce9d99ea490cf02965bae48ef494359b3b527","observation_id":"3f516bb1-7f71-487f-a83a-b3ad062311da","resolution":{"observed_at":"2026-08-03T14:00:20.827780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08950","last_updated":"2025-03-11T23:01:08Z","snapshot_observed_at":"2026-07-06T20:51:00.484104Z","submitted_at":"2025-03-11T23:01:08Z","title":"FP3: A 3D Foundation Policy for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08950","snapshot_observed_at":"2026-08-03T14:00:20.830245Z","title":"Fp3: A 3d foundation policy for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.830245Z"},"links":{"cited_paper":"/paper/2503.08950","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:253c81fed9ce392d538de79cb33d7de0bc23a1db460d1be7611df072b59f6158","observation_id":"08b01426-c2c5-4119-a374-e7fc6457bbae","resolution":{"observed_at":"2026-08-03T14:00:20.830245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.832873Z","title":"Evo-0: Vision- language-action model with implicit spatial understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.832873Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:39f9257490d307baee21292241d0c0718c26310a23b5c9892a7144c90652ec9c","observation_id":"f3e85bbd-a1e7-4674-b97b-17ba4355c0ab","resolution":{"observed_at":"2026-08-03T14:00:20.832873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.835316Z","title":"Gp3: A 3d geometry-aware policy with multi-view images for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.835316Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:23454445bb9e2f26d5e7a62fe60f779768483c58579e0e93b302a58cebe1c2d5","observation_id":"4b14c6b1-069a-4c3f-8d63-d0608475797d","resolution":{"observed_at":"2026-08-03T14:00:20.835316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.837678Z","title":"Learning the distribution of er- rors in stereo matching for joint disparity and uncertainty estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.837678Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:f1db9ab9e8f3da32225c359e43a3a3792fe925fbdd8e81bf372daddd668eb817","observation_id":"647f1a5d-5aac-435e-a2c3-c5b1b0cdfba5","resolution":{"observed_at":"2026-08-03T14:00:20.837678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.840251Z","title":"Cfnet: Cascade and fused cost volume for robust stereo matching,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.840251Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:2d3419207a23a70d19cac75d433de8b7bf8fa9bbfc4e80987582a28690171afa","observation_id":"f295d6cf-0cf1-4c91-9e22-e1c45540f400","resolution":{"observed_at":"2026-08-03T14:00:20.840251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.842621Z","title":"Pcw-net: Pyramid combination and warping cost volume for stereo matching,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.842621Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:969f442a72c6f33f5f40d1424834403b364cd272eef0c0b5df74ec6754f3727c","observation_id":"af5d338b-0d2c-4dde-94ff-729c23ab1b40","resolution":{"observed_at":"2026-08-03T14:00:20.842621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.845047Z","title":"Aanet: Adaptive aggregation network for efficient stereo matching,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.845047Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:c27a44d3c16d684c448b11ef25c642cc054b86da592f4972238a4c9f0d9f55b1","observation_id":"0be59683-b8ed-47d8-b656-0a7af496d967","resolution":{"observed_at":"2026-08-03T14:00:20.845047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.847397Z","title":"Arunet: Advancing real-time stereo matching for robotic perception on edge devices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.847397Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:825c457f8511b703251e66a0c4be11d0f8cbb485a492dc738a6f30f8452c8d26","observation_id":"689ded80-bfb5-4e9a-83a1-2fbaaed4be91","resolution":{"observed_at":"2026-08-03T14:00:20.847397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.849923Z","title":"Gfanet: Group fusion aggregation network for real time stereo matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.849923Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:bbb2d7ed17691e8cf7760875299dde9a9c01084e4d232b83cadbf0bd41569c44","observation_id":"e4f029ab-af3e-4d83-b1b9-4943b8887eac","resolution":{"observed_at":"2026-08-03T14:00:20.849923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.852639Z","title":"Raft-stereo: Multilevel recurrent field transforms for stereo matching,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.852639Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:79b18e3ec3ae2e75b506d139b8440a0477ef83088c10556fd6f2bf3c5c09c57e","observation_id":"40a17586-476b-42e5-9d95-d701b592fa3d","resolution":{"observed_at":"2026-08-03T14:00:20.852639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.855173Z","title":"Iterative geometry encoding volume for stereo matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.855173Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:807c02ccbc8df7e4a78799fd78bac8a7d7b596f23e47d200fe05b9e879ef9495","observation_id":"b657e44e-d0cd-407a-8b97-780df2ec3e1d","resolution":{"observed_at":"2026-08-03T14:00:20.855173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.857433Z","title":"Practical stereo matching via cascaded recurrent network with adaptive correlation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.857433Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:35c18518cb7b6efc5ba5b747f1bdd9ce7de4772a542d7c272af7e26e85420354","observation_id":"821d3cfa-00e1-47ac-85f8-27b550f0867b","resolution":{"observed_at":"2026-08-03T14:00:20.857433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.859742Z","title":"Uncertainty guided adaptive warping for robust and efficient stereo matching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.859742Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:74ada03b10988c527813486d6e94f9c2e6dbe02fc943f45662490fac1f21b553","observation_id":"9cb26f67-0881-472b-849d-e25512166d71","resolution":{"observed_at":"2026-08-03T14:00:20.859742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.862334Z","title":"Learning intra- view and cross-view geometric knowledge for stereo matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.862334Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:4dc9695d105b729be192773587eb32e40a525c4c9637eef649c06eceeb1db101","observation_id":"f7d67585-2b8e-409a-8f2f-255dc443fb49","resolution":{"observed_at":"2026-08-03T14:00:20.862334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.864728Z","title":"Efficient and hardware-friendly online adaptation for deep stereo depth estimation on embedded robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.864728Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a7b65096baebfdb87ee6cba39be2bcfaead37f3ff644a5f24a94d9c02d3bbb05","observation_id":"536476e5-9dc8-4179-ac95-322f49b11667","resolution":{"observed_at":"2026-08-03T14:00:20.864728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.867054Z","title":"Stereo image- based visual servoing towards feature-based grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.867054Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:bfb96741c30b997be8b2a17fef928d6639c6a60b706f3caabbcec3fd7697bf24","observation_id":"68fd4d0a-e8fc-4911-b6fa-302c7204bdc8","resolution":{"observed_at":"2026-08-03T14:00:20.867054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01791","last_updated":"2025-02-01T07:58:23Z","snapshot_observed_at":"2026-08-04T09:11:43.366611Z","submitted_at":"2024-11-27T23:15:06Z","title":"DextrAH-RGB: Visuomotor Policies to Grasp Anything with Dexterous Hands","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01791","snapshot_observed_at":"2026-08-03T14:00:20.869541Z","title":"Dextrah- rgb: Visuomotor policies to grasp anything with dexterous hands,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.869541Z"},"links":{"cited_paper":"/paper/2412.01791","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:67911508c8fbbe7c5d45af904b4f01fc48f20a66ccd356771f09f78d7096bf73","observation_id":"6c24e98b-43b4-43c6-a2d6-b31742e32627","resolution":{"observed_at":"2026-08-03T14:00:20.869541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.872190Z","title":"Simnet: Enabling robust unknown object manipulation from pure synthetic data via stereo,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.872190Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:825015207cf506987bc565845563bc296a1d9b5ad900f60a088fc0529240af02","observation_id":"52159cb6-e386-4419-bbfb-962ed03dc739","resolution":{"observed_at":"2026-08-03T14:00:20.872190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-03T14:00:20.874567Z","title":"Internlm2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.874567Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:205f116de2d4e91fe01eca31ab48546f5d5b6344e230bec06d41094ecb1c5fac","observation_id":"183fd8e0-b25a-4fcc-a077-b286aba51e48","resolution":{"observed_at":"2026-08-03T14:00:20.874567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T14:00:20.877040Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.877040Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a3dabb6b30c9a621e0f824cc3ea8e14f54913b248293938cab83cf7394b33b39","observation_id":"9a010d3a-800f-4e66-b2ae-51f5b95e2bb2","resolution":{"observed_at":"2026-08-03T14:00:20.877040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T14:00:20.879627Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.879627Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:aaed200645e93fea066c4aa055e1f5efb57d97e2c16d4ab26d4579f11def5609","observation_id":"c60bafb7-2202-42ce-a5fd-18448b6c4d0f","resolution":{"observed_at":"2026-08-03T14:00:20.879627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.882762Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x- embodiment collaboration 0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.882762Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:7c93fc2582feac572525bca1ed06c780a649ef648cf543ca0830a1784c72e7a5","observation_id":"08702300-1375-4a36-89de-93277c83f09b","resolution":{"observed_at":"2026-08-03T14:00:20.882762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.885441Z","title":"Mujoco: A physics engine for model-based control,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.885441Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:784b6ec27be47af6fcbc7f68e7a27f604d075f6e517e4adec8ce93a822409d70","observation_id":"c7b73b3f-2007-4ada-b7e0-853868a86f79","resolution":{"observed_at":"2026-08-03T14:00:20.885441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.888280Z","title":"Isaac Sim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.888280Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:e7ef5e2e76828914e8c006fb57a6bbfcc41daae8af87f8fbda183494e83c474a","observation_id":"a3143be9-2046-47ad-8b82-d46d4be7beb8","resolution":{"observed_at":"2026-08-03T14:00:20.888280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-03T14:00:20.891559Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.891559Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:be02868171523ffd3cfe85e1e32ba49d612886d7c2281b9f1521546c1460ac31","observation_id":"bd27a75e-e7af-41b7-9a7c-8dc80099b7c9","resolution":{"observed_at":"2026-08-03T14:00:20.891559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.894490Z","title":"Vggt: Visual geometry grounded transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.894490Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:2c3cc8ce207a3bd6cced5bc98208de486f2d0692ed7a7ede24a6601bdc4ccd5a","observation_id":"bf7fb575-bf4f-4a41-918c-8fbd10c5ec33","resolution":{"observed_at":"2026-08-03T14:00:20.894490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:00:20.896966Z","title":"Depth map prediction from a single image using a multi-scale deep network,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.896966Z"},"links":{"citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:7b2de5860d3c70c0ad3b1517b247240196ed4fbf8a3b7363f1e07544693eedab","observation_id":"0f44e8f0-4a64-4c6a-b38c-f743f13a6696","resolution":{"observed_at":"2026-08-03T14:00:20.896966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 10 inbound Pith citation observations for arXiv:2512.21970."}