{"as_of":"2026-08-12T12:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:509e479a1d93fa49aff30b4861425fadaafd922d9bcba918d60149fb43673898","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T16:32:32.885345Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:10:33.754125Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27759","snapshot_observed_at":"2026-07-14T05:11:57.092685Z","title":"Morgan, P","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11498","last_updated":"2026-07-13T12:50:32Z","snapshot_observed_at":"2026-08-06T19:17:49.055959Z","submitted_at":"2026-07-13T12:50:32Z","title":"See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T05:11:57.092685Z"},"links":{"cited_paper":"/paper/2605.27759","citing_paper":"/paper/2607.11498"},"observation_digest":"sha256:4a349de6ac767f8ac87def02375b855797e112e6cf9412a7b02ffc37f8ee8042","observation_id":"9fc87436-d7ab-4b77-bd4e-777affaf6790","resolution":{"observed_at":"2026-07-14T05:11:57.092685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27759","snapshot_observed_at":"2026-08-04T06:10:33.754125Z","title":"Colosseum v2: Benchmarking generalization for vision language action models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02497","last_updated":"2026-08-03T17:02:04Z","snapshot_observed_at":"2026-08-10T03:03:42.557157Z","submitted_at":"2026-08-03T17:02:04Z","title":"Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T06:10:33.754125Z"},"links":{"cited_paper":"/paper/2605.27759","citing_paper":"/paper/2608.02497"},"observation_digest":"sha256:e7c42da39451f5f106e504a59eeeb564fd8c0f70cefd602453c74f300bb8bc04","observation_id":"926ecd5d-215c-4b2e-bbaf-d13d5fa8c494","resolution":{"observed_at":"2026-08-04T06:10:33.754125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.27759/citation-record","integrity":"/paper/2605.27759/integrity","json":"/paper/2605.27759/citation-record.json","paper":"/paper/2605.27759"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"ChatGPT: Optimizing language models for dialogue,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:dcbb6669fbc5f07465133ef1220edc6d8750de2f7aeb91d06c1f499b954bd584","observation_id":"cbe8b940-f904-47cc-a9f7-093dc2d361d9","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:6840fca75cee4a3ad2d0771c9e94a595cfebf9bf3301d30b25d0320ded248358","observation_id":"7ef84ecb-c270-465e-ad73-4d5150abf36e","resolution":{"observed_at":"2026-06-29T16:33:38.637300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Rlbench: The robot learning benchmark and learning environment,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:256cbb395d8852933e734a8fa16178a35ef73e8c148cab80dad29457bded62c7","observation_id":"871f02dd-90ea-4e65-8f78-18aaf8dfe943","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Pyrep: Bringing v- rep to deep robot learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:358afb36586414e965836378dc8a1fda7ebcb1532e8fdf64728327f8bd70f7b0","observation_id":"007ad77f-bb6e-4cb2-a361-d0c19f0da85f","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Coppeliasim robot simulator,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:f8eac9ca04964c0ce721566171e216442e3d900a2d5d36059bf20b53179b1828","observation_id":"bee08941-b285-4b45-94ee-9ec22ae7e100","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"The colosseum: A benchmark for evaluating generalization for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:c1ecf769eb3ab4f1a4e218072901ef08aff6a98526adf22ea51f4076efeafb41","observation_id":"96ded4e1-af25-442d-b617-452f495d1a1b","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:dccfaae80dbd7cd8b1fb96cc35a1c4329f4b3d0feba8e2f727e38119d3c93941","observation_id":"305a473a-f0a0-469a-b9a9-ae0c7d4bcce6","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.28301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:33:38.645004Z","title":"Libero-para: A diagnostic benchmark and metrics for paraphrase robustness in vla models,","venue":null,"work_id":"da6d71a1-3414-4587-9a48-57db4e9308ee","year":2026},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:6622d0d1943cb587d8971d4dbb225b8afb8b4713471e99c3d2a5e6375e9c17ec","observation_id":"a7b5cba4-ef93-4676-bf50-d2d78382f044","resolution":{"observed_at":"2026-06-29T16:33:38.646882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Roboverse: Towards a unified platform for robotic manipulation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:677b6b64f59b95d9749fd5dfae6e8479657aba092f59a1671ed67bef6210f1a4","observation_id":"97244e5d-e855-4cd6-9e75-f0cfefbbe4e2","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Roboarena: Distributed real-world evaluation of generalist robot policies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:1c5da111c1ffaa09a0343cc1d1b4ad08fe8efd848f0eb9d8383be217833a8887","observation_id":"fadeaf97-ce4f-4859-83fa-3559ad2d939d","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Robotwin: A platform for scalable robot learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:8a3017a8c871fff165600b66fb276782a787ca6ab82ce17a4ce19f425b407336","observation_id":"a810712b-3d35-4a88-9818-311295004413","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Bimanual manipulation benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:74f000cb68514985e79fbdb82dad6fc18800e81cca19fc92f19b47ef32d2031b","observation_id":"9c008b7f-7035-4f78-8166-1ca8716c9fb4","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:01f030fd7d7410a4f31a6c7f0a0fc1774dff8332565d2219786c44cd6df51dc1","observation_id":"f2fae33f-3283-4603-937b-b5b101451653","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18194","last_updated":"2024-12-24T06:03:42Z","snapshot_observed_at":"2026-08-11T04:54:18.910403Z","submitted_at":"2024-12-24T06:03:42Z","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":"2412.18194","doi":"10.48550/arxiv.2412.18194","metadata_source":"pith","pith_arxiv_id":"2412.18194","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks","venue":"cs.RO","work_id":"9ce9e004-2bc2-433e-82c4-460eddd18830","year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2412.18194","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:48817434b4de07db4da1c1a1a7fdd7fb134b3afca7e96a93658ef9b8afe13d6f","observation_id":"ed0293e3-433d-4eaf-91e9-64e563944e18","resolution":{"observed_at":"2026-06-29T16:33:38.665724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08522","last_updated":"2022-08-17T17:18:43Z","snapshot_observed_at":"2026-08-09T12:17:30.206076Z","submitted_at":"2022-06-17T03:07:18Z","title":"VLMbench: A Compositional Benchmark for Vision-and-Language Manipulation","version":2},"cited_work":{"arxiv_id":"2206.08522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08522","snapshot_observed_at":"2026-06-29T16:33:38.669600Z","title":"VLMbench: A compositional bench- mark for vision-and-language manipulation","venue":null,"work_id":"b3f2b0e4-188c-4643-84ba-ffacfaeb2ca9","year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2206.08522","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:ac29aef1991856f921c1bb4b5817d4cc4178f2f77a45cc77bd35c437178dd4e3","observation_id":"9018405c-5ecd-4b40-a2ca-d5eb26d4301e","resolution":{"observed_at":"2026-06-29T16:33:38.671017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09698","last_updated":"2025-08-30T18:59:30Z","snapshot_observed_at":"2026-08-07T15:45:19.574832Z","submitted_at":"2025-05-14T18:01:00Z","title":"ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2505.09698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.09698","snapshot_observed_at":"2026-07-02T23:07:27.171003Z","title":"Manipbench: Benchmarking vision-language models for low-level robot manipulation","venue":null,"work_id":"91e10f9c-5885-469f-9bb1-eb45e1da6ff9","year":2025},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2505.09698","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:5b49caf8440de1b395ad945ec7d5da5f3fb8a98aeb0b4dd6cb588ffba47c5c60","observation_id":"dc307761-1811-4e52-954e-bd759c6ee3f8","resolution":{"observed_at":"2026-06-29T16:33:38.663024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"R3m: A universal visual representation for robot manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:65b378234272c3a5a545dcf25b642c8346f38954c8f5662b47ae60c291522a77","observation_id":"b6cf6b50-5057-467f-a215-4c54461ed9ed","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Mvp: Multi-view pretraining for vision-language robotics,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:4c8f34003f090bd6dd565227eb86c3b51ac209afa1c1d910507d40361233c5f6","observation_id":"24c839a1-4e12-4702-b24e-314a64b00d40","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-11T15:42:16.204049Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":"2210.00030","doi":"10.48550/arxiv.2210.00030","metadata_source":"pith","pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","venue":"cs.RO","work_id":"022de141-49ac-43d5-9667-e36913ec1950","year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:a75f74128c94169295a035f8f635e9a1fd3c7bbe3cb2fea07014fe6915262c56","observation_id":"5d886665-2f5b-4bcd-af67-2ca6bfc621d6","resolution":{"observed_at":"2026-06-29T16:33:38.671502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Cliport: What and where pathways for robotic manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:82e0f93a9fb63f416c6feaa0070991d7544d2fd53f05dc8144ff32177ff2a0fe","observation_id":"ddeea52c-adce-41ad-bd81-3064d602b1b4","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:61cdb632c769699e246e31aef6f08fabb58f6483afb247d4212fdf109e3d3efb","observation_id":"7edb617b-9c80-4cb8-b47a-e3e9de1a8977","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"C2farm: Coarse-to-fine imitation learning for manipu- lation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:cb2f8e84dcdcfb70356a5a32e9830991cd3cb0f7e50a0d4e8d0e8dca37657266","observation_id":"4d008cbd-7351-4fe6-949d-36c226da8d61","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Kite: Keyframe imitation for task execution,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:7a80a7406995911418a2c5abdd3c9fde32cefbebd2c0dd2d3443a81c0955ffa7","observation_id":"46af9365-c207-41fe-bcba-f9fa6c0ca0d7","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Learning fine-grained bimanual manipulation with act,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:350cd80eec6deb67da38bdb400e1a8a56bb6473c824e39102787125cfddb3cd3","observation_id":"fc441fa5-ed95-4bb0-b60c-8f8a177c9bc2","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Peract: Perceiver-actor for 6-dof manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:6897cc3825d9029ea19ad51559ba0f2250d5324784bde64afee5f106a93de3f7","observation_id":"e2519e6b-d901-4b7b-971c-c5c0b1c9c898","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Rvt: Robotic vision transformer for manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:a1bc7280ab7ec369b79fa6fb0516e3b384460119767119859a66554cbcc4f0e6","observation_id":"7214ea25-e6eb-44db-899d-0178760cdb31","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Rvt-2: Scaling vision transformers for robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:bb9e02fe409e11f3a62627c0fdaa504ec9bf964588b0e55b41bb0f6a30b74a8e","observation_id":"ed9aae14-7382-4577-b9f5-01be80caea64","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Act3d: 3d feature fields for manipulation policies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:5be7d5c56a35e31a895aba35d5f1df98bdf4b13debd2b58dc8265955ee14740e","observation_id":"16acdf44-8564-4078-80e8-7a29ff69cfc8","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:ad25e5583415a4c9becc8d3b9a276783ccad43b5d7eed9961a8d6c434539e3f0","observation_id":"9e66fd3f-cc8a-41ff-a4a6-07fc83cb5798","resolution":{"observed_at":"2026-06-29T16:33:38.666511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:2cec02d5d438afec23cb66d7ac73bfdf6958b04a8d1dacd0a2218a1b06372262","observation_id":"eda6ce01-dac8-4d17-8859-a9f0d804c420","resolution":{"observed_at":"2026-06-29T16:33:38.643866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:12d978388a7a7aacac89c9dbe4b7be8408b5b2f4e95bf441165564564970fc2b","observation_id":"04dd3932-b846-4a2e-8a09-cbe562287af1","resolution":{"observed_at":"2026-06-29T16:33:38.640816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03854","last_updated":"2024-10-02T13:39:36Z","snapshot_observed_at":"2026-08-12T08:30:01.636570Z","submitted_at":"2024-05-06T21:00:59Z","title":"Provable Preconditioned Plug-and-Play Approach for Compressed Sensing MRI Reconstruction","version":2},"cited_work":{"arxiv_id":"2405.03854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.03854","snapshot_observed_at":"2026-06-29T16:33:38.658968Z","title":"π0: A vision-language-action model for general robot control,","venue":null,"work_id":"bd1049ab-a197-4f75-8998-5ecd5ce2ece2","year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2405.03854","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:219806073acf92557738314c5aad46b6ae9e5bab9bf4651a4bf32b6bd3f1621e","observation_id":"6939e931-bf43-420f-9f91-22b8b7d5a64f","resolution":{"observed_at":"2026-06-29T16:33:38.660427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.00000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T00:35:10.248811Z","title":"AgentNet: A scalable framework for multi-step agent trajectory generation.arXiv preprint arXiv:2501.00000","venue":null,"work_id":"efb5e929-552b-4310-8af5-106308b8eb4f","year":2025},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:46bd0b1d4eda9220f0841e0182b77f7fa90dedda90ad80f168dbfdbc2d160983","observation_id":"b9efcf2f-556f-4d20-afa6-7d120d273d23","resolution":{"observed_at":"2026-06-29T16:33:38.649454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"π0.5: Vision-language-action models for open-world robotics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:0c47de64589d0b088e0dc5a834275ac98da2addb1bee6a9973efd40fcd50e09f","observation_id":"8935a05d-cb8a-408a-ab8c-58eae96e8d62","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:e4a419e4b5ea619343363c9d2df9572acd1666824426d6c8c84694f5f64da025","observation_id":"db2112e6-6e00-4320-881c-d048ee87d685","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Lerobot: State-of-the-art machine learning for real-world robotics in pytorch,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:42fbc6556abbf458b9bbcb75283e225773d02a03807f0e48fce88ca13a865de7","observation_id":"edd948c0-0bc0-432a-8d09-e6cd64e37bf6","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Maniskill3: Gpu parallelized robotics simulation and rendering for generalizable embodied ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:c51a4cde7152acfd845263f82ecd892dbe472abcd87c146d267286e2f67f2d59","observation_id":"52a26050-24c8-49f5-9ef1-9193e4f087f0","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:9dcb613741b8fb8997a086dc0559b17f3aa7386f87fb0d430c8e0018e62619cc","observation_id":"b4c5cdd1-3ccc-4880-ae85-c69912764229","resolution":{"observed_at":"2026-06-29T16:33:38.673807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":"2303.15343","doi":"10.48550/arxiv.2303.15343","metadata_source":"pith","pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sigmoid Loss for Language Image Pre-Training","venue":"cs.CV","work_id":"a72a5260-62c8-463d-95d2-fc6ab01b4994","year":2023},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:6051702700c36f93cdb8a19e4e15b8b3e28bd35a2ba2483a13e93a030a254589","observation_id":"05b17789-7c24-4604-abf9-714219389994","resolution":{"observed_at":"2026-06-29T16:33:38.676519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:04734711065865842be648d8eb98ab771c85d1fda24452fe025aa9d6600f8dd1","observation_id":"e9b8fb3b-eeaf-4144-861f-f26d0d872b66","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:9100b59b089005ae589ff8366fa1eb3490f784161c32cd3a1147a19b4fb9360f","observation_id":"a9cb44e3-7f76-4668-8ac2-4b1608b3ed26","resolution":{"observed_at":"2026-06-29T16:33:38.663952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-07T13:44:24.778030Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2210.03094","doi":"10.48550/arxiv.2210.03094","metadata_source":"pith","pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jiang, A","venue":"cs.RO","work_id":"7b5f6cce-bbaa-40ed-8b09-7330832dd736","year":2022},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:db0d2b9f3dfed60002e7d0f2fbab3898353865a5e91d007b88c916d3bbcf1184","observation_id":"835a08be-64b7-4fc1-9347-eb9d519d2e45","resolution":{"observed_at":"2026-06-29T16:33:38.668159Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Learning an actionable discrete diffusion policy via large-scale actionless video pre- training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:cb9f879c8dbe7b8f4ed84e917c8c82737078ccde7b7cdb2fff6ba74c0bb758d2","observation_id":"a5df6c8f-ac0b-452e-a79c-4c60d8b2a9cc","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":"2503.00200","doi":"10.48550/arxiv.2503.00200","metadata_source":"pith","pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified Video Action Model","venue":"cs.RO","work_id":"fb4cc512-d1d9-40f4-8854-d35950ad20b3","year":2025},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:7aa9904847c1826604595ca622cb2e528b86c21e7f2d9ade5bc399996f096b2f","observation_id":"a001da23-370f-4b61-b88d-9d130fae1590","resolution":{"observed_at":"2026-06-29T16:33:38.669066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T16:32:32.885345Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:4b3ec220068696c8ff62dfb2626ad682273f880ecb1e5112b6ca0a1038eedf46","observation_id":"71a90fad-2969-478f-b485-6e1d027a3a2d","resolution":{"observed_at":"2026-06-29T16:32:32.885345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":"2412.14803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-10T12:47:05.518340Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","venue":"cs.CV","work_id":"62dbe235-8473-4190-8686-17e7437de50f","year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:ebdddf8918fa6e0fcc0f6d3191842bd9a4a264f7702719085f74bce202334957","observation_id":"7fd864f6-be9f-47d9-8fe7-65fd4d9e7605","resolution":{"observed_at":"2026-06-29T16:33:38.661283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.601064Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control","venue":null,"work_id":"fbddd7d2-e7dd-47df-8f81-fdf4dd1efdd3","year":2026},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:142e06dfbe0886d6b3b115e9820ac632c502e357439176fc4860ffcba8012068","observation_id":"ba119abb-c646-4ed6-90bf-fe89c6db2a7f","resolution":{"observed_at":"2026-06-29T16:33:38.657675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13636","last_updated":"2024-10-25T15:23:07Z","snapshot_observed_at":"2026-08-12T08:30:01.397467Z","submitted_at":"2024-06-19T15:31:21Z","title":"Contrast Sets for Evaluating Language-Guided Robot Policies","version":2},"cited_work":{"arxiv_id":"2406.13636","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.13636","snapshot_observed_at":"2026-06-29T16:33:38.633740Z","title":"Contrast sets for evaluating language-guided robot policies,","venue":null,"work_id":"ff3c4245-26fa-4812-80db-3af8de74e900","year":2024},"citing_paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T16:32:32.885345Z"},"links":{"cited_paper":"/paper/2406.13636","citing_paper":"/paper/2605.27759"},"observation_digest":"sha256:2a5ab8d310ac006d1513bc0aaee6eb1e942dd86e96edbbbec39b447471db9623","observation_id":"51944ed5-f013-4f5a-a327-7100e862b164","resolution":{"observed_at":"2026-06-29T16:33:38.635208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.27759","last_updated":"2026-05-26T23:17:39Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T08:29:29.657428Z","submitted_at":"2026-05-26T23:17:39Z","title":"Colosseum V2: Benchmarking Generalization for Vision Language Action Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":29,"verified_exact":17,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2605.27759."}