{"as_of":"2026-08-06T06:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:902320a77d8509e7315ab62f8ca37e6049a9508f49efa5bdb519ab71fc498605","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:51:57.719892Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":24,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T08:57:22.299028Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2307.05973"},"observation_digest":"sha256:e5e799fdbf5cb349dd012810944415897a05aadb473618b6d5ff38eba268b739","observation_id":"6e6e8e92-5167-437a-8f8e-3ba29a7018f1","resolution":{"observed_at":"2026-05-13T08:57:22.570726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-11T17:23:24.255829Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2310.08864"},"observation_digest":"sha256:e3e2cde37cedd7f905c91435cdab8f69d3d1fc3b7e48302d1bb57a965931549a","observation_id":"ab904600-e585-4a6e-9663-7038b8ae26e5","resolution":{"observed_at":"2026-05-11T17:23:24.351434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T05:54:58.940428Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2310.10639"},"observation_digest":"sha256:ea02fa17a8568af77ee485ae41962802a4bd8cc67ee6b2d9e5165df1d7d69084","observation_id":"9e46c221-234c-4ae0-acd1-72c5d6fb3d78","resolution":{"observed_at":"2026-05-16T05:54:59.132287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:828ee02edc517197274350eb6f5ad30a0699c3f68b0ff60d06f8cda8d36789d6","observation_id":"9435dbc9-57ce-45f9-9a79-2a792a253746","resolution":{"observed_at":"2026-05-24T01:25:54.465586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:4f475b98faf5fb32c86d26c73c5e413807754400698bd4a3eb65f3de1bfe45b7","observation_id":"b8513001-5337-4b36-9899-284f6eaff38c","resolution":{"observed_at":"2026-05-10T14:46:36.281682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T18:27:22.760982Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2412.10345"},"observation_digest":"sha256:98f67c83504c4f1f09d7090f0bc252fcc88a9884f626c530d1e44b34046fa130","observation_id":"94e238f7-627f-4b2d-884d-609a3aaea92d","resolution":{"observed_at":"2026-05-15T18:27:22.835880Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:33f9f6291c98847b3a549cea9fddf1c22e7308cb2589e532e4d37352ead6d22b","observation_id":"ca32e68d-fc72-41e1-957f-8f24fc0e225e","resolution":{"observed_at":"2026-05-15T22:53:37.275383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:43de5bcfdb53143c1cb6e2f41f5fc9dd5923630bf8b96c21461412719aa58d10","observation_id":"c1c0d234-863a-4774-98df-cc50b82325de","resolution":{"observed_at":"2026-05-11T04:35:32.851181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:0060817d01e7686a7073744d7abaf9d7ca4240b7f47bf421d41fcee5ba16f3b9","observation_id":"8a97b39f-b308-47ce-a50e-cf8997c5a9b2","resolution":{"observed_at":"2026-05-22T18:05:00.899383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:f286f81747327c46af32165835787faac53b74c0947320f8e8a1da24d7161aa6","observation_id":"3f51432a-c1c2-4e04-9d52-b14534762b3a","resolution":{"observed_at":"2026-05-17T20:55:52.251612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T22:51:57.719892Z","title":"Open-world object manipulation using pre-trained vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06257","last_updated":"2025-08-08T12:22:36Z","snapshot_observed_at":"2026-08-05T22:51:52.256416Z","submitted_at":"2025-08-08T12:22:36Z","title":"Multi-Omics Analysis for Cancer Subtype Inference via Unrolling Graph Smoothness Priors","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T22:51:57.719892Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2508.06257"},"observation_digest":"sha256:d9dfff30ecaf531f27cd429c90c08fa9b1ccff5c400d2aa81e3702044778f34b","observation_id":"f27ff8c3-ca20-4a21-aa1e-46a9ded69031","resolution":{"observed_at":"2026-08-05T22:51:57.719892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2511.15279","last_updated":"2026-04-03T06:36:12Z","snapshot_observed_at":"2026-07-06T22:36:24.466921Z","submitted_at":"2025-11-19T09:42:08Z","title":"Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T21:03:28.341042Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2511.15279"},"observation_digest":"sha256:c94bee1722a6414ea00346bf88f177c6377ab604a2d4b6a35bc9474682cf41de","observation_id":"56f02102-3db8-4d18-9986-01ad136caf58","resolution":{"observed_at":"2026-05-17T21:05:15.672460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-02T21:43:09.897136Z","title":"Open-world object manipulation us- ing pre-trained vision-language models.arXiv preprint arXiv:2303.00905,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19313","last_updated":"2026-07-22T22:14:13Z","snapshot_observed_at":"2026-08-02T21:43:05.758047Z","submitted_at":"2026-02-22T19:25:48Z","title":"TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T21:43:09.897136Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2602.19313"},"observation_digest":"sha256:dd90faad854cb8537948c639225b5e9882e5c09f3a9352a5aed0bf0c1b7d06b5","observation_id":"ed491bfc-b2bb-4772-9e84-699379fa0973","resolution":{"observed_at":"2026-08-02T21:43:09.897136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-02T18:13:10.246106Z","title":"arXiv preprint arXiv:2303.00905 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-02T18:13:05.647574Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:10.246106Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:5c0b398f7aa4b7012830bf152f5e21729d570ce17a391f695395d26c2c0d5bcf","observation_id":"c80735aa-51fb-49ea-b4f0-a69e76cfb67e","resolution":{"observed_at":"2026-08-02T18:13:10.246106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T11:42:34.409651Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2604.15483"},"observation_digest":"sha256:871ab5372e0e8c9aa1b91b79c0125dfc8e6c7a24cee18f9ceedc5c88eac09757","observation_id":"35314711-93ca-455e-b754-e5bb313e6b82","resolution":{"observed_at":"2026-05-10T11:45:21.565939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2605.00438","last_updated":"2026-05-01T06:15:43Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:15:43Z","title":"Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T19:51:05.220627Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2605.00438"},"observation_digest":"sha256:051fec4867359d7f99f3e5b8ac33628c4e1ec068299d79ded30185f4ad458f5d","observation_id":"74c964fd-9da7-453c-99a8-06e4da12d3dd","resolution":{"observed_at":"2026-05-11T15:31:07.233360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2605.11114","last_updated":"2026-05-11T18:23:04Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:23:04Z","title":"SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T02:50:35.117038Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2605.11114"},"observation_digest":"sha256:17d84ea050a8a238721a9307df8fe41f6ac0dc05618e9a4cc620e5dc9bc91061","observation_id":"9294b453-f12e-4635-a6e4-bc7a40285662","resolution":{"observed_at":"2026-05-13T02:52:08.744611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2605.12655","last_updated":"2026-06-10T15:03:44Z","snapshot_observed_at":"2026-07-06T23:24:18.302402Z","submitted_at":"2026-05-12T19:01:16Z","title":"Robust Instruction Compliance in Cooperative Multi-Agent Reinforcement Learning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:35.277901Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2605.12655"},"observation_digest":"sha256:45061c05d1012f0afb33306de882bc18dcbcc0b11b7e1f3a339f7874fee4eb19","observation_id":"3c615202-ee07-43c2-bd21-08cd1dc63ac1","resolution":{"observed_at":"2026-06-30T22:15:05.889350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:9d4a39354c65bdb5461adb247a5139128a3d1d41ac744aa5acaa9ab2b0651431","observation_id":"9be766c6-d92c-41cf-a173-1d58118890eb","resolution":{"observed_at":"2026-05-20T12:43:17.300839Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2606.12910","last_updated":"2026-06-11T05:09:34Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T05:09:34Z","title":"Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T06:46:45.209053Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2606.12910"},"observation_digest":"sha256:7326ec39f8983ef0b9209abb63245f3d02d5f8da29c39cd9dcb11da03d30426e","observation_id":"3da45ba8-22cc-43d9-b07f-ef683d0fb025","resolution":{"observed_at":"2026-07-03T14:58:33.491536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2606.25585","last_updated":"2026-06-24T08:56:48Z","snapshot_observed_at":"2026-08-04T14:09:28.537223Z","submitted_at":"2026-06-24T08:56:48Z","title":"FeVOS: Foresight Expression Video Object Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-25T21:13:21.500674Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2606.25585"},"observation_digest":"sha256:0658b380f6f2f0aab652842314fe7330d33a065a9704cd1513aa54ac419db2a8","observation_id":"2740f7c6-48d1-4492-b47b-64ec4d8d0694","resolution":{"observed_at":"2026-07-04T19:30:08.043849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2606.26588","last_updated":"2026-06-25T04:20:08Z","snapshot_observed_at":"2026-08-02T20:22:03.294527Z","submitted_at":"2026-06-25T04:20:08Z","title":"Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T05:32:52.472573Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2606.26588"},"observation_digest":"sha256:4ccddd0b67907cb350a64c7c39625c831e989ba3e6f5f9454fe44a86d14a7717","observation_id":"b1813dd7-829b-4727-bde7-d7c5c2cd8a35","resolution":{"observed_at":"2026-07-04T13:09:50.140694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-02T02:25:55.766741Z","title":"Open- world object manipulation using pre-trained vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14341","last_updated":"2026-07-15T20:10:09Z","snapshot_observed_at":"2026-08-02T02:25:52.126724Z","submitted_at":"2026-07-15T20:10:09Z","title":"Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T02:25:55.766741Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2607.14341"},"observation_digest":"sha256:b29f735ddd2eb9d94f330bac0448b3a1d4f506e0a551cdbb37c7e6aa5fb4a237","observation_id":"7382167f-f5a6-4da5-91ab-de49c429aa6d","resolution":{"observed_at":"2026-08-02T02:25:55.766741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-01T14:39:52.346741Z","title":"arXiv preprint arXiv:2303.00905 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-04T15:25:40.989347Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.346741Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:a311ad591eca1ac0059411aff550e84efb68e897acbb314a6985cfbbb0582ac0","observation_id":"6ca2a3f3-8f35-440b-9e23-158707323d9f","resolution":{"observed_at":"2026-08-01T14:39:52.346741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-04T06:10:34.688795Z","title":"Open-world object manipulation using pre-trained vision- language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02497","last_updated":"2026-08-03T17:02:04Z","snapshot_observed_at":"2026-08-06T05:41:19.177127Z","submitted_at":"2026-08-03T17:02:04Z","title":"Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T06:10:34.688795Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2608.02497"},"observation_digest":"sha256:79deca9c6eaa4f82010107c043d30d3f9c9792aa8f0df43cd1f0de9f84a6bb00","observation_id":"64c74535-d0a0-461b-8f49-1c20b198fbf9","resolution":{"observed_at":"2026-08-04T06:10:34.688795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.00905/citation-record","integrity":"/paper/2303.00905/integrity","json":"/paper/2303.00905/citation-record.json","paper":"/paper/2303.00905"},"outbound":[],"paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2303.00905."}