{"as_of":"2026-08-13T05:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4b307c24a60f0e1f205fe934fecd3063cd29d47bc1942fabe7c05338ace2c3d","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:59:04.663968Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:38:20.785896Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-03T17:38:20.785896Z","title":"Graphcot-vla: A 3d spatial- aware reasoning vision-language-action model for robotic manipulation with ambiguous in- structions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11891","last_updated":"2026-07-02T17:23:13Z","snapshot_observed_at":"2026-08-03T17:38:18.677599Z","submitted_at":"2025-12-09T16:53:44Z","title":"VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:38:20.785896Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2512.11891"},"observation_digest":"sha256:026e328f3905de78bba632519851258f44b84ff04561a8ef89169ac6ee8c104c","observation_id":"cfaa48a2-6d08-4c1e-8e5f-e7a9f4ae9992","resolution":{"observed_at":"2026-08-03T17:38:20.785896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2604.09824","last_updated":"2026-04-10T18:56:48Z","snapshot_observed_at":"2026-08-11T10:10:16.679310Z","submitted_at":"2026-04-10T18:56:48Z","title":"ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:19.995405Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2604.09824"},"observation_digest":"sha256:a402b62f1d3d8849ea46775e3e7742b6c1a3c598d5fb69f32f250265aae4d452","observation_id":"6f36ca5f-1c77-4b7a-acf9-74fb39086d8e","resolution":{"observed_at":"2026-05-11T08:30:57.258483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2605.05714","last_updated":"2026-05-07T05:57:49Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:57:49Z","title":"TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T14:54:48.058400Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2605.05714"},"observation_digest":"sha256:76ecf9247c214db932157b73ecc316a977f6b65ba37889206aa05fd4208d3475","observation_id":"88d240b7-7eaf-43ec-a10e-27dd97ffe09f","resolution":{"observed_at":"2026-05-11T18:36:09.179305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2605.12162","last_updated":"2026-05-12T14:13:06Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:13:06Z","title":"X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:07.792757Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2605.12162"},"observation_digest":"sha256:d860d0b822d0277df7049799298f94058190b2111952a23f64b797946dd6e424","observation_id":"7b5158b3-e675-40d2-8a40-aa4907ff9396","resolution":{"observed_at":"2026-05-13T04:52:17.025802Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2605.13775","last_updated":"2026-05-13T16:54:36Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:54:36Z","title":"RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-14T17:54:50.325820Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2605.13775"},"observation_digest":"sha256:cab2b197a5301f56bac488e98b0d4001b2a757ce1c05a0053341a7df0ae4ce86","observation_id":"5f93b8ea-0f8e-4842-9f73-437ff3206344","resolution":{"observed_at":"2026-05-14T17:57:33.311170Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2605.14598","last_updated":"2026-05-21T03:24:31Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T09:06:01Z","title":"DSSP: Diffusion State Space Policy with Full-History Encoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T10:17:44.804745Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2605.14598"},"observation_digest":"sha256:2780d62a58c182a1b5c4c27373bc49a9f2e0d691a23ab680b4aa909a2b56f05f","observation_id":"963a8b05-0fcc-418c-907c-038d6af2d935","resolution":{"observed_at":"2026-05-22T10:21:24.247338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":"2508.07650","doi":"10.48550/arxiv.2508.07650","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Graphcot- vla: A 3d spatial-aware reasoning vision-language-action model for robotic manipulation with ambiguous instructions","venue":"ArXiv.org","work_id":"7a334ef3-6214-42eb-bcea-b043daa6e97e","year":2025},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:03086ca7c263ce7e5a30f6dc03e94744aecda602fc64d5b64d56d1ae01b58fbb","observation_id":"8af57b5b-6e93-4cc6-9456-acc96e48fe0f","resolution":{"observed_at":"2026-06-27T22:01:20.749485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07650","snapshot_observed_at":"2026-08-02T06:36:27.368310Z","title":"Huang, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-13T05:12:43.650293Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:27.368310Z"},"links":{"cited_paper":"/paper/2508.07650","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:551eed92577daf57af193e260ead71597b4adfc42e067723f34282f271bbedbf","observation_id":"4a2bf18c-6494-44e4-b6a3-ad0de77e6d30","resolution":{"observed_at":"2026-08-02T06:36:27.368310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07650/citation-record","integrity":"/paper/2508.07650/integrity","json":"/paper/2508.07650/citation-record.json","paper":"/paper/2508.07650"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:00.281025Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.281025Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:cf9c919972d745d5b4674c7f356ad1d16827eaeabfd14359beba5d9b3ead67aa","observation_id":"0a654059-9e67-4146-9782-73063cb25d2a","resolution":{"observed_at":"2026-08-05T21:59:00.281025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:00.374741Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.374741Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:c099e9a5869a317d9bf4ea4aced307b8a207e50863204d8f037fe4034ade3bc5","observation_id":"633a45ab-0d9e-4ef9-b84a-796c397622bc","resolution":{"observed_at":"2026-08-05T21:59:00.374741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T21:59:00.513385Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.513385Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:d39e3f2cabed0db89d35d55d8e7bb97204ef79a730b990a6f292a9b9aee7225f","observation_id":"d5704008-07ae-4823-999f-98e7addf7ddd","resolution":{"observed_at":"2026-08-05T21:59:00.513385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T21:59:00.642456Z","title":"S.; Kolesnikov, A.; Wang, X.; Salz, D.; Neumann, M.; Alabdulmohsin, I.; Tschannen, M.; Bugliarello, E.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.642456Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:ef0eb6be7c14e76c2d57671be938179338483af6d2f7f49f58a02188de9717d3","observation_id":"4b160908-3609-46e3-bba5-8edf69cc572f","resolution":{"observed_at":"2026-08-05T21:59:00.642456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T21:59:00.765491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.765491Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:5d5b25b118112978266d0a6fdafd7f321fb6384a6fa63e14c919569644dec110","observation_id":"1559dab7-3594-454f-bd9f-302cac670c54","resolution":{"observed_at":"2026-08-05T21:59:00.765491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T21:59:00.915445Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.915445Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:00358cec0309e1d3365888ef0b5c573fe5189581ab2bf5bc0a3eafb8695991eb","observation_id":"2ab685a4-4b7f-4a09-b1be-3b9db0277c27","resolution":{"observed_at":"2026-08-05T21:59:00.915445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T21:59:01.047936Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.047936Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:627a89d95d7e5b0c301db96878a06ec23c85565266b0ffc2ad98a4a7bbe1cc13","observation_id":"c99be82a-8dec-4b14-9ead-6d31a1e9b659","resolution":{"observed_at":"2026-08-05T21:59:01.047936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08243","last_updated":"2025-05-17T21:04:22Z","snapshot_observed_at":"2026-08-07T15:47:38.595241Z","submitted_at":"2025-05-13T05:35:00Z","title":"Training Strategies for Efficient Embodied Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08243","snapshot_observed_at":"2026-08-05T21:59:01.209286Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.209286Z"},"links":{"cited_paper":"/paper/2505.08243","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:699d6c67c15c4526a8925161e3f9760cda654e8c7faab7301c3145e6dfaacb4d","observation_id":"20ff8100-4ca7-47bb-9441-8c965fb14dc3","resolution":{"observed_at":"2026-08-05T21:59:01.209286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:01.316143Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.316143Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:d7a1709ed9bba8e01b7a94cb4677803a0bc84644fc8010117b9304edaf1419c2","observation_id":"6dd3773a-3739-4d0c-ac3d-15d3faa5cb56","resolution":{"observed_at":"2026-08-05T21:59:01.316143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:01.465144Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.465144Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:db13ed1ff5c51d3b84244cd41729f123eabe07d9a1019696be774f6a62608645","observation_id":"c0535c25-b455-4093-be57-bbe23e6ed593","resolution":{"observed_at":"2026-08-05T21:59:01.465144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:01.586486Z","title":"U.; Akram, W.; Saoud, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.586486Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:cead4c17c87c65821e275f831a7cf38e34585b693533208982e3cb01ed39a502","observation_id":"8112ce35-afb6-4377-be70-593bac236238","resolution":{"observed_at":"2026-08-05T21:59:01.586486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T21:59:01.753969Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.753969Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:892f4c562c43770c094e2fedae2a976f1164b672e1930acc5a0d35dd8f0fa902","observation_id":"9c7419bf-4469-49a7-aeb0-36cf0ae16ef8","resolution":{"observed_at":"2026-08-05T21:59:01.753969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T21:59:01.879712Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.879712Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:d8a3585fc04ec5a3cb1a645e3a4dfc5adb214a34d194b8d0e19dab64339e0fb2","observation_id":"cbf66c8f-7dff-4bcf-af3d-5e294652bcc7","resolution":{"observed_at":"2026-08-05T21:59:01.879712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T21:59:01.984771Z","title":"T.; Ben-Hamu, H.; Nickel, M.; and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.984771Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:14fbfec0fe10f6cbfa6f37a8f63566579f86d22739280887b61e373123217759","observation_id":"f22f2f3f-3975-4f85-88c5-a93078de177f","resolution":{"observed_at":"2026-08-05T21:59:01.984771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T21:59:02.125016Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.125016Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:306c19bfc44aa366620e48299ca81303b8339701c7558a1bdc0c9f12c17ab680","observation_id":"21b237a7-900b-4669-83fe-c4bb2e4577ba","resolution":{"observed_at":"2026-08-05T21:59:02.125016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:05.999291Z","title":null,"venue":null,"work_id":"6a6d8d37-a463-4f1c-85d3-bc1d8c3a228e","year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.219607Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:cfc041ea8e546588cb337269b884f7b938d27e2403e24e9c573349062cea3c7a","observation_id":"d2a5271a-649c-47e2-89a7-f093f194ff20","resolution":{"observed_at":"2026-08-05T21:59:06.090482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:02.395778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.395778Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:314a38bd8cd6004f17b8dd7181fadfb72aa079fd9cdb84a8af7dfd827fad11e4","observation_id":"2d951652-97cf-4845-b9e3-30536abadda5","resolution":{"observed_at":"2026-08-05T21:59:02.395778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T21:59:02.521887Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.521887Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:de26df0d14b3d5a494ca5466be3b7286350a4c777f154066828c478275d1319e","observation_id":"3972e8e3-e061-4e2c-a015-369cad400f00","resolution":{"observed_at":"2026-08-05T21:59:02.521887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:02.669629Z","title":"C.; Hagenbuchner, M.; and Monfardini, G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.669629Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:e939f2d17ad3049f82a73454c637c19b36b63e28f4e1a988c70d5088ee79567a","observation_id":"1d9a072c-0eda-4c4d-b4ff-bd99563f9f45","resolution":{"observed_at":"2026-08-05T21:59:02.669629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T21:59:02.850855Z","title":"M.; Ghosh, D.; Walke, H.; Pertsch, K.; Black, K.; Mees, O.; Dasari, S.; Hejna, J.; Kreiman, T.; Xu, C.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:02.850855Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:f602df878c2cca5af8cf95cc1601af0049fec28ced35eec2b034589e20903d85","observation_id":"387a2d33-f234-4fb8-8dc5-7b234f572307","resolution":{"observed_at":"2026-08-05T21:59:02.850855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:03.028529Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.028529Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:812f790fddb09d2eac445efef1df2defb646d21e866dcfd5bdd8c1f4be5b8458","observation_id":"1eb08441-3332-416c-85bb-0788f87d9060","resolution":{"observed_at":"2026-08-05T21:59:03.028529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19510","last_updated":"2025-03-25T10:01:57Z","snapshot_observed_at":"2026-08-07T16:38:50.733709Z","submitted_at":"2025-03-25T10:01:57Z","title":"RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19510","snapshot_observed_at":"2026-08-05T21:59:03.238165Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.238165Z"},"links":{"cited_paper":"/paper/2503.19510","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:1c7976ecb736246e6bb5808ea0ff394744edccc40dbfaf814a985fbcb35e6a99","observation_id":"46b3d570-56a7-4917-9861-7454eaa9e4de","resolution":{"observed_at":"2026-08-05T21:59:03.238165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:03.360868Z","title":"V.; Zhou, D.; et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.360868Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:91d9043824c7a03ed459a0b7de90bb96f2db88de47e90d7f2c1a3418c4ecb0a7","observation_id":"ed56506c-f6b4-4bdb-9e27-8837f393f21b","resolution":{"observed_at":"2026-08-05T21:59:03.360868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-12T14:04:58.697808Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-05T21:59:03.506693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.506693Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:d1e29181a9d7a5bb179ed40fde0e48c3a3fa71f8b7fe5b101d91ac679aa26917","observation_id":"8a3068a2-2413-4b17-893b-59a5f87d8200","resolution":{"observed_at":"2026-08-05T21:59:03.506693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-05T21:59:03.685804Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.685804Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:8a94ba531760cb49fbb7b73eca32cd200d0e2c06aa81b543582739cb8cc0d2fe","observation_id":"c37b3efa-6603-4150-a9d7-3b8038644537","resolution":{"observed_at":"2026-08-05T21:59:03.685804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:05.697407Z","title":null,"venue":null,"work_id":"6d0a81ea-8128-4d3b-b6c8-3d4cfc89cfc4","year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.815934Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:bdaf06e34f19c135cc9fb264fd84a42365966708aeb80a40d3338f662f265618","observation_id":"937d58e2-100c-4b34-8746-37cb3ae1f068","resolution":{"observed_at":"2026-08-05T21:59:05.824403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-05T21:59:03.989579Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:03.989579Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:1a3edeaa55e667734e192be3cff1d6da84cc2847f6754cc2b3a776717dcd1a76","observation_id":"607ad875-3aa4-405e-8f2a-2638e625de80","resolution":{"observed_at":"2026-08-05T21:59:03.989579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-05T21:59:04.110925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.110925Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:65ffcc40f0fc6707783763adc6cee3a37d019000f6eeee23f7470fc3d72ac266","observation_id":"10fcbea8-bb85-41dc-8eb6-083a24f9dbee","resolution":{"observed_at":"2026-08-05T21:59:04.110925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:05.404478Z","title":null,"venue":null,"work_id":"99190d6a-8622-4236-aa0e-70a876d452fd","year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.244235Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:b024f5583bafa96fdfebeaacac51687c3b107b8fcb56c271bbee00e2d4bc71ba","observation_id":"fc824915-7486-47f8-a96f-94bace06dedf","resolution":{"observed_at":"2026-08-05T21:59:05.549634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:05.115107Z","title":"J.; Fu, Z.; Zhang, Z.; Wu, Y.; Li, Z.; Ma, Q.; Han, S.; Finn, C.; et al","venue":null,"work_id":"2e08e62f-6a18-4c9d-8a90-0057c06e01a3","year":2025},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.376600Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:81301dc490cbc22a4fcea355eec9aa0d3a75250bba0e3ac80bf82764b99082a7","observation_id":"b6b0a23a-ae10-4209-9a43-49c754fc910d","resolution":{"observed_at":"2026-08-05T21:59:05.235334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T21:59:04.551521Z","title":"Z.; Kumar, V.; Levine, S.; and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.551521Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:728bf01fb2b7e818dcdbfdc9a59b4795df1ec0fd20658b5b4bb9671881ca34d7","observation_id":"a04cce51-79b9-43fb-ada7-aafa8657335a","resolution":{"observed_at":"2026-08-05T21:59:04.551521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:59:04.663968Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:04.663968Z"},"links":{"citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:fe3fe96b58fd17540e5012d97537f5d89fcb1298c12e89ce45e84c176a861bf2","observation_id":"e7a23773-4d3a-433b-bee1-e3af492139df","resolution":{"observed_at":"2026-08-05T21:59:04.663968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T20:57:04.544464Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 8 inbound Pith citation observations for arXiv:2508.07650."}