{"as_of":"2026-08-09T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e2cd1ff10e7b282ae11b554dd8c6247e63fe81da3328e72172f17cc928e9e77","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:26:04.124888Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:18:33.003700Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-07T13:26:04.124888Z","title":"Pointvla: Injecting the 3d world into vision-language-action models.arXiv preprint arXiv:2503.07511, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-07T13:17:24.769477Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:04.124888Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:ba4e9ab7f84f46cf82de2974fc9d86d71fbfb54e2d355074489cfb2b0704c005","observation_id":"dcd4bf35-08f6-4584-8d82-ba1130d069e3","resolution":{"observed_at":"2026-08-07T13:26:04.124888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-07T00:57:29.913716Z","title":"Pointvla: Injecting the 3d world into vision-language-action models.arXiv preprint arXiv:2503.07511, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12374","last_updated":"2025-06-24T10:01:18Z","snapshot_observed_at":"2026-08-07T07:38:26.007252Z","submitted_at":"2025-06-14T07:11:44Z","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:29.913716Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.12374"},"observation_digest":"sha256:361b14d8d6cd8ad9299ce4261f31eb99c1ef39ba66af37613c6e3e45a97e8ee2","observation_id":"ff242380-cf6f-43b4-8272-bc9b797fab99","resolution":{"observed_at":"2026-08-07T00:57:29.913716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2506.13456","last_updated":"2026-05-13T10:49:00Z","snapshot_observed_at":"2026-08-07T16:19:33.135284Z","submitted_at":"2025-06-16T13:14:58Z","title":"Block-wise Adaptive Caching for Accelerating Diffusion Policy","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T09:36:09.790248Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.13456"},"observation_digest":"sha256:96f05e3287c6b32e5fac027c341e2eb2eda93988587f84b23a10113a2ba9134e","observation_id":"c0b9c9b2-fb93-4682-8288-15a48054d178","resolution":{"observed_at":"2026-05-19T09:37:14.012841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-06T23:12:05.478000Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-08T04:14:25.873050Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.478000Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:6b0bbb81848d965e2433739fa48baa2604eb521bb95f22dcb083994ae761b23c","observation_id":"5a081d2e-86fc-45f3-801d-ec30236c942d","resolution":{"observed_at":"2026-08-06T23:12:05.478000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-06T21:31:04.553726Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-07T14:33:37.793120Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.553726Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:79a91652d6721e5faf0427e9af1054d100f10a12e7f2f2b3f42a9562e88c0be6","observation_id":"4acb9048-e194-4083-bc7f-d33873d302b6","resolution":{"observed_at":"2026-08-06T21:31:04.553726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-05T21:44:57.369165Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08113","last_updated":"2025-08-11T15:53:23Z","snapshot_observed_at":"2026-08-07T18:09:09.035859Z","submitted_at":"2025-08-11T15:53:23Z","title":"AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:44:57.369165Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2508.08113"},"observation_digest":"sha256:fdcf130833feedbceb8f851c058d591e2f9ceb2aae8d4c587eb1d3042dfc1c02","observation_id":"a35ca375-9e95-4252-9aff-04c085ca2630","resolution":{"observed_at":"2026-08-05T21:44:57.369165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-05T21:16:50.635037Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.635037Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:b0c42a444c5ea68e873d8ea5c07aa454551646f26842fbb5e30bd2dde9ab34e1","observation_id":"f9c6fa5d-81b5-4426-873a-e0eae9c2790e","resolution":{"observed_at":"2026-08-05T21:16:50.635037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-05T20:31:44.697712Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-06T07:55:46.567033Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.697712Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:95035b25e7942aaa83417ab6c9b830c47108f638214b3197aa3cc8bc64bcfa58","observation_id":"aa7accc5-6d43-4a9f-aa6e-b4bec3e39f33","resolution":{"observed_at":"2026-08-05T20:31:44.697712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":161,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:0db684684164eb7833a081b17d871b8e09765627372d6963d5fcaca8940a6045","observation_id":"3de2c2ee-50b8-430b-aaa8-d90b0f28cf0e","resolution":{"observed_at":"2026-05-17T20:28:16.020169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-04T09:34:43.166142Z","title":"ArXivabs/2503.07511 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-05T03:01:04.996856Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T09:34:43.166142Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2510.14836"},"observation_digest":"sha256:6733674d8525a0a8635ef57fa71783a120b62daa1be44eaf7b6860a5edec04a5","observation_id":"e0d84149-dcb9-4c5f-995f-a824256616a8","resolution":{"observed_at":"2026-08-04T09:34:43.166142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-03T14:00:20.825243Z","title":"Pointvla: Injecting the 3d world into vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-07T16:52:10.823568Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.825243Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:89714e1f62b67bff3187104a12af856961776577ee3cb2d00dbce4091c478fa1","observation_id":"68888964-eab6-4441-904e-4ebba7a9d12e","resolution":{"observed_at":"2026-08-03T14:00:20.825243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2512.23864","last_updated":"2026-06-28T00:20:33Z","snapshot_observed_at":"2026-08-03T13:35:53.078536Z","submitted_at":"2025-12-29T21:06:33Z","title":"Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T18:39:59.449746Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2512.23864"},"observation_digest":"sha256:768c90fcf0d21b4e505a2d19275c66f383b4ca774b8f19c5adea90eb56d1c95e","observation_id":"d6e2d2d9-a70f-45c9-80e7-c8fc88203900","resolution":{"observed_at":"2026-05-16T18:41:10.984675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-03T13:35:54.124177Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23864","last_updated":"2026-06-28T00:20:33Z","snapshot_observed_at":"2026-08-03T13:35:53.078536Z","submitted_at":"2025-12-29T21:06:33Z","title":"Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T13:35:54.124177Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2512.23864"},"observation_digest":"sha256:9a8af86d82c9a6858f4279eff38fb12ecd6209e2f23c4da13f04745064f638d6","observation_id":"1e3dd686-6eab-4812-8a1b-70c84eb8d3bb","resolution":{"observed_at":"2026-08-03T13:35:54.124177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-02T21:06:09.471941Z","title":"Pointvla: Injecting the 3d world into vision-language-action models.arXiv preprint arXiv:2503.07511, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21445","last_updated":"2026-06-20T22:55:52Z","snapshot_observed_at":"2026-08-02T21:06:07.003435Z","submitted_at":"2026-02-24T23:48:48Z","title":"VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:06:09.471941Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2602.21445"},"observation_digest":"sha256:62e1838acef44f85a06c3452875716c40f2231486246191912165770c134ee88","observation_id":"849bca38-52c1-4ca2-9d1e-388de3769f06","resolution":{"observed_at":"2026-08-02T21:06:09.471941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-07-13T09:40:35.215938Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T20:21:45.365156Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:63a16233a8d43fd51f73c2b6b3bb712db9b3415f7efb21588f7bad1312a6471c","observation_id":"aadd17e3-827e-458d-8cd3-43ee312c2195","resolution":{"observed_at":"2026-05-10T22:00:48.402416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2604.15281","last_updated":"2026-04-16T17:50:37Z","snapshot_observed_at":"2026-08-02T21:20:28.291912Z","submitted_at":"2026-04-16T17:50:37Z","title":"R3D: Revisiting 3D Policy Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T10:57:54.273960Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2604.15281"},"observation_digest":"sha256:6af21d730d82b6f1c30ff4e3286ba93cb301a3a8527bf70c45c4c9151f6cdf80","observation_id":"fc36ecab-8d5d-474f-b84b-f282c404de6f","resolution":{"observed_at":"2026-05-10T11:00:04.190007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2604.17880","last_updated":"2026-04-20T06:48:47Z","snapshot_observed_at":"2026-08-01T03:28:42.182562Z","submitted_at":"2026-04-20T06:48:47Z","title":"ST-$\\pi$: Structured SpatioTemporal VLA for Robotic Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T04:46:21.784769Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2604.17880"},"observation_digest":"sha256:6ab778191a81a7d4f92434f5772a489b559808d8445dccee89efe9fab6f28afd","observation_id":"1d7d34ec-203c-4022-af06-631cd113fe33","resolution":{"observed_at":"2026-05-10T11:40:19.869296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2604.20834","last_updated":"2026-04-24T16:37:03Z","snapshot_observed_at":"2026-08-02T06:38:24.634185Z","submitted_at":"2026-04-22T17:58:19Z","title":"PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T00:04:16.073230Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2604.20834"},"observation_digest":"sha256:e6e7f2d8351c2e48374c1a59baf2bf32aa25faf766548648f28669e2898a4f03","observation_id":"74418ad3-5c5e-444d-82f1-3f654360937b","resolution":{"observed_at":"2026-05-10T00:29:47.562283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2605.05126","last_updated":"2026-05-06T16:55:44Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:55:44Z","title":"ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T16:40:19.057979Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2605.05126"},"observation_digest":"sha256:0e68d1380d0622d79b7639ac51501be1b965b97287b7c473088a701ca9a9fea8","observation_id":"e5357876-7653-4d70-aa16-56aa03c37e24","resolution":{"observed_at":"2026-05-11T18:06:06.268981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2605.12162","last_updated":"2026-05-12T14:13:06Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:13:06Z","title":"X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:07.792757Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2605.12162"},"observation_digest":"sha256:0c1c00985b3aed3c0d31b4a698f7332b97dd6988c1ddc396960ab95538ffdb8b","observation_id":"34217eea-514c-41a9-bdcc-01e7036fedf2","resolution":{"observed_at":"2026-05-13T04:52:17.020022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:52.461348Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:9cfc7b1fe6932f91724dabe1f051d35b1bf604b85319bb5913e391c39f88605a","observation_id":"63376b24-316f-4f5f-afcc-dc4a37b175d1","resolution":{"observed_at":"2026-05-22T06:06:08.703355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T16:52:05.565650Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:d01934b7fe3e6f93ddf54224801527a723f409c3e225fde0691e94b1503c2924","observation_id":"134aa164-34ca-4cba-aeb5-4e13ff9a65d3","resolution":{"observed_at":"2026-06-30T16:54:58.317685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2605.24642","last_updated":"2026-05-23T16:18:41Z","snapshot_observed_at":"2026-07-30T07:41:42.487489Z","submitted_at":"2026-05-23T16:18:41Z","title":"Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:40:59.330788Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2605.24642"},"observation_digest":"sha256:8f79dc083e9e4f5f8f7c88d791a6f15366722598ca9693668f3e611ebd427e4d","observation_id":"79850471-bffb-49f2-9a5e-c01b70001734","resolution":{"observed_at":"2026-06-30T13:44:40.743959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2605.25829","last_updated":"2026-05-25T13:28:33Z","snapshot_observed_at":"2026-08-02T07:58:35.491806Z","submitted_at":"2026-05-25T13:28:33Z","title":"OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T21:27:26.682689Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2605.25829"},"observation_digest":"sha256:3f370be05bd3810adde162ebb652db0e0fa8a35159a36db64e2e388660c2d2df","observation_id":"74cb6a2f-f619-431b-a572-ae0c900b4345","resolution":{"observed_at":"2026-06-29T21:33:59.337303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2606.12403","last_updated":"2026-06-10T17:59:08Z","snapshot_observed_at":"2026-08-01T17:35:24.729614Z","submitted_at":"2026-06-10T17:59:08Z","title":"World Pilot: Steering Vision-Language-Action Models with World-Action Priors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:02.137152Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2606.12403"},"observation_digest":"sha256:5dce7c551ce9d44f17f2a18882014444f245d03f2b8b61f19c5b6f26f688fc59","observation_id":"c1da69b1-9aa2-4bac-ab1b-fcabffb90382","resolution":{"observed_at":"2026-07-03T11:18:03.254393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2503.07511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-07-03T15:18:33.003700Z","title":"Pointvla: Injecting the 3d world into vision-language- action models.arXiv preprint arXiv:2503.07511, 2025a","venue":null,"work_id":"9be65aa8-e58c-4756-b5ab-b5e59aac9eae","year":2025},"citing_paper":{"arxiv_id":"2606.13394","last_updated":"2026-06-11T14:25:09Z","snapshot_observed_at":"2026-08-06T00:19:24.282471Z","submitted_at":"2026-06-11T14:25:09Z","title":"GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T06:37:21.516021Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2606.13394"},"observation_digest":"sha256:9fee7515405127bc017051e2534393427b8bd83cb2fd933f1363fce44fc45a6c","observation_id":"cd6b747c-1cdd-4abe-8ffd-4e9a3261f804","resolution":{"observed_at":"2026-07-03T15:18:33.005241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-02T06:36:24.361775Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-06T22:26:58.903585Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:24.361775Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:32bba8b77585f49b4cb12e0ca1244a5cb8a3b4bbd7dc9f26b127c2520fdd8f36","observation_id":"4e0972ee-631b-49a8-b983-2cc8cdd6ba3f","resolution":{"observed_at":"2026-08-02T06:36:24.361775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-04T11:57:40.822184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.822184Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:2c0b7cc7c9344115e3565555892b5ef97d424e8a7aa4f9d29a63d9e37999d3b9","observation_id":"866f949d-1f4b-448d-9bf3-77f4d8a5c3ea","resolution":{"observed_at":"2026-08-04T11:57:40.822184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.07511/citation-record","integrity":"/paper/2503.07511/integrity","json":"/paper/2503.07511/citation-record.json","paper":"/paper/2503.07511"},"outbound":[],"paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2503.07511."}