{"as_of":"2026-08-19T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:701f3f8cb2c74464441921e009b7127bfb0ecae93b089e34aaeb14c55d0cd929","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:37:16.250864Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:11:17.634768Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T00:39:17.424396Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"cited_work":{"arxiv_id":"2602.19710","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.19710","snapshot_observed_at":"2026-07-04T00:39:17.424396Z","title":"Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","venue":"cs.CV","work_id":"d2079511-72ad-42e6-ad08-78eecd103fea","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2602.19710","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:439f67a9d06605b31395c833adca35c94a699dc51371da254984085a71dac0c8","observation_id":"14adc3dd-c331-4945-844f-7b8981d089e0","resolution":{"observed_at":"2026-07-03T14:48:32.870836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"cited_work":{"arxiv_id":"2602.19710","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.19710","snapshot_observed_at":"2026-07-04T00:39:17.424396Z","title":"Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","venue":"cs.CV","work_id":"d2079511-72ad-42e6-ad08-78eecd103fea","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-08-17T04:58:30.005341Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2602.19710","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:e5fed64fc0756ed8668d45c7a0b853edba61b613bc2b5b7a84c8b527904ec884","observation_id":"db88cc04-c30a-4c28-864c-8cfed2513b62","resolution":{"observed_at":"2026-07-04T00:39:17.425754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.19710","snapshot_observed_at":"2026-08-07T05:11:17.634768Z","title":"Posevla: Universal pose pretraining for generalizable vision- language-action policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06332","last_updated":"2026-08-06T17:40:32Z","snapshot_observed_at":"2026-08-14T02:03:41.905277Z","submitted_at":"2026-08-06T17:40:32Z","title":"GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:17.634768Z"},"links":{"cited_paper":"/paper/2602.19710","citing_paper":"/paper/2608.06332"},"observation_digest":"sha256:a8731730d249dac22fb92992ba1e54deedac95c886e7fb0a9ac827eed82094cd","observation_id":"debb4867-1ec5-4d65-ac42-eeedc4ffc602","resolution":{"observed_at":"2026-08-07T05:11:17.634768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.19710/citation-record","integrity":"/paper/2602.19710/integrity","json":"/paper/2602.19710/citation-record.json","paper":"/paper/2602.19710"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:09.276954Z","title":"Objectron: A large scale dataset of object-centric videos in the wild with pose annotations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:09.276954Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:ec3385d7018ecc0ed11a5816c6d722c51488a909ab5a8fc6e9b9f3d2ae56fb54","observation_id":"c7836cd2-72d2-4240-9beb-46ff0e3673c0","resolution":{"observed_at":"2026-08-02T21:37:09.276954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:09.389547Z","title":"On the representation degradation in vision- language-action models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:09.389547Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:e18b33175f54ab1ec56ea1fa40ff09f3d7fabcdbcbb5b139b0383a14405f2c05","observation_id":"13787cf2-8a07-4f77-812b-a6d664dcbc45","resolution":{"observed_at":"2026-08-02T21:37:09.389547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T21:37:09.569609Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:09.569609Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:4214a959b7535c0c01e0e3c7593b2ad10371335f88fb0c064e8840830174dba0","observation_id":"dc1b9b76-3585-4d13-ad50-241b1b6d04a8","resolution":{"observed_at":"2026-08-02T21:37:09.569609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-02T21:37:09.716828Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:09.716828Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:e907b92ea03a585fccfd008e49dc045376e5cb633657ce25c434159a43abd637","observation_id":"1f14761d-9d52-456b-9e60-da1e6a74cf26","resolution":{"observed_at":"2026-08-02T21:37:09.716828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T21:37:09.848953Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:09.848953Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:7761345280cd98002a4d1309639a86ead2bedf2f11ee69fe25d714893bda7a19","observation_id":"e4356ceb-fefb-4b66-918b-6a8d9d2f8b4d","resolution":{"observed_at":"2026-08-02T21:37:09.848953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T21:37:09.982605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:09.982605Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:1af1d236a7f9ce56d54cf2007117c623ffb66c19d757a6d61b57d5726d84ca4a","observation_id":"50fa0fdd-f25a-4d27-9cdf-b650b250858a","resolution":{"observed_at":"2026-08-02T21:37:09.982605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:10.171748Z","title":"In9th Annual Conference on Robot Learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:10.171748Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:b909cee796b1c5e8abf0ecf093af6fb37fe87b1a0ad335501e225006c01a865b","observation_id":"32de1248-beff-414b-9a66-056fb6ba3064","resolution":{"observed_at":"2026-08-02T21:37:10.171748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:10.355369Z","title":"Omni3d: A large benchmark and model for 3d object detection in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:10.355369Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:bde3cf54cabfb816369cc3b31d996f38b7aa9d75cb879151c5ef12ce364562ca","observation_id":"4af5f446-d60d-4fdd-8490-c16efd2d18e7","resolution":{"observed_at":"2026-08-02T21:37:10.355369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-02T21:37:10.505000Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:10.505000Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:b4963a65e334eb5537592383dda4048a9c1421d5035c196ce262cc141c8c5042","observation_id":"3665d143-5566-4892-aacd-59f730cda58a","resolution":{"observed_at":"2026-08-02T21:37:10.505000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-02T21:37:10.660577Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain random- ization for robust bimanual robotic manipulation.arXiv preprint arXiv:2506.18088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:10.660577Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:ac074d87e16ca6a0e311fa357e0b3b1ed23f3b480aa1e55c2dc35393a7de3722","observation_id":"4e7fb85d-047b-4cca-a206-12cb859cff1b","resolution":{"observed_at":"2026-08-02T21:37:10.660577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08243","last_updated":"2025-05-17T21:04:22Z","snapshot_observed_at":"2026-08-18T01:42:20.495799Z","submitted_at":"2025-05-13T05:35:00Z","title":"Training Strategies for Efficient Embodied Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08243","snapshot_observed_at":"2026-08-02T21:37:10.787322Z","title":"Training strategies for efficient embodied reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:10.787322Z"},"links":{"cited_paper":"/paper/2505.08243","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:69496c040366075266d87f8825ee84b087ba8f46efdeba085dc3d6a8d5dc55a2","observation_id":"695d346a-885e-4bbe-ab8f-f360d97c2d60","resolution":{"observed_at":"2026-08-02T21:37:10.787322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03685","last_updated":"2024-05-06T17:57:27Z","snapshot_observed_at":"2026-08-16T13:54:56.912050Z","submitted_at":"2024-05-06T17:57:27Z","title":"Language-Image Models with 3D Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03685","snapshot_observed_at":"2026-08-02T21:37:10.906144Z","title":"Language- image models with 3d understanding.arXiv preprint arXiv:2405.03685, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:10.906144Z"},"links":{"cited_paper":"/paper/2405.03685","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:97779430d9e9b5c41d26d01f0cca7f076aa3002c6213561e6a7b47522684d84f","observation_id":"a825d5c6-361f-4032-84ec-2cb6bbbc3e42","resolution":{"observed_at":"2026-08-02T21:37:10.906144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T21:37:11.048220Z","title":"Gem- ini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:11.048220Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:0af450369fbe4059cfd97b47541a4566567455ae7cff7f9d0cbd25c8c8eb542b","observation_id":"f395ef63-03ef-440d-867d-58d13819b45d","resolution":{"observed_at":"2026-08-02T21:37:11.048220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:11.241225Z","title":"Vla-0: Building state-of-the-art vlas with zero modification.arXiv preprint arXiv:2510.13054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:11.241225Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:020bc7fc0bc380deb097cbc9ce589fe018e56f7872b80ef0894788f867feaa02","observation_id":"332ec85a-a121-4926-8f00-0b3157c5210a","resolution":{"observed_at":"2026-08-02T21:37:11.241225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T21:37:11.438697Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:11.438697Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:f37280fd5624d9c2480c5c42ebe1ea6a86dd428080b7c99eeb770bfd746af98b","observation_id":"9158f500-ae05-4265-8f33-ca70f58be589","resolution":{"observed_at":"2026-08-02T21:37:11.438697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:11.571557Z","title":"Pow3r: Empow- ering unconstrained 3d reconstruction with camera and scene priors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:11.571557Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:86c5299c179ba5758d506dc62fd90bde22b2ced69bb663b0ac2718f84a731dcf","observation_id":"d6bc258a-8622-4d21-b897-b3622abba245","resolution":{"observed_at":"2026-08-02T21:37:11.571557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:11.691309Z","title":"Don’t blind your vla: Aligning visual representations for ood generalization.arXiv preprint arXiv:2510.25616, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:11.691309Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:b682412063241e0b5fb02b4f7d6179df5fa6c644f98e0f85b7004a5da1416d07","observation_id":"36e77b2e-5337-40a6-a07c-f381598307c7","resolution":{"observed_at":"2026-08-02T21:37:11.691309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T21:37:11.867178Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:11.867178Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:94d1656de1c975a44aab3709994ff134fb4ac76339fa06408b872ec2d8ecbc53","observation_id":"ab137981-81d6-46f0-8282-1c87ec346ec8","resolution":{"observed_at":"2026-08-02T21:37:11.867178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-08-14T09:44:01.476519Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-02T21:37:12.038367Z","title":"Molmoact: Action reason- ing models that can reason in space.arXiv preprint arXiv:2508.07917, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:12.038367Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:a6bffc13a79d3fab19aed432360b595e1d88d43118267e60b78abfd50938a171","observation_id":"608225c9-c9d3-437c-9ee3-100846ec7415","resolution":{"observed_at":"2026-08-02T21:37:12.038367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:12.262166Z","title":"Spatial forcing: Implicit spatial representation align- ment for vision-language-action model.arXiv preprint arXiv:2510.12276, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:12.262166Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:582fabd9ebdc17b0a9c441a5de1392711a8653e75cc638f5d13922c1810c6380","observation_id":"8e19ce90-9856-4c74-8aa1-fab6df6129f2","resolution":{"observed_at":"2026-08-02T21:37:12.262166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20072","last_updated":"2026-05-31T15:50:43Z","snapshot_observed_at":"2026-08-15T16:46:32.902409Z","submitted_at":"2025-08-27T17:39:11Z","title":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20072","snapshot_observed_at":"2026-08-02T21:37:12.445617Z","title":"Discrete diffu- sion vla: Bringing discrete diffusion to action decod- ing in vision-language-action policies.arXiv preprint arXiv:2508.20072, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:12.445617Z"},"links":{"cited_paper":"/paper/2508.20072","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:cf557faa8414c77596bfb65e1e5e45a140f00e6bfce9914aa32f2bd4ca435361","observation_id":"ff1c7ab5-0453-4562-ab5d-224f51eef893","resolution":{"observed_at":"2026-08-02T21:37:12.445617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:12.615594Z","title":"Onetwovla: A unified vision-language-action model with adaptive reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:12.615594Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:1980b17e0f746a778e707e79ba9ccd7b795a5828bf859bcd6281c0c5cf2c707b","observation_id":"f9490399-d3bd-4063-bc71-c22b33f310db","resolution":{"observed_at":"2026-08-02T21:37:12.615594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-02T21:37:12.715620Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:12.715620Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:6ba2f5a39f6a0740a2f403daf17227a558988dda0b76c85f77ade0464f6d90c8","observation_id":"6855142e-b978-4985-9626-8d6b5cb7039e","resolution":{"observed_at":"2026-08-02T21:37:12.715620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:12.837474Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:12.837474Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:480003c2d3f0b8c8fdad54aa8ba8db59ab40ae3f79de56e76c9c8fc95877ec9f","observation_id":"a6781868-2bad-440d-a316-42773c16ae41","resolution":{"observed_at":"2026-08-02T21:37:12.837474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-08-16T10:00:51.789693Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-02T21:37:12.899050Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language- action model.arXiv preprint arXiv:2503.10631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:12.899050Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:55e2f7a8d2fb217e0690d88775558f85913640faff562e79bcefaa85c4e5b891","observation_id":"00ce6743-9a5f-41dc-8a83-b2bb6d4a9225","resolution":{"observed_at":"2026-08-02T21:37:12.899050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-14T20:34:51.960761Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-02T21:37:12.941124Z","title":"Rectified flow: A marginal preserv- ing approach to optimal transport.arXiv preprint arXiv:2209.14577, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:12.941124Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:af936d5b9a6e6680747d01b9bd1a37dbc7ab28fe119f8a5bfdb9adbe719c1148","observation_id":"4041a377-8649-4145-baa2-65e6f5f33f11","resolution":{"observed_at":"2026-08-02T21:37:12.941124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-02T21:37:13.125283Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:13.125283Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:4dfc469943882119abd36fe3ab19c444ed19eca8671c409acabc02678ebc4407","observation_id":"89b1aa89-e22d-4ce3-a247-bbb8a6ffa1cd","resolution":{"observed_at":"2026-08-02T21:37:13.125283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20024","last_updated":"2025-06-10T17:53:33Z","snapshot_observed_at":"2026-08-16T05:34:52.005177Z","submitted_at":"2025-04-28T17:48:43Z","title":"SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20024","snapshot_observed_at":"2026-08-02T21:37:13.241240Z","title":"Spatial- reasoner: Towards explicit and generalizable 3d spatial reasoning.arXiv preprint arXiv:2504.20024, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:13.241240Z"},"links":{"cited_paper":"/paper/2504.20024","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:3bb62671b9b975fbd504ea7cbfcb8d2f38b26dc300757ab3ff4ff105c726b925","observation_id":"a0d59919-a6a7-49dc-8105-3f2c08e04de7","resolution":{"observed_at":"2026-08-02T21:37:13.241240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:13.473981Z","title":"Locateanything3d: Vision- language 3d detection with chain-of-sight.arXiv preprint arXiv:2511.20648, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:13.473981Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:7fa70dce8dcf76476225728e4e600d93d64f2bd0430d1ccf5721840f2ad25679","observation_id":"50fa8582-1f65-4fa2-8cc4-bab0e4de3690","resolution":{"observed_at":"2026-08-02T21:37:13.473981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:13.627124Z","title":"Spa- tiallm: Training large language models for structured in- door modeling.arXiv preprint arXiv:2506.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:13.627124Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:7636fff2c9e6ca9c6da94c0e0fc56d53891bba9610b73dfca878c7088fbd47bb","observation_id":"b02e4c95-c70a-488d-b79e-fd43c711c706","resolution":{"observed_at":"2026-08-02T21:37:13.627124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T21:37:13.747288Z","title":"Fast: Efficient action tokeniza- tion for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:13.747288Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:f38170d2a8554bc0e80f1686dd318b5a025a1d39bcbd1bc2ab41667ef871c084","observation_id":"58dc68ba-727b-4dc8-a9e4-3b0ed97a74f7","resolution":{"observed_at":"2026-08-02T21:37:13.747288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:13.975339Z","title":"Eo-1: Interleaved vision- text-action pretraining for general robot control.arXiv preprint arXiv:2508.21112, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:13.975339Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:95c425e2e7a271e191150e28682b5b454dcdd555331cda1ebee1db6034cadd0c","observation_id":"e2e84639-41aa-45db-95b8-40ce6cf16bc0","resolution":{"observed_at":"2026-08-02T21:37:13.975339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-17T12:53:34.218587Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-02T21:37:14.096872Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model.arXiv preprint arXiv:2501.15830, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.096872Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:2589942d8e808b747f97814ddcd62ee481c2f52f3f89853eb43f5b673baed1db","observation_id":"2a9f7163-7f55-49c6-b515-1e2d44d64994","resolution":{"observed_at":"2026-08-02T21:37:14.096872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:14.213063Z","title":"Qwen3-vl: A frontier multimodal large lan- guage model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.213063Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:cb5ca3e6cfe025eb2ce7f5dfabd7c8058f3a5c66e2d61d8eba30f62f6abc26cc","observation_id":"0d7908e9-4133-462c-8987-902a9cf46eea","resolution":{"observed_at":"2026-08-02T21:37:14.213063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-02T21:37:14.453522Z","title":"Memoryvla: Perceptual- cognitive memory in vision-language-action models for robotic manipulation.arXiv preprint arXiv:2508.19236, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.453522Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:3ca379c9f63fcb08c062500679d2ae66c773aaa9f0ab9416eb069b36dc1f0d11","observation_id":"70d727fc-7eb0-4d66-a788-1f2b3873e63e","resolution":{"observed_at":"2026-08-02T21:37:14.453522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:14.611612Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.611612Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:9b2f5abd2c20eefb6e8212a0d2c2a45303fa6cba396c6873ff62b379b377575e","observation_id":"cbb2ba4e-6064-464e-9287-655ed5bf425e","resolution":{"observed_at":"2026-08-02T21:37:14.611612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:14.725557Z","title":"Emma-x: An embodied multimodal action model with grounded chain of thought and look-ahead spatial rea- soning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.725557Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:385c4700910b5043d31665dd5d49c9150023f50616831886d20fc6d938910eec","observation_id":"1ec095cf-0eec-4824-bdbb-0def141888c1","resolution":{"observed_at":"2026-08-02T21:37:14.725557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-02T21:37:14.891831Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.891831Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:7891893ffe48b80bea0936c3699df344fc7dc2451f03f80b0b0ae4779d886f09","observation_id":"1212fad9-76b7-4c03-8e71-0e9887b77dc2","resolution":{"observed_at":"2026-08-02T21:37:14.891831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T21:37:14.956373Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.956373Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:443c614b494ecb176d39e625815e2dde15d8cf20b4f55f0921bb7008de6adbd4","observation_id":"99aa2b4a-aeeb-4118-bade-36b97fa5adf2","resolution":{"observed_at":"2026-08-02T21:37:14.956373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-18T02:44:29.412804Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-02T21:37:14.978308Z","title":"Vq-vla: Improving vision- language-action models via scaling vector-quantized ac- tion tokenizers.arXiv preprint arXiv:2507.01016, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.978308Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:ae346bb56031595bf80e2b4bf7c6e676fa0af574c3002132a3b9fd3f560a8ac6","observation_id":"408a266b-fe64-4d6d-a97c-0ced98d15a1f","resolution":{"observed_at":"2026-08-02T21:37:14.978308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:15.087357Z","title":"N3d-vlm: Native 3d grounding enables accu- rate spatial reasoning in vision-language models.arXiv preprint arXiv:2512.16561, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:15.087357Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:4b882846c02fd0acc97a5df8787cd3b09ba7a9a11cd32284047ad04664daf849","observation_id":"5a9ff308-f506-4843-ada3-067a6187d278","resolution":{"observed_at":"2026-08-02T21:37:15.087357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13860","last_updated":"2024-10-17T17:59:55Z","snapshot_observed_at":"2026-08-19T01:39:03.200835Z","submitted_at":"2024-10-17T17:59:55Z","title":"VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13860","snapshot_observed_at":"2026-08-02T21:37:15.172508Z","title":"Vlm-grounder: A vlm agent for zero-shot 3d visual grounding.arXiv preprint arXiv:2410.13860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:15.172508Z"},"links":{"cited_paper":"/paper/2410.13860","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:1e6631f829098e6147f8516c228460a1317519bcd5aa5b2cab5950aa1cb9df46","observation_id":"3354e406-cad3-44e4-a168-aa6be5881022","resolution":{"observed_at":"2026-08-02T21:37:15.172508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:15.251491Z","title":"Visual spatial tuning.arXiv preprint arXiv:2511.05491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:15.251491Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:7e793181b12a8aa178a54dc3ccbe9509694a1d82257f81ff9bd935052a696c2e","observation_id":"0b496158-cb66-4d09-bcd6-0b6d266b69c2","resolution":{"observed_at":"2026-08-02T21:37:15.251491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:15.332694Z","title":"Instructvla: Vision-language-action instruction tuning from understanding to manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:15.332694Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:d5feee0127371215c5c1324cc6b13379c2a904e321a8e5eca02579b6ba8497bb","observation_id":"e8597b77-d3c7-4985-b394-26b413f23c41","resolution":{"observed_at":"2026-08-02T21:37:15.332694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-02T21:37:15.434643Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:15.434643Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:be5bde18f0a6956e8cc5d307be863f0996dfc182583418007558afce778b3dc4","observation_id":"1c0049f5-38d9-4087-ba75-7af585525d4e","resolution":{"observed_at":"2026-08-02T21:37:15.434643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:15.598305Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:15.598305Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:556bddabf4a1c14f47f51d9a7aeaa9faf24aa07538a289858c66cc4a1b009fdb","observation_id":"98f4fbad-b8c3-4acc-9277-2b09dd81eb7c","resolution":{"observed_at":"2026-08-02T21:37:15.598305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03309","snapshot_observed_at":"2026-08-02T21:37:15.741346Z","title":"Vlm4vla: Revisiting vision-language-models in vision-language-action mod- els.arXiv preprint arXiv:2601.03309, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:15.741346Z"},"links":{"cited_paper":"/paper/2601.03309","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:90b611ef0ec6679268afd4dafc5e41c763bf6fa3671ef850c5b29ae833058e42","observation_id":"18d1f9c5-29de-4ab9-b147-807980952787","resolution":{"observed_at":"2026-08-02T21:37:15.741346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:15.903815Z","title":"Omni6dpose: A benchmark and model for universal 6d object pose estimation and tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:15.903815Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:33cdd13fb7afab75d585915e1797bfafef589f1aad842bef2345733dec4bcdf3","observation_id":"5045d1ff-c7a7-44e5-9a3c-0d2322629782","resolution":{"observed_at":"2026-08-02T21:37:15.903815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:16.012864Z","title":"Cot-vla: Visual chain- of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:16.012864Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:5b2499930ba14e22b7a05b882334ca0563a9d6908effcdfaab4233ce370257a5","observation_id":"a7774f0c-7958-4a18-9b98-868e92ec8d31","resolution":{"observed_at":"2026-08-02T21:37:16.012864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:16.137591Z","title":"Chatvla: Unified multimodal understanding and robot control with vision- language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:16.137591Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:3fc018fe4e1e64435280e4f55c0558d6d8eabbe03ee9b732a1847af88ab5bee1","observation_id":"48770eb8-b9d6-4007-856f-b98651a35fdc","resolution":{"observed_at":"2026-08-02T21:37:16.137591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:16.250864Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:16.250864Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:1eb19f34224590d57e7eeecaa1a6851c740ddc9a232950d92b2e8f6301901fe5","observation_id":"47a1e215-21a2-49a5-982f-4a1c8d8ce4a7","resolution":{"observed_at":"2026-08-02T21:37:16.250864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:37:14.293501Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.293501Z"},"links":{"citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:144d6a5de7cf3ea746e19cb672cc215f996175e46e0937ccc132e6b55c25eac9","observation_id":"6cf70152-9102-4e65-b5fd-273de537d6d3","resolution":{"observed_at":"2026-08-02T21:37:14.293501Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T11:05:41.010907Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 3 inbound Pith citation observations for arXiv:2602.19710."}