{"as_of":"2026-08-05T13:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4068c25aa6ee15cd424c41160a8fa52bc9f6acf2050cfd1cc05dcca0817a5404","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:25:18.120832Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.11832/citation-record","integrity":"/paper/2605.11832/integrity","json":"/paper/2605.11832/citation-record.json","paper":"/paper/2605.11832"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"f7885331-8589-479a-8005-b6fd1dcb77e7","year":2022},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:8c032aa79ef63156e5f10c8d4b8c1459b43e4629e455bd11003bff2f916ae176","observation_id":"9f2373c1-810e-4fa0-ac43-615bc624cc48","resolution":{"observed_at":"2026-05-13T10:32:38.305442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"8a48fb14-e058-448d-95e8-b2eca4305f75","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:48c64cb39a9169e6963b1a6d0ce2ec35c8aef50d2a44873454442a7924bd1ba1","observation_id":"b9ae34bd-6f91-44d1-99bc-2197ac885554","resolution":{"observed_at":"2026-05-13T10:32:38.288472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:f19b4731179dda5e573d881451f1b5a02cfe2e9d8853b4493d9164f636094dbf","observation_id":"2d6df557-0000-47fd-ae15-3ba9b5f41561","resolution":{"observed_at":"2026-05-13T05:27:18.569048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"8540171a-f11b-4334-bb73-1e086aaa7ede","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:cbb09b2d44aa5835c6f84b1b3049afc72986c5978d120903811ab111112dd2ff","observation_id":"7d7a2cc4-f18c-491c-a1cd-5d77ebe61b48","resolution":{"observed_at":"2026-05-13T10:32:38.292662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:ff291c889c8a21dd1afce682476c98aae143a1a67c859d15c2bdf27060293cea","observation_id":"8f3a12f0-a62a-403a-a83d-25a7ba7e1545","resolution":{"observed_at":"2026-05-13T05:27:18.566164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:dc072c0e65cccfa246ec4c68629a5cb781e915131068b148704d9c09c71e37a1","observation_id":"33f6e4df-ae6f-4116-865a-762f9b93b9f4","resolution":{"observed_at":"2026-05-13T05:27:18.571718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24948","last_updated":"2026-04-27T05:41:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T15:45:19Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","version":6},"cited_work":{"arxiv_id":"2509.24948","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.24948","snapshot_observed_at":"2026-07-10T08:36:59.803669Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","venue":"cs.RO","work_id":"e43fb37f-61a0-4911-b5e5-880083d7aa30","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2509.24948","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:e5caa84e07841b0776d209f9a8656d22cf4f08fc2698badc8c1f8ec370fe782f","observation_id":"0a8ecc01-d235-4f80-9c16-dbda403f7157","resolution":{"observed_at":"2026-05-13T05:27:18.555877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Janusvln: Decoupling semantics and spatiality with dual implicit memory for vision-language navigation","venue":null,"work_id":"ae104479-b447-4e48-a1e4-aedb9f242639","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:616d53d7c3a1ff4f4b2355076de46dc41d324209b80832b3fcc22e7bd39816bc","observation_id":"db142b39-6285-4a31-b0c2-88094fc651eb","resolution":{"observed_at":"2026-05-13T10:32:38.309592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-07-31T04:11:07.384159Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":"2507.05240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T02:27:48.997495Z","title":"Streamvln: Streaming vision-and- language navigation via slowfast context modeling","venue":"cs.RO","work_id":"ec969c94-54ed-47a7-8dd3-a07cd132485e","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:ff6dca76258d46ccd6dcaff5d0caf8bb27eb8a2a2dd42465435470838709a687","observation_id":"191a073c-a88f-4214-9dda-cbe1adb50dc3","resolution":{"observed_at":"2026-07-10T01:18:45.609520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"9e514bf2-af7a-472e-8485-8660bd7bb32a","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:a1960374fe948764da9968682c710220c08cf4e887ff0e55faff302c85dcd528","observation_id":"18830f6d-259f-4fec-a569-e42c1b76770f","resolution":{"observed_at":"2026-05-13T10:32:38.296967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-Tuning Vision-Language- Action Models: Optimizing Speed and Success","venue":null,"work_id":"ec6fc663-26b5-4c0f-a9ec-4bcc02675700","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:4d7b389d95c6872ce9ded2087155e6a806b76b67a8af078fb533dba78261bc0e","observation_id":"7fdd1dbc-37e2-42eb-8930-fe74a12b833d","resolution":{"observed_at":"2026-05-13T10:32:38.280339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FAST: Efficient Action Tok- enization for Vision-Language-Action Models","venue":null,"work_id":"a46b789d-0bce-4b06-b371-8587f4453462","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:fb6961e2f24544c95a73a41c1a2a0cffc5293f2540515e9f0fd9b084820b2693","observation_id":"5c4c4424-fbea-4b52-b499-a6ab5cceb5bb","resolution":{"observed_at":"2026-05-13T10:32:38.284554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":"21e6cf7a-d882-4e7d-9882-acf5e1579e0c","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:6969002e8306d50023f4b4e8fb9e384e2ca2b7fa96118b1a8a14bfd544d9d1e5","observation_id":"87aeed09-82b8-4aec-bf95-a8102cd9285b","resolution":{"observed_at":"2026-05-13T10:32:38.317469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RVT- 2: Learning Precise Manipulation from Few Demonstrations","venue":null,"work_id":"933ba6b1-a16c-4a78-934d-b556513f3c56","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:d06a1f1770a908643309a443c4017c8baa5510bdef90aa8696c562cdd61b2f51","observation_id":"b0f6cd15-f67a-4474-8414-1a9447a21244","resolution":{"observed_at":"2026-05-13T10:32:38.313550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.00416","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.614921Z","title":"Evo-0: Vision-language-action model with implicit spatial understanding.arXiv preprint arXiv:2507.00416","venue":null,"work_id":"d1204baf-ba9c-4c49-a595-132c514f7fde","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:9b6fb533e41607b43d4f1b448495c7918c1e398e5953ee7145b989f06d9120bb","observation_id":"9225fb87-3914-4873-91a0-79b34f9a89a0","resolution":{"observed_at":"2026-05-13T05:27:18.559411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial forcing: Implicit spatial representation alignment for vision-language-action model","venue":null,"work_id":"a59717ed-e2ab-4e03-962c-fb102c3b9563","year":null},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:893706cb0b6f3d80f79d758f858abcbf08d8fd9f7f8ccccd777ca6b8f92dadd3","observation_id":"51f755aa-3322-4e6d-9818-ae1c76cce6bc","resolution":{"observed_at":"2026-05-13T10:32:38.197392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":"01c8ae26-89ef-4928-9142-dede33dde470","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:34f64cb59e16f0c3991e739a18d925bce69c52aacd6f1b3872a734a42e3ba87d","observation_id":"52ce7381-91d4-4f68-ac1d-a03b7ee1e083","resolution":{"observed_at":"2026-05-13T10:32:38.157535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depth anything 3: Recovering the visual space from any views","venue":null,"work_id":"e5d74615-1a41-456a-9612-0d5fc34966d6","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:c9f5604480163e2e5f3de23210840c4b1eec599c56a1f657e9dad142bcb8c040","observation_id":"f8284c38-bf39-4a1c-a294-a1821ab599eb","resolution":{"observed_at":"2026-05-13T10:32:38.188676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"a89286af-f053-4256-b1ae-a47658b54c70","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:55c3d7f4acc85fde3d5e25ceef9d87e469307dd69aad95570709c079be6457dc","observation_id":"cc119cc7-e19c-48e8-907b-9ddb18c8c265","resolution":{"observed_at":"2026-05-13T10:32:38.249341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:ca74162a5a81c9e8e47f5c38e2834c482e8f920ccb54d88f25be786bf5780b6c","observation_id":"87f199a3-12e5-420e-8045-9d59d46d5d8b","resolution":{"observed_at":"2026-05-13T05:27:18.532163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2411.19650","doi":"10.48550/arxiv.2411.19650","metadata_source":"pith","pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","venue":"cs.RO","work_id":"4b158d3e-3dff-4412-85cd-baa879465a5e","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:d5df616e8593e829d593ccd34f21c9faba4c7f48f3d5167322c2284fead453e2","observation_id":"fef89edf-faa5-4a28-ae26-b5dc647fc156","resolution":{"observed_at":"2026-05-13T05:27:18.521709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"1f1def90-c3db-494f-8688-25d2b4bdd4d9","year":2020},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:a923408beaac52e1e53c903ceed96bf195c93aee3a6d6fc6d26e4ed5932fd883","observation_id":"a616a8cf-2349-4a45-861f-e567dd4672de","resolution":{"observed_at":"2026-05-13T10:32:38.075769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"bf128734-b192-4b4e-b4d2-e0e05e02bd12","year":2021},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:0049d9b1be6f051185b6622ea7b50dea3a49e497e65430f321d57be6261ff3be","observation_id":"d02cea01-1b83-44c9-826f-5249dc0d058a","resolution":{"observed_at":"2026-05-13T10:32:38.240886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow matching for generative modeling","venue":null,"work_id":"44dba50d-32bf-4a32-80ad-f7bfbfea5333","year":null},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:876f398ab171d8f24c9744c249c61a8ac368fcb5b25b2f553355c84c147510c1","observation_id":"e66d5391-c469-4206-8676-9f7e6bc9a517","resolution":{"observed_at":"2026-05-13T10:32:38.180152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"46c02529-b781-4d05-b2c0-113bb2971ee2","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:0a8e52e6847a110a3d16117cef26ff361e608d6cac42b29171792a1e94fc9ce3","observation_id":"573dde78-35b8-40d4-8fa4-4bbe08bb6839","resolution":{"observed_at":"2026-05-13T10:32:38.205576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean flows for one-step generative modeling","venue":null,"work_id":"6ff91661-d5bf-4e2e-9d64-136fea98b071","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:e9e2c0c4f63a066574f4f2de3e58049b56fcdcffa58481dce5aafc5ef281dde0","observation_id":"feb54258-3ab5-47fa-bcd4-ad67174d3dd9","resolution":{"observed_at":"2026-05-13T10:32:38.079975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":"ab3fa9b8-5782-4056-9461-e60efdde514d","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:d8c7a22b3e26e29a258a18c7d624b928373e65c87bf616feb3af3dce2e93602a","observation_id":"1c80bdaf-5778-4b72-8259-936850baab92","resolution":{"observed_at":"2026-05-13T10:32:38.201505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:be2e95374c43e2dada668f1865bbcbc2d51b739e9ef6b6ee63c3c49dcbafc63e","observation_id":"8803732d-4165-46eb-809c-c420832a64a0","resolution":{"observed_at":"2026-05-13T05:27:18.548705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:b640d6823049e7d2982dfd183a1df22bbc45ddea0ddd2a4e16ff1a7b85cc8114","observation_id":"9ebe0adb-2601-41f0-b107-78d498d39560","resolution":{"observed_at":"2026-05-13T05:27:18.475629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"3af233eb-41b1-4677-a155-3d62f147b272","year":2022},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:0a22c16e4a3c8925ce00fe4c8858508fff6c563f1b76b55bc5062eed69398983","observation_id":"63cadc00-50d7-4a4d-9cd3-c5420dca5566","resolution":{"observed_at":"2026-05-13T10:32:38.184282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"34e3b940-c072-47ac-9b7c-3c2afd4187a9","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:1f67d5551a0af8fcc6bf03c2c807c8099594457ef9a171ac2eebf7bac5c22511","observation_id":"545b4bd8-24ba-4190-b21d-b58ea673866c","resolution":{"observed_at":"2026-05-13T10:32:38.262897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning","venue":null,"work_id":"6aa276a5-e1b0-437d-8d31-8683a396ee47","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:5b9f2f0d9efbd4d33224f5122990153516232059102e0f64df7a354dca396919","observation_id":"7df243d0-936b-4619-a51c-ddedb1a12144","resolution":{"observed_at":"2026-05-13T10:32:38.236976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"e9ea13bc-ad4f-427a-945b-3bcb5980afea","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:f2a0ba6948119ceee7fc30ea369b268062abc52101b73d608b8f9e93d947d7d4","observation_id":"13a66d3c-996b-4e29-834b-8c30412c7481","resolution":{"observed_at":"2026-05-13T10:32:38.166510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prismatic VLMs: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"aede8fda-7745-46f3-9370-f33902171a19","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:926aa5b3b8af623fc7857dea574237ca6c2b4f55ce9b83340718fba16124614b","observation_id":"e63635f2-176a-45c2-922e-a8832ac88554","resolution":{"observed_at":"2026-05-13T10:32:38.275543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-vla: Soft-prompted transformer as scalable cross-embodiment vision-language-action model","venue":null,"work_id":"4f79f0c7-ecb1-485b-bfe8-814774ca5223","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:855b0448e9bd4dc894cedabfd066a148df42a2b550c4bca01a4ec91d5a8e1fb8","observation_id":"fa9aa304-2145-49a5-823f-9ec018dbdaa3","resolution":{"observed_at":"2026-05-13T10:32:38.232639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"St4vla: Spatially guided training for vision-language-action models","venue":null,"work_id":"486df39e-8643-4c7b-b2bd-7ec037a15c28","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:c7f812c5aa73f0818dae26b3845b7d40e7d0685199f0a6576f2bdedb54a57ba0","observation_id":"b9f6804c-bce3-4ec1-8cb4-45ea467ddb3d","resolution":{"observed_at":"2026-05-13T10:32:38.253451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision- language-action models","venue":null,"work_id":"25c171ca-90b7-4c82-a139-1ba46d98915c","year":null},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:b8fcee90d2ef1b818b94aabe264457ef87737ab1068011ccc37ba4da9877bfa9","observation_id":"d779b73e-1eb4-43ef-a3ad-5fa9eacf084f","resolution":{"observed_at":"2026-05-13T10:32:38.118512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Univla: Learning to act anywhere with task-centric latent actions","venue":null,"work_id":"7515867b-7991-49dd-bfaa-7836442f0428","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:f6e2a51676ad5f990cfd05a5bdb1eac53738d9e89048c202301f445b22cfdf3e","observation_id":"6b421c52-9705-4aff-9064-ee1219c92087","resolution":{"observed_at":"2026-05-13T10:32:38.192799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":"2506.21539","doi":"10.48550/arxiv.2506.21539","metadata_source":"pith","pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldVLA: Towards Autoregressive Action World Model","venue":"cs.RO","work_id":"d8c0c873-b2fc-44a5-a0c8-0d4a698783fb","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:80d47cbb00f8076969f5c8e99a7c9fee16c066e868e34fca4f696260e0f2839d","observation_id":"f6463a01-5e52-4108-85fc-4f0a404a8948","resolution":{"observed_at":"2026-05-13T05:27:18.509529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconvla: Reconstructive vision- language-action model as effective robot perceiver","venue":null,"work_id":"35687a26-3b70-4de1-b580-ce7eb0ebbbb2","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:71c0f9af77a82221d90a7ca7e738ed3b529297953b535cfcc1a10794609f8bba","observation_id":"d3d95fd6-70a1-46aa-8be3-153b1ec476d9","resolution":{"observed_at":"2026-05-13T10:32:38.084080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.17016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-07-04T20:50:12.325218Z","title":"Interactive Post-Training for Vision-Language-Action Models","venue":"cs.LG","work_id":"1ad0b2af-71bb-415b-b955-e3350f1a1ae8","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:36a376f8bac63483a07348ceea3f5f47bb5db973ba5d46bba713a32b1cface74","observation_id":"8aa8db3e-76f4-4119-b759-b07151e93811","resolution":{"observed_at":"2026-05-21T14:25:47.344448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":"066cc36b-aca3-4bfa-93b7-e4545e2bf350","year":2018},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:a095c813c179bfb741ba57f905461160417e6fb0c1bed3c9d6856e6f0a0c9a33","observation_id":"11121fa5-f607-4de9-ae82-b08f1e521eee","resolution":{"observed_at":"2026-05-13T10:32:38.148678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pre-Training for Robots: Offline RL Enables Learn- ing New Tasks in a Handful of Trials","venue":null,"work_id":"4d4851f4-9c39-4303-8980-02fd78a422a5","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:9c1c4e0a50d5e24d4df2e5e010c457dc252a4afbc83e38750b12a79304e9bdf4","observation_id":"f49523b3-8a00-4726-94dd-dc089cd3eeb5","resolution":{"observed_at":"2026-05-13T10:32:38.171255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13041","last_updated":"2023-09-22T17:59:14Z","snapshot_observed_at":"2026-08-04T05:11:00.008249Z","submitted_at":"2023-09-22T17:59:14Z","title":"Robotic Offline RL from Internet Videos via Value-Function Pre-Training","version":1},"cited_work":{"arxiv_id":"2309.13041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotic Offline RL from Internet Videos via Value-Function Pre-Training","venue":null,"work_id":"5b0ddc04-56dc-49d4-acb4-5795933824a8","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2309.13041","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:13f0561b0eec9268f70342ef3535ddbec7f0c462572775dc9d2b5bf54f6aa866","observation_id":"6feb5edc-6d85-4b94-ae32-6f8fab2d30dc","resolution":{"observed_at":"2026-05-13T05:27:18.552494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Steering your generalists: Improving robotic foundation models via value guidance","venue":null,"work_id":"6629f6a4-af3f-4fc0-8cf8-7a31b19417ea","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:5a43a1a98e6de5892ff7ea48c2dc69bddcdcf5bcefb9705e34e881723a22fdc3","observation_id":"731b3f74-9101-4ab5-930e-4eeea282c11f","resolution":{"observed_at":"2026-05-13T10:32:38.062630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning","venue":null,"work_id":"af5a81b0-6e12-44c7-a5a0-46f00ae2a025","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:ad0eb564ca7e4b6eecf60e473088f19208ebe45ccfc62c2e37cd7b97487ea23e","observation_id":"8e231de0-43fb-4ac1-9d6d-c0af7ae5d9fb","resolution":{"observed_at":"2026-05-13T10:32:38.223657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Residual reinforcement learning for robot control","venue":null,"work_id":"9bef4f1b-308e-401c-9b6f-05616c765200","year":2019},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:fa3ef713bd2926912a5eba19e2d97cb568c66028250dc8a1881b8e1e71f078d5","observation_id":"ac6df52d-89ff-44d2-bb7f-38590f7e4c60","resolution":{"observed_at":"2026-05-13T10:32:38.114028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:5248991a3194cac1bd403ef34f7781de57a1f0259072cdbb7f1dc5826113142d","observation_id":"a8263df0-2b6d-435c-8b68-aa9a8721d04d","resolution":{"observed_at":"2026-05-13T05:27:18.469693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:575a84d487b5e4c36878e0d2a5ea8f2fdfc2797c4b851a210517a89028db457b","observation_id":"51e9b58d-dd57-4457-a838-e13fe2cadfbe","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","venue":null,"work_id":"af6d2e19-dae4-4d6b-b609-90cd8150fb7a","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:7625b4e907e924a1948c2a4f51f25ae3c0a941b6b49a8e87d0bba58bf0b5d42f","observation_id":"d7d366b8-3c47-4a69-b052-6e54f0bf5bdd","resolution":{"observed_at":"2026-05-13T10:32:38.092705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simplevla-rl: Scaling vla training via reinforcement learning","venue":null,"work_id":"52f4c015-70f5-44a0-8d1c-456fb6a0911a","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:a19360c0bf0046c338dd57dbf1583852342d9fde2769a72b39ce7f09776e8d66","observation_id":"334348df-bd31-4e85-b433-1013ac75ebc5","resolution":{"observed_at":"2026-05-13T10:32:38.101256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":"3c5fe877-e14b-499e-a73b-01bc00cdd1d8","year":2020},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:87146480ecfa7d2a6497905d8ffd6c101f2ce9a2c9625f0550a5bd6931c78250","observation_id":"73cffc9a-4790-4d53-b27b-42b0b638c888","resolution":{"observed_at":"2026-05-13T10:32:38.070955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering atari with discrete world models","venue":null,"work_id":"65c9bbe9-0e23-47a4-8769-d0605f1c1cd2","year":2021},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:7a5c6d09865dafded32808c51903aae2d43b870139b610935cb469a157c6aea9","observation_id":"a4194e46-fc59-432f-8cd6-8a72a9a94bff","resolution":{"observed_at":"2026-05-13T10:32:38.152884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":"c758bd8c-f259-485a-a87e-8356a1f12390","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:dfddffe0d71bbeb22f6924310e3c1194bd655d739bc8c2d00ab890120dcc080e","observation_id":"d43d812f-5efc-4de3-ad70-354597c0bf44","resolution":{"observed_at":"2026-05-13T10:32:38.301410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":"d70ffe2c-ea2e-4de2-8e4c-d895f98c298c","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:c489a7fcd131bc1e8a9d3d7aecc7e26588356165f8481370b83f178031b9dfca","observation_id":"df70ea23-9bdf-46e3-a625-766c43ba3dab","resolution":{"observed_at":"2026-05-13T10:32:38.105606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wmpo: World model-based policy optimization for vision-language-action models","venue":null,"work_id":"076b4c5c-e88c-4042-bdbc-5ae6291f48ea","year":null},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:b47d1b9a90dc45accaf14d5b672adcc33813b5036695ab112b06ec46b5b21006","observation_id":"58cb3ff7-21f7-4e30-bb98-b3a61cd37dd2","resolution":{"observed_at":"2026-05-13T10:32:38.144235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15605","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:33:25.093042Z","title":"Srpo: Self-referential policy optimization for vision-language-action models","venue":null,"work_id":"5547ea6d-8228-4614-99ce-323e9ab3355a","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:400407ba06ef0d0a838d68608645255291ec8ae2d587e12dbaf7d7f28a2fb6b5","observation_id":"6d8aa755-1f51-4f83-8dcd-60380d2305ac","resolution":{"observed_at":"2026-05-13T05:27:18.466539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.00406","doi":"10.48550/arxiv.2510.00406","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-rft: Vision- language-action reinforcement fine-tuning with veri- fied rewards in world simulators","venue":"ArXiv.org","work_id":"16edb51b-b4fd-415d-ac17-fa5e8a7462bd","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:6806904041e4650c161521e46720a032f58d40851628061df86b8a1083bbaed8","observation_id":"39255eaa-50b6-453d-b8cd-65ec9ec483a9","resolution":{"observed_at":"2026-05-13T05:27:18.488722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-02T23:23:50.481908Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"cited_work":{"arxiv_id":"2602.13977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.13977","snapshot_observed_at":"2026-07-09T03:05:55.345856Z","title":"Wovr: World models as reliable simulators for post-training vla policies with rl","venue":"cs.RO","work_id":"17804900-10e7-4323-9584-388ff825c14a","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2602.13977","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:7d74dc76bb580cfb40a93cca12b49c903f6559db73f10ede408023b1cb74224f","observation_id":"c23624bd-d09a-47b8-9311-99cc335c12c2","resolution":{"observed_at":"2026-06-30T02:16:14.370216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":"67a75204-d1ff-481f-9572-23a4e4592446","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:30e52301694df2b4ba48e64fdf1b3cedfdb2db43ce0dc4e7a8ddc3e633b2ab30","observation_id":"01dbde3b-dc5f-4777-9397-d2f5b845662b","resolution":{"observed_at":"2026-05-13T10:32:38.244813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vihe: Virtual in-hand eye transformer for 3d robotic manipulation","venue":null,"work_id":"d0d08c4b-804f-4a6a-9e22-970046c0571b","year":2024},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:28046704427895d38513c7866c0730182a29746cef9a433d8543dd10591281ef","observation_id":"e7b87707-c817-4a48-812c-ccb782e5e886","resolution":{"observed_at":"2026-05-13T10:32:38.219346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.820608Z","title":"3d cavla: Leveraging depth and 3d context to generalize vision language action models for unseen tasks","venue":null,"work_id":"10a5d041-6d20-404d-a379-a0782b16f45e","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:234f2ca87367a1ea42a019c624981a75526ae015dac62397b650e6c151d93d53","observation_id":"e2c7ca76-72ab-4945-b105-c9c064f5a39d","resolution":{"observed_at":"2026-05-13T05:27:18.539303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.350063Z","title":"Depthvla: Enhancing vision-language-action models with depth-aware spatial reasoning","venue":null,"work_id":"16c300ae-4c10-4266-aa06-0541694dec38","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:57432bfaaea5a08e920421f3b4b3c714167f358738f0d7c06cd40350522962c0","observation_id":"e847dc85-45dd-46ff-b6b9-26c1ffcaa4ff","resolution":{"observed_at":"2026-05-13T05:27:18.542759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-07-06T22:11:52.522787Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:72bc9e72abb956bda00563006e365e9cc2bb09e4e6557c971310839de0bdca20","observation_id":"4fcfcc17-bca0-4983-90e1-8e69f46bb3db","resolution":{"observed_at":"2026-05-13T05:27:18.495377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatialactor: Exploring disentangled spatial represen- tations for robust robotic manipulation","venue":null,"work_id":"0856b215-2e64-481d-a32b-5120c23b1592","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:9195cea8a5c099299d08ee8ce332b80a5fd7cd923fce8e9a23d2d57012da1d1c","observation_id":"0a0f9c88-bad3-44e6-9be1-887eb936000d","resolution":{"observed_at":"2026-05-13T10:32:38.058494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Voxact-b: Voxel- based acting and stabilizing policy for bimanual manipulation","venue":null,"work_id":"0822f84f-bc80-4e3f-beca-b0b91da88f76","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:848e0fc13ba8f35694d19548c575509a4e3d3f2e989773a6af5e2c466dcaccab","observation_id":"fd9730fd-98b3-4705-be38-93a5d8b9ef43","resolution":{"observed_at":"2026-05-13T10:32:38.088480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":"b64e468d-57df-4123-8a38-bc341aa8582d","year":2017},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:1397734d416c96624af9eeb8f60f0139cf76644e1c0911a0e6a6e575af591011","observation_id":"0339400f-3587-41ec-9840-64a7155e4c18","resolution":{"observed_at":"2026-05-13T10:32:38.258600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:33:45.440010Z","title":"Geoaware- vla: Implicit geometry aware vision-language-action model","venue":null,"work_id":"e07e635f-26de-4a78-9be4-c2836032744f","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:f2871c84e7f15a79475c8ef3eb3723ef6ed647a7817a03c9e6a2007940f8ebd1","observation_id":"293b8f55-0744-4bd4-9101-afdef174c933","resolution":{"observed_at":"2026-05-13T05:27:18.515816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.24393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:35:46.771385Z","title":"3d-mix for vla: A plug-and-play module for integrating vggt-based 3d information into vision-language-action models.arXiv preprint arXiv:2603.24393","venue":null,"work_id":"634bb72f-ad25-4ae6-aef1-48b77b8c587c","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:e567525b956874a405e8fecdc3a7656db360d79c379ddd04911cf697c5394595","observation_id":"c809f220-c69b-4ac3-b321-2e912a99a44a","resolution":{"observed_at":"2026-05-13T05:27:18.518797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridgevla: Input-output alignment for efficient 3d ma- nipulation learning with vision-language models","venue":null,"work_id":"06ae63d1-a7fa-41d3-b3d0-a1af278de7a3","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:0a376ef3aa04664a71bf31fa1057359dec446e9ecec23bc52a3651c27050cf82","observation_id":"cd978677-b2dc-4d98-a906-02392c4811d7","resolution":{"observed_at":"2026-05-13T10:32:38.161974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to see and act: Task-aware virtual view exploration for robotic manipulation","venue":null,"work_id":"88af976a-ade4-4e8c-bc74-55c9af77a01a","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:830ea09a03e4a29480a6378679bcf6f57322d99c4a807e2ee6fdd34ccb8aea78","observation_id":"38cc84cf-425c-4ad6-9538-06ebc126ce24","resolution":{"observed_at":"2026-05-13T10:32:38.228003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:63996abf8674ceac8e2e5638bd9133f7512a89cfc6746812488049a17b7e0e4a","observation_id":"f20e311a-94f7-4b80-9e3e-0882d69c25f7","resolution":{"observed_at":"2026-05-13T05:27:18.535241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:5ec7f57592b4b32790f54011a37a37b8515c8a73bda8eaa3302a2e113b3ec4ad","observation_id":"838d5c97-3ccb-4a72-aab0-da79130e38bc","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"d062fc00-d803-4208-8670-3af4549a3ec8","year":2017},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:3a3916530aa5fd108e4eeb9c08f03937726755aad79d25f6931404f6f9d15190","observation_id":"8511fb50-234e-41c7-86d5-0c67e5419ac3","resolution":{"observed_at":"2026-05-13T10:32:38.066744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2504.19854","doi":"10.48550/arxiv.2504.19854","metadata_source":"pith","pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","venue":"cs.RO","work_id":"1e89a464-b414-4d5c-a974-b2cb8be33053","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:e878dfc2fad13a7fcaeb2a17c395ae4efe7c65a4c7a55a2eef8a8e40bfbbec52","observation_id":"7ed0102e-927a-4bb8-ad9a-cb1cb1ce139e","resolution":{"observed_at":"2026-05-16T15:53:29.501619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mergevla: Cross-skill model merging toward a generalist vision- language-action agent","venue":null,"work_id":"ead27e69-7c32-4401-ba7a-7f3e4d3862b3","year":null},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:59ec231ece0efa3cf8727d93f2a59f07a5bac29d312e374e70f210201c810ba2","observation_id":"1af9a063-7198-4022-81bb-20dce2602072","resolution":{"observed_at":"2026-05-13T10:32:38.214989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifolm-vla-0: A vision-language-action (vla) frame- work under unifolm family","venue":null,"work_id":"8e68a724-6ec0-49a9-b5f0-94ebe5fb847c","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:aa63f9eb42440a4a16d506dcf57f0a4a48fa0edbae911a8bc68e2b0e117716fd","observation_id":"326e6fed-5784-42d5-aa94-4e7bb8b46c5c","resolution":{"observed_at":"2026-05-13T10:32:38.109920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatialvla: Exploring spatial representa- tions for visual-language-action model","venue":null,"work_id":"27c01f0f-73bb-43cf-bff3-dea58569ca58","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:ef80e8617dfb5a9a13fb09d276760d724e61a827b5dbac1ee851c9ab826dcd41","observation_id":"9a4e9853-a15e-460e-9667-7c41370cc1c8","resolution":{"observed_at":"2026-05-13T10:32:38.210394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":"2509.06951","doi":"10.48550/arxiv.2509.06951","metadata_source":"pith","pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","venue":"cs.RO","work_id":"0557ae67-ef52-4cba-a579-208458bc2bbc","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:4f7ceb2b146604cdc90dd56a2d3e1718ce85355cb9d874a976bde2ef2e3101dd","observation_id":"9d64095d-d893-4373-a8d5-e355477963ba","resolution":{"observed_at":"2026-05-16T12:42:47.099823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"cited_work":{"arxiv_id":"2510.13778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13778","snapshot_observed_at":"2026-07-07T14:03:48.568825Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","venue":"cs.RO","work_id":"8a11d29e-4bf8-4a9c-a97e-d87e7350dd9c","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2510.13778","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:cfd9c67973467c2adbcb28fd4a909c81a7f35cf095ca09805713cf7af277cb57","observation_id":"04e208cc-5ecd-4083-8d89-6b9d5e55d37e","resolution":{"observed_at":"2026-05-14T20:09:40.076178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20072","last_updated":"2026-05-31T15:50:43Z","snapshot_observed_at":"2026-08-05T09:21:02.402625Z","submitted_at":"2025-08-27T17:39:11Z","title":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","version":4},"cited_work":{"arxiv_id":"2508.20072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.20072","snapshot_observed_at":"2026-07-04T10:59:46.979599Z","title":"Discrete diffu- sion vla: Bringing discrete diffusion to action decod- ing in vision-language-action policies","venue":"cs.CV","work_id":"33a64891-124d-4530-ab4c-056d66b706d6","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2508.20072","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:5e18d1de10874c9f56b068cf25fec87f1356a88e392299b0f5ff61783f286285","observation_id":"51c0309e-8e16-4b81-be9f-6f25b96e42c1","resolution":{"observed_at":"2026-06-02T03:04:00.649074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:3d237f000ce32a7c52b91782024074e6ba384172834d9f7741b75b16d6623b8e","observation_id":"24268b22-8938-4898-839a-a5a2c3fa97f3","resolution":{"observed_at":"2026-05-13T05:27:18.545536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"mitpress/9780262","doi":"10.7551/mitpress/9780262016315.001.0001","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Chater, Nick , year =","venue":"The MIT Press eBooks","work_id":"f90bc3f0-7c2b-44f6-a8aa-1420c3a84682","year":2016},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:dae694ec578772ee3b7e8a625e7fec1568637b230e6612f1de3087f9296ca9f8","observation_id":"5cff0f09-a29d-49bf-a7f2-63e8e3f96287","resolution":{"observed_at":"2026-05-13T05:27:18.305742Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Topology and data","venue":null,"work_id":"95227cc5-f9a5-4cce-9dc6-e677609125c0","year":2009},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:96b331cbce70c57c42cbb16bd20cc335c11c715da397f0e0dcd1436b647d3dd2","observation_id":"e0fb0e1e-bd71-4b47-93ea-120209225648","resolution":{"observed_at":"2026-05-13T10:32:38.096669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":"2511.13720","doi":"10.48550/arxiv.2511.13720","metadata_source":"pith","pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Back to Basics: Let Denoising Generative Models Denoise","venue":"cs.CV","work_id":"37973de8-a5e6-4d92-897b-a98fa9f7f2f3","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:c72e9d4ea56d68f66299aeda029f4ae81a552e0d40d7fd924f2d6de127ca13ae","observation_id":"2f78275e-6a36-4e55-9add-a5a97c83b205","resolution":{"observed_at":"2026-05-13T05:27:18.491910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stacked denoising autoencoders: Learning useful rep- resentations in a deep network with a local denoising criterion","venue":null,"work_id":"1489498f-bc0e-44f4-8fcd-aaa658291574","year":2010},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:3e827335f0d0ea10b10b30c48e14838fc45099ccb633b70636e78f9557c761f8","observation_id":"db854668-6e36-4969-b74c-f80a75aed200","resolution":{"observed_at":"2026-05-13T10:32:38.267346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transform- ers","venue":null,"work_id":"35a2c790-c161-4739-8eb9-bb0343ee9061","year":2023},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:ab3c7242f03f4a9183d82dc801e02bb0bd88bb1028390dd22e418b680ac48926","observation_id":"7ce0e2ca-735d-4389-a930-ec31bff82385","resolution":{"observed_at":"2026-05-13T10:32:38.053959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":"2604.05014","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-07-10T07:26:54.478996Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","venue":"cs.RO","work_id":"e9be5436-00f8-4b43-b82a-ff154145e079","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:8bd2d97f9934a8a13772edfd82c8d49e1f49bca4fea8605d0ea01d068b17cc1c","observation_id":"1a86b9b1-97f8-4144-a485-80407dab895d","resolution":{"observed_at":"2026-05-13T05:27:18.512326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":"2602.11236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-07-08T07:14:45.378913Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","venue":"cs.CV","work_id":"30745958-0491-4e57-a989-e53b1a7fe19f","year":2026},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:72179334e245c1c7052cc67b2539ed5bd39c1716bb8236370bf48181ee7f2574","observation_id":"f45a6ce5-b7a9-44da-a8e6-009ed8f3f772","resolution":{"observed_at":"2026-05-13T05:27:18.525531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regulariza- tion","venue":null,"work_id":"bb321108-913b-480d-b386-ed1aefa0abcc","year":2019},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:164430081155f596cee6546bc44600e5f3a4935b03e83ad933e4bf13fee21e19","observation_id":"fa25e1e8-cbd5-4ef9-b9fc-1c8d87df606c","resolution":{"observed_at":"2026-05-13T10:32:38.175533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision transformers for dense prediction","venue":null,"work_id":"7eecd48e-297e-4649-8536-46a04416b008","year":2021},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:b95f9f31b60d30eb1db036df1d5d702502ffb8a3f813a28e723345a6a66d7ba5","observation_id":"361fb4d1-2fbd-41bc-a621-d77e7d2e671c","resolution":{"observed_at":"2026-05-13T10:32:38.271379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":33,"verified_fuzzy":57},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2605.11832."}