{"as_of":"2026-08-10T20:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd7e068c88fcee53a0deb3503f77ce5475bef349ce42a91c880a3b07c9c796ba","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T14:27:40.585782Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.21501/citation-record","integrity":"/paper/2606.21501/integrity","json":"/paper/2606.21501/citation-record.json","paper":"/paper/2606.21501"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"Zitkovich, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:4d3c2100351056f2f34403b3f6f27e0c4135ca3350ce9cc0524702d1f9a43169","observation_id":"ca7fc4f2-51b1-4f30-92b6-af92773e595b","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:20c9ed5283e99e391c531c39ce237dd4a704bedafc4ab66b5620e56129e05e35","observation_id":"0765c9a7-1ebe-49fb-88db-e8d4ccdf65a6","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:b8e9e63f73e1e67a9eb5bae8dc82a54356173ad03e9dbeb8b1df7d9a1ba5b550","observation_id":"54e5ba95-440b-46a2-9ecc-5c72b31951f5","resolution":{"observed_at":"2026-07-04T06:29:37.524279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:fc46190d575177a481270032bfe44e36d88342a1cf6b0f02849d3db58dc6277c","observation_id":"a5102fc2-e695-4665-8e37-989022e009ae","resolution":{"observed_at":"2026-07-04T06:29:37.521710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19958","last_updated":"2025-08-28T10:13:01Z","snapshot_observed_at":"2026-08-06T11:55:27.946631Z","submitted_at":"2025-08-27T15:12:03Z","title":"Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2508.19958","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19958","snapshot_observed_at":"2026-07-04T13:39:50.503852Z","title":"Long-vla: Unleashing long-horizon capability of vision language action model for robot manipulation","venue":null,"work_id":"3b763de6-a4b4-4318-82bb-4c26bfc575c5","year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2508.19958","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:ba25094c7dfc436b3f33e9dcacd2bef948bc720fc1c721c1a2fc05b6064bcd79","observation_id":"5ce132dc-71ee-4a1d-92a7-7f5242e8912e","resolution":{"observed_at":"2026-07-04T06:29:37.526893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:8d9d64b93992b8d4edb4bb2ae5c73daf45f69c4eb7512fada190d1b2f1ddf958","observation_id":"e51f5acf-d273-4f6e-b3be-db67c337009b","resolution":{"observed_at":"2026-07-04T06:29:37.519105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03181","last_updated":"2026-04-03T16:57:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T16:57:06Z","title":"Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model","version":1},"cited_work":{"arxiv_id":"2604.03181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03181","snapshot_observed_at":"2026-07-04T13:59:51.728626Z","title":"Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model","venue":"cs.RO","work_id":"7fc43cfd-f24c-4013-b303-0d91f85b68d9","year":2026},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2604.03181","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:601eb7bf0b64587c171f9c50a3761faf11d4932289fcec2e1e73fc4a550ec6a1","observation_id":"e4b0850c-cf5f-4dd5-b353-8eac53150610","resolution":{"observed_at":"2026-07-04T06:29:37.513776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.00557","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:37.515235Z","title":null,"venue":null,"work_id":"609271d2-9d29-423c-8ef3-3f36dd955859","year":2026},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:b8945c6bb6858d72fc61b01e2a0a69b11c458f9fed4f0d3c228fcc178c8369c7","observation_id":"6f65c46c-0a8d-431b-9f2d-8a4fec1a99e3","resolution":{"observed_at":"2026-07-04T06:29:37.516624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:384a47f818ab53018540ecffabed57ed30627e8d6f6529724df6fc09bd17a8d1","observation_id":"10c7dfe4-b582-4a96-b2cb-dd962b27ec16","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08545","last_updated":"2024-06-12T18:00:01Z","snapshot_observed_at":"2026-08-08T15:01:31.827555Z","submitted_at":"2024-06-12T18:00:01Z","title":"RVT-2: Learning Precise Manipulation from Few Demonstrations","version":1},"cited_work":{"arxiv_id":"2406.08545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08545","snapshot_observed_at":"2026-07-04T11:09:47.137557Z","title":"RVT-2: learning precise manipulation from few demonstrations","venue":null,"work_id":"88df1da8-0634-4e47-898e-14226fa69a01","year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2406.08545","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:fcd1927cccac9939cf9a2c317eba58d9864ee28b770b2776a05f9cbeda0bf9be","observation_id":"91c11564-544b-4e92-8e5c-c274b7ef6777","resolution":{"observed_at":"2026-07-04T06:29:37.529578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"Goyal, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:891b05f7d02f5a270f6bb601a9b8ce4d243b087e3378e148e7a86485ab6e3a3d","observation_id":"f407b61d-5138-4271-8c87-b8c7f6a2f716","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"Shridhar, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:2a766dcb482ca71b64bfbaeaa0fc5f014e98f5c40f5847c0d6651670330a8f4c","observation_id":"ba9df051-0063-41f1-b576-a088a9cd0368","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":"1912.01603","doi":"10.48550/arxiv.1912.01603","metadata_source":"pith","pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","venue":"cs.LG","work_id":"5103f4be-344a-4139-8504-eaa59f5bac9d","year":2019},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:5470348058348138cac1026e33bb1a4fa2bd629588f3ad37969d53eec867f867","observation_id":"164031e4-fb2f-4d52-ba97-6ca2e5560170","resolution":{"observed_at":"2026-07-04T06:29:37.509182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:5c2910b368596b729a89c22cfd1f963182f946d1318f4a57e52e57eef8f783f2","observation_id":"f53f24b1-9ade-4e87-a02d-dda6c5dbb0da","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:1c931729a783ba0f54eb40e96e5ae1eeaf551e4f6783bfe3c0172fae6fda4b61","observation_id":"8d57ff85-046e-4ba0-b406-57f1daee56b2","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.26757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:33:45.434034Z","title":null,"venue":null,"work_id":"8c11e901-51c6-4b7a-9c81-59cbeb061d4a","year":2026},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:b70f8b2bd2c1dd2781d35aec700fd3ada2dc52c7d0f50f5572ac37663459effc","observation_id":"2664120f-a45f-422e-b480-de20cb0fad78","resolution":{"observed_at":"2026-07-04T06:29:37.532043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03685","last_updated":"2025-05-31T05:58:31Z","snapshot_observed_at":"2026-07-06T19:11:05.273789Z","submitted_at":"2024-09-05T16:39:21Z","title":"View-Invariant Policy Learning via Zero-Shot Novel View Synthesis","version":3},"cited_work":{"arxiv_id":"2409.03685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03685","snapshot_observed_at":"2026-07-04T06:29:37.502893Z","title":"View-invariant policy learning via zero-shot novel view synthesis","venue":null,"work_id":"46d6e0cd-bd3b-40ce-bcbb-326b9436e8e3","year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2409.03685","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:68378da2e452a23fc5a1a88226a9b773ff21a6d49bf062a24d56a261b011b935","observation_id":"6a9bc384-f000-4779-a000-cabe59ea8e3b","resolution":{"observed_at":"2026-07-04T06:29:37.504400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.29192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:37.500455Z","title":null,"venue":null,"work_id":"86796ece-b582-4552-9a83-4cc69450dd58","year":2026},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:f43c7dede73cd49be0ecbfe3bf258612477aa71ca67bd3b341218bd3aa3da090","observation_id":"70665551-3087-42e1-8f31-751c046d42bb","resolution":{"observed_at":"2026-07-04T06:29:37.501758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:16af2cb0bcc8a0940e0c7c128e75885c2fbd14f7b6be4a980eb6e39c00b420ba","observation_id":"558b8666-e791-44fd-980b-315c4bfa1be3","resolution":{"observed_at":"2026-07-04T06:29:37.506820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"Huang, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:c9d449cb8538108b5106603268c27619f0f5657403f5c1285050e777452cff41","observation_id":"ca92eea0-9b36-46cb-abcf-e3d47aa76775","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25661","last_updated":"2026-04-07T08:13:17Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T17:14:57Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","version":3},"cited_work":{"arxiv_id":"2603.25661","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.25661","snapshot_observed_at":"2026-07-04T06:29:37.510322Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","venue":"cs.RO","work_id":"be68d95c-515c-47d5-94bd-c2193862932b","year":2026},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2603.25661","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:12d748dbc6f5ebdd84c9ee10b663ae383ef40224d3bc418482fda706fa78b729","observation_id":"91cdd5ec-aeea-488c-a466-c56ae9c8b086","resolution":{"observed_at":"2026-07-04T06:29:37.511484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:7510bdd26a1553c547e57704bd18c77406bfea512e86010f00df100f6e9ce280","observation_id":"9bb1f2ba-4921-4fea-9917-86a386a92175","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:8c5459d3b80d8b611fa322428ef490dd523616dbcd4701544c5bdd47c883f57c","observation_id":"02b100fb-ed27-4563-a5e6-57c90fd8dd66","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:32e65b53b1d2b2f555c664e60e64a702e33a1f197330d0a69350ca33dbede99a","observation_id":"ac0e0697-af8b-460d-84fe-2a67b204cd08","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"Huang, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:7a24bbeaa9d939cb7ec59365c1b604074b03c0e4b2614484f2557e8c3dbeca22","observation_id":"5aad40f0-d819-449d-b45a-357fabd8c8ca","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:944c82bb47cd00b00f25973cc218ac6d7973320e4fc401b4141fc8b75e1cd934","observation_id":"1d35e410-f0c6-40c1-bfc9-51470d5546a8","resolution":{"observed_at":"2026-07-04T06:29:37.510203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"Driess, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:4e471608da294a8484685bb12c2bebba109bed536184ff85ba37660982a481fc","observation_id":"426a861a-1c1a-4a73-95c7-1f0797cced93","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:67d16bcdc8becb09fa34c3a678973c7ab21b0d2718a00ffa96ffcd15641712a8","observation_id":"0fc37597-66a9-4edf-b177-048d90911c53","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:3d9624a530e84853f20857632d338f94ea15540b56c30e0c23ffbd5dea46b065","observation_id":"f6898887-b20b-454b-88c1-90910588d8c9","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-08-09T11:58:54.163697Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2306.11706","doi":"10.48550/arxiv.2306.11706","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robocat: A self-improving foundation agent for robotic manipulation","venue":"arXiv (Cornell University)","work_id":"143e7731-0488-4088-8e23-63f9d4140118","year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:5ba6590e4395143fa66ed387c33b36fe8be8d3d17d37dedf45d93e5e1a6ca58f","observation_id":"29ec4886-7db5-4476-b9ca-cc5ce599f78a","resolution":{"observed_at":"2026-07-04T06:29:37.499209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"O’Neill, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:72e69e3a08b96988e2485b258a617001aa3d21ec8532f0155d9e84357405401e","observation_id":"cb3359b5-5f13-4e24-ab7d-d4b6da217b5a","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:0ad89f5a4432c41a8db4cf76bf314f3e2f0c57e76ac2b7f973e491ce4239d9a2","observation_id":"dfe1d043-37e8-4c32-804e-2b4051523dab","resolution":{"observed_at":"2026-07-04T06:29:37.505244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"James, Z","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:774991a5fe0a455887eed1875c284f2fdf333741b4fbdf27687de8611c70b8c6","observation_id":"48b74ed9-a9d9-4e95-97bf-22ffd06aad6d","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:6e23d1a8ff9ea383e67d166b7c280806c463c50fbbedb74fa8267c59f98179a0","observation_id":"ae59119b-a109-4a99-9094-9f33a7a530da","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":"Shridhar, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:8c0288b08ab4cb296f0a7b2aff873556a0ccccfdc4c97331155dfd956e0e1057","observation_id":"5ac45d58-f5ff-48fc-b251-bf31740d44cd","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":"2307.05973","doi":"10.48550/arxiv.2307.05973","metadata_source":"pith","pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","venue":"cs.RO","work_id":"5a5edf95-2538-4e2b-8dfa-da39cec89f22","year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:8fee3a631e1f372c191250e207cdb435d2b2b37263178766f4a167ed9622c416","observation_id":"eae3de8a-93b8-493a-a14d-7d7b4fbb551a","resolution":{"observed_at":"2026-07-04T06:29:37.517488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:fcc3c00f1dcc2746ee85ece209a802b249ad21f8fe6638f8b4a6bbaff68c6b93","observation_id":"b9fbfdea-53a2-4628-8442-30069236aff8","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13175","last_updated":"2025-04-17T17:59:43Z","snapshot_observed_at":"2026-08-07T16:01:20.885795Z","submitted_at":"2025-04-17T17:59:43Z","title":"Novel Demonstration Generation with Gaussian Splatting Enables Robust One-Shot Manipulation","version":1},"cited_work":{"arxiv_id":"2504.13175","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13175","snapshot_observed_at":"2026-07-10T23:17:45.492536Z","title":"Novel demonstration generation with gaussian splatting enables robust one-shot manipulation","venue":"cs.RO","work_id":"449f314d-899c-4bf4-9214-8aa93c235907","year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2504.13175","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:5fbd6bdd053e0b3cc332d1e84610814e727bf86a66d0fdffd8525278c29110bb","observation_id":"7b756bf7-f410-4d75-bfa0-b88b8611790d","resolution":{"observed_at":"2026-07-04T06:29:37.502805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:dcdde59b16304811b7af23b5b5d9d5730e5506bee43d78ed5428083e6add33e0","observation_id":"e8dc08ee-b4bc-4940-809d-e84023c21bcb","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:6b34bf144310f0217f1ffc2bae2dc89f0fcf0cc22cc302cb2cdb76765094770c","observation_id":"c2b2bccc-85b8-429e-8e0a-7741008256af","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:40e2a47caf31f788ee36ddffa7b818277bacc0b9a3e9fc67314f21cbbf6c4b5c","observation_id":"a1a8881a-3937-4832-b9ca-4a9b5b997eca","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:5228001722a4412180a07890a21f627951e2937813e729e8e6d7966f51282756","observation_id":"8bdce975-a0eb-4870-b8ae-995b63c79a69","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:75e9c34566e8374f10bdabcfc83029000bd99c4a46c8306c0fd473f436a795ea","observation_id":"8c8a1e24-9226-4673-b2ea-bd7f038c60c7","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08602","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:37.506407Z","title":"Mimic intent, not just trajectories","venue":null,"work_id":"cd821b51-37b7-4f52-ac33-20ad3ff7eaa7","year":2026},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:07fcadfce2b8ebf0fa86c46298e6521eaeb0aeb8c6ba017ffa2b81c8df278d6d","observation_id":"6f3a0fd8-6027-4663-a864-9c3f7fb19218","resolution":{"observed_at":"2026-07-04T06:29:37.507804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T14:27:40.585782Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:b7ac25032f79354d89d97fc440d0de17cd7a351968a8c3835582f4e19bd770c0","observation_id":"9a7d97fe-04f1-462c-9627-e9d1d333b9d3","resolution":{"observed_at":"2026-06-26T14:27:40.585782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13054","doi":"10.48550/arxiv.2510.13054","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-0: Building state-of-the-art vlas with zero modification","venue":"ArXiv.org","work_id":"2b9209c3-c0fa-408b-9acf-06ab74e0ef7e","year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:6656f5b37f6c46a0461f8adccd4924068d0587c2d7c8669aa8c392a72064df2a","observation_id":"8c32b98c-3a11-4fba-bafb-589e1c20a22c","resolution":{"observed_at":"2026-07-04T06:29:37.512625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:92fc8ed3e3b898e06562bd741988c04b4ede12336fb23ebd87207e72044293ea","observation_id":"530aa628-ede3-4a9e-a5c2-d2be9a105bd9","resolution":{"observed_at":"2026-07-04T06:29:37.515033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:b28a407017e2209b9a183e042dadc6518a3ad93204b957fc850078248359dc11","observation_id":"056a4144-9b20-411b-962a-9ae32942ea7d","resolution":{"observed_at":"2026-07-04T06:29:37.520148Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":26,"verified_exact":21,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2606.21501."}