{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d791c28d28fd0d859fe13e833eb54f28fafeeec1caa44903ca41d196e8fc41f6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:23:17.797242Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:19:38.145306Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-07T14:23:17.797242Z","title":"Up-vla: A unified understanding and prediction model for embodied agent.arXiv preprint arXiv:2501.18867,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.797242Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:a8ed696f31fdc45714fbe0db2d7355492b6d1472b9883f1271566ebc53e97294","observation_id":"19898cd3-2219-4907-9f3d-17d2f2cee578","resolution":{"observed_at":"2026-08-07T14:23:17.797242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:3621bab3b8457dac1f9fb04a8dbc24e6156a2849e76431fd9c2aaeda7c362bfa","observation_id":"0bbf6716-25e6-401d-bc0f-69f035bbb1ee","resolution":{"observed_at":"2026-05-16T15:42:41.525266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-06T05:00:00.281156Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02405","last_updated":"2025-08-04T13:29:26Z","snapshot_observed_at":"2026-08-06T20:05:39.172477Z","submitted_at":"2025-08-04T13:29:26Z","title":"Improving Generalization of Language-Conditioned Robot Manipulation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:00:00.281156Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2508.02405"},"observation_digest":"sha256:2a54a0bb7b1c5c1cf597bb698a702c18302c39166108ab55d4b6baf8da96ee6f","observation_id":"1834e392-4731-4b51-b42b-5e7fecf03bef","resolution":{"observed_at":"2026-08-06T05:00:00.281156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-05T20:35:47.885219Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-07T13:33:54.413844Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:47.885219Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:e71dae64218af587e4af266fb99f2785c084fc82181dbaab190d08152bdcc541","observation_id":"5017bbf7-2e89-4a9d-94ce-046ac81d647c","resolution":{"observed_at":"2026-08-05T20:35:47.885219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-05T20:38:45.491893Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-08T01:00:17.824912Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:45.491893Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:78a17ac8423a5566c0b788ad55d69400510074a2b82b16ff8e746047df3e3276","observation_id":"13d393e9-8b69-4fe8-8a73-c3a3660eb217","resolution":{"observed_at":"2026-08-05T20:38:45.491893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T01:14:10.174044Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2510.10125"},"observation_digest":"sha256:f37af62ca95bafcfc6763faf023e8dc73bba3c48ab272391260087208660c1ae","observation_id":"1cea0819-f384-45cc-824d-f912b80e0671","resolution":{"observed_at":"2026-05-16T01:14:10.412898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T23:01:13.910539Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2512.09928"},"observation_digest":"sha256:afb41a7e0ec6afc43e69b3b0684c461e934c1ecf4951b0c3c113e1a8cd13c250","observation_id":"3d7c705f-3896-4d61-92be-52552f46fe2b","resolution":{"observed_at":"2026-05-16T23:01:20.326259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-03T12:30:33.889361Z","title":"Up-vla: A unified understanding and prediction model for embodied agent.arXiv preprint arXiv:2501.18867, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.889361Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:c1784e963b6b4ed1cca9408921467f840a40b638f4060a2f5022e49f168e1f3a","observation_id":"82e66e5a-afd9-4728-95eb-7f7b46bde77d","resolution":{"observed_at":"2026-08-03T12:30:33.889361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:4f1544284ce54df28532ab30f6cb0f4de8ade181ca229daebbe65ce83529387a","observation_id":"fc62d89c-84fb-4888-a78c-81b968be093b","resolution":{"observed_at":"2026-05-16T15:08:02.045723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:bd2bb19e83337b55b571b7c837f45dafe6f85b7bbe008c2d9ca6e58f8a3bdbf2","observation_id":"a5932355-278d-421b-aec1-1ead141326b3","resolution":{"observed_at":"2026-05-21T13:24:11.167790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-02T20:18:04.971064Z","title":"Up-vla: A unified understanding and prediction model for embodied agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-07T10:00:45.484265Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.971064Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:47cb10f6c19b89d6cee6e168e67927bcb396fbf4ca7597c67e13f854a32c26b9","observation_id":"c8cd7914-b628-4f76-a057-a5d7f4368dd6","resolution":{"observed_at":"2026-08-02T20:18:04.971064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2603.25661","last_updated":"2026-04-07T08:13:17Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T17:14:57Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T00:27:35.706107Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2603.25661"},"observation_digest":"sha256:75909832f5e5735f30a32ed90acebc6c17fa6562c4a94c50ad4d87e145036f07","observation_id":"8c502b30-011a-4097-8701-a4f775628619","resolution":{"observed_at":"2026-05-15T00:28:23.112425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2603.26320","last_updated":"2026-08-06T10:15:07Z","snapshot_observed_at":"2026-08-08T00:14:34.348410Z","submitted_at":"2026-03-27T11:38:43Z","title":"DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T22:59:21.473359Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2603.26320"},"observation_digest":"sha256:7d658b1b3e3c8b7b6ef842446e70de943a5b063aacb39b0e8fada68262dde7d2","observation_id":"fe21e7e9-76b4-4ea2-bf6f-c929037bf61d","resolution":{"observed_at":"2026-05-14T22:59:34.036536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2604.04502","last_updated":"2026-04-06T07:57:52Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T07:57:52Z","title":"Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T20:10:54.362107Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2604.04502"},"observation_digest":"sha256:5ad7ee3fd6dba804bc892290f3d3ef76070d9346250e4a1a873475b0590cfdbc","observation_id":"215344d3-9b62-4ee6-90c6-e167ac1d2ca6","resolution":{"observed_at":"2026-05-10T22:10:49.501816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2604.17800","last_updated":"2026-04-20T04:46:20Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T04:46:20Z","title":"ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:38.517652Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2604.17800"},"observation_digest":"sha256:95057a3d5517e7721ff63a7af89f62d6b03848cc85062c38886b98b252d6ae4f","observation_id":"6a9b6c95-3c09-4cdd-bcbb-b2b4d9df7eac","resolution":{"observed_at":"2026-05-10T09:48:48.368301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T03:39:41.090350Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:4bd68960f8823d20d295252c484498fd620c19abc504ea8f52749c11c25ab583","observation_id":"bbe15e70-d9c6-4266-b018-17bf1e4020f0","resolution":{"observed_at":"2026-05-11T03:40:53.701218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T02:53:54.608425Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:cb9ba97e0d283934cf65ec9cf4ce91428779ee0bc44ad264f93b6895b0a41dfe","observation_id":"a546ed1d-8b0c-41fb-96f5-371f64fb4702","resolution":{"observed_at":"2026-05-12T07:26:29.199579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T06:16:48.180290Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:c67d1ed927a2e151e0226cb52d040c4b3640d5b354e04b8967f97dc5e4474f8d","observation_id":"1e489c8a-6af9-4c50-bf3b-8b25fb7bb44d","resolution":{"observed_at":"2026-05-15T06:19:49.907080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-06T08:57:29.338706Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T04:14:54.885244Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.10819"},"observation_digest":"sha256:98a3d1d1ea652586b9979080e4c714a9f5e88f3e426844adf2e276026ef9c9cb","observation_id":"eed7992c-03d2-4756-9207-b9e06610f666","resolution":{"observed_at":"2026-05-12T06:26:26.881607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-06T08:57:29.338706Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T21:14:56.501485Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.10819"},"observation_digest":"sha256:4830d59a7999d8cbec9c2df5d46f9ccb3461f9d06cbfc112f60e1d9c1976d56f","observation_id":"06681ab4-54d2-4ec5-9873-e7dee94d86a3","resolution":{"observed_at":"2026-05-14T21:17:59.541966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-02T14:25:58.642997Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:43.222818Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:adaa5e013430e35efbb3783ad89fdc6169e751f70419c1f99c7b8ae86d042dcc","observation_id":"8a60aa44-b1bc-419a-abb0-009de18a24d1","resolution":{"observed_at":"2026-05-12T06:36:25.755642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-02T14:25:59.846732Z","title":"Up-vla: A unified understanding and prediction model for embodied agent.arXiv preprint arXiv:2501.18867, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-02T14:25:58.642997Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:25:59.846732Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:364026480dbf5a88dab3d07a254e6f0fdacb1f5e67987d2d6168f649888a7ab2","observation_id":"bbf4990f-9cc8-4f36-8c36-7d5d8f5c96cf","resolution":{"observed_at":"2026-08-02T14:25:59.846732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.15735","last_updated":"2026-05-18T07:08:58Z","snapshot_observed_at":"2026-08-05T15:39:24.495350Z","submitted_at":"2026-05-15T08:45:37Z","title":"UAM: A Dual-Stream Perspective on Forgetting in VLA Training","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T19:24:57.339949Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.15735"},"observation_digest":"sha256:7ecedc6a3a3b888f6321a6c0de6142a17df9081b9ec95d94899d1d8216bd5e90","observation_id":"244fea20-afda-4dff-920c-68fe5a1cf106","resolution":{"observed_at":"2026-05-20T19:28:55.072771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.21862","last_updated":"2026-05-21T01:19:17Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T01:19:17Z","title":"EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T06:19:36.625269Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.21862"},"observation_digest":"sha256:6dc73cbee2fccc15d66c757f965892c04fe9746e69c7bead070953b90fa0c686","observation_id":"a7ccadef-7dfe-4e6e-8a80-ae221c8a6dec","resolution":{"observed_at":"2026-05-22T06:21:10.582695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:52.461348Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:e9b8fab1d944a23bfd085b3c31e3ba667537d871da81698c594fb4d26ae853a5","observation_id":"a635d8f1-ac24-40cf-a4fe-0205460e94f5","resolution":{"observed_at":"2026-05-22T06:06:08.671326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T16:52:05.565650Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:cd6f0c8f609a6198e26c241a3c661f537b6714ba9243f247862dc5b8dde50140","observation_id":"d45834e8-781a-4585-a3e2-d40fe382e7bb","resolution":{"observed_at":"2026-06-30T16:54:58.304885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:3b9e5626fe599a358bafc3645adee55079b81e2d6d64eeeedffa07b141d75c35","observation_id":"0e610237-103c-4e29-85ab-bfb040883cc3","resolution":{"observed_at":"2026-06-29T13:43:28.812492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2606.06155","last_updated":"2026-06-04T13:28:51Z","snapshot_observed_at":"2026-07-29T15:22:02.359291Z","submitted_at":"2026-06-04T13:28:51Z","title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T01:23:02.576098Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2606.06155"},"observation_digest":"sha256:9e2ecff15263d52a6365c95dac522a9be8937b16d33fadb140dadeb9c02e9ea8","observation_id":"0c011b33-cf82-4e6a-acac-4920df51827d","resolution":{"observed_at":"2026-07-02T13:16:59.243402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2606.12403","last_updated":"2026-06-10T17:59:08Z","snapshot_observed_at":"2026-08-01T17:35:24.729614Z","submitted_at":"2026-06-10T17:59:08Z","title":"World Pilot: Steering Vision-Language-Action Models with World-Action Priors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:02.137152Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2606.12403"},"observation_digest":"sha256:0fdb5636d4cd8238d82fd3f85b5ad2fef80be377deb88aa0d0fbf6cbc365dc25","observation_id":"b5e73954-1eb4-493a-b5d1-a114cc96fe0c","resolution":{"observed_at":"2026-07-03T11:18:03.287276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2606.21088","last_updated":"2026-06-19T04:35:18Z","snapshot_observed_at":"2026-08-06T05:03:39.968585Z","submitted_at":"2026-06-19T04:35:18Z","title":"MV-WAM: Manifold-Aware World Action Model with Value Augmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:36:42.051049Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2606.21088"},"observation_digest":"sha256:bdaad6635ed0ef7776f42fc61b3f0376fadb0ab8155634b96d6b234739fafb6d","observation_id":"5fe65f78-e8ee-401e-8667-7858116c64e6","resolution":{"observed_at":"2026-07-04T06:19:38.147129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":"2501.18867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-07-04T06:19:38.145306Z","title":"UP- VLA: A unified understanding and prediction model for embodied agent","venue":null,"work_id":"216b3846-c9cd-4d45-ae95-261606a3f480","year":2025},"citing_paper":{"arxiv_id":"2606.29384","last_updated":"2026-06-28T13:19:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-28T13:19:11Z","title":"Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T07:01:48.330369Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2606.29384"},"observation_digest":"sha256:8acadad28d15c775cf54149e8a2fe51762ca4e878ac15b60e10869bba7cfec5c","observation_id":"e6920ae1-14bf-43af-b651-170eb1996765","resolution":{"observed_at":"2026-06-30T07:04:21.013976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18867/citation-record","integrity":"/paper/2501.18867/integrity","json":"/paper/2501.18867/citation-record.json","paper":"/paper/2501.18867"},"outbound":[],"paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2501.18867."}