{"as_of":"2026-08-10T21:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53e3fce6995db2d0b6992da1e3a060dedc973b0fbe092da7c60c19f718b061ac","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T00:54:23.508845Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:56:57.482174Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T16:57:10.319204Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2605.10858","last_updated":"2026-05-11T17:05:49Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:05:49Z","title":"Is Your Driving World Model an All-Around Player?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:50.292305Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2605.10858"},"observation_digest":"sha256:c4ac501bea8433a3e3c9db9bc750ce1c98990c2a7da2655b6b290b184299c6a1","observation_id":"331997d7-08e6-4ca7-b2bb-4b05796870be","resolution":{"observed_at":"2026-05-12T06:01:24.008567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2605.13815","last_updated":"2026-05-13T17:42:20Z","snapshot_observed_at":"2026-08-02T07:55:48.285473Z","submitted_at":"2026-05-13T17:42:20Z","title":"OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T19:20:15.333859Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2605.13815"},"observation_digest":"sha256:cf48a50f77f40477d2967a07989cfe1800a595358e49085d26863cfee15a3b7e","observation_id":"4e6f403d-8549-477d-ac75-a963e1c621a3","resolution":{"observed_at":"2026-05-14T19:22:50.653700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2605.19771","last_updated":"2026-05-19T12:41:47Z","snapshot_observed_at":"2026-07-06T23:30:25.609722Z","submitted_at":"2026-05-19T12:41:47Z","title":"Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T05:28:21.056792Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2605.19771"},"observation_digest":"sha256:af274a0b2672a6b1e1812c63b4c95f38d0bfbaf71283de3d664b0340d960b445","observation_id":"86600751-4c2f-497e-9562-608bea60a07d","resolution":{"observed_at":"2026-05-20T05:33:04.352441Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2606.01241","last_updated":"2026-06-02T03:11:27Z","snapshot_observed_at":"2026-08-07T02:28:05.002889Z","submitted_at":"2026-05-31T13:43:23Z","title":"OneVLA: A Unified Framework for Embodied Tasks","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:08.124096Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2606.01241"},"observation_digest":"sha256:e32bf69357d779c0b8f939e38ba66c2dd04d76579937e41e103d5f64a7e9cd5c","observation_id":"0f008b2a-8686-49db-9bf1-fe950c51d477","resolution":{"observed_at":"2026-07-01T21:26:14.122300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2606.01955","last_updated":"2026-06-01T09:14:51Z","snapshot_observed_at":"2026-08-03T02:17:56.167011Z","submitted_at":"2026-06-01T09:14:51Z","title":"WALL-WM: Carving World Action Modeling at the Event Joints","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T14:15:14.454649Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2606.01955"},"observation_digest":"sha256:ef801b89755b834b4927f492506e7829c1aa4ff7a0df41383e9c7556c17621c8","observation_id":"9eab05e9-a088-4b20-8431-84405cf6c45c","resolution":{"observed_at":"2026-07-01T23:36:22.326219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2606.05769","last_updated":"2026-06-04T06:53:19Z","snapshot_observed_at":"2026-08-03T03:37:13.228116Z","submitted_at":"2026-06-04T06:53:19Z","title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T02:46:50.373450Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2606.05769"},"observation_digest":"sha256:052c72714708750fb9ecb432909c0a9583ebb058556aaf6cd5908ed0753d397c","observation_id":"8ac20d96-80fe-467f-a21d-417dbc8bd2eb","resolution":{"observed_at":"2026-07-02T11:56:55.429542Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2606.07366","last_updated":"2026-06-05T15:09:27Z","snapshot_observed_at":"2026-08-06T23:45:41.420266Z","submitted_at":"2026-06-05T15:09:27Z","title":"Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T22:15:08.063308Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2606.07366"},"observation_digest":"sha256:858131149715df1ccbc145c1fc8f2401253c67c9361c43b39ff70e1686764ec0","observation_id":"e1259f2f-b0cd-40ce-9d3d-f39e2bf1ad4b","resolution":{"observed_at":"2026-07-02T16:57:10.321628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2606.30367","last_updated":"2026-06-29T14:33:03Z","snapshot_observed_at":"2026-08-06T15:33:36.109677Z","submitted_at":"2026-06-29T14:33:03Z","title":"FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T05:05:56.065261Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2606.30367"},"observation_digest":"sha256:80e58fb9caed76bf052a009aaedd4d353aa7d70e77d75487360b11681fc19cb1","observation_id":"ddd72e8b-ce8b-4d34-a859-27ce4e0d5e0e","resolution":{"observed_at":"2026-06-30T15:44:49.434536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":"2604.18486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-02T16:57:10.319204Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","venue":"cs.CV","work_id":"50a8fe28-0142-433c-8da4-bd231fd02f23","year":2026},"citing_paper":{"arxiv_id":"2607.00399","last_updated":"2026-07-01T03:50:45Z","snapshot_observed_at":"2026-08-04T06:35:09.194548Z","submitted_at":"2026-07-01T03:50:45Z","title":"DriveVer: Lightweight Trajectory Evaluator as Test-Time Verifier for Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-02T14:59:35.226245Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2607.00399"},"observation_digest":"sha256:b779693dd297ad7865ba4478d10a01cb9f4652bb01835e5e20796857beb9ddf1","observation_id":"7eb48b8a-c4c7-4953-925b-e620c9234984","resolution":{"observed_at":"2026-07-02T15:07:04.053954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-08-01T19:56:57.482174Z","title":"Xiaomi OneVL: One-step latent reasoning and planning with vision-language explanation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16806","last_updated":"2026-07-18T12:55:40Z","snapshot_observed_at":"2026-08-09T06:56:01.071812Z","submitted_at":"2026-07-18T12:55:40Z","title":"Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T19:56:57.482174Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2607.16806"},"observation_digest":"sha256:6f0b4323c892b8ec70ad81a4226cccd337cb3a2daeb85b24640fdc3b98005b61","observation_id":"09405c93-1edd-42bc-b8c0-98cd78597ea7","resolution":{"observed_at":"2026-08-01T19:56:57.482174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-08-01T08:49:48.309380Z","title":"Xiaomi onevl: One-step latent reasoning and planning with vision- language explanation.arXiv preprint arXiv:2604.18486, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20988","last_updated":"2026-07-23T07:11:41Z","snapshot_observed_at":"2026-08-05T16:29:13.350727Z","submitted_at":"2026-07-23T07:11:41Z","title":"HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T08:49:48.309380Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2607.20988"},"observation_digest":"sha256:0b8d9d745ad92a58da552607ea9b749e0dc4b7d70363ca80d2994f561b350a5f","observation_id":"90980c78-0455-40f7-b57c-a88828014828","resolution":{"observed_at":"2026-08-01T08:49:48.309380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18486","snapshot_observed_at":"2026-07-31T06:18:55.846788Z","title":"Xiaomi OneVL: One-step latent reasoning and planning with vision-language explanation.arXiv preprint arXiv:2604.18486, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-08-06T17:57:37.442251Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":255,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.846788Z"},"links":{"cited_paper":"/paper/2604.18486","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:aaaeac46b6ff1bbd04bdc16ce0d1d2693ffe305f34923cbc89057ea392488094","observation_id":"23dbe812-28cd-4331-b7eb-82aea1231cb7","resolution":{"observed_at":"2026-07-31T06:18:55.846788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.18486/citation-record","integrity":"/paper/2604.18486/integrity","json":"/paper/2604.18486/citation-record.json","paper":"/paper/2604.18486"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.7 Sonnet and Claude Code.https://www.anthropic.com/news/claude-3-7-sonnet","venue":null,"work_id":"0dd94600-b0fd-4a9c-bcd7-d345dbec16b3","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:ba033c39992cc65dc83e3ee1414525c92b1f358a5945b0077f3bf1f22d7cf201","observation_id":"afe21470-a494-48dc-97f9-e6a16805d14c","resolution":{"observed_at":"2026-05-14T09:28:26.956782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":"e0007770-41b0-41db-b92d-85b386d40c46","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:62c2ee09cfcf2b022a0772c829731145bf82e207350e733b923b5fda12ccb37e","observation_id":"ff616f81-e00f-4a4e-8134-d1475698d7bd","resolution":{"observed_at":"2026-05-14T09:28:27.146836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":"2503.15558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-07-05T11:41:02.557688Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","venue":"cs.AI","work_id":"09215448-e68a-4168-89b7-9d9a83a0e51f","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:0a408ba8ffd84038e0e145d8d3047673dca0adb68521eda09a7987a16cc327c6","observation_id":"3627fa32-91d8-45b1-8876-bba15b85d603","resolution":{"observed_at":"2026-05-16T12:47:10.348602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:cd17b2b91bcf4ca821bf4af9361d9f8cece32277241d2b34c46d510e350b6673","observation_id":"cb490e54-c2fb-4f2b-921b-d4dbcdf5a3da","resolution":{"observed_at":"2026-05-12T08:36:25.958151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:16526a9f9c7dec643e1e76d2906b375e9f28d72be0d806847267369eff9c3c79","observation_id":"53e59826-aefe-43c2-809c-72c9aa545c43","resolution":{"observed_at":"2026-05-12T08:36:26.145301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:e1c45cc2fe0524b3c2379968694e4255bd5dc2e6134166fe019a7243f037f465","observation_id":"885fe00b-5b3f-4ad9-8230-102eb2512c51","resolution":{"observed_at":"2026-05-12T08:36:26.005487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.18084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamiccity: Large-scale 4d oc- cupancy generation from dynamic scenes","venue":null,"work_id":"d09e1fb0-df96-4e33-83fb-c3638f023b14","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:22cb276e573729d1c9ab5645e42a53e5080ba3d8776a00ee3aac0db3eaeea7c2","observation_id":"64fbd631-b097-441b-ac7b-26de69cc7a57","resolution":{"observed_at":"2026-05-12T08:36:26.114624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":"a498c193-2add-4056-bdc1-ec0db0706d76","year":2020},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:94177a1af30bf42291d1ab66e49e28529cbed8f8f9c9f8135cec7eac058896e1","observation_id":"b816d1b3-3b7e-4592-9b40-00e4523b8b45","resolution":{"observed_at":"2026-05-14T09:28:26.948035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.763919Z","title":"Maplm: A real-world large-scale vision-language benchmark for map and traffic scene understanding","venue":null,"work_id":"d94da023-e9d5-4ac1-a734-bb267e96f430","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:84a34f9b9dfb44fdc132acb6354510f920fe1b5ed93e464fbbaf46f8fd3bbf9a","observation_id":"9dc12a58-83f3-49b9-adcf-dbafa8bd9fad","resolution":{"observed_at":"2026-05-14T09:28:27.102138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.25122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:38.790823Z","title":"arXiv preprint arXiv:2510.25122 (2025)","venue":null,"work_id":"52d0e10c-25be-4570-ab66-1c356bc58ba3","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:262a2fb33aa5aefa75f3b200d6f7027a1d74954b740e9f8afc267a0aca3f29a6","observation_id":"7ea35755-2bd2-4cd7-9e3b-2514ce54b21d","resolution":{"observed_at":"2026-05-12T08:36:25.952483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":"2402.03216","doi":"10.48550/arxiv.2402.03216","metadata_source":"pith","pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","venue":"cs.CL","work_id":"a9435752-4e49-42bd-95b4-0fec975633c8","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:c43f9c45d3860de4a84e14bf479db5936e45d294476ca8524f2652b53c2d745f","observation_id":"1938e40b-b0f9-4977-a83d-a2cf3c406a3e","resolution":{"observed_at":"2026-05-12T08:36:26.135572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automated evaluation of large vision-language models on self-driving corner cases","venue":null,"work_id":"739f953a-ac6e-4697-a843-386d6f1de880","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:634dd2d9b50ec92d952498bbc8500b83fcc44aeb86d9e87a9ad235e72aa7f94b","observation_id":"6f6069d0-72d4-4e34-aaa0-6e99044706f0","resolution":{"observed_at":"2026-05-14T09:28:27.130709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Driving with llms: Fusing object-level vector modality for explainable autonomous driving","venue":null,"work_id":"59afb46e-a967-4332-9ef3-9302fde25575","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:823142c2d272fecf4967f4c5f6ec05717005867add44cf4f8e0812daab7d09d6","observation_id":"41071d63-b645-49a3-9130-b66678e30519","resolution":{"observed_at":"2026-05-14T09:28:27.081174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:07d3ac67e3374fa83b4b93d8e1ffc99df3928715ceae935056b2eb00fe73811d","observation_id":"3a5e2368-0cbf-46a5-ac7b-06088f13084f","resolution":{"observed_at":"2026-05-12T08:36:26.082150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.12672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:27:25.532417Z","title":"Vilta: A vlm-in-the-loop adversary for enhancing driving policy robustness","venue":null,"work_id":"840d93a4-1104-485e-980d-f1144ead2a07","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:7e3809a684fa700edfee74316d5441ab19cb3b5d25a13c1feca06d4085bd17b2","observation_id":"112f04bb-3a77-45e8-b544-4996b1204386","resolution":{"observed_at":"2026-05-12T08:36:25.994615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13171","last_updated":"2024-12-17T18:50:33Z","snapshot_observed_at":"2026-08-09T18:44:01.140163Z","submitted_at":"2024-12-17T18:50:33Z","title":"Compressed Chain of Thought: Efficient Reasoning Through Dense Representations","version":1},"cited_work":{"arxiv_id":"2412.13171","doi":"10.48550/arxiv.2412.13171","metadata_source":"pith","pith_arxiv_id":"2412.13171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Compressed Chain of Thought: Efficient Reasoning Through Dense Representations","venue":"cs.CL","work_id":"5d72fcbb-d14d-4ac0-8644-50807a64d543","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2412.13171","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:3654a47f88bbb675755317b6d28fccd19d43190edbaeb452b307e82197767c19","observation_id":"47737d8e-5862-4011-bebb-f6469cdb3ff9","resolution":{"observed_at":"2026-05-17T04:47:40.470022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Impromptu VLA: Open weights and open data for driving vision-language-action models","venue":null,"work_id":"bbcc13ca-5a05-4a20-8e9f-8d5097f2e0ae","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:5da0a453faa4990a0695a911df1590cbaf79692ff775a8c7e9f3c7e4b7304e49","observation_id":"e7693050-a7ed-4eb9-a224-00b35724fa7f","resolution":{"observed_at":"2026-05-14T09:28:27.122045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-07T15:13:13.622286Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:39bd33d8c9f4e6584e022fea46b4a59fffcb2c807798c2705506b3b83ce565f3","observation_id":"19177e61-0370-4e00-b196-c64d4bda4c92","resolution":{"observed_at":"2026-05-18T01:12:13.931083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Navsim: Data-driven non-reactive autonomous vehicle simulation and benchmarking.Advancesin Neural Information Processing Systems, 37:28706–28719","venue":null,"work_id":"9d4ba3f4-1b18-4514-8ed4-7b2e5f026671","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:fbaeebc7b817e9866fbe2bddf0da8f6b6dc8d71359f66078f4fe56fc6b025a91","observation_id":"b46d9a9d-4e92-4705-9491-c54b7881db37","resolution":{"observed_at":"2026-05-14T09:28:26.993180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10668","last_updated":"2024-03-18T23:15:47Z","snapshot_observed_at":"2026-07-06T16:20:36.866744Z","submitted_at":"2023-09-19T14:50:38Z","title":"Language Modeling Is Compression","version":2},"cited_work":{"arxiv_id":"2309.10668","doi":"10.48550/arxiv.2309.10668","metadata_source":"pith","pith_arxiv_id":"2309.10668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Modeling Is Compression","venue":"cs.LG","work_id":"e9f96f8e-ac74-44e1-bfd5-ac6ff083003f","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2309.10668","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:d206090d45452321df55389833469be73b020de9883ace9c7d0cb64b404543da","observation_id":"8ac4bf0a-0f8b-4089-a5d3-767c35939e5c","resolution":{"observed_at":"2026-05-17T22:36:13.497932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14838","last_updated":"2024-05-23T17:54:14Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:54:14Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","version":1},"cited_work":{"arxiv_id":"2405.14838","doi":"10.48550/arxiv.2405.14838","metadata_source":"pith","pith_arxiv_id":"2405.14838","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","venue":"cs.CL","work_id":"70541c9d-c3f3-48e4-be00-e7de1622f612","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2405.14838","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:287a0a467a43f947d36ff2397ff01d6c8ad0e63984648e53facb276708514284","observation_id":"1b9bba79-0104-4460-a111-fe205e9fbb16","resolution":{"observed_at":"2026-05-16T11:44:32.634190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.800908Z","title":"Holistic autonomous driving understanding by bird’s-eye-view injected multi-modal large models","venue":null,"work_id":"014eed05-291e-42c6-8d21-9b372c5d9b4b","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:283e01d27deb4255ca54f0aa68774dc75c74d11cf744c84b7f227d13995fdac5","observation_id":"c8166422-dbb3-4821-a7d7-ed67d279e2bf","resolution":{"observed_at":"2026-05-14T09:28:26.933883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:29:59.608897Z","title":"Hauptmann, and Zhi-Qi Cheng","venue":null,"work_id":"88af92b3-9062-40f4-8024-9c49e977b8bb","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:e7a0b257912aa3b087407cc1c9e6594f574d3842230a5f52e2fed0145b13ecea","observation_id":"f61d2ea3-f73d-4c45-acf4-5c9aec3bc003","resolution":{"observed_at":"2026-05-12T08:36:26.067131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.26741","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:29:59.556233Z","title":"Language-conditioned world modeling for visual navigation","venue":null,"work_id":"98086e90-e0a9-4974-8e49-f2a6c8aede91","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:9947ae58ee400180efea58e7a7e3cea3ea782387746ff50a95f90d25ab9383fe","observation_id":"545c5e5d-ef61-4ce5-8580-1ecc29d9dd02","resolution":{"observed_at":"2026-05-12T08:36:25.942926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large scale interactive motion forecasting for autonomous driving: The waymo open motion dataset","venue":null,"work_id":"079304e3-b25a-4412-a05f-7ff37371ffab","year":2021},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:019372b007ff19d1eeae4ad52e07305cf9272c2ab978550d66d8bf3c9cf77084","observation_id":"2780ccca-bd98-4ccc-8173-eb91a5d33c86","resolution":{"observed_at":"2026-05-14T09:28:27.000828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advancing sequential numerical prediction in autoregressive models","venue":null,"work_id":"41cf1c05-102b-49a7-b415-4556b183916c","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:c197df84e969c5981eddfed3ee889f28dcf875951f300cbff129a5d877b89a7e","observation_id":"54e96c37-84ae-46f7-a65d-ae63c24a258d","resolution":{"observed_at":"2026-05-14T09:28:26.980942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dolphin: Document image parsing via heterogeneous anchor prompting","venue":null,"work_id":"28e136ac-17d8-4fda-93a8-44faa049b4da","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:5b14b477166c0c50738b1f42ffb52502979e30d3d6b3da0c213297a8d86e189d","observation_id":"f1ba7fa9-8fde-4ebd-a3d6-2d641ca8e39e","resolution":{"observed_at":"2026-05-14T09:28:26.977003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11260","last_updated":"2025-09-10T14:02:23Z","snapshot_observed_at":"2026-08-10T18:25:50.768841Z","submitted_at":"2025-01-20T04:00:02Z","title":"A Survey of World Models for Autonomous Driving","version":4},"cited_work":{"arxiv_id":"2501.11260","doi":"10.48550/arxiv.2501.11260","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11260","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey of world models for autonomous driving","venue":"ArXiv.org","work_id":"5775e072-5965-490b-b444-42d28c541e6f","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2501.11260","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:0a9c4d743b490c40087667fab14159a80acb45f151aa25407a0642298a030c22","observation_id":"cc7d6ea5-f360-4445-afc6-a084108778b6","resolution":{"observed_at":"2026-05-12T08:36:25.917007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orion: A holistic end-to-end autonomous driving framework by vision-language instructed action generation","venue":null,"work_id":"7b92d410-1897-49fb-88c1-645068286440","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:b9342b304d61fe35b5e42ad5ce79b154ca869f974b2b918d36a2a30a196bc680","observation_id":"236f4343-fad7-49f7-87d5-8d519b6f4cde","resolution":{"observed_at":"2026-05-14T09:28:27.031896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13636","last_updated":"2026-07-17T07:01:14Z","snapshot_observed_at":"2026-08-10T09:41:13.055186Z","submitted_at":"2025-12-15T18:31:32Z","title":"MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2512.13636","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.13636","snapshot_observed_at":"2026-07-20T02:18:22.862599Z","title":"Minddrive: A vision-language-action model for autonomous driving via online reinforcement learning","venue":null,"work_id":"194e5628-5507-415b-b9dd-adf44a066c35","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2512.13636","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:60a3898ca2745aff73ac3c25eafecbb28ed9acc58dd686a9c9f230974cbbe275","observation_id":"e5a188c7-178f-4979-96f9-2b79aac3b7fc","resolution":{"observed_at":"2026-07-20T02:18:22.862599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision meets robotics: The KITTI dataset","venue":null,"work_id":"6303dd61-7e17-4a16-b4ff-c991761cf546","year":2013},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:cc5c60e9e7122172309d056f5f9b77d870eaf02bba4713df0d3ec25a46dfba51","observation_id":"8198289c-3a26-4a1f-b16b-00bf42971b9e","resolution":{"observed_at":"2026-05-14T09:28:27.004571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16055","last_updated":"2026-04-19T08:53:50Z","snapshot_observed_at":"2026-08-01T17:47:07.197066Z","submitted_at":"2025-12-18T00:41:31Z","title":"Driving in Corner Case: A Real-World Adversarial Closed-Loop Evaluation Platform for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2512.16055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.16055","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Driving in Corner Case: A Real-World Adversarial Closed-Loop Evaluation Platform for End-to-End Autonomous Driving","venue":"cs.CV","work_id":"c03ba18c-67e2-4d06-b470-ddf10f7aed56","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2512.16055","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:98e8eae8288ab0729c99923f9bc102924a0af9c05e896e7d9549790e45338782","observation_id":"085ff846-a7ce-4fad-933e-735946f9a7ea","resolution":{"observed_at":"2026-05-12T08:36:26.025230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Narasimhan","venue":null,"work_id":"a8e665ae-4310-4cae-a1e2-d09be387e438","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:dbee42c89ebc89aa99018206458f5c9b262f9c4dc75ad91a6d9978526c62b8ae","observation_id":"ba9f214d-e395-417a-9c21-2f59262bfd37","resolution":{"observed_at":"2026-05-14T09:28:27.035456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.5 Pro preview: even better coding performance.https://developers.googleblog.com/en/ gemini-2-5-pro-io-improved-coding-performance","venue":null,"work_id":"0b824680-3d50-4703-9979-c52ee8b29053","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:689e7534b51c109a995c2d746123079b132cba334acb0ba1205a6247f4e8246d","observation_id":"0deda81c-23b1-4b65-92e2-67a27e86957d","resolution":{"observed_at":"2026-05-14T09:28:26.972718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World models for autonomous driving: An initial survey.IEEE Transactionson Intelligent Vehicles, pages 1–17","venue":null,"work_id":"6dcaf950-522d-4cb3-af88-ac8fb28f3b11","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:1661ec56458b4ece6b33b8a340f856c19c7afca76e03857796cd263b648cdfaa","observation_id":"dcb3504d-5c72-4a43-9cf2-69b471620150","resolution":{"observed_at":"2026-05-14T09:28:27.117978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:6694c33eca2400efca20027c6ec8d9eaa84b0b469ae1aef7316107971ba15127","observation_id":"982ffee2-ddec-4146-8e38-ea7f991d2168","resolution":{"observed_at":"2026-05-12T08:36:26.045917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:95c94ab8508f6cca98cc92c5389d5e9ba3f453bc0a7c6d46f3e72c019c02dfa3","observation_id":"1298f9e2-02e3-458a-af07-8c4ef8c99a56","resolution":{"observed_at":"2026-05-12T08:36:25.937007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:c624147346a34f277930ee5b8aca3f3845ac9f0c8e50b9ef1b3fb23495f48d3e","observation_id":"d06f0d02-d1db-45ea-b128-a8d00e9bcfcd","resolution":{"observed_at":"2026-05-12T08:36:25.974962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":"1912.01603","doi":"10.48550/arxiv.1912.01603","metadata_source":"pith","pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","venue":"cs.LG","work_id":"5103f4be-344a-4139-8504-eaa59f5bac9d","year":2019},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:019e7ff44d0a1d583fd4ae064452f2f2314f8be55a736e202d210989395a449a","observation_id":"d69e091e-0f6d-4ec1-bd80-73ae172fc2ba","resolution":{"observed_at":"2026-05-12T08:36:26.020489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:6057b4974a7c1abf17add314e971c3c9ce1bec55c9912b078d9e41f6ec10d04f","observation_id":"6b8688fd-4d23-4e64-9556-f587ef618d05","resolution":{"observed_at":"2026-05-12T08:36:26.108770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"cited_work":{"arxiv_id":"2511.16518","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16518","snapshot_observed_at":"2026-07-05T11:41:02.521274Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","venue":"cs.RO","work_id":"d195ae66-288b-40f6-9dc0-c6a4c02fc03d","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2511.16518","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:8d69a3b33ec692f79948d0a307b37f5beed4e5902113b6bf37faf4e7d548e765","observation_id":"e8132dd7-4299-41ac-8c75-432621e774e7","resolution":{"observed_at":"2026-05-12T08:36:26.119384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02948","last_updated":"2025-07-13T15:16:06Z","snapshot_observed_at":"2026-08-10T11:42:24.109922Z","submitted_at":"2025-06-28T21:28:01Z","title":"DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction","version":3},"cited_work":{"arxiv_id":"2507.02948","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02948","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drivemrp: Enhancing vision-language models with synthetic motion data for motion risk prediction","venue":null,"work_id":"74ad98de-47c3-4f46-b4a7-0214598d957a","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2507.02948","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:dc3c9dc24673dd5803541bc505da7cb146f7d73a83ffadf687545eaf8d57fe48","observation_id":"90ab0c2e-c23b-4c66-bf27-d0b1e8da0585","resolution":{"observed_at":"2026-05-12T08:36:26.150807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2309.17080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-07-10T11:47:02.949785Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"313484e6-a442-4522-8e19-d07e502844a8","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:663d80fd9c3db7b2dd52be41b6f26e75ff8de8c382f6e243ccc7f7035841fb00","observation_id":"f0455a59-ab08-4d7a-8771-7bc65ef14683","resolution":{"observed_at":"2026-05-12T08:36:26.160483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:46:40.293866Z","title":"Vision-language-action models for autonomous driving: Past, present, and future","venue":null,"work_id":"3ed0d403-c946-4357-b4f8-c33ead499359","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:d329bbd2cf94ad44051af1911f4f045a6997f40a6be4ae27d48386c30551a8b2","observation_id":"add2c6a1-1e1d-426a-8654-d2e3493891c2","resolution":{"observed_at":"2026-05-12T08:36:25.979896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15359","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T03:16:34.565011Z","title":"NavThinker: Action-conditioned world models for coupled prediction and planning in social navigation","venue":null,"work_id":"9445a55e-2dfb-4991-9608-cf74a6582994","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:23f4b2cffd30853d80e4f2afae9c16c110df41a67bf546aa4834e20baf8e5dad","observation_id":"b47ebd11-2c33-49f0-b3c9-80650a543b56","resolution":{"observed_at":"2026-05-12T08:36:25.989888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fuller: Unified multi-modality multi-task 3D perception via multi-level gradient calibration","venue":null,"work_id":"a35bbbbc-8bd3-43ca-8d63-018861f14035","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:87f5cf9d240580d711660add40d5d59f69c8fe02e8e209b00d61cd2f48ff2f61","observation_id":"e9d6a343-9e18-47e9-9d52-25a48fc86a22","resolution":{"observed_at":"2026-05-14T09:28:27.012473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making large language models better planners with reasoning-decision alignment","venue":null,"work_id":"841b1bb7-5ecf-48c8-bbb0-677e9dc85318","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:7141f7e66088930789058e8db6b8c3ab5e4ac0e5e17c77e3f823c134c960c93d","observation_id":"5e3ee279-4a83-439c-bbd2-d9bdaa1a2ab2","resolution":{"observed_at":"2026-05-14T09:28:27.052531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RoboTron-Drive: All-in-one large multimodal model for autonomous driving","venue":null,"work_id":"56875190-9627-4c77-87f5-c8e42b7e92a8","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:6af81894ac2fd87f229b4fd045fdd800d2f6fafec9bc53b5435c420fa59bb1ea","observation_id":"cbeb9ec0-be71-4d1d-8835-4b1049b6e960","resolution":{"observed_at":"2026-05-14T09:28:27.026950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:d6480984da68558f07ce9ad8edcccab4031dd9d5d61fa462e15c6a43a4943229","observation_id":"6927d97a-b8b8-4ca1-932c-ca107d61b1e0","resolution":{"observed_at":"2026-05-12T08:36:25.984468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10621","last_updated":"2025-03-13T17:59:01Z","snapshot_observed_at":"2026-08-07T17:06:11.585648Z","submitted_at":"2025-03-13T17:59:01Z","title":"DriveLMM-o1: A Step-by-Step Reasoning Dataset and Large Multimodal Model for Driving Scenario Understanding","version":1},"cited_work":{"arxiv_id":"2503.10621","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10621","snapshot_observed_at":"2026-07-05T11:41:02.478415Z","title":"Drivelmm- o1: A step-by-step reasoning dataset and large multimodal model for driving scenario understanding","venue":"cs.CV","work_id":"9202cb0d-c224-47da-8483-b5e054b86064","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2503.10621","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:7522fcd44d2d9036e7439f224c4eb424630e31d4e5e7c3ec8725e331aae85f3f","observation_id":"722e832f-126e-4e72-896f-a079bb27268f","resolution":{"observed_at":"2026-05-12T08:36:26.000557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:f9cc7c166ec1beacab4c7246b960933f00dc61fd1fa4854e43533d32f4efd11e","observation_id":"50bed8ca-bb2c-49d5-86e7-7465238af746","resolution":{"observed_at":"2026-05-12T08:36:26.154997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meml-grpo: Heterogeneous multi-expert mutual learning for rlvr advancement","venue":null,"work_id":"eb61584f-8050-4d5b-9bb0-fa4f5759051b","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:85bb1dba325ba1b0e5ac4c5aaebff88df57697aa780c297ccb43855d169648a6","observation_id":"f9ab1206-fe37-469a-b28a-96803dcd9022","resolution":{"observed_at":"2026-05-14T09:28:27.068710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards learning- based planning: The nuPlan benchmark for real-world autonomous driving","venue":null,"work_id":"a56b7094-a240-4324-97a4-0b0d956d1c2b","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:843b73253e82975dda6569ab8e6028e1643fe937d0cf807a549594f17ff7b45d","observation_id":"7f35206e-1553-408e-b54e-36717c420eb4","resolution":{"observed_at":"2026-05-14T09:28:26.922400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08816","last_updated":"2024-05-30T03:49:20Z","snapshot_observed_at":"2026-07-06T18:14:20.889736Z","submitted_at":"2024-05-14T17:59:57Z","title":"The RoboDrive Challenge: Drive Anytime Anywhere in Any Condition","version":2},"cited_work":{"arxiv_id":"2405.08816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08816","snapshot_observed_at":"2026-06-30T09:24:32.472471Z","title":"The robodrive challenge: Drive anytime anywhere in any condition","venue":null,"work_id":"2af43486-702e-4f0e-935b-376b3e989288","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2405.08816","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:da5c4a417671b1309677a724c1f043338ce438d318238f200ada24345ed2c736","observation_id":"8f759bc3-d470-441e-9ab4-9a5b191998a6","resolution":{"observed_at":"2026-05-12T08:36:26.010977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal data-efficient 3D scene understanding for autonomous driving.IEEE Transactions on Pattern Analysis and Machine Intelligence, 47(5):3748–3765","venue":null,"work_id":"9ea9687b-0a4b-4924-9045-fbb2eb24c73c","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:3e55266297342a2f6fa3988281fea020e1e27c011bd5e30eb602e68f8efe458d","observation_id":"e9739e53-cc52-4c1f-8a49-a9d343ed6b9d","resolution":{"observed_at":"2026-05-14T09:28:26.918393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-07T09:38:31.708978Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"cited_work":{"arxiv_id":"2509.07996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07996","snapshot_observed_at":"2026-07-21T03:22:29.733321Z","title":"3d and 4d world modeling: A survey","venue":null,"work_id":"0197d8fe-e11f-40f4-9254-87e63d981bf9","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2509.07996","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:75be77c3799755f2d272b5775e6403ea12594ecb6efbec328691456d9e62296f","observation_id":"244fed89-f186-451a-a330-46bdeb84d43b","resolution":{"observed_at":"2026-07-21T03:22:29.733321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LargeAD: Large-scale cross-sensor data pretraining for autonomous driving.IEEE Transactionson Pattern Analysis and Machine Intelligence, 48(2):1291–1308","venue":null,"work_id":"9a8ae3f6-d0fc-4cb2-bd6f-9bc332ee254f","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:312c1ac624b088dceab4c9c94bcf5b00fcd04073dd3eeeae41b668cf9410ce7b","observation_id":"9534465d-35cf-4059-a05c-1760ba4fe1f5","resolution":{"observed_at":"2026-05-14T09:28:27.155138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal intelligence: A definition of machine intelligence.Minds and Machines, 17(4):391–444","venue":null,"work_id":"a7b0f4dc-3b22-4493-86d0-da10c21ccd23","year":2007},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:1d66c94405845dbd9a7aa91b49dd06a8d0973a9fd506a6cef694469bbe77e01f","observation_id":"671dee57-d1f4-4b40-a601-7272c70ae337","resolution":{"observed_at":"2026-05-14T09:28:27.048217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing end- to-end autonomous driving with latent world model","venue":null,"work_id":"574c99e6-1ecd-4540-84d0-56b2ef284812","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:0cc4dc30fbc081d1b73b8c1ab641f0c913a0dc69828da7a2e78ec5b543b2c84c","observation_id":"113837ec-0886-4220-9ede-9672b07a86b7","resolution":{"observed_at":"2026-05-14T09:28:27.039632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end driving with online trajectory evaluation via BEV world model","venue":null,"work_id":"c0ff25bc-dcf5-419a-aaab-af535c2e9261","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:0a89f5250453dd78838aee8823c58fa90d90d31d8eef013f0d60750b9b20c36a","observation_id":"59a1dff2-a1c9-4ce8-aa54-1f5aba3c953a","resolution":{"observed_at":"2026-05-14T09:28:27.023303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DriveVLA-W0: World models amplify data scaling law in autonomous driving","venue":null,"work_id":"1a4f2746-ed55-4404-bad2-23b1bb031bd7","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:954cbfa3dac6e21073557ad73c3531bf22b6053478506b12c99476442c4fdd77","observation_id":"99fe55d7-c1ef-4ccb-b1c4-456f6bc51bca","resolution":{"observed_at":"2026-05-14T09:28:27.139153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2506.08052","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08052","snapshot_observed_at":"2026-07-10T08:36:59.842975Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","venue":"cs.CV","work_id":"02bd7e58-a437-4e26-912d-8f1a2e695fa7","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2506.08052","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:a50cb47cda2db91113bb7aeaa936584fcd4d8f38738c6bed7e7f03b3f85933f2","observation_id":"1030d577-5b2a-4a88-b885-20bb80d20d79","resolution":{"observed_at":"2026-05-15T07:36:24.555133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i22.38905","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lidarcrafter: Dynamic 4d world modeling from lidar sequences.Proceedings of the AAAI Conference on Artificial Intelligence, 40(22):18406–18414, Mar","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"a2a8e5cf-2999-408e-a8d9-e2b89d4a098c","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:8f5ecae197daebc272855ab018cfabb35768ddcfc787f612f34f20d0e3cca1c9","observation_id":"b9fde2de-5229-4987-b210-c34141b1e6a4","resolution":{"observed_at":"2026-05-12T00:56:13.429159Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, and Ziwei Liu","venue":null,"work_id":"eaccf330-30d8-431c-a050-b958e4b40663","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:1735012ed40558f27ecf8b0f322729f95836dd47f76627dd8ed1bb8714d74e56","observation_id":"9b11874e-ae5d-42d1-8860-e69e1c4f8220","resolution":{"observed_at":"2026-05-14T09:28:27.113849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s verify step by step","venue":null,"work_id":"8bbe9a30-f09b-4de4-8689-a047c2afdc36","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:c87243f3675812ce8fa5870875924fafe9590d4fbdd269b1ab4cb92a6beb3bcb","observation_id":"8abcd7b0-e6d1-45fa-93ae-13363e14d86e","resolution":{"observed_at":"2026-05-14T09:28:26.913878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:56:41.205990Z","title":"Visual instruction tuning","venue":null,"work_id":"3c1db438-8cdd-42df-8c2c-41401ff8df87","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:24576eee6643731bbf563b2d9c9b0deb53933966c5a795584a1df240b9e06237","observation_id":"23119ec1-5e0a-42ea-a692-29b98f360b55","resolution":{"observed_at":"2026-05-14T09:28:26.988446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"c4483301-e378-4e3b-9ed6-f1e93cba08d3","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:74b730d77c8d9a95da54522dc3ba6201e8c012f073ac2b6dfdb9e76ed13fa888","observation_id":"5018f948-4b49-487f-978e-7e0315496a61","resolution":{"observed_at":"2026-05-14T09:28:26.937629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:29:22.355516Z","title":"Guideflow: Constraint-guided flow matching for planning in end-to-end autonomous driving","venue":null,"work_id":"77bb7610-de6b-4ea2-83cc-67941bfe353d","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:c26e9885958ab40f8d7d4f3270afb95c566bf3633e58574e28d50bf9ecfde910","observation_id":"5520fd27-c576-483a-b886-bd67562cff5a","resolution":{"observed_at":"2026-05-12T08:36:26.056267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:36:59.856983Z","title":"Driveworld-vla: Unified latent-space world modeling with vision-language-action for au- tonomous driving.ArXiv, abs/2602.06521","venue":null,"work_id":"470671b9-e73d-4a1f-ada7-4ea10be2e111","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:c9970495e5a6279201997fee8e8de9572fa231ff2fe160a4c18d07ba232d7212","observation_id":"460b551d-9731-412b-8413-a7f793b171f6","resolution":{"observed_at":"2026-05-12T08:36:25.923214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ReasonPlan: Unified scene prediction and decision reasoning for closed-loop autonomous driving","venue":null,"work_id":"54af38a7-4479-498f-a405-3e717b8b2e43","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:d6e16a9e92948ab0f03b8e0a92c77c8a6cc6491209bb0de5dc9db918f597129c","observation_id":"71739495-92fe-4d76-926f-37b578189c94","resolution":{"observed_at":"2026-05-14T09:28:26.926123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A rationale-centric framework for human-in-the-loop machine learning","venue":null,"work_id":"b9bf8daa-0ae0-4e9c-adcc-03013caffb17","year":2022},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:5b70417dde3327c355a91a22707ea65341e6e73c493ec8d25a3115145e8f966d","observation_id":"16f167f0-0d6f-4e38-bdbf-8ec01025f4af","resolution":{"observed_at":"2026-05-14T09:28:27.105989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v37i11.26564","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Punifiedner: a prompting-based unified ner system for diverse datasets","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"fc850b41-0b0b-4cb5-adab-55d866b8aa3d","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:fae5d67f7f97d27e0ad915b77bdc8ddd60e842fd977a9a4bf490f5b24acb8322","observation_id":"b6af7b92-b15e-4d71-9c87-0214aa6f91fe","resolution":{"observed_at":"2026-05-12T00:56:13.432442Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What makes pre-trained language models better zero-shot learners? InAnnual Meeting of the Association for Computational Linguistics, pages 2288–2303","venue":null,"work_id":"35be648e-347a-470f-a018-ba894a455a74","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:587c88d3dd9f23ff40790103b2c7178fbcd3496e446d443b8f0d1b3ec89f44bf","observation_id":"3005b26f-07ac-4b60-ae7c-c22cf75f3a93","resolution":{"observed_at":"2026-05-14T09:28:27.097798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PaDeLLM-NER: Parallel decoding in large language models for named entity recognition","venue":null,"work_id":"947d4eaa-93e9-4aa2-85e7-798d2821fd34","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:70a424e7891da8b93eb8856de05af6763f9f2811d2c3216d75f6c2bd3a86079d","observation_id":"1cf21f5a-3921-4256-b9a6-abd6b2426cb8","resolution":{"observed_at":"2026-05-14T09:28:27.093495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A bounding box is worth one token - interleaving layout and text in a large language model for document understanding","venue":null,"work_id":"8cb4511a-7c88-4402-a0eb-2f257d2d6920","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:86864bb4826952ba2511f8a3400762b82b151562cd5332ae4ba812bedfc3ef43","observation_id":"5be4e1d5-51ab-4b3a-b53e-481f8ef7ab7e","resolution":{"observed_at":"2026-05-14T09:28:27.085499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"179d7eae-4e8a-471d-9247-25fd552ad4f9","year":2022},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:7e64f30afe0a4b5cc61e5e4a960e9a3f15abff9c3585de6c6fb4e415da976ae9","observation_id":"6fb73279-136c-4dbe-acc9-dcd487444f67","resolution":{"observed_at":"2026-05-14T09:28:26.984854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:09:44.908036Z","title":"Last-vla: Thinking in latent spatio-temporal space for vision-language-action in autonomous driving","venue":null,"work_id":"2cd8d8af-b827-4c00-a75a-0e1d2fd4a5d1","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:18f383a42c97736f3cd87632df5cffa7f0a9471197478932978d1422ea1f6eff","observation_id":"3565fb29-e396-4de8-9929-aa45e3dad758","resolution":{"observed_at":"2026-05-12T08:36:25.903632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:36:59.811333Z","title":"Adathinkdrive: Adaptive thinking via reinforcement learning for autonomous driving","venue":null,"work_id":"338d5fbe-d397-489d-959b-c4319523f102","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:10f6c6908752a46ba33243542f0e9d03a5ac70c6319f58db63e535b5123e8092","observation_id":"391d1782-8dd5-487c-adfc-baa6fd312bca","resolution":{"observed_at":"2026-05-12T08:36:25.910801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:09:44.913418Z","title":"Unleashing vla potentials in autonomous driving via explicit learning from failures","venue":null,"work_id":"eb7d7260-2b80-4121-bfe2-8a043f30e338","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:bee02f818ed6f4d1c687e757e3669c2725bf8f4f9c3d4277dc474d2af590378a","observation_id":"291a81bb-1f12-4e16-b88e-edb540f16845","resolution":{"observed_at":"2026-05-12T08:36:26.051200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:27:25.540338Z","title":"MTRDrive: Memory-tool synergistic reasoning for robust autonomous driving in corner cases","venue":null,"work_id":"d627d4dc-dc74-4a4a-a194-9cef25942436","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:a22ad01948e9f18cb5a6f6786f1b33f144a5a7dcef123c8632351c95592c77eb","observation_id":"98cf6bc8-3244-4b8e-8c2d-f27aecb19e8f","resolution":{"observed_at":"2026-05-12T00:56:14.430355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DRAMA: Joint risk localization and captioning in driving","venue":null,"work_id":"06d46834-3d63-4962-ab37-78e1876b5036","year":2023},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:cc7c5057cf4a6f3969d43281d6803a5cafce5efa315c55c40c53699e191f0143","observation_id":"733ad1f3-1b83-4b2f-9dfe-252b148f3a1f","resolution":{"observed_at":"2026-05-14T09:28:27.076819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11037","last_updated":"2021-10-25T08:08:25Z","snapshot_observed_at":"2026-08-02T02:50:48.113132Z","submitted_at":"2021-06-21T12:28:08Z","title":"One Million Scenes for Autonomous Driving: ONCE Dataset","version":3},"cited_work":{"arxiv_id":"2106.11037","doi":"10.48550/arxiv.2106.11037","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"One million scenes for autonomous driving: Once dataset","venue":"arXiv (Cornell University)","work_id":"641ea7fa-1766-4747-9593-41a95c89e65d","year":2021},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2106.11037","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:3f7a8752dacb658167b603b766886f98fa41d4764a229f325eda654f601d34f1","observation_id":"b47adb1f-d950-4cc1-928a-956fd29128e1","resolution":{"observed_at":"2026-05-12T08:36:25.931211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LingoQA: Visual question answering for autonomous driving","venue":null,"work_id":"60b3eced-f4c1-4ff9-a27b-d421557eb37d","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:24c96df61bc55de8b40adcb2958bd5b778c448b8739607c02242205ad7c6853f","observation_id":"600053ac-8981-4a6c-a56d-15215dc29816","resolution":{"observed_at":"2026-05-14T09:28:27.008416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Mapillary Vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"ce16cc79-577a-4898-bc95-bc605cd86c69","year":2017},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:ef63ccb1bf0a8f4913326d22de8210aa8b6a9cf40cc2d77dd6d40b7fc36136df","observation_id":"214dbcf6-5d3f-462c-a6a9-3e4b4f8afef3","resolution":{"observed_at":"2026-05-14T09:28:27.150957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DynVLA: Learning world dynamics for action reasoning in autonomous driving","venue":null,"work_id":"783dac49-0c4d-4524-bf15-d0ffdae1828d","year":2026},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:2c404bccaa8373e968dd3b6f5d64918bc1261395e08b1df1ec442c1a231cb495","observation_id":"3663ab44-5b14-4ae8-810a-d62c23301983","resolution":{"observed_at":"2026-05-12T00:56:14.434052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CODI: Compressing chain-of- thought into continuous space via self-distillation","venue":null,"work_id":"4ad8321f-4f49-4bd8-80d0-7eeb2815f6d5","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:4ff267370511c176f4f936a9e36d4a349e627576c348315870ab8ce1063ddf1b","observation_id":"d1d00094-37b6-426c-b03e-a1f5e829b847","resolution":{"observed_at":"2026-05-14T09:28:27.109975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalableimagetokenizationwith index backpropagation quantization","venue":null,"work_id":"00acaded-0831-45c7-be9b-f9e125b90858","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:543266e88c07d759ff96a3170aa1a2f24a63dfe827101f22e7fc473605af0358","observation_id":"f8304efd-5119-48ac-b378-b8122ecca706","resolution":{"observed_at":"2026-05-14T09:28:27.064985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DriveLM: Driving with graph visual question answering","venue":null,"work_id":"7625aad2-c59a-42b4-be3c-77bcac5f94c5","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:0f21dd935621fe35dbe15700c9032cc74dfce29b1c1f5752522fd7f8ebadc329","observation_id":"6f0abdb4-c447-443b-aab4-e40daedde74a","resolution":{"observed_at":"2026-05-14T09:28:27.043786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:8b5c088a6e57264143648c31d5cd2730b1656766bd503ac02847378eee3e2f56","observation_id":"0a79c90d-afd3-4cab-ba58-fcd97b15a62b","resolution":{"observed_at":"2026-05-12T08:36:26.093692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03275","last_updated":"2025-09-01T18:25:38Z","snapshot_observed_at":"2026-08-09T05:15:11.459630Z","submitted_at":"2025-02-05T15:33:00Z","title":"Token Assorted: Mixing Latent and Text Tokens for Improved Language Model Reasoning","version":2},"cited_work":{"arxiv_id":"2502.03275","doi":"10.48550/arxiv.2502.03275","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Token assorted: Mixing latent and text tokens for improved language model reasoning","venue":"ArXiv.org","work_id":"d863e729-c841-4f4e-b283-0b014ed4b795","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2502.03275","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:2ceef8843aac2268482b17850cc2b84d17eb4c4a5baea97dbec9fdb468d66b57","observation_id":"39c8e822-17f8-415c-a770-5d479634be57","resolution":{"observed_at":"2026-05-12T00:56:14.437815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MTVQA: Benchmarking multilingual text-centric visual question answering","venue":null,"work_id":"0819598b-c69e-4dca-a6d9-833fd109b944","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:e13dfb7b29c0c27d34b5c81a593d6f956bc61f6669bfa7b646dd31ac263ac306","observation_id":"5f8407aa-2f0d-434f-98f2-8281dd1c6aaf","resolution":{"observed_at":"2026-05-14T09:28:27.072718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.24497","last_updated":"2026-05-18T09:26:59Z","snapshot_observed_at":"2026-07-31T22:57:41.701920Z","submitted_at":"2025-12-30T22:50:03Z","title":"What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?","version":3},"cited_work":{"arxiv_id":"2512.24497","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.24497","snapshot_observed_at":"2026-07-03T17:08:43.316703Z","title":"What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?","venue":"cs.AI","work_id":"f517d44f-464b-41ec-9bd7-b7dc28c89b5c","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2512.24497","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:a2e4bda6beb039c0fded40b6f1b51924619d5b3b1cfc426166a49bf684b01d7e","observation_id":"1bbfb0b5-56c6-4d27-9c4a-d245529bf937","resolution":{"observed_at":"2026-05-20T00:04:20.071030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.23369","last_updated":"2026-04-10T09:10:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-28T17:17:38Z","title":"SimScale: Learning to Drive via Real-World Simulation at Scale","version":3},"cited_work":{"arxiv_id":"2511.23369","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.23369","snapshot_observed_at":"2026-07-04T01:29:22.366383Z","title":"SimScale: Learning to Drive via Real-World Simulation at Scale","venue":"cs.CV","work_id":"e9d49469-44e1-499b-98e0-38fe71b6335c","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2511.23369","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:47e238d769e3f3b22d19b3641450d4a086229925fba81fe517fbf4355fe25e42","observation_id":"17a0933a-0ce5-4828-ae43-65e7eeeef114","resolution":{"observed_at":"2026-05-12T08:36:26.062231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning and the information bottleneck principle","venue":null,"work_id":"25bd759e-a06c-4118-af55-6b684182269b","year":2015},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:d9cefc9ac52dd58f1a2152e9710f08df7ac8fb713f96454ea0d06d08accdadff","observation_id":"067b5e6b-a2b7-4d3d-874a-9372da15e125","resolution":{"observed_at":"2026-05-14T09:28:27.056894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-07T10:46:08.274157Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":"physics/0004057","doi":"10.48550/arxiv.physics/0004057","metadata_source":"pith","pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The information bottleneck method","venue":"physics.data-an","work_id":"72655a80-0724-45ad-a330-1f4ed7aa613b","year":2000},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:74d946ab3790f23da5a7c97c61b7e7cb161ad881d8587816422913d1b76a926d","observation_id":"e8a6840c-f5d1-4add-9ac5-4920faf1c7bb","resolution":{"observed_at":"2026-05-12T08:36:25.947345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:06.793856+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:06.793856+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs","venue":null,"work_id":"0edd6542-e511-4980-9e60-6fd77660ad79","year":2024},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:09def81865bf0f026152ce534cf20d7ed5faad1b869b6a9d845ac52150a6902d","observation_id":"951ca6c9-148f-41f2-8ae5-843ccaf433da","resolution":{"observed_at":"2026-05-14T09:28:27.143052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IDD: A dataset for exploring problems of autonomous navigation in unconstrained environments","venue":null,"work_id":"5bde0501-5a85-4950-b167-ba01d6944697","year":2019},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:11eeee8a17b22fdabb92d64c416dcd2d0b99977fe39c932e1dbe68da1e0f4122","observation_id":"b755d325-b7f4-46b6-9a6e-32772f023871","resolution":{"observed_at":"2026-05-14T09:28:27.089472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"48b99736-7c46-440b-95c2-1e05ce9ee0ab","year":2017},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:eaf85860491fb30c6635acf6989e7b8936cd810ee6d7ade3fa8c5238f3e889f8","observation_id":"ed3c0551-9ba4-47ff-b39b-92fc18c2c410","resolution":{"observed_at":"2026-05-14T09:28:26.940888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20680","last_updated":"2025-03-26T16:15:42Z","snapshot_observed_at":"2026-08-08T13:06:07.318088Z","submitted_at":"2025-03-26T16:15:42Z","title":"Vision as LoRA","version":1},"cited_work":{"arxiv_id":"2503.20680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20680","snapshot_observed_at":"2026-07-04T03:29:29.127520Z","title":"Vision as LoRA","venue":null,"work_id":"9d714fdb-ba2a-4dbb-b163-2184b8d89b51","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2503.20680","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:970ad728b016409ee5fe57e551137922b481b3029a9e4d8191bd7514638a338d","observation_id":"900348eb-cf57-4efa-927b-84fc5448bae2","resolution":{"observed_at":"2026-05-12T08:36:26.103976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VGGT: Visual geometry grounded transformer","venue":null,"work_id":"f72fe4d4-c0c3-4ecd-a388-751459112aa5","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:44ae80ef4c06bc0566074f3508b4583c54745169295d36e1b78997a74ce245ad","observation_id":"81cfff75-923f-4a2c-914e-a7cdeca2dc19","resolution":{"observed_at":"2026-05-14T09:28:27.016154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":49,"verified_fuzzy":50},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 12 inbound Pith citation observations for arXiv:2604.18486."}