{"as_of":"2026-08-09T16:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8039957fea97c161322dc8bea5ab126204a0840577e957768a5ff4b16e374238","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:37:52.766985Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02428/citation-record","integrity":"/paper/2608.02428/integrity","json":"/paper/2608.02428/citation-record.json","paper":"/paper/2608.02428"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:48.941151Z","title":"Is sora a world simulator? a comprehensive survey on general world models and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:48.941151Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:d2ad58ee9427ce9981811f05b820da7ca27d63a5bad90ab66dd02f71e76cb34c","observation_id":"186a2a23-2b8e-43e3-b77f-e7ba0c440d19","resolution":{"observed_at":"2026-08-04T07:37:48.941151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:49.005193Z","title":"From forecasting to planning: Policy world model for collaborative state-action prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:49.005193Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:46cb6e97ae96b869fb48ce3e68b7d747479e1633b48c975da09c349126b7261e","observation_id":"2cc7b9a8-2075-40ee-9d02-9a2908fe0370","resolution":{"observed_at":"2026-08-04T07:37:49.005193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04453","last_updated":"2026-07-01T06:26:33Z","snapshot_observed_at":"2026-08-05T01:50:41.678211Z","submitted_at":"2026-01-07T23:49:52Z","title":"UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04453","snapshot_observed_at":"2026-08-04T07:37:49.119923Z","title":"Unidrive-wm: Unified understanding, planning and generation world model for autonomous driving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:49.119923Z"},"links":{"cited_paper":"/paper/2601.04453","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:af319b604fbb5f8598a4686a6192c9b987a949e8438ad982c80eaed9c8b82cb6","observation_id":"131bdab0-2221-4cde-ab14-c444d626fefd","resolution":{"observed_at":"2026-08-04T07:37:49.119923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:49.292992Z","title":"Navigation world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:49.292992Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:65a96ca6b925e3c3d6510394cf18e7fc53821384e42e39755c4ff64109797ec3","observation_id":"fa70c894-b89b-498e-93fa-2312c4e24021","resolution":{"observed_at":"2026-08-04T07:37:49.292992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-04T07:37:49.410277Z","title":"Cosmos world foundation model platform for physical ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:49.410277Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:4a01421a84a7f5efb9d232240f520decf4a9a12c3d20bf2d50d42867933e1b19","observation_id":"ce3fb325-5b40-463c-8201-b845a683ad6d","resolution":{"observed_at":"2026-08-04T07:37:49.410277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09042","last_updated":"2025-06-18T17:37:28Z","snapshot_observed_at":"2026-08-07T04:54:23.914784Z","submitted_at":"2025-06-10T17:58:17Z","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09042","snapshot_observed_at":"2026-08-04T07:37:49.565620Z","title":"Cosmos-drive-dreams: Scalable synthetic driving data generation with world foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:49.565620Z"},"links":{"cited_paper":"/paper/2506.09042","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:116ede41577eeef30a4f8ce020896d38af3a535d7b255931230b3566a164a3ac","observation_id":"cc3c1832-d803-4ae1-bc95-ca546f07182a","resolution":{"observed_at":"2026-08-04T07:37:49.565620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-07-06T20:59:00.415760Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-08-04T07:37:49.707640Z","title":"Gaia-2: A controllable multi-view generative world model for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:49.707640Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:f233a5ad53b8b2ff2fae7513317a9be5f895c08e47040b3f02335b226cd3b2a4","observation_id":"27346d5f-f09f-49fa-96f2-eb7790bd1b99","resolution":{"observed_at":"2026-08-04T07:37:49.707640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:49.930211Z","title":"Papnet: Point-enhanced attention-aware pillar network for 3d object detection in autonomous driving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:49.930211Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:a2391e5f4b873605081bed8d06b1fe0394cef6d28e1573982b4e6e3f40dff20c","observation_id":"648280ea-38f0-48b3-a361-ae03ca577adb","resolution":{"observed_at":"2026-08-04T07:37:49.930211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:50.091891Z","title":"Rangevit: Towards vision transformers for 3d semantic segmentation in autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.091891Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:0818e28cc82645fc89269f0c3828178182eded7831183a9187646a0b762155e1","observation_id":"39e862fc-7e7f-40b9-b30c-9c22a0e3470f","resolution":{"observed_at":"2026-08-04T07:37:50.091891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:50.259959Z","title":"World4drive: End-to-end autonomous driving via intention-aware physical latent world model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.259959Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:4e0ae8456da4786c0d8f39dd614177386a78f21cf64e390bb0ed40af7c3ab68c","observation_id":"b270b5b7-f5c4-4e9d-8963-40180412db77","resolution":{"observed_at":"2026-08-04T07:37:50.259959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22032","last_updated":"2026-07-02T16:34:59Z","snapshot_observed_at":"2026-08-06T13:47:02.411226Z","submitted_at":"2026-01-29T17:39:20Z","title":"Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22032","snapshot_observed_at":"2026-08-04T07:37:50.369679Z","title":"Drive-jepa: Video jepa meets multi- modal trajectory distillation for end-to-end driving,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.369679Z"},"links":{"cited_paper":"/paper/2601.22032","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:d14b9b1895a1f0a8d88b205b8f1a53785d23656478db2adb34e8f486e7df5b8f","observation_id":"2896cac7-4fee-4fb9-a8b0-71d466b535b2","resolution":{"observed_at":"2026-08-04T07:37:50.369679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:50.430845Z","title":"Dino-wm: World models on pre-trained visual features enable zero-shot planning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.430845Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:c10c7afd771b1de7246ef3e4d38fed9d006017223c7f1356c2187f1ed8cc6d4a","observation_id":"f06ccd4b-de75-4a72-9951-6006519f6595","resolution":{"observed_at":"2026-08-04T07:37:50.430845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:50.507001Z","title":"DINO- foresight: Looking into the future with DINO,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.507001Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:fd7194a657fc83ea04874cd56e4bfd95b7be5ce00f9151da710bd0045cc73f28","observation_id":"56313a77-e758-456f-b681-293bcfe8bcb8","resolution":{"observed_at":"2026-08-04T07:37:50.507001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:50.600217Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.600217Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:db36a7b1edb91868ecbf7f44cb1f732bdae86dd64a6677e2206b55c290eaa495","observation_id":"b92d944f-a12c-4ecd-9976-1da96a3237c8","resolution":{"observed_at":"2026-08-04T07:37:50.600217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-04T07:37:50.703618Z","title":"Siglip 2: Multilingual vision-language encoders with improved se- mantic understanding, localization, and dense features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.703618Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:49315eeb477831bea98c81b4a81e2a727db9754efd64517e2b7e8de71eef9f74","observation_id":"14058d42-75b2-4a61-b57f-b8e14a53f9bb","resolution":{"observed_at":"2026-08-04T07:37:50.703618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T07:37:50.800143Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.800143Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:5a137568c1310fafe4f5cf63a8edfcb03c73463a7894090a5042e0f6c2d4e462","observation_id":"66cee00a-2d3a-4249-b5cd-ba832ab18acc","resolution":{"observed_at":"2026-08-04T07:37:50.800143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:50.859990Z","title":"Your vit is secretly an image segmentation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.859990Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:f0e26536cdf8f17d96442c4a6f1fea9789f037a3286e15a9c8420f1b9fc26d06","observation_id":"02cfa85e-497b-4e80-8f76-abafaa435f1b","resolution":{"observed_at":"2026-08-04T07:37:50.859990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T07:37:50.940877Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:50.940877Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:b4d489150bf535e6bede7e877f3a09e881b89fdc37cfe73896b055fea20d5514","observation_id":"eba085e4-cafb-4382-a145-f0043ff939a6","resolution":{"observed_at":"2026-08-04T07:37:50.940877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-04T07:37:51.032181Z","title":"Sim ´eoni, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.032181Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:49d962e55a93cf0433d3b3d4c4e6d3e60abe79b9894977badd7336816dcfb41b","observation_id":"e5074253-cbf7-4306-8a76-45ba9b8fcd8b","resolution":{"observed_at":"2026-08-04T07:37:51.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:51.059306Z","title":"VidEoMT: Your ViT is Secretly Also a Video Segmentation Model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.059306Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:6b1ca7ccdf4590020a9b2cea6575f07e10938e8a7cd1ffed12ca3bd8fa99f57d","observation_id":"5c4ee577-8338-46ec-a2b0-49d6a4723b12","resolution":{"observed_at":"2026-08-04T07:37:51.059306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:51.160164Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.160164Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:b6acdc633441b71da5fec376e9daa6206e24f87dc9c8dd45c2790086a11b4af8","observation_id":"20572376-4210-4451-b448-23d092f7de82","resolution":{"observed_at":"2026-08-04T07:37:51.160164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:51.285905Z","title":"Foundation models defining a new era in vision: a survey and outlook,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.285905Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:4e30f7df0010c34ad9dc3e2dc57db8417a41a985cfa83eb18b3b1da2131ab1a8","observation_id":"e8be8905-e98f-424b-be40-df157cfd5888","resolution":{"observed_at":"2026-08-04T07:37:51.285905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:51.345145Z","title":"Foundation models in robotics: Applications, challenges, and the future,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.345145Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:40196d1947db4524e6e4590d8c89a7d4412000bb520829bd26dbf6cd23c11be6","observation_id":"3d9fb360-14d5-4cd7-b8c4-93a4594c3def","resolution":{"observed_at":"2026-08-04T07:37:51.345145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-04T07:37:51.419498Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.419498Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:47c97df2c4edc64b9766c2acc6cdc440a56353d50f7c2345a5e057d4d1b8e942","observation_id":"8d3841eb-dbb5-4492-97c8-7e0a966053db","resolution":{"observed_at":"2026-08-04T07:37:51.419498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-04T07:37:51.489561Z","title":"Cogvideox: Text-to- video diffusion models with an expert transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.489561Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:879ca788cd1d0c10cc5fdd37eefeb6014da8c5dd18a8f9f1390b8884374cf4c5","observation_id":"e073ed10-c6a1-4093-a087-c8cea657f839","resolution":{"observed_at":"2026-08-04T07:37:51.489561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:51.534986Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.534986Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:66eba6365a174e72023846ed81c8a80c5a02824f1fa0f0dc673149d61f2413e7","observation_id":"9c051329-6f74-424d-926a-d9f90e508d3e","resolution":{"observed_at":"2026-08-04T07:37:51.534986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:51.646231Z","title":"Flexible diffusion modeling of long videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.646231Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:25dcb03e426c447b63e5fc9d517d432a0f0ebcc968bc2514cfa9693529e6e466","observation_id":"9d28637c-e827-4fd2-ac12-05791a0d76a9","resolution":{"observed_at":"2026-08-04T07:37:51.646231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:51.729779Z","title":"Genad: Generative end-to-end autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.729779Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:a28552d9fdacd4384bf64e8d3b78dc2b65a6353cbb6e91f29b7a566b22852b20","observation_id":"ac7227ca-59c3-4df2-a955-66afc87d4762","resolution":{"observed_at":"2026-08-04T07:37:51.729779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02914","last_updated":"2024-11-05T08:58:35Z","snapshot_observed_at":"2026-07-06T19:45:25.884330Z","submitted_at":"2024-11-05T08:58:35Z","title":"Exploring the Interplay Between Video Generation and World Models in Autonomous Driving: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02914","snapshot_observed_at":"2026-08-04T07:37:51.814110Z","title":"Exploring the interplay between video generation and world models in autonomous driving: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.814110Z"},"links":{"cited_paper":"/paper/2411.02914","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:65fffcb11917e1b4b1dfa4168ba69af35b7db8cdc732280188c92a7446ee88d1","observation_id":"39382166-091b-4305-a21c-ea7da2bc752c","resolution":{"observed_at":"2026-08-04T07:37:51.814110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:51.953583Z","title":"Sparseworld: A flexible, adaptive, and efficient 4d occupancy world model powered by sparse and dynamic queries,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:51.953583Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:a4fff3b3d6a7c1763c0e01df16028e09c7f3c0f4e982859af99fc171973babb6","observation_id":"9f5340d4-6a5f-45d5-8269-59a96039d752","resolution":{"observed_at":"2026-08-04T07:37:51.953583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-04T07:37:52.070987Z","title":"V-jepa 2: Self- supervised video models enable understanding, prediction and plan- ning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.070987Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:8391960d0cb45891a554484a6f1fcbc0ba444f56a01034a2f13071f400d2b6e4","observation_id":"7fe7ef4a-ecb2-4bd3-9325-e8fade54c132","resolution":{"observed_at":"2026-08-04T07:37:52.070987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-04T07:37:52.079989Z","title":"Mastering diverse domains through world models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.079989Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:0533072f85259a864bc665757e48984cd26e17bd333ddc5d4c074af1f26b30cf","observation_id":"cb116a4a-689d-4dc0-96f9-26e0c3e361f3","resolution":{"observed_at":"2026-08-04T07:37:52.079989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:52.164064Z","title":"Learning multiple probabilistic decisions from latent world model in autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.164064Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:6a333e02c26f20ffc7dc22ff83ec97e1c988eaa02e9b1b0ef0b6d1c847c65517","observation_id":"63f839a9-3227-489f-8cd8-d21f849c0b81","resolution":{"observed_at":"2026-08-04T07:37:52.164064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:52.260185Z","title":"En- hancing end-to-end autonomous driving with latent world model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.260185Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:e9b59fe6f1869eef44c23e7d949b215280b3fd2782445749ef263a6d93a55fe7","observation_id":"db90f43d-da98-4b1b-b873-72991d704605","resolution":{"observed_at":"2026-08-04T07:37:52.260185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-08T15:35:43.235215Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19468","snapshot_observed_at":"2026-08-04T07:37:52.354911Z","title":"Back to the features: Dino as a foundation for video world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.354911Z"},"links":{"cited_paper":"/paper/2507.19468","citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:53c7e6a1f2d4a245d2fd64007472929329c08740bc723a3cf4bd0fe61d234072","observation_id":"291abc56-8acb-4515-949a-231de4f18a6e","resolution":{"observed_at":"2026-08-04T07:37:52.354911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:52.440924Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.440924Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:191a2e6264251d05154f75cb63f9e1710776055d510864ce028f957ce13bb9d1","observation_id":"d382ffc2-61bf-4a00-ad56-b93ceae4b7b7","resolution":{"observed_at":"2026-08-04T07:37:52.440924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:52.509526Z","title":"Masked-attention mask transformer for universal image segmenta- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.509526Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:db3bb736722123418e62fac7c6049b51590c9010be7ca2f34133b4d886740578","observation_id":"beb1c34a-58c1-4cba-ade5-311a1419803e","resolution":{"observed_at":"2026-08-04T07:37:52.509526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:52.581329Z","title":"Robust estimation of a location parameter,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.581329Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:74f45f0224980cdb3a4e99ffd12a9edcbfa3283e25ff95edb89d63e55111c073","observation_id":"73532753-6d5f-4901-b0ea-7fe63580cddb","resolution":{"observed_at":"2026-08-04T07:37:52.581329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:52.636457Z","title":"Matrix: An advanced simulation platform that integrates mujoco, unreal engine 5, and carla,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.636457Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:7ae273e025262bd58af2bc756d45d7e334fcb9584db1e31cc5a10032acc089c6","observation_id":"8d4d1412-7eb7-4ebe-83cd-871cfa6b165f","resolution":{"observed_at":"2026-08-04T07:37:52.636457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:52.715324Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.715324Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:b229799a3005cd5d8320711ddd102859411d3cd79cd10e40929526bf688dcea9","observation_id":"d8a91aed-c026-474a-bc3f-ad7ab5b0151d","resolution":{"observed_at":"2026-08-04T07:37:52.715324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:37:52.766985Z","title":"Viplanner: Visual semantic imperative learning for local navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T07:37:52.766985Z"},"links":{"citing_paper":"/paper/2608.02428"},"observation_digest":"sha256:a6fbaf48f2212cca300003bd71e655609cb2feae1628e280a529ee5f22c33cf8","observation_id":"43f59941-1fb2-40ca-b9bd-f0aec09ccabd","resolution":{"observed_at":"2026-08-04T07:37:52.766985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02428","last_updated":"2026-08-03T16:08:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T06:08:49.677115Z","submitted_at":"2026-08-03T16:08:59Z","title":"DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.02428."}