{"as_of":"2026-08-08T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e265de20ef55de967662ef74eff985d20de68a02b0342c659ad62a4fe2dca687","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:08:54.630490Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T06:04:23.964735Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:04:21.611097Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09144","snapshot_observed_at":"2026-08-05T06:04:23.964735Z","title":"I2-World: Intra-inter tokenization for efficient dynamic 4D scene forecasting.arXiv preprint arXiv:2507.09144, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-07T09:38:31.708978Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-08-05T06:04:23.964735Z"},"links":{"cited_paper":"/paper/2507.09144","citing_paper":"/paper/2509.07996"},"observation_digest":"sha256:3f28977f740318c937ac72ba90bc16fd3a5194a39791d025173bbcb5f9e58608","observation_id":"6e1c4be7-4d62-43e7-9758-7e2c00ad752c","resolution":{"observed_at":"2026-08-05T06:04:23.964735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"cited_work":{"arxiv_id":"2507.09144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09144","snapshot_observed_at":"2026-06-30T06:04:21.611097Z","title":"I 2-world: Intra-inter tok- enization for efficient dynamic 4d scene forecasting","venue":null,"work_id":"f5901678-8fcd-42aa-9397-0a6fc864293a","year":2025},"citing_paper":{"arxiv_id":"2511.22039","last_updated":"2026-04-14T12:13:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-27T02:48:45Z","title":"SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T05:26:34.859975Z"},"links":{"cited_paper":"/paper/2507.09144","citing_paper":"/paper/2511.22039"},"observation_digest":"sha256:387d523536d5241571e6d7a35e00edd714448194e07c1c9f34673b370c4fed7f","observation_id":"f43675e7-76f5-40d7-a1c2-e3fcd4bb03a6","resolution":{"observed_at":"2026-05-17T05:29:05.040869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"cited_work":{"arxiv_id":"2507.09144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09144","snapshot_observed_at":"2026-06-30T06:04:21.611097Z","title":"I 2-world: Intra-inter tok- enization for efficient dynamic 4d scene forecasting","venue":null,"work_id":"f5901678-8fcd-42aa-9397-0a6fc864293a","year":2025},"citing_paper":{"arxiv_id":"2606.30421","last_updated":"2026-06-29T15:05:41Z","snapshot_observed_at":"2026-08-05T02:53:09.232634Z","submitted_at":"2026-06-29T15:05:41Z","title":"OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T05:59:20.898830Z"},"links":{"cited_paper":"/paper/2507.09144","citing_paper":"/paper/2606.30421"},"observation_digest":"sha256:576e3d049649e53fd2bd31f52eddbf224ea02c558b4c6a29b10b6548e8b736b8","observation_id":"e607822e-c87d-47a0-b335-f9067297f13b","resolution":{"observed_at":"2026-06-30T06:04:21.612613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09144/citation-record","integrity":"/paper/2507.09144/integrity","json":"/paper/2507.09144/citation-record.json","paper":"/paper/2507.09144"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:08:48.426576Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:48.426576Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:a1d1e8e1988a4f981517cef93b7854b31c8dbd291b9149a6d0bb96668631ab36","observation_id":"2bbb9c59-7659-4e8c-b65c-7d0c19f7301d","resolution":{"observed_at":"2026-08-06T18:08:48.426576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.982450Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":"a0549908-ab89-43b6-a5f8-5a69cb7897bc","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:48.668292Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:56649ce8199a66f5e8aa3c4a0dacba437df9f2fbfd9611e52aed0e4321722706","observation_id":"66e84cc4-ba7a-4fea-87e8-4649dd5ce474","resolution":{"observed_at":"2026-08-06T18:09:05.081203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.750874Z","title":"V-jepa 2: Self- supervised video models enable understanding, prediction and planning","venue":null,"work_id":"3aab61a8-d256-459f-afe3-27df60068bbd","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.219446Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:eeba7c8d1103525d2aa6006107d88c6b275d585890331cd96dadbc1dfe33beae","observation_id":"965e659d-8f89-4c29-a8c4-1a91d51690e3","resolution":{"observed_at":"2026-08-06T18:09:04.858535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.513161Z","title":"Semantickitti: A dataset for semantic scene understanding of lidar sequences","venue":null,"work_id":"9403bb85-c882-4aeb-80c9-cf062876f14c","year":2019},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.517326Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:006efef5039e6fc8e35af963606fd406ccb80dae526a3eae2049ec25862e3c66","observation_id":"e18bab8f-8330-4d94-b8d7-08db64eae7e1","resolution":{"observed_at":"2026-08-06T18:09:04.637797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.274416Z","title":"The lov ´asz-softmax loss: A tractable surrogate for the optimization of the intersection-over-union measure in neural networks","venue":null,"work_id":"85259d81-957d-4225-a587-8d9de7b56baa","year":2018},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.609521Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:7a0780b2e241cd00e8e84c71e7c635e6cd4bc367a66605393f81031eecda260a","observation_id":"d138711c-cb41-429a-806c-385803b99432","resolution":{"observed_at":"2026-08-06T18:09:04.395568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:04.021415Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gi- ancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"48ceb51f-9062-4103-9a81-f1f876dd66ed","year":2020},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.711273Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:c9af2741aa29a57c850cfc508f1497fa3ef08c2f78dd62fd7c06e58365995815","observation_id":"222df20f-8547-4aaf-8c8a-44d37659da11","resolution":{"observed_at":"2026-08-06T18:09:04.147704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.897907Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"89938f5a-b805-40a2-ba1d-cc13dc3292a8","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.808930Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:4539a90f5ed846fb3aba2a01ba9affd57a555998b5ba32eeb54b7ee5b6e54a0e","observation_id":"30610dcb-f2ad-4225-ae5c-3319f977822f","resolution":{"observed_at":"2026-08-06T18:09:03.950736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.770001Z","title":"A survey of world models for autonomous driving","venue":null,"work_id":"96537b4a-4d62-47d0-b488-500b33563660","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.879554Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:ad236d0be9a14386042e60871dc15698907d34f9e5b369b327fe720c65b35fd5","observation_id":"6cb1d39a-9ec5-4da8-959d-fbb62f2def67","resolution":{"observed_at":"2026-08-06T18:09:03.829784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.625246Z","title":"Magicdrive: Street view generation with diverse 3d geometry control","venue":null,"work_id":"32c2a0f1-b837-4f80-a264-18b64c0a15c7","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:49.965754Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:b222ad133d68a3cf9b56415387f2f29dea739d386c47cfcde08e7e1aafbe2fe2","observation_id":"69a33bb2-4a40-43c9-bddf-56f726d7088d","resolution":{"observed_at":"2026-08-06T18:09:03.709724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.484517Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":"b5539680-acb6-48c6-a6bd-f9cca9bfbc84","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.039181Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f38cd627e8a464b4160a8832b6b8c80d0719c8bb9d02ced22a29847ee3fd213e","observation_id":"65c97ca3-6e9a-4349-a51e-cf2bedf367a4","resolution":{"observed_at":"2026-08-06T18:09:03.536278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10429","last_updated":"2024-10-14T12:24:32Z","snapshot_observed_at":"2026-08-07T21:31:53.134914Z","submitted_at":"2024-10-14T12:24:32Z","title":"DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10429","snapshot_observed_at":"2026-08-06T18:08:50.127134Z","title":"Dome: Tam- ing diffusion model into high-fidelity controllable occupancy world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.127134Z"},"links":{"cited_paper":"/paper/2410.10429","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:aa53bb515f060d82d5457ee05044defe6baef430c13b7cd74a8a557e39b065ed","observation_id":"69b499b6-93b8-40fa-9686-373f74471843","resolution":{"observed_at":"2026-08-06T18:08:50.127134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-06T18:08:50.235191Z","title":"Bevdet: High-performance multi-camera 3d object detection in bird-eye-view","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.235191Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:5c9569faa0daef75cf99112f4caeacc39623e95650f92c802ef69dbd1a3faaea","observation_id":"b62e77aa-7eca-46f6-9bce-74fd1ac180f8","resolution":{"observed_at":"2026-08-06T18:08:50.235191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.346437Z","title":"Tri-perspective view for vision-based 3d se- mantic occupancy prediction","venue":null,"work_id":"3a02e0f0-5afe-4e6d-869d-bf2437af774b","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.317153Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:8568054bd1c20e4f3d64b1c3706dd89e4b1fce27b1729ce62b6f1430ed344876","observation_id":"b5f1f833-cbcc-475b-80a4-ec8076d79f0e","resolution":{"observed_at":"2026-08-06T18:09:03.399408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.219928Z","title":"Differentiable raycasting for self- supervised occupancy forecasting","venue":null,"work_id":"20ee0254-49f4-4f59-a94b-c6bb49fcce8e","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.393125Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:267e835688f147998f42a1ace61e32bd678614a3762d16671851b93fc1a7c74e","observation_id":"2f1c8941-a1f8-45af-8b68-6128e989fd7c","resolution":{"observed_at":"2026-08-06T18:09:03.272688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:03.066990Z","title":"Point cloud forecasting as a proxy for 4d occupancy forecast- ing","venue":null,"work_id":"f6c8980d-6f91-46f9-b7d8-fe9f9ac128b5","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.493807Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:62f331fe255cb45b0b504622277c4045527e777473195dfe1c03b2d8d28bd396","observation_id":"743d97d8-8b93-4b63-979b-e20815fa1e63","resolution":{"observed_at":"2026-08-06T18:09:03.143906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:02.879628Z","title":"Pointpillars: Fast encoders for object detection from point clouds","venue":null,"work_id":"0aca508b-a4f4-4fa8-96f6-206763a8fbde","year":2019},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.560096Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:d99734d987e35430372511ddf72c359c74fe74b9b25a5b481a5b8cab91ca7286","observation_id":"c08a5008-6392-4e0e-8251-69842482cb4c","resolution":{"observed_at":"2026-08-06T18:09:02.998009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:02.660959Z","title":"Autoregressive image generation using resid- ual quantization","venue":null,"work_id":"01c09c9e-81a1-4253-b79a-4b60a856c4bd","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.633261Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:27844a222d6955d49fefffcc013fc7b95a956c1e2e84f2690ef5657b35b0fee4","observation_id":"82b2bad3-c536-47cb-a5b6-92c6fa2c0a5d","resolution":{"observed_at":"2026-08-06T18:09:02.760488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:02.349012Z","title":"Uniscene: Unified occupancy-centric driving scene generation","venue":null,"work_id":"1096766c-223d-4c4b-8f0c-69f645712d8b","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.728848Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:6ba170e8e0a2fd02f1ad08824ddbbe1b25d921f12327b27d4bed201bca3fcb7c","observation_id":"7f6b9285-69a5-400f-b4d2-06beacf22cbe","resolution":{"observed_at":"2026-08-06T18:09:02.498928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:02.127565Z","title":"Bevstereo: Enhancing depth estimation in multi-view 3d object detection with temporal stereo","venue":null,"work_id":"e108f24a-dd83-46a9-a833-0fc5508acd96","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.823568Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:406dea6d22d61418437325064b7087a524bf04ef538a77ba6de349710d3a9ce0","observation_id":"7e130820-8fb4-4571-98c5-9f8758968697","resolution":{"observed_at":"2026-08-06T18:09:02.228951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.886756Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detec- tion","venue":null,"work_id":"ea500ee0-016e-451d-9a63-aabc5f760f37","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:50.919951Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:c6fd5ea2f3d044c7dd4d4e01a0aa847a753bb63ca6f59e86200a4546b345de0d","observation_id":"a25f3e61-c40e-45d0-b959-15d23045e2b6","resolution":{"observed_at":"2026-08-06T18:09:01.997157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.639590Z","title":"V oxformer: Sparse voxel transformer for camera- based 3d semantic scene completion","venue":null,"work_id":"4eadb069-47b6-4112-80b1-b09558a33112","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.017115Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:92d29c462a4a283643855c5ec46b6da3b5afedb0cfbd6f41445bc39c09045b36","observation_id":"34ebb596-8c32-4c92-a71f-dd79da3ea0dd","resolution":{"observed_at":"2026-08-06T18:09:01.753154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.440073Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"a03ba8c9-ce26-48ca-a659-5cc8a7bf577a","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.104435Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:eb3ee059fb0e67e519380fc05b1fec8ba758898e6457a47a9ed007b28eebaf93","observation_id":"e88a43db-e0d1-4b78-90db-45eeeac41333","resolution":{"observed_at":"2026-08-06T18:09:01.507827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.298223Z","title":"Fb-occ: 3d occupancy prediction based on forward-backward view transformation","venue":null,"work_id":"9190872d-ec48-4dc3-9cb2-328f347a3155","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.303891Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:391a0f326bc494167a57a027f71d8387cf9865f7f330eba89a7b710a405963a2","observation_id":"54451612-7eee-4b13-af85-73dd2aa7caf2","resolution":{"observed_at":"2026-08-06T18:09:01.369519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:01.112497Z","title":"Stcocc: Sparse spatial-temporal cascade renova- tion for 3d occupancy and scene flow prediction","venue":null,"work_id":"13cbf885-bf4e-4b20-b59c-bd8402602791","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.531927Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:873f7bd2604e9767ab227e7ed1ae8e7b9b09b6eb96f0862688a6c36aa663ae13","observation_id":"83c3227f-c3fe-448b-b16c-bac86c11e6c0","resolution":{"observed_at":"2026-08-06T18:09:01.219357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.888812Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":"fb619188-46ca-492a-895e-c3481bda18aa","year":2017},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.706309Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:4d996bd21a0b18ed9d60cbb95c0e5ae5f75ceca384541f4296a879252b894896","observation_id":"d1d715e2-b9ae-429c-9bdd-dd3b1685f073","resolution":{"observed_at":"2026-08-06T18:09:00.962012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.745465Z","title":"Sparsebev: High-performance sparse 3d object detec- tion from multi-camera videos","venue":null,"work_id":"7ad4f431-3272-4370-9e2b-3c211598c4cc","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:51.885899Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:ba91bd8b58808efc9121385430e19bf7fa6d93976b19218fa3071865ad51a273","observation_id":"61e59656-1b88-428f-ae1e-98855dbfa616","resolution":{"observed_at":"2026-08-06T18:09:00.821938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:08:52.036255Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.036255Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:517b1c2407fa0fa30fde9f47f969325217ce8e1a348f8b1bf6f07ced1a887402","observation_id":"25fc74c4-001e-41fb-a08d-66a1b61921aa","resolution":{"observed_at":"2026-08-06T18:08:52.036255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.550663Z","title":"Self-supervised point cloud prediction using 3d spatio-temporal convolutional networks","venue":null,"work_id":"be9dcd70-18d2-4e8f-866c-a6316c5a891a","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.184670Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:fe5380783522deccf31f528154a68c449d0b29abbb68d392724a59399c87a5b3","observation_id":"6f43300d-16b0-4564-9856-629564ac49a0","resolution":{"observed_at":"2026-08-06T18:09:00.628992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.361226Z","title":"Uniworld: Autonomous driving pre-training via world models","venue":null,"work_id":"1298180a-ac2f-4bcf-afed-6a6fa19985bf","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.361405Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f7df935f0ab9c16b6ca391b6459ac6e275b096c77ea473f1bd8d6296af9eef45","observation_id":"f9f9068e-3c70-45fa-9962-bfbf5778fb65","resolution":{"observed_at":"2026-08-06T18:09:00.442668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.208589Z","title":"Driveworld: 4d pre-trained scene understanding via world models for autonomous driving","venue":null,"work_id":"74551087-56e8-4b02-8eb5-d530e86b28b0","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.433606Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:5ab6f513a9554de0ae58825e47f4dc6d1703aff3792051b7eb29b8c5e1cbb931","observation_id":"8ec25494-0bef-441c-8f0e-d8bd45c3547c","resolution":{"observed_at":"2026-08-06T18:09:00.271810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:09:00.054867Z","title":"Renderocc: Vision- centric 3d occupancy prediction with 2d rendering supervi- sion","venue":null,"work_id":"85dd592f-b968-43ec-b88b-0d606d945d8c","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.515304Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:ac86eb1b919e4e826940bf98892321f114849f69f6338c821f3d371fa41047b8","observation_id":"f7c78b6c-5e7a-49f7-8015-1e195d58c065","resolution":{"observed_at":"2026-08-06T18:09:00.141947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.842808Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"f1a07400-a9cd-4833-832a-f7316f1a3544","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.559195Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:42c9e863aeaed8ca5d750f2e11e80b9a7f92ac721191f6908c17cf51e3d8b4e7","observation_id":"0adca95e-b7c8-49ec-951c-7a4af22a493d","resolution":{"observed_at":"2026-08-06T18:08:59.939166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.715175Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":"6e075b0a-114f-4767-b0ae-b27e588e53ed","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.612080Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:aa7fccdc3e08e7274b7b4401824f1a32c468501c69f2cefe92189eaa46a5dde7","observation_id":"d14a39b2-6cb5-430b-8cf1-ec119baabb23","resolution":{"observed_at":"2026-08-06T18:08:59.761346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.670827Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.670827Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:a0f3ae1ea84e7429a30b125e12a142c053eb76af8f67f3dd31afacb1a5a06f79","observation_id":"33feea60-fcd3-4d54-a652-beae61e9d8bd","resolution":{"observed_at":"2026-08-06T18:08:52.670827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.576120Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"a1f9cfcb-9592-44a7-9101-57cf68d48e1b","year":2022},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.708980Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:af2267c95e0aa54df451a329f15c2f2a7a21d2938d452dc0aa8a89356b2057fb","observation_id":"099d5316-3ec0-4356-8e00-1c683c10e7b3","resolution":{"observed_at":"2026-08-06T18:08:59.640948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.426299Z","title":"Pointr- cnn: 3d object proposal generation and detection from point cloud","venue":null,"work_id":"2708be7b-ec0e-4f14-b790-f9ffce75ca28","year":2019},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.840969Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:c743b2a8e165c6fdc8bb5e96e182bbf5c763f0be9659f61cda3b8cfceb30f757","observation_id":"56daf1cb-2efe-4f22-b982-5708c729dd9b","resolution":{"observed_at":"2026-08-06T18:08:59.534102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.274799Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"1f9156a7-f69e-48db-ba93-bbad8b5e5134","year":2020},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:52.948765Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:4d683ec984c433eca2ba96b47065e2475f58b1d45adf5c10923047a71dac64ab","observation_id":"db5da3c2-a0fa-45ce-833e-f30d6135bdf8","resolution":{"observed_at":"2026-08-06T18:08:59.360467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.154054Z","title":"Vidtok: A versatile and open-source video tokenizer","venue":null,"work_id":"48cc607e-39d9-4c68-b403-fe7548d322c2","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.006460Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:1a2a586bdbf9e2b1019e95492838a890a35ad32bda234b8dc40742c46a6fef6c","observation_id":"57067620-3d17-407b-aae0-014d1c8ded3f","resolution":{"observed_at":"2026-08-06T18:08:59.215295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:59.011776Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"a1aef2f9-e7e4-47bb-846c-52fa1941037c","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.053424Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:38c6af4de601e8cbab5617f5f6ee670583cf68ab1af43cc0523a05929040d58e","observation_id":"7a74403d-91a4-4a80-bb60-32c6fa72906d","resolution":{"observed_at":"2026-08-06T18:08:59.073376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.840947Z","title":"Occ3d: A large-scale 3d occupancy prediction benchmark for au- tonomous driving","venue":null,"work_id":"eb6bc198-54ad-44b0-9f92-c14bae9ef267","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.176555Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:31f0ee9204546d0539832900e0285cf0106486835a11654c67eeec35f79e50b4","observation_id":"21565967-1c02-42c9-b6fc-a13e8aad039d","resolution":{"observed_at":"2026-08-06T18:08:58.911047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.670854Z","title":"Neural discrete representation learning","venue":null,"work_id":"00814ac3-9983-4917-8c7c-337f1a122ef0","year":2017},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.240006Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:28bb845b5209260471c5948c51418696a68d0fb567e10a9bde687c0cb3121f75","observation_id":"099436e3-04e4-439d-aa0b-bce8c8bed48a","resolution":{"observed_at":"2026-08-06T18:08:58.743975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.542548Z","title":"Attention is all you need","venue":null,"work_id":"c2a7e5e0-8fa3-4a1e-9c62-5aeb4e041834","year":2017},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.315105Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:ec9349fc10a43875998645e0deca47f733a78303b9b3d15c9eb71c45d48c6a1b","observation_id":"04e126c0-afaa-4328-ac32-2f3c4c46b1d5","resolution":{"observed_at":"2026-08-06T18:08:58.609298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.395322Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":"e50fc7d3-ff41-4739-b9b7-1275c2d66d24","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.386792Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f8e4e156dc2831b881d1851d5fd67ebf9735effe29b4d88f864ff9543bbd8854","observation_id":"bccb78db-3114-4aa3-abae-3579711fe1bc","resolution":{"observed_at":"2026-08-06T18:08:58.452120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20337","last_updated":"2024-05-30T17:59:42Z","snapshot_observed_at":"2026-08-02T21:48:22.210406Z","submitted_at":"2024-05-30T17:59:42Z","title":"OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20337","snapshot_observed_at":"2026-08-06T18:08:53.539429Z","title":"Occsora: 4d occupancy generation models as world simulators for autonomous driv- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.539429Z"},"links":{"cited_paper":"/paper/2405.20337","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:7665a8ba0be4c9b9723d9bf326a9faa142562bda4bbb190316da2c9b4f4a2c9a","observation_id":"f459aa87-5b1d-4d6e-9b2d-05fce9a823b5","resolution":{"observed_at":"2026-08-06T18:08:53.539429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.255244Z","title":"Drivedreamer: Towards real-world- drive world models for autonomous driving","venue":null,"work_id":"95caf110-7b88-4cf7-a394-929fe678ac7a","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.625583Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:330b24380bd2dc099c2364bfbca0990615fd345629e27f7bed9fbfece05e4f15","observation_id":"c7f01f57-31fe-47f7-9af9-073e815af061","resolution":{"observed_at":"2026-08-06T18:08:58.317739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:58.120123Z","title":"Occllama: An occupancy- language-action generative world model for autonomous driv- ing","venue":null,"work_id":"ec424f52-b60a-4d48-8293-2abaaf89506c","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.699531Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:3639f06ee2e1f1c0b8e0cad7f0b4e101bb43ea524d2a43699b825b4f6e70458b","observation_id":"110888b1-8ef1-485e-afcd-c52478dc0446","resolution":{"observed_at":"2026-08-06T18:08:58.179254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:57.923971Z","title":"Inverting the pose forecasting pipeline with spf2: Sequential pointcloud forecasting for sequential pose forecasting","venue":null,"work_id":"24b0b340-f1fb-4568-9510-948e1ee54c51","year":2021},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.809724Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:4e03af3d6b1db8cd0771c1b694dc8bc9781f40da0b9f61bc671c84d833e29efb","observation_id":"e8361453-a2cb-467a-aabb-d712ebffad80","resolution":{"observed_at":"2026-08-06T18:08:58.033467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:57.730872Z","title":"ivideogpt: Interactive videogpts are scalable world models","venue":null,"work_id":"78a8a6be-7c1e-4a8b-ba6b-3661af4d5a73","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:53.915478Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:ff282fed464a71fe7c1bf1a3b605a535d6d7c2fb841b6b8311d0475cc07d3f78","observation_id":"a4e81d92-c85a-463c-8ed0-9110de2c7fff","resolution":{"observed_at":"2026-08-06T18:08:57.800415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:57.582581Z","title":"Occ-llm: Enhancing autonomous driving with occupancy-based large language models","venue":null,"work_id":"cfd05ca6-f2da-4c0f-9d09-408d59e4af3a","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.001361Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:281c78e87ef13182b946ff2f2a4a5fc3e2893ea203cecd59f16d2e263fa3b4ed","observation_id":"3c105349-79a2-4657-a197-2c3e912ed02a","resolution":{"observed_at":"2026-08-06T18:08:57.655793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:57.272610Z","title":"Videogpt: Video generation using vq-vae and transform- ers","venue":null,"work_id":"b8a15772-9244-4b84-8c5f-26c1a78683c6","year":2021},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.064863Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:c7a97fe7135de295d72fa33022969cc76e368c066fe4e76c466fcd48efcbc703","observation_id":"064180a0-e7b7-4992-8186-da7c2a7cb1de","resolution":{"observed_at":"2026-08-06T18:08:57.483539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:56.982802Z","title":"Renderworld: World model with self-supervised 3d label","venue":null,"work_id":"33876852-2830-4104-b5c4-6411923794ad","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.151092Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:7b55fb93612f4fc0f73f2f3301c2bf4268c19601f4b8f6c83ec2e9ec6ae75aa8","observation_id":"694925b3-ab48-4c1f-956c-1f7ab4d310c1","resolution":{"observed_at":"2026-08-06T18:08:57.138598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:56.678758Z","title":"Bevformer v2: Adapting modern image backbones to bird’s-eye-view recognition via perspective su- pervision","venue":null,"work_id":"3b9432ba-0a1e-4bae-ab63-fcbcc4a24d5c","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.187795Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:bd82a5c6082ec21eca9516f9582d2189390977328d44e8a61a039b6c51553254","observation_id":"2d2f8d2f-4caf-4d18-91d9-b125fae29c9a","resolution":{"observed_at":"2026-08-06T18:08:56.805746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:56.369107Z","title":"Driving in the occupancy world: Vision-centric 4d occupancy forecasting and planning via world models for autonomous driving.AAAI,","venue":null,"work_id":"6c719852-2404-4a1d-88ca-4721b5500b42","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.228110Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:b7f87755864e7551c26a4ee658da974b665f0cbd7ddc656436bdc6c529180a47","observation_id":"e977cd88-d0f1-4faf-af0c-27e452e22984","resolution":{"observed_at":"2026-08-06T18:08:56.536961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:56.076410Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"0638fcef-7334-4299-b132-9da7262cdf4f","year":2023},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.289856Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:25a850bf0e5ca943f8041ebd0e8febbdacc958071fe29ee7bc30a7ecc94cdb6a","observation_id":"8b6a7c64-83c9-49c0-9ef6-8062a3b23f88","resolution":{"observed_at":"2026-08-06T18:08:56.185791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13772","last_updated":"2024-12-18T12:10:33Z","snapshot_observed_at":"2026-07-06T20:09:10.465980Z","submitted_at":"2024-12-18T12:10:33Z","title":"An Efficient Occupancy World Model via Decoupled Dynamic Flow and Image-assisted Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13772","snapshot_observed_at":"2026-08-06T18:08:54.319827Z","title":"An efficient occupancy world model via decoupled dynamic flow and image-assisted training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.319827Z"},"links":{"cited_paper":"/paper/2412.13772","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:2fd92b854a8a3148e77c3e4326e4e6a19e524c4b70295725cfa01227ed6ce517","observation_id":"77cf7902-228e-4d73-a16a-b73cc266e453","resolution":{"observed_at":"2026-08-06T18:08:54.319827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:55.825255Z","title":"Copilot4d: Learning unsupervised world models for autonomous driving via discrete diffusion","venue":null,"work_id":"b0bc869b-e7ba-4c28-a6da-59579d7f3b19","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.357990Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:ab0ec7632613f068d5cc67939af87c86d1e06ef4c896bb2fe78ac60466b6ccb4","observation_id":"78fd15a8-b6d8-49f2-8ae5-b05f35aad011","resolution":{"observed_at":"2026-08-06T18:08:55.948100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06845","last_updated":"2024-04-11T04:17:13Z","snapshot_observed_at":"2026-08-06T17:41:27.486645Z","submitted_at":"2024-03-11T16:03:35Z","title":"DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06845","snapshot_observed_at":"2026-08-06T18:08:54.392162Z","title":"Drivedreamer- 2: Llm-enhanced world models for diverse driving video gen- eration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.392162Z"},"links":{"cited_paper":"/paper/2403.06845","citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:86813310818dedb3817e45fe56ab098966e81a7a0d8fd29d8d05914afdfed9dd","observation_id":"c46c6f49-6e33-4b5c-86c4-8484eba1f7f1","resolution":{"observed_at":"2026-08-06T18:08:54.392162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:55.494459Z","title":"Cv-vae: A compatible video vae for latent generative video models","venue":null,"work_id":"9254ba5d-7203-4735-a0a5-cf80af68dba7","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.443696Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f4cca7939e03fe99e66b8fc4c9294096904680bb3f3e8449263388738a24939c","observation_id":"127bba40-acbf-4a51-8fbb-e1c9940887e5","resolution":{"observed_at":"2026-08-06T18:08:55.684773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:55.266530Z","title":"Occworld: Learning a 3d occupancy world model for autonomous driving","venue":null,"work_id":"902b7f78-a278-4435-9e15-fb54f623e027","year":null},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.484694Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:f4b9fafa1f370fea8065d902da7ff0abfff819387435e7a3f9601529a67048bf","observation_id":"53cbfdfe-6fb4-43e3-ab81-33f0a834df97","resolution":{"observed_at":"2026-08-06T18:08:55.372362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:55.081531Z","title":"Hitvideo: Hierarchical tokenizers for enhancing text-to- video generation with autoregressive large language models","venue":null,"work_id":"3373496e-8db7-4a6d-8b35-ee9dfc2e529d","year":2025},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.528141Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:9ce08c4d3da2aecfd7ac5631fc1a171c1cb43a739f5e32694152c43e6432b3f0","observation_id":"16c40c42-07a2-4d24-9052-96b0e4c25d69","resolution":{"observed_at":"2026-08-06T18:08:55.194296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:54.974664Z","title":"Scaling the codebook size of vq-gan to 100,000 with a utilization rate of 99%","venue":null,"work_id":"233e901f-bae5-4081-a57c-b64d3e632386","year":2024},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.571426Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:647696c128ad4213a14141ba3146f556ee522cb92693bb305de93463218356b0","observation_id":"3d658106-c657-4d36-a2cd-79356caeb59a","resolution":{"observed_at":"2026-08-06T18:08:55.034751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:54.811695Z","title":"Deformable detr: Deformable transformers for end-to-end object detection","venue":null,"work_id":"65139e59-f7ab-4d54-a32f-eac2c987988d","year":2021},"citing_paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:08:54.630490Z"},"links":{"citing_paper":"/paper/2507.09144"},"observation_digest":"sha256:6f71a312a77dc9ee7e923b7f5fa2868db24126b6b9cccbd47bb0ef16be19ae8a","observation_id":"f72cfb80-31fc-4cc4-b8a8-f94862811795","resolution":{"observed_at":"2026-08-06T18:08:54.873947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09144","last_updated":"2025-08-02T15:31:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:00:29.544972Z","submitted_at":"2025-07-12T05:14:39Z","title":"$I^{2}$-World: Intra-Inter Tokenization for Efficient Dynamic 4D Scene Forecasting"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":54},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 3 inbound Pith citation observations for arXiv:2507.09144."}