{"as_of":"2026-08-07T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87a3aaa9faed843547ac726132f8c99c16f0c355edfa2392eeb367ac13b04da9","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:37:53.713132Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:57:08.231458Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:28:52.737750Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-08-04T08:57:08.231458Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency.arXiv preprint arXiv:2506.07497, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18313","last_updated":"2026-06-29T02:20:45Z","snapshot_observed_at":"2026-08-06T20:20:34.094359Z","submitted_at":"2025-10-21T05:49:01Z","title":"OmniNWM: Omniscient Driving Navigation World Models","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:57:08.231458Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2510.18313"},"observation_digest":"sha256:eb0b6b7c96442a1d06aa83aaae11520844a710285924186ac4a1bb49e12f82f3","observation_id":"1f4e4ccf-3a5d-48c7-bd29-26a10afca9d9","resolution":{"observed_at":"2026-08-04T08:57:08.231458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-08-03T15:54:39.583328Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15422","last_updated":"2026-06-08T07:34:10Z","snapshot_observed_at":"2026-08-06T17:32:28.956105Z","submitted_at":"2025-12-17T13:14:15Z","title":"A Survey on the Applications of Generative Artificial Intelligence in Automated Driving Systems Test Scenario Generation Methods","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T15:54:39.583328Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2512.15422"},"observation_digest":"sha256:69e6fa451062901011e7f00e167fa4ddb641b9cff3816b8167f4758ab4bdbb62","observation_id":"bc0aecb1-ed81-4793-ae62-f216b225084a","resolution":{"observed_at":"2026-08-03T15:54:39.583328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":"2506.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-03T19:28:52.737750Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency","venue":null,"work_id":"2d2ba843-33be-42bf-9278-c03e782102fb","year":2025},"citing_paper":{"arxiv_id":"2512.23421","last_updated":"2026-04-17T11:51:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-29T12:32:27Z","title":"DriveLaW:Unifying Planning and Video Generation in a Latent Driving World","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T19:34:39.518649Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2512.23421"},"observation_digest":"sha256:050dcb5a60018f964c8331b98d3189f0a3c6f6db88ca69de9b64065841f7bdc8","observation_id":"37eb6db4-a748-4454-8e71-c49ba98fabb7","resolution":{"observed_at":"2026-05-16T19:38:21.112262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-08-02T20:36:09.847931Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22960","last_updated":"2026-06-29T11:22:33Z","snapshot_observed_at":"2026-08-06T09:45:03.691678Z","submitted_at":"2026-02-26T12:54:46Z","title":"UCM: Unified Modeling of Camera Control and Memory with Time-aware Positional Encoding Warping for World Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:36:09.847931Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2602.22960"},"observation_digest":"sha256:dc32460c221759a3301da3e15a67b37145633a0cc607623991d18dd0204cd44c","observation_id":"41783d20-7bf4-4541-b45e-20fb32be0b90","resolution":{"observed_at":"2026-08-02T20:36:09.847931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":"2506.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-03T19:28:52.737750Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency","venue":null,"work_id":"2d2ba843-33be-42bf-9278-c03e782102fb","year":2025},"citing_paper":{"arxiv_id":"2604.15805","last_updated":"2026-04-17T08:06:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-17T08:06:26Z","title":"From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:45:46.944379Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2604.15805"},"observation_digest":"sha256:788e3654e389b7137247aa96d07340c83cf0db0ff2d7fbb7e2ce269776383f59","observation_id":"6510c82b-a3cd-4d81-946b-6fd8ced5044a","resolution":{"observed_at":"2026-05-10T08:48:01.778224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":"2506.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-03T19:28:52.737750Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency","venue":null,"work_id":"2d2ba843-33be-42bf-9278-c03e782102fb","year":2025},"citing_paper":{"arxiv_id":"2605.10426","last_updated":"2026-05-13T08:01:33Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:01:13Z","title":"CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T03:48:36.717026Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2605.10426"},"observation_digest":"sha256:780c0d0016151a24ad03afb2f9fe3edad965ecd2c7011cd589c2d82b022a26dd","observation_id":"ca8be82c-36cf-427f-82a8-afccb44d388f","resolution":{"observed_at":"2026-05-12T06:56:28.605367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":"2506.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-03T19:28:52.737750Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency","venue":null,"work_id":"2d2ba843-33be-42bf-9278-c03e782102fb","year":2025},"citing_paper":{"arxiv_id":"2605.10426","last_updated":"2026-05-13T08:01:33Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T12:01:13Z","title":"CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T21:36:52.396245Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2605.10426"},"observation_digest":"sha256:292b5048638f4f62bf84b93398f4b10cd4f5545b3d1592e8091e233a4bad9a80","observation_id":"cabd6262-800a-4b4f-b89c-cab10128566b","resolution":{"observed_at":"2026-05-14T21:38:00.560018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":"2506.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-03T19:28:52.737750Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency","venue":null,"work_id":"2d2ba843-33be-42bf-9278-c03e782102fb","year":2025},"citing_paper":{"arxiv_id":"2605.22809","last_updated":"2026-05-22T21:31:07Z","snapshot_observed_at":"2026-08-02T05:33:27.669061Z","submitted_at":"2026-05-21T17:57:17Z","title":"Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T05:56:45.641080Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2605.22809"},"observation_digest":"sha256:8c0ab345687e758db4ebc8c9360556bd0cf19aee789284487bfffdae6a1b42d6","observation_id":"3086f0b7-76e7-4d65-9840-fb635026f0cd","resolution":{"observed_at":"2026-05-22T06:01:09.043469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":"2506.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-03T19:28:52.737750Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency","venue":null,"work_id":"2d2ba843-33be-42bf-9278-c03e782102fb","year":2025},"citing_paper":{"arxiv_id":"2605.22809","last_updated":"2026-05-22T21:31:07Z","snapshot_observed_at":"2026-08-02T05:33:27.669061Z","submitted_at":"2026-05-21T17:57:17Z","title":"Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:24.858861Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2605.22809"},"observation_digest":"sha256:35f097848ca3613d51cf0a1884e9062d9d8cfda033a2740de268034068bb561d","observation_id":"25f7670b-e538-47fb-8b7c-c1bd06464768","resolution":{"observed_at":"2026-06-30T16:44:55.995325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":"2506.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-03T19:28:52.737750Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency","venue":null,"work_id":"2d2ba843-33be-42bf-9278-c03e782102fb","year":2025},"citing_paper":{"arxiv_id":"2606.17536","last_updated":"2026-06-16T05:25:55Z","snapshot_observed_at":"2026-07-31T01:15:07.358009Z","submitted_at":"2026-06-16T05:25:55Z","title":"OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T01:46:14.430539Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2606.17536"},"observation_digest":"sha256:c51f60b761abdf3117b8e8bbd9e8f64553363133b4ca39c3d8a72e1028afe4d6","observation_id":"0bfa4449-05bd-4707-a3ea-fe2515e5471e","resolution":{"observed_at":"2026-07-03T19:28:52.739321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":"2506.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-03T19:28:52.737750Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal con- sistency","venue":null,"work_id":"2d2ba843-33be-42bf-9278-c03e782102fb","year":2025},"citing_paper":{"arxiv_id":"2606.27504","last_updated":"2026-06-25T19:37:58Z","snapshot_observed_at":"2026-08-02T08:51:25.044614Z","submitted_at":"2026-06-25T19:37:58Z","title":"ReWorld: Learning Better Representations for World Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T01:58:46.435886Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2606.27504"},"observation_digest":"sha256:96b0ba96039a05a214a4de79d6fe8adb2350f01cb2f7b72079f8b9ff03109cbf","observation_id":"89427131-e1a6-4272-901f-3792c54795eb","resolution":{"observed_at":"2026-07-01T18:25:58.424941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07497","snapshot_observed_at":"2026-07-11T08:19:04.131379Z","title":"Genesis: Multimodal driving scene generation with spatio-temporal and cross-modal consistency.arXiv preprint arXiv:2506.07497, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05133","last_updated":"2026-07-06T14:18:18Z","snapshot_observed_at":"2026-08-04T03:35:43.340219Z","submitted_at":"2026-07-06T14:18:18Z","title":"UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T08:19:04.131379Z"},"links":{"cited_paper":"/paper/2506.07497","citing_paper":"/paper/2607.05133"},"observation_digest":"sha256:1bc7e5581fa020046c809996d68a3560e2002eb2f6ed562bb6447569a2578cd2","observation_id":"dceccfac-7cfb-4f7f-9062-8aa62f9a58a0","resolution":{"observed_at":"2026-07-11T08:19:04.131379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07497/citation-record","integrity":"/paper/2506.07497/integrity","json":"/paper/2506.07497/citation-record.json","paper":"/paper/2506.07497"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T05:37:53.480480Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.480480Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:0de8975f8e08408421fbc0f5fa36ece9033ebe86bf80b899ca3658138ecdad3e","observation_id":"a48e3d34-be12-4c25-8957-eee046ed32f6","resolution":{"observed_at":"2026-08-07T05:37:53.480480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.496633Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transformers","venue":null,"work_id":"93b5b31c-b81b-4e89-8483-6d8dfacab1aa","year":2022},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.486277Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:d8e1807d4eda796cca359d66da2d3e3aee33e6731f76a120a030e9dd50704da2","observation_id":"5cf9c107-4208-4985-8261-389c8dbe4bda","resolution":{"observed_at":"2026-08-07T05:37:54.501574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.482906Z","title":"Camera-lidar inte- gration: Probabilistic sensor fusion for semantic mapping.IEEE Transactions on Intelligent Transportation Systems, 23(7):7637–7652, 2021","venue":null,"work_id":"a186f930-7ca7-480a-a723-f4fb9822bcce","year":2021},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.490987Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:34043f046ecece85de311f6c978e30bcc9a219fe8c82ee6f5e13e719c29900bc","observation_id":"951a427e-9b2f-4954-aef0-924c0dafc292","resolution":{"observed_at":"2026-08-07T05:37:54.487360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.495865Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.495865Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:5fe14e72efea5396c5efd29ffae3d7a82ac7f214d348128dc9c6a6aea48752ea","observation_id":"4a22c19d-e3b2-4e1d-825a-02fd06bffdac","resolution":{"observed_at":"2026-08-07T05:37:53.495865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.500583Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.500583Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:01ffa280b7b6dd5e35e1f3135a31a6173bb381904d3a04ef3f855a924763d8c2","observation_id":"cda1960b-60af-4262-b5bc-26c8006656af","resolution":{"observed_at":"2026-08-07T05:37:53.500583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.505322Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.505322Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:2d15be69b3ad279521bfc23d382771c72e4f5a3994dc4a324d8103c71b5fbbe2","observation_id":"a21c1d5d-5742-4009-8023-4dd70a137bf5","resolution":{"observed_at":"2026-08-07T05:37:53.505322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.441369Z","title":"Trafficgen: Learning to generate diverse and realistic traffic scenarios","venue":null,"work_id":"3c8c381e-1e99-4df4-b97f-258ec3a683a1","year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.510195Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:7f0fac38df1422680d7146d247a3797278aa13f007a251baa72b2e6a22c6e72a","observation_id":"10daedaf-dc4b-4d75-8b65-b0d607bf7e60","resolution":{"observed_at":"2026-08-07T05:37:54.445835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14475","last_updated":"2025-07-25T02:48:16Z","snapshot_observed_at":"2026-07-06T18:18:34.617427Z","submitted_at":"2024-05-23T12:04:51Z","title":"MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14475","snapshot_observed_at":"2026-08-07T05:37:53.514590Z","title":"Magic- drive3d: Controllable 3d generation for any-view rendering in street scenes.arXiv preprint arXiv:2405.14475, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.514590Z"},"links":{"cited_paper":"/paper/2405.14475","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:ffdb23276be6f6235e325975c168f84d75bf5719b921a5a9c5bc8b4d96c5a284","observation_id":"da919632-7ffd-434f-b87f-79a35b2122bb","resolution":{"observed_at":"2026-08-07T05:37:53.514590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13807","last_updated":"2025-07-25T02:30:46Z","snapshot_observed_at":"2026-08-02T12:19:53.873467Z","submitted_at":"2024-11-21T03:13:30Z","title":"MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13807","snapshot_observed_at":"2026-08-07T05:37:53.519590Z","title":"Magicdrivedit: High-resolution long video generation for autonomous driving with adaptive control.arXiv preprint arXiv:2411.13807, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.519590Z"},"links":{"cited_paper":"/paper/2411.13807","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:6cbd42ffad9287c4fb9467c3f103428075f0d8b09427bdf32406ed025a46159e","observation_id":"b2be098a-fc3e-4f7b-be2c-1cabcc112221","resolution":{"observed_at":"2026-08-07T05:37:53.519590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02601","last_updated":"2024-05-03T04:50:27Z","snapshot_observed_at":"2026-08-06T19:21:54.069156Z","submitted_at":"2023-10-04T06:14:06Z","title":"MagicDrive: Street View Generation with Diverse 3D Geometry Control","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02601","snapshot_observed_at":"2026-08-07T05:37:53.524532Z","title":"Magicdrive: Street view generation with diverse 3d geometry control.arXiv preprint arXiv:2310.02601, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.524532Z"},"links":{"cited_paper":"/paper/2310.02601","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:a13c3d8a08511affca70e01230ce0b5a2b754b24f37ffe14a777bfd8f269f47e","observation_id":"e36da3c9-0cb7-4ca7-adad-16d9513f481a","resolution":{"observed_at":"2026-08-07T05:37:53.524532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17398","last_updated":"2024-10-28T05:53:17Z","snapshot_observed_at":"2026-08-07T02:31:28.236732Z","submitted_at":"2024-05-27T17:49:15Z","title":"Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17398","snapshot_observed_at":"2026-08-07T05:37:53.529341Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability.arXiv preprint arXiv:2405.17398, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.529341Z"},"links":{"cited_paper":"/paper/2405.17398","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:4d81fd8989f315c6aeb4b1c3737580254e14ce2c7477b313955c792fd03ed7bd","observation_id":"973f4d24-146c-4556-84f1-cc72adaa1088","resolution":{"observed_at":"2026-08-07T05:37:53.529341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.534200Z","title":"Vision meets robotics: The kitti dataset.The international journal of robotics research, 32(11):1231–1237, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.534200Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:92391586fdc79ce6c4f238ffa63d95448151faf779800a1fe6762480a9e4b20f","observation_id":"c2f7d725-15d0-43c3-b676-7d7fdc604d78","resolution":{"observed_at":"2026-08-07T05:37:53.534200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.538438Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.538438Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:fba5e0f34a4ff3c1c959f2db724f4828b8d7a36c0dd32503a551478e66996992","observation_id":"8de2b146-c2f5-4380-bf0a-8604a0b1059a","resolution":{"observed_at":"2026-08-07T05:37:53.538438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T05:37:53.542834Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.542834Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:90c0394871b5f5de56a1ab1a11846e5db1edd17d1a3e5e7748e07688676490fa","observation_id":"8b6be0d0-9fd9-4173-ba29-d76ec2c4ef50","resolution":{"observed_at":"2026-08-07T05:37:53.542834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22231","last_updated":"2025-04-05T15:43:06Z","snapshot_observed_at":"2026-08-03T21:36:55.745971Z","submitted_at":"2025-03-28T08:27:05Z","title":"CoGen: 3D Consistent Video Generation via Adaptive Conditioning for Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22231","snapshot_observed_at":"2026-08-07T05:37:53.547745Z","title":"Cogen: 3d consistent video generation via adaptive conditioning for autonomous driving.arXiv preprint arXiv:2503.22231, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.547745Z"},"links":{"cited_paper":"/paper/2503.22231","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:b4fd475f98513a514b6d093315dded3ea57d6433d9ab0d8050cbd39e062d1237","observation_id":"913b628b-250c-4159-8935-e1ae5e0e3e78","resolution":{"observed_at":"2026-08-07T05:37:53.547745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01595","last_updated":"2024-09-03T04:29:59Z","snapshot_observed_at":"2026-07-06T19:09:32.189008Z","submitted_at":"2024-09-03T04:29:59Z","title":"DiVE: DiT-based Video Generation with Enhanced Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01595","snapshot_observed_at":"2026-08-07T05:37:53.552383Z","title":"Dive: Dit-based video generation with enhanced control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.552383Z"},"links":{"cited_paper":"/paper/2409.01595","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:d5e21e1d3db9e9c259ca3a2c1d04dd3bd029b4e14ed7691a57ab3cac64f36685","observation_id":"02560e80-bbaa-447a-bb00-5ed5cdf6d0cd","resolution":{"observed_at":"2026-08-07T05:37:53.552383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.556773Z","title":"Point cloud forecasting as a proxy for 4d occupancy forecasting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.556773Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:f57405625fa7d9ca2492c0e9dbaebe3c2cc20c5dbafcdf4a3ebb46eb9548cb29","observation_id":"8e9d4c05-0c91-43f8-8ef7-9336d47a01dd","resolution":{"observed_at":"2026-08-07T05:37:53.556773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05435","last_updated":"2025-03-11T12:38:27Z","snapshot_observed_at":"2026-07-06T20:03:06.933007Z","submitted_at":"2024-12-06T21:41:52Z","title":"UniScene: Unified Occupancy-centric Driving Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05435","snapshot_observed_at":"2026-08-07T05:37:53.561406Z","title":"Uniscene: Unified occupancy-centric driving scene generation.arXiv preprint arXiv:2412.05435, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.561406Z"},"links":{"cited_paper":"/paper/2412.05435","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:8e72ebbced5636e0d554b17e309cf63005c8079f3e52b9fcb8d9b7e39ded5b9a","observation_id":"f2d47840-adea-440e-be8f-8bc4740ac7c2","resolution":{"observed_at":"2026-08-07T05:37:53.561406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.398415Z","title":"Deepfusion: Lidar-camera deep fusion for multi-modal 3d object detection","venue":null,"work_id":"a3ffe567-1d1e-4269-a38f-26d8bf6bcc9f","year":2022},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.565899Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:6112e0caf776abcbb7fa64ecb39c73f3293096cfad20e6f3bce71a155199a094","observation_id":"3ae218aa-f448-430e-afc0-e5b031fe2903","resolution":{"observed_at":"2026-08-07T05:37:54.403234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.570093Z","title":"Bevfusion: A simple and robust lidar-camera fusion framework","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.570093Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:bfbb81397063f578f4ce7876fdcc1ea8cbc898c21f41d156e90fb1725a489c5c","observation_id":"97817166-7d39-4b11-a189-dc96bde9cd80","resolution":{"observed_at":"2026-08-07T05:37:53.570093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.575430Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.575430Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:c20cd81af5b68499c65276b6077de685fabdb232918eef060109bd50d822f04d","observation_id":"7bd90cf4-5e54-4f8d-b008-e13244d031a6","resolution":{"observed_at":"2026-08-07T05:37:53.575430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.579945Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.579945Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:e39fed17e94e6db1d9dae681102cdf05e2fe59f717bbff3cf2d884826ff6dd31","observation_id":"9737325c-0413-4e95-b419-23730d09000f","resolution":{"observed_at":"2026-08-07T05:37:53.579945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.356019Z","title":"Wovogen: World volume-aware diffusion for controllable multi-camera driving scene generation","venue":null,"work_id":"32ac1609-6e81-4d62-a508-a8c138d49f9a","year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.584599Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:abdfb060a2132dc3fcd0c4c6cee12d7cb9c35e96883bea272dfb172c5cab4502","observation_id":"c857f0af-00ae-45cb-baf7-11f143b1bac9","resolution":{"observed_at":"2026-08-07T05:37:54.360663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01349","last_updated":"2024-06-06T17:39:50Z","snapshot_observed_at":"2026-07-06T18:24:26.225262Z","submitted_at":"2024-06-03T14:13:13Z","title":"Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01349","snapshot_observed_at":"2026-08-07T05:37:53.589125Z","title":"Unleashing generalization of end-to-end autonomous driving with controllable long video generation.arXiv preprint arXiv:2406.01349, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.589125Z"},"links":{"cited_paper":"/paper/2406.01349","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:2e118c4e1b073d5cf440a5f9bbeb2a2567a974aa1a8052bad27949aa8f37448c","observation_id":"2915b128-9a06-49ca-a5d1-64de3241a0e5","resolution":{"observed_at":"2026-08-07T05:37:53.589125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.593752Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.593752Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:df811ada4db7413a0825161fede36ffbaa5e86f801531ae83f6e166d307f9694","observation_id":"1f7dda2d-9abb-4652-9afd-a3f97aba60be","resolution":{"observed_at":"2026-08-07T05:37:53.593752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.332723Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3d","venue":null,"work_id":"f52396d3-f821-4a64-b266-c3b0adc4e392","year":2020},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.598487Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:4def3f5b7f85cd3e2ee5e4266ec4472b6c3a05f1d359ba50ead1e471fc328842","observation_id":"21ceec62-ab6d-467b-bedf-2291c9799b41","resolution":{"observed_at":"2026-08-07T05:37:54.337469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.317455Z","title":"Scenario diffusion: Controllable driving scenario generation with diffusion.Advances in Neural Information Processing Systems, 36:68873–68894, 2023","venue":null,"work_id":"64024f0f-df78-4c03-b0a5-231a843399ae","year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.602729Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:f59656257121edbd4864ae917a47e49a9fbed1ab292098e0306f7f51ffa529b2","observation_id":"64bdebe8-b95b-4f1d-ae90-fe2176caec3c","resolution":{"observed_at":"2026-08-07T05:37:54.322428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.607077Z","title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.607077Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:546c6efa3ff2c6c7765a7a17b2f51f3913455728c8045919b447d5e6790fbcc1","observation_id":"22009dd1-b790-4965-b85b-7a378d5fc560","resolution":{"observed_at":"2026-08-07T05:37:53.607077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.294212Z","title":"Towards realistic scene generation with lidar diffusion models","venue":null,"work_id":"d8115bbe-1a9d-4b9c-b42a-2dd2f4cd01e0","year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.611655Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:46b451db02c5254f32348e14601156114fe3b83a16d378d1bc4340a09d67984f","observation_id":"7cbb251d-e85a-437c-8743-6dbdd8b3547e","resolution":{"observed_at":"2026-08-07T05:37:54.298762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.615860Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.615860Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:c79a0930bd28fb12b39ea2ad83554b87074594fe091567a4ababb6e2c71cb0e9","observation_id":"a17f0717-87f3-446c-af2d-92414bfc62b4","resolution":{"observed_at":"2026-08-07T05:37:53.615860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.270480Z","title":"Drivescenegen: Generating diverse and realistic driving scenarios from scratch","venue":null,"work_id":"ddf501de-db5e-424c-8b08-113e9632a4e6","year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.620049Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:343b871bbb577b3da2ef50e5552d7fa3dff59ba8702948205a4f01f5fa35255f","observation_id":"875c1f86-1877-4056-8221-4cb9cd0c7973","resolution":{"observed_at":"2026-08-07T05:37:54.275109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.254748Z","title":"Street-view image generation from a bird’s-eye view layout.IEEE Robotics and Automation Letters, 2024","venue":null,"work_id":"151f9155-a173-447d-a969-ca86d6236217","year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.628534Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:24fde23b279600cfc6fa964b0e2ab112719e36c6b4b5fa5d0e32b4c4dfb66890","observation_id":"2edd54ca-b8e8-4128-b6af-f50d2f8d4774","resolution":{"observed_at":"2026-08-07T05:37:54.259721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.633174Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.633174Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:6b01d4b84a7c678191f12c3d0232668085dfd44e5e13d197e628a827ac1dc4c2","observation_id":"9391a233-0bf3-48f2-a4ce-b5a7b6ebffa3","resolution":{"observed_at":"2026-08-07T05:37:53.633174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15875","last_updated":"2025-03-20T05:58:32Z","snapshot_observed_at":"2026-07-06T20:55:51.881366Z","submitted_at":"2025-03-20T05:58:32Z","title":"MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15875","snapshot_observed_at":"2026-08-07T05:37:53.638574Z","title":"Mila: Multi-view intensive-fidelity long-term video generation world model for autonomous driving.arXiv preprint arXiv:2503.15875, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.638574Z"},"links":{"cited_paper":"/paper/2503.15875","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:c37d82a426dea9f884bb97477d63b5ce7613044545c17668dfe3cfaeb12890fd","observation_id":"cf12d541-a77e-45d6-b49d-d0f521364c61","resolution":{"observed_at":"2026-08-07T05:37:53.638574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.644426Z","title":"Drive- dreamer: Towards real-world-drive world models for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.644426Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:e58dbf1a7b5c7e493c38e27d72ce198d8361aedcf53f47af9285ff3ec7fab43c","observation_id":"4b1ba8b9-7c0f-4cd7-a855-94eeba645fe7","resolution":{"observed_at":"2026-08-07T05:37:53.644426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.649011Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.649011Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:bc84a6e83b99eab48f2fd46149c7957ce6dcc4c5e91d1beded46774b99fc24cc","observation_id":"8225b22e-44d9-4c4d-8b80-d6b4a97f9960","resolution":{"observed_at":"2026-08-07T05:37:53.649011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.212563Z","title":"Lidenerf: Neural radiance field reconstruction with depth prior provided by lidar point cloud.ISPRS Journal of Photogrammetry and Remote Sensing, 208:296–307, 2024","venue":null,"work_id":"209309e2-e146-4731-9c0a-2b61c1997cfd","year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.653249Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:7bcf873a65732503bff43f0b1fd6ea78037347b39b90cc938848d746fab5e256","observation_id":"0a9488ad-af98-47a8-9014-7efb31e322e6","resolution":{"observed_at":"2026-08-07T05:37:54.217316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.657642Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.657642Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:7cacbe5d2baa641537d80da8f8758f251514715b751f68e0c342ba1ad5d376d3","observation_id":"2746e56b-f07c-4aa8-80ce-5d50bf531a20","resolution":{"observed_at":"2026-08-07T05:37:53.657642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.662034Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.662034Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:f3520a815e3140175bcaafc84e16b97de1e8b9ed479a26bf6a342eb9bc88400d","observation_id":"f7c8a747-501a-4309-9bef-d5326deff41e","resolution":{"observed_at":"2026-08-07T05:37:53.662034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.179553Z","title":"Driver lane change intention recognition based on attention enhanced residual-mbi-lstm network.IEEE Access, 10:58050– 58061, 2022","venue":null,"work_id":"c8d7c8ab-e29c-46c1-bda0-bfd4d07e6fef","year":2022},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.666347Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:eda90fe3a0d033385d5fc90bf494da3758b3f2b3951b9a021e663941c5343d64","observation_id":"041e5865-e3c7-46e1-b6ff-e3b6f39493a9","resolution":{"observed_at":"2026-08-07T05:37:54.184278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.671416Z","title":"Point-nerf: Point-based neural radiance fields","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.671416Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:cd5c32f1d5c3a554c2f11d6a49452599e3380823b4cb17b0c2b5f34803cfc58a","observation_id":"0b07300e-7184-40d3-8449-2acb762681fe","resolution":{"observed_at":"2026-08-07T05:37:53.671416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01661","last_updated":"2023-09-23T06:59:18Z","snapshot_observed_at":"2026-08-06T17:02:57.215189Z","submitted_at":"2023-08-03T09:56:31Z","title":"BEVControl: Accurately Controlling Street-view Elements with Multi-perspective Consistency via BEV Sketch Layout","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01661","snapshot_observed_at":"2026-08-07T05:37:53.675805Z","title":"Bevcontrol: Accurately controlling street-view elements with multi-perspective consistency via bev sketch layout.arXiv preprint arXiv:2308.01661, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.675805Z"},"links":{"cited_paper":"/paper/2308.01661","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:2698c77c107e3a0288d8d6677a8c45292db5769193927e838e83e65fa7694ac5","observation_id":"9f18b92f-e605-4921-9927-d8ac85237541","resolution":{"observed_at":"2026-08-07T05:37:53.675805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.680568Z","title":"Visual point cloud forecasting enables scalable autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.680568Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:b18b96d5e87da1edf2320099a5572e68b7bcb225b83bb9ec9f468a511e8dc80f","observation_id":"1639931f-30c7-4fe4-aa52-8d6268b93b7e","resolution":{"observed_at":"2026-08-07T05:37:53.680568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01017","last_updated":"2024-04-01T15:41:50Z","snapshot_observed_at":"2026-07-06T16:42:04.139453Z","submitted_at":"2023-11-02T06:21:56Z","title":"Copilot4D: Learning Unsupervised World Models for Autonomous Driving via Discrete Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01017","snapshot_observed_at":"2026-08-07T05:37:53.685162Z","title":"Copilot4d: Learning unsupervised world models for autonomous driving via discrete diffusion.arXiv preprint arXiv:2311.01017, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.685162Z"},"links":{"cited_paper":"/paper/2311.01017","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:c60acb42131413460b3166a779e91d482953273f490d638f7df22e8f8b54c462","observation_id":"4f38f51f-333a-43ae-b05d-84c017338b22","resolution":{"observed_at":"2026-08-07T05:37:53.685162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05679","last_updated":"2025-04-30T13:43:51Z","snapshot_observed_at":"2026-08-04T05:35:49.863354Z","submitted_at":"2024-07-08T07:26:08Z","title":"BEVWorld: A Multimodal World Simulator for Autonomous Driving via Scene-Level BEV Latents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05679","snapshot_observed_at":"2026-08-07T05:37:53.689840Z","title":"Bevworld: A multimodal world model for autonomous driving via unified bev latent space.arXiv preprint arXiv:2407.05679, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.689840Z"},"links":{"cited_paper":"/paper/2407.05679","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:9b8fb7421b534911200b74ef68b0b1d3fc8d3abbfad2e74d21a6eb8e44f37a51","observation_id":"99a95cf3-3760-4543-bbcf-64ba67862d16","resolution":{"observed_at":"2026-08-07T05:37:53.689840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.145401Z","title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video gen- eration","venue":null,"work_id":"5ec8ac9b-db94-415b-a3b4-1b5dad0ee566","year":2025},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.694355Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:6a3020b3c7ca28292887cee97cb6f792bdfff9b10412bda79702cc3f375c5c5e","observation_id":"469a0893-7342-48a4-803a-2ce7a1c2b7b0","resolution":{"observed_at":"2026-08-07T05:37:54.151020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14729","last_updated":"2025-08-13T09:10:30Z","snapshot_observed_at":"2026-08-06T09:11:30.127816Z","submitted_at":"2025-01-24T18:59:51Z","title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14729","snapshot_observed_at":"2026-08-07T05:37:53.698728Z","title":"Hermes: A unified self-driving world model for simultaneous 3d scene understanding and generation.arXiv preprint arXiv:2501.14729, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.698728Z"},"links":{"cited_paper":"/paper/2501.14729","citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:dcb85228328bec953ef8ec3d2ec7740cde63cee817aeb853e1edc4e2bd345ac7","observation_id":"aa96d767-5e76-4214-afd4-77db0d641785","resolution":{"observed_at":"2026-08-07T05:37:53.698728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.703572Z","title":"V oxelnet: End-to-end learning for point cloud based 3d object detection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.703572Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:5c08f9fb7a36c8fcce98940e814405806f518c8f30a94c8e0224fad03836c189","observation_id":"580001f9-4d2b-467d-aaa4-6e5c54160ed1","resolution":{"observed_at":"2026-08-07T05:37:53.703572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.708796Z","title":"Lidardm: Generative lidar simulation in a generated world.arXiv preprint arXiv:2404.02903, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.708796Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:19fc4b679789b84b7ab48198e56a6d64be293f14781a12deff0a4bad97f993c4","observation_id":"b4964914-1372-4e3f-a0b4-e9c6788d3f3b","resolution":{"observed_at":"2026-08-07T05:37:53.708796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:54.119565Z","title":"Daytime\",","venue":null,"work_id":"626d6d69-b547-4759-aced-8087be8bc26f","year":2022},"citing_paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:53.713132Z"},"links":{"citing_paper":"/paper/2506.07497"},"observation_digest":"sha256:bcbda556a680c4d0ccf706406181a0e6f4ca9c06656c7f2522a740c3abf6075b","observation_id":"883a735b-0381-49e1-9e5b-1cb44fe15c5b","resolution":{"observed_at":"2026-08-07T05:37:54.125711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07497","last_updated":"2025-06-20T14:20:56Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:29:45.955480Z","submitted_at":"2025-06-09T07:20:49Z","title":"Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 12 inbound Pith citation observations for arXiv:2506.07497."}