{"as_of":"2026-08-07T07:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8458cf2701f492bc99c08a3be16975b83f33816e5286e11edf511af5af543e04","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:16:03.985223Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:23:06.577719Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00707","snapshot_observed_at":"2026-08-02T01:23:06.577719Z","title":"Bev-vae: Multi-view image generation with spatial consistency for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14710","last_updated":"2026-07-16T08:20:37Z","snapshot_observed_at":"2026-08-02T01:23:05.724130Z","submitted_at":"2026-07-16T08:20:37Z","title":"Variational Inference for Bird's Eye View Segmentation in Autonomous Driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:23:06.577719Z"},"links":{"cited_paper":"/paper/2507.00707","citing_paper":"/paper/2607.14710"},"observation_digest":"sha256:1fb5384ae411e1295d576e0e75c0882954e40cc0e2dc064d03128060646f76e9","observation_id":"dcea4640-d784-4eb3-bbef-fedbc86f5832","resolution":{"observed_at":"2026-08-02T01:23:06.577719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00707/citation-record","integrity":"/paper/2507.00707/integrity","json":"/paper/2507.00707/citation-record.json","paper":"/paper/2507.00707"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.02601","last_updated":"2024-05-03T04:50:27Z","snapshot_observed_at":"2026-08-06T19:21:54.069156Z","submitted_at":"2023-10-04T06:14:06Z","title":"MagicDrive: Street View Generation with Diverse 3D Geometry Control","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02601","snapshot_observed_at":"2026-08-06T21:16:02.509759Z","title":"Magicdrive: Street view generation with diverse 3d geometry control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.509759Z"},"links":{"cited_paper":"/paper/2310.02601","citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:3024fdc82a9d08db4f415ab9f0907622177cbaad66699cbdce2754dc2d3e2186","observation_id":"769ed58f-a6e8-4c27-a985-0697b7262a43","resolution":{"observed_at":"2026-08-06T21:16:02.509759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:06.517105Z","title":"Drivingdiffusion: Layout-guided multi-view driving scenarios video generation with latent diffusion model","venue":null,"work_id":"feb9edb4-e7c2-496a-a24f-d2be3ab685c2","year":2025},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.561112Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:aad757766b74e8a7e0c9d6b0844d58ce429419e4132812125de9d90c8aaf3db0","observation_id":"2d42f68f-3106-496a-8c2a-f72eabd645e4","resolution":{"observed_at":"2026-08-06T21:16:06.591249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:06.451237Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving","venue":null,"work_id":"c99ad29d-ff4d-4eaf-96df-03aa8f32abd0","year":2024},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.664596Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:50df35a35ec57c9ae1da3d596a2d7ca5801ac5a824f7a88334644124447276b3","observation_id":"a08a8240-46a5-4bf8-a291-8ee4fb7feb20","resolution":{"observed_at":"2026-08-06T21:16:06.496258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:06.265862Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":"8f888737-0518-435f-bd79-e25d070b48c2","year":2024},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.708374Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:9cb96f3b2950770c2da7724b18f261449cae12658c1cfb5cbf7e205de2a563d5","observation_id":"0aea0997-6f15-4b82-8a56-087ebb3d8108","resolution":{"observed_at":"2026-08-06T21:16:06.349411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:06.180775Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3d","venue":null,"work_id":"fb37944c-77fa-4b07-9031-e501e312de54","year":2020},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.788028Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:5de30b68106ef6fdc7b39ebfa1a971c9c7002772164ed80a6d2276a7e60906bb","observation_id":"dedffad0-b373-4094-84be-9228e6e88250","resolution":{"observed_at":"2026-08-06T21:16:06.220621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-06T21:16:02.821152Z","title":"Bevdet: High-performance multi-camera 3d object detection in bird-eye-view","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.821152Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:5dcc414141fcd36b262d9f0f6dcdf3e261f9bfa3b38d9cd1b1afb1cfcb880caa","observation_id":"20d6d946-f60b-4246-b128-04f842f7e7e0","resolution":{"observed_at":"2026-08-06T21:16:02.821152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.999766Z","title":"Bevfusion: Multi-task multi-sensor fusion with unified bird’s-eye view representation","venue":null,"work_id":"a6dba017-1a3b-4435-b8dc-34e527f5558e","year":2023},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.876874Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:32f6a11560a09e6f49ca741762ee61b170ab6aa59aedc3fba7fd13fe41116952","observation_id":"bc3292b6-0aea-43c0-821c-020df08a96bb","resolution":{"observed_at":"2026-08-06T21:16:06.095644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.896793Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal trans- formers","venue":null,"work_id":"3d28e77a-e02a-4957-9090-9f5fe62a0db4","year":2022},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.916508Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:43f262fbc5a876ec48e60edffdd6c5e87fafb02a2fafde32e71d7f482f01d300","observation_id":"7d8bc499-4011-492a-8171-59a739b5ecd2","resolution":{"observed_at":"2026-08-06T21:16:05.932218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.788454Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":"f8ce9beb-c891-4e8b-8adc-6f55778c46fd","year":2023},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.947076Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:fa5197acbbd387ab4566303edde4ea6cbfc30f078dfdfef101bc38f2893af269","observation_id":"b1327940-5b5d-456f-990f-f3ab4fa2f54a","resolution":{"observed_at":"2026-08-06T21:16:05.864956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:02.972118Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:02.972118Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:f5488be559561e7f35ac350cba57ae81857c352fd390690bb091e62e3b2323d6","observation_id":"41cdfdbb-c5af-4ee5-aa2d-94df67354be3","resolution":{"observed_at":"2026-08-06T21:16:02.972118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.638937Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"89e2b33e-0b39-4b68-9686-72f086ac5634","year":2021},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.040381Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:13742b2f3a1241c403639ccbf3b767aa5300de25f5f1a770625673369e55dae3","observation_id":"2257872d-bf9c-41fd-921e-c46278b9be47","resolution":{"observed_at":"2026-08-06T21:16:05.708350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:03.085635Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.085635Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:7855df46e994f4da420ff9c9b50a4d7cc82ab31787121276b4ef6c8a41fd7dd3","observation_id":"bad47d59-1fd0-4b00-ac7c-46dee8ec2bec","resolution":{"observed_at":"2026-08-06T21:16:03.085635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.508161Z","title":"Perceptual losses for real-time style transfer and super- resolution","venue":null,"work_id":"5755b4b6-8365-4f11-9249-b2c65da4a57a","year":2016},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.122390Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:1915f459259bacf291eafe6180524e5734c64d6e70ee8147be052ddea0d5342e","observation_id":"4d9b0286-5eee-429b-bbc6-ffa31108cd44","resolution":{"observed_at":"2026-08-06T21:16:05.567907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-06T21:16:03.158583Z","title":"Vector-quantized image modeling with improved vqgan.arXiv preprint arXiv:2110.04627, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.158583Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:76ca624c4e9120024fc4a0e1c9d24a7cdd1787945cdcfdedb3523bf8a99348f0","observation_id":"4292a0d8-a245-4237-9f74-c6be65f04009","resolution":{"observed_at":"2026-08-06T21:16:03.158583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:16:03.199718Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.199718Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:ba75af67c24b079638fcc542e99b9ecc5ca72facfe58584f1e913b38d1abfec2","observation_id":"cf18d2c8-c8e9-4044-8b52-e7fa5819b09d","resolution":{"observed_at":"2026-08-06T21:16:03.199718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:03.249349Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.249349Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:c1327e01b39ef046068c036bd2f7a4af1f696f6f3b4c99660745194ee0c2ad30","observation_id":"a4cd8744-61ce-4a54-ad7d-f2f08314b127","resolution":{"observed_at":"2026-08-06T21:16:03.249349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T21:16:03.347096Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.347096Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:e413d4a045d98131dc8aa16948eb51e422feef17b93f7d36b42a2b51ea25bace","observation_id":"70a4ed66-17e0-4a35-b601-b46b0efe62ab","resolution":{"observed_at":"2026-08-06T21:16:03.347096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.357770Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"42ddc803-06c1-452c-836b-cf20689238f3","year":2022},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.382308Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:23a9389cdbb1b19ca8db19d3537d857ea407890de79b5263645e9cab7690862e","observation_id":"461e5eb7-26cf-4b27-97d6-155d1422d189","resolution":{"observed_at":"2026-08-06T21:16:05.434381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.228147Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"31e88096-ec75-4b79-af8c-969e81bf31d8","year":2023},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.466342Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:28b23872139f7731c38d6bb378b72b5b3bcceec364aa6e3c22c7d719e921321a","observation_id":"0b771eb2-ae24-431b-ba13-cdd9712f509e","resolution":{"observed_at":"2026-08-06T21:16:05.262604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.120525Z","title":"Street-view image generation from a bird’s-eye view layout","venue":null,"work_id":"34d51f4c-90f4-41b9-a7e1-ff83b58dbf58","year":2024},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.574745Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:c4c6032a5c1f1c772783bd65616c45bc701578b37c8319456511a65bfcfb236f","observation_id":"b028a2df-cc99-4301-b53a-73e3d895b032","resolution":{"observed_at":"2026-08-06T21:16:05.169444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:05.025555Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":"08097d3e-4131-4552-aa73-427f04ec0c93","year":2021},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.662211Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:18496c0206a1c788b2e16c9735f3351c2e7a6092fe8ba7d351952d10bad96fc0","observation_id":"6d9dfdbf-2b59-41d4-8021-5289a736b6f4","resolution":{"observed_at":"2026-08-06T21:16:05.063741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:04.800361Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"ee31b02b-c2fe-430e-875c-580f0c872c33","year":null},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.734048Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:33e453517e1605db0d6e77423e4c25e443c4e09d557906a04fea0f82acb95d8d","observation_id":"e4caaf21-99d8-4422-bdf4-d9893319697d","resolution":{"observed_at":"2026-08-06T21:16:04.897313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:04.580446Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":"28ab4803-e1a1-4dcd-bbad-c9ef7e612191","year":2017},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.802897Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:b7dc117765c709ce1a2cceb18d94c7aa5a423e1189b747d88073ee194fc4c262","observation_id":"b1852ddb-eacc-40e9-9029-fe74ada547e5","resolution":{"observed_at":"2026-08-06T21:16:04.679187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:04.315467Z","title":"Loftr: Detector-free local feature matching with transformers","venue":null,"work_id":"211ea2b2-b849-4343-8859-ba064545bb89","year":2021},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.905488Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:e782ef38eaaf9fac51a70cceaa5f33fe0dc37e969b71c7c2c338a9df27918db1","observation_id":"dd832207-7098-46cb-aa28-d4769f758fd6","resolution":{"observed_at":"2026-08-06T21:16:04.447945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:16:04.106075Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"c0433c65-8322-4d07-aead-f5dd1cdaa046","year":2022},"citing_paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:03.985223Z"},"links":{"citing_paper":"/paper/2507.00707"},"observation_digest":"sha256:00c4b7269324b63636623362685cab192248ff862e7e1293274920b2f25e0637","observation_id":"f846a9e7-da1a-44c9-9d91-44a6ce011637","resolution":{"observed_at":"2026-08-06T21:16:04.213139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00707","last_updated":"2025-07-01T12:10:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:06:31.319886Z","submitted_at":"2025-07-01T12:10:11Z","title":"BEV-VAE: Multi-view Image Generation with Spatial Consistency for Autonomous Driving"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2507.00707."}