{"as_of":"2026-08-08T00:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b530cccd1baed3159ee60dd4ddc5827ffc5c4cb52b482f39ffe585b0ac1f3885","coverage":[{"denominator":123,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:39:33.523972Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04701/citation-record","integrity":"/paper/2608.04701/integrity","json":"/paper/2608.04701/citation-record.json","paper":"/paper/2608.04701"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:23.833592Z","title":"HyperReel: High-fidelity 6-DoF video with ray-conditioned sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:23.833592Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:e5d255a56a54c925590874c11a0eeb3741c2639bedd44eb8a2ae18a924e1b256","observation_id":"769d24f3-4276-47ab-bf58-0a41c1a8b5b5","resolution":{"observed_at":"2026-08-06T18:39:23.833592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:24.721924Z","title":"Vd3d: Taming large video diffusion transformers for 3d camera control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:24.721924Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:b395754d5b908ca9fe5c9dbdd337819923371ddc8f9ce684f0c935873f36b4bd","observation_id":"8fe0dbfc-1477-45e3-8e98-c7ff9caec63f","resolution":{"observed_at":"2026-08-06T18:39:24.721924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.534842Z","title":"Recammaster: Camera-controlled generative rendering from a single video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.534842Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:04671168fe32d9e2b1aaa0081229163ac32ec04664318e15b0b5c0d9d7a6fb8d","observation_id":"58fffe63-7d21-4a44-940a-2446f34cd810","resolution":{"observed_at":"2026-08-06T18:39:25.534842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.584804Z","title":"Syncammaster: Synchronizing multi-camera video generation from diverse viewpoints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.584804Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:aefa980ace89357d36b1f83ae0c7920b1643946b738e61929d3f4bbb1697a06b","observation_id":"2d13d07f-fc27-4ad6-a401-44441acef3f1","resolution":{"observed_at":"2026-08-06T18:39:25.584804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.652645Z","title":"Mip-nerf: A multiscale representation for anti-aliasing neural radiance fields","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.652645Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:aeaa5beb28fa499f48ca65e728341978d03ffa5eafde9b178f5e652f2e37b1d5","observation_id":"c850955e-a832-4f73-b448-a4c2c64ee766","resolution":{"observed_at":"2026-08-06T18:39:25.652645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.758785Z","title":"Mip-nerf 360: Unbounded anti-aliased neural radiance fields","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.758785Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:4ff704a198ebcbc157b90c24c2a31938519f7a00a1d84d12db2321542e637012","observation_id":"4c37c0fe-f8ea-425e-adac-7c4a6c747565","resolution":{"observed_at":"2026-08-06T18:39:25.758785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:25.848067Z","title":"Zip-nerf: Anti-aliased grid-based neural radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.848067Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:67d14d74738cc71fcf38053d49140e69585df84b3232830964f6dc0a0059537e","observation_id":"dee55b3a-b20b-4ba0-9a50-e50b47f54f1c","resolution":{"observed_at":"2026-08-06T18:39:25.848067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T18:39:25.912585Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:25.912585Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:f3c32796881ad548d2166ce876038f2052d6629be3de897737c748ad00065695","observation_id":"86ae3955-174c-4a0e-bc92-fa54fda7bed9","resolution":{"observed_at":"2026-08-06T18:39:25.912585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.032055Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.032055Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:be35af756e229508be34e606eb2379602ab65fd80cc351e48e36dbf987c1af24","observation_id":"468aa9ce-c49d-4f7f-9434-4c9d4327bc47","resolution":{"observed_at":"2026-08-06T18:39:26.032055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.159781Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.159781Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:8a5346fc195e0ae26ab735f04f3d369681bf10f19718dc3e43f6bcda4552d37c","observation_id":"451a9d82-aa24-47e3-ad7d-324be47c485b","resolution":{"observed_at":"2026-08-06T18:39:26.159781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.241951Z","title":"Hexplane: A fast representation for dynamic scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.241951Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:69a6e84229a16c609b484f02341739580a0cf4cde9b3e54a9a24e231cd0bb259","observation_id":"a81e46f1-751d-4f63-96af-00b4be64830e","resolution":{"observed_at":"2026-08-06T18:39:26.241951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.328838Z","title":"Uni3c: Unifying precisely 3d-enhanced camera and human motion controls for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.328838Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6a6cd8ea04594b23506be17f02aae586cc969eed09556fe3db7f16cd9b6b9399","observation_id":"486d6bec-ffb2-4397-ab75-b1cce53f4cf2","resolution":{"observed_at":"2026-08-06T18:39:26.328838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.391065Z","title":"Mvsnerf: Fast generalizable radiance field reconstruction from multi-view stereo","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.391065Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:3a872e4ff29ed339b0443b595939cfaa0c6c7357f2ecc72575acb22ba0afd3d6","observation_id":"44c6ad67-89e9-49b5-ba45-6af6318db70c","resolution":{"observed_at":"2026-08-06T18:39:26.391065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-06T18:39:26.478077Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.478077Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:96e8a19e4d28e8a0b14c20d6515c6ad831b249932aca6058d17adbb12f17c7ea","observation_id":"1c8e4d68-a0a9-4c4e-ae54-9eec7c072e7c","resolution":{"observed_at":"2026-08-06T18:39:26.478077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12375","last_updated":"2025-06-15T03:50:49Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:53:30Z","title":"Video Depth Anything: Consistent Depth Estimation for Super-Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12375","snapshot_observed_at":"2026-08-06T18:39:26.592889Z","title":"Video depth anything: Consistent depth estimation for super-long videos.arXiv:2501.12375, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.592889Z"},"links":{"cited_paper":"/paper/2501.12375","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:e1eeaf57aeca2d1d58c8668a086ead3795f36bc9d1948f29540d43127915be7a","observation_id":"a1ac38ed-ec1a-4c70-8835-a89107fa843d","resolution":{"observed_at":"2026-08-06T18:39:26.592889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.705710Z","title":"Mvsplat: Efficient 3d gaussian splatting from sparse multi-view images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.705710Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:3567eef2714c9f7ecbce25c31c1ede66d99094d3994a556d43543205a1958605","observation_id":"7cf94cf7-c846-47ac-8e08-cd2af6e452af","resolution":{"observed_at":"2026-08-06T18:39:26.705710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13384","last_updated":"2023-11-23T11:40:16Z","snapshot_observed_at":"2026-07-06T16:51:06.781541Z","submitted_at":"2023-11-22T13:27:34Z","title":"LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13384","snapshot_observed_at":"2026-08-06T18:39:26.797307Z","title":"Luciddreamer: Domain-free generation of 3d gaussian splatting scenes.arXiv preprint arXiv:2311.13384, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.797307Z"},"links":{"cited_paper":"/paper/2311.13384","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6a460cc81e41e868d7e3390df312ef037f5f9d3f76cf8fde5207aa74ef1ca2b5","observation_id":"8d44ce30-75cb-4e4a-b669-84c568b04b99","resolution":{"observed_at":"2026-08-06T18:39:26.797307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:26.915727Z","title":"Cogvideox-fun, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:26.915727Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:c2750aabb8fd7633cc0f9e7472d21c5547f9b63a213e01ac689646f040b4bef8","observation_id":"a933a4d4-0003-489d-acf4-7743de4756e2","resolution":{"observed_at":"2026-08-06T18:39:26.915727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.028938Z","title":"Meva: A large-scale multiview, multimodal video dataset for activity detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.028938Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:be4227c200428a1d54c481fb92b1841f2dfcbd21ce9960f5001a76d8c018e3c9","observation_id":"90bb4576-bd9d-46b2-8aab-4ccf285eef67","resolution":{"observed_at":"2026-08-06T18:39:27.028938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20309","last_updated":"2025-07-03T22:28:07Z","snapshot_observed_at":"2026-08-06T20:09:51.889461Z","submitted_at":"2024-03-29T17:29:58Z","title":"InstantSplat: Sparse-view Gaussian Splatting in Seconds","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20309","snapshot_observed_at":"2026-08-06T18:39:27.140041Z","title":"Instantsplat: Unbounded sparse-view pose-free gaussian splatting in 40 seconds.arXiv:2403.20309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.140041Z"},"links":{"cited_paper":"/paper/2403.20309","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:240f21b73c53542aa37944ca8ca252712fc33a713b5b68594872f8c1bb7a9c60","observation_id":"00ce304d-bf9e-4c9a-b0fa-fc9ad0599a1e","resolution":{"observed_at":"2026-08-06T18:39:27.140041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.254619Z","title":"Ae-nerf: Augmenting event-based neural radiance fields for non-ideal conditions and larger scene","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.254619Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:34753cf0d11b03a5b13521c4ef291e67434a549b3bbad1c6f0c3dbc581444ece","observation_id":"161ed4e1-fdca-4013-bc31-0ea89dae746a","resolution":{"observed_at":"2026-08-06T18:39:27.254619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.331520Z","title":"K-planes: Explicit radiance fields in space, time, and appearance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.331520Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:cf0c94316b55be5b2b763311323a70f4eb66a664d3fb1fb444e61dcdcb5895b2","observation_id":"8255a259-f316-408d-9a78-1a950ac137d0","resolution":{"observed_at":"2026-08-06T18:39:27.331520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.426239Z","title":"Dynamic view synthesis from dynamic monocular video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.426239Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:2ef16921aec9ecf3be48c673f952437c4c3071cdb0d9bf4f0a8ec5d51767e621","observation_id":"2f952cd2-4d11-4e74-bea3-b380794aefb1","resolution":{"observed_at":"2026-08-06T18:39:27.426239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12365","last_updated":"2024-05-13T19:06:48Z","snapshot_observed_at":"2026-07-06T17:46:46.415492Z","submitted_at":"2024-03-19T02:22:21Z","title":"GaussianFlow: Splatting Gaussian Dynamics for 4D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12365","snapshot_observed_at":"2026-08-06T18:39:27.524488Z","title":"Gaussianflow: Splatting gaussian dynamics for 4d content creation.arXiv preprint arXiv:2403.12365, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.524488Z"},"links":{"cited_paper":"/paper/2403.12365","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:d0f5b30484c133e5da09e6d7d0cfbdeba1047a288f67153cae89dee4714222bd","observation_id":"79747d4e-60ed-4b31-817b-2d46dbad912d","resolution":{"observed_at":"2026-08-06T18:39:27.524488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.644521Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.644521Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:36623ed2fdce7d920905c8fd83cc2c11cdf897f876fcde8ba12ac33b931c41ca","observation_id":"fd5358de-745a-4376-b3f2-5d97d80925c5","resolution":{"observed_at":"2026-08-06T18:39:27.644521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.763840Z","title":"Fastnerf: High-fidelity neural rendering at 200fps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.763840Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:fb828d32620dd947771014421cf3f1965e1f7ec203bfb3d710134d70a41ec2d4","observation_id":"ee03573d-c21c-445c-93a3-0a3de8f2b8d1","resolution":{"observed_at":"2026-08-06T18:39:27.763840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.845553Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.845553Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:bc5c229e9956bf5b1edb59951958d57be945f400b1dbf0d933629e1173646561","observation_id":"b1c86394-00d8-475e-a719-fc6abb078946","resolution":{"observed_at":"2026-08-06T18:39:27.845553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:27.938002Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:27.938002Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:50f8cb1fede5ec86f57aca38292dc566496947b9a129b6928b1a0c23f337180c","observation_id":"9a2efdd7-a369-45fe-ba12-4790379f3794","resolution":{"observed_at":"2026-08-06T18:39:27.938002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.002426Z","title":"Diffusion as shader: 3d-aware video diffusion for versatile video generation control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.002426Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:aad00374bb1f1f9035c607ba145dbf45b1d60dda2634f96f9ac0553d7130321f","observation_id":"cb473ccd-7ebf-4a5e-a291-2f8bb1472d1e","resolution":{"observed_at":"2026-08-06T18:39:28.002426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.097988Z","title":"Sparsenerf: Distilling depth ranking for few-shot novel view synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.097988Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:365988b640ef6cb7ff00ced35cd72af942504bd99d15664e334e856b9cb764b2","observation_id":"998a7fb4-e8c5-4c4a-8ba6-19a0a77069be","resolution":{"observed_at":"2026-08-06T18:39:28.097988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.183868Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.183868Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:5b987ec6fcc496eb0c2c423c2951385a3d22e61a7323edae0707111f796053af","observation_id":"e0cce43d-e7ad-4f7d-8894-8a3bd9897fa5","resolution":{"observed_at":"2026-08-06T18:39:28.183868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.289068Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.289068Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1516da72d83a48a303a1f241f415f7cb9be16a17f9352890c600d1da5e36365e","observation_id":"d0f11b97-3e74-40db-9aca-165df33a9c41","resolution":{"observed_at":"2026-08-06T18:39:28.289068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.359598Z","title":"Tri-miprf: Tri-mip representation for efficient anti-aliasing neural radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.359598Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:f7f3b438b77f9ee806312088cb9966c4716904008b7490ac3f32ef2d65e72ee3","observation_id":"5980f02b-83ce-4f61-a2cf-f164a8e98b76","resolution":{"observed_at":"2026-08-06T18:39:28.359598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-07T23:17:31.541423Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-06T18:39:28.438741Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos.arXiv preprint arXiv:2409.02095, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.438741Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:fc6e5940866048212dc7629141da30ac9e00366ed2ae85810200109f1a61805f","observation_id":"ce60f8a1-2a92-48d5-a927-09230e65782c","resolution":{"observed_at":"2026-08-06T18:39:28.438741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10934","snapshot_observed_at":"2026-08-06T18:39:28.517132Z","title":"Vipe: Video pose engine for 3d geometric perception","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.517132Z"},"links":{"cited_paper":"/paper/2508.10934","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7012bb01de171c0a12bb64a53ad530349793f4a6869c579af1723e6c9f11cef8","observation_id":"dc20168e-7ce9-4952-a3ef-a3f10fd3146e","resolution":{"observed_at":"2026-08-06T18:39:28.517132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.601018Z","title":"Roompainter: View-integrated diffusion for consistent indoor scene texturing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.601018Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:299b7a36de8ddad269cd29e565d3a66007c31ce6b32df9108d857b5f58b35d65","observation_id":"ec05a56c-969e-45a1-b196-578961dfac91","resolution":{"observed_at":"2026-08-06T18:39:28.601018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.705252Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.705252Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:17cadae808e66c07be3d2768695aebdf0c08cd9080264bb8fc6590c858776d78","observation_id":"2bf6148f-3857-4b32-a54b-a66be40d8854","resolution":{"observed_at":"2026-08-06T18:39:28.705252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.773560Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM TOG, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.773560Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:af5bbb0919ce5e4a971f5123ba53576b733c7b048e25a9867b35388ebd31907e","observation_id":"0555b1df-885b-42be-ac8b-ab0ad77a673f","resolution":{"observed_at":"2026-08-06T18:39:28.773560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10893","last_updated":"2025-08-14T17:58:05Z","snapshot_observed_at":"2026-08-05T20:18:34.296996Z","submitted_at":"2025-08-14T17:58:05Z","title":"STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10893","snapshot_observed_at":"2026-08-06T18:39:28.822177Z","title":"Stream3r: Scalable sequential 3d reconstruction with causal transformer.arXiv preprint arXiv:2508.10893, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.822177Z"},"links":{"cited_paper":"/paper/2508.10893","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:4761a20dffe628735abab4e972983a22ee6be26e224b3bc2d0b3d5c612a7c66b","observation_id":"90a4c676-3bfd-465c-84b0-1b9015642161","resolution":{"observed_at":"2026-08-06T18:39:28.822177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:28.884751Z","title":"Fast view synthesis of casual videos with soup-of-planes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.884751Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:c46a96e55c64c34afb39d26f2280eb88204b47334ec48b23cb0c3f39dc5dbcd8","observation_id":"5fca4c42-65e5-45a4-b0b3-32f07d719eb8","resolution":{"observed_at":"2026-08-06T18:39:28.884751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17421","last_updated":"2024-11-29T18:53:12Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:07Z","title":"MoSca: Dynamic Gaussian Fusion from Casual Videos via 4D Motion Scaffolds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17421","snapshot_observed_at":"2026-08-06T18:39:28.956722Z","title":"Mosca: Dynamic gaussian fusion from casual videos via 4d motion scaffolds.arXiv preprint arXiv:2405.17421, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:28.956722Z"},"links":{"cited_paper":"/paper/2405.17421","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:892af08119779919077ae7b6a3828cd11a7db8f764335f3090302ed589509ba6","observation_id":"573b54e6-2e2a-43be-b343-6e1b6f32cf32","resolution":{"observed_at":"2026-08-06T18:39:28.956722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04847","last_updated":"2023-05-10T05:31:59Z","snapshot_observed_at":"2026-08-03T20:31:56.133732Z","submitted_at":"2022-10-10T17:03:23Z","title":"NerfAcc: A General NeRF Acceleration Toolbox","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04847","snapshot_observed_at":"2026-08-06T18:39:29.042224Z","title":"Nerfacc: A general nerf acceleration toolbox.arXiv preprint arXiv:2210.04847, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.042224Z"},"links":{"cited_paper":"/paper/2210.04847","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:2011104001b965247639df6320258697d594ec5e629c687de54d362c205787a6","observation_id":"5a9eb8fe-c915-44b6-99c6-0cf89181d094","resolution":{"observed_at":"2026-08-06T18:39:29.042224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.111731Z","title":"Spacetime gaussian feature splatting for real-time dynamic view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.111731Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:71216b3edf1c5fa7547a33dc3333ba0869de83b4feb5d9766ceddd0cdeb80051","observation_id":"58e8a04a-9c18-4b99-bf68-209b9d030735","resolution":{"observed_at":"2026-08-06T18:39:29.111731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.174331Z","title":"Neural scene flow fields for space-time view synthesis of dynamic scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.174331Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7102cb483ad2b5048e4b0cfab0b2ae3474bb9b791f349dd213c21a6ed07ae505","observation_id":"0f407144-8978-430f-99e2-7af2060853b1","resolution":{"observed_at":"2026-08-06T18:39:29.174331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.237316Z","title":"Dynibar: Neural dynamic image-based rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.237316Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:22b25d8b5c74f1244e949fd34fcb0ddb9b126fdd96364069c0948ad3d19c9b93","observation_id":"da13ffca-f908-4bb7-805c-07c98691cfb8","resolution":{"observed_at":"2026-08-06T18:39:29.237316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12091","last_updated":"2025-04-26T13:48:44Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:58:17Z","title":"Wonderland: Navigating 3D Scenes from a Single Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12091","snapshot_observed_at":"2026-08-06T18:39:29.317516Z","title":"Wonderland: Navigating 3d scenes from a single image.arXiv preprint arXiv:2412.12091, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.317516Z"},"links":{"cited_paper":"/paper/2412.12091","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:736023364380d4142cc22d79b0dced788fdfa8f942199466c6648b2670f0d077","observation_id":"54c225c0-d606-4085-8c50-408b800a7ada","resolution":{"observed_at":"2026-08-06T18:39:29.317516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.378999Z","title":"Analytic-splatting: Anti-aliased 3d gaussian splatting via analytic integration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.378999Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:af7a0838701d345fef94df675f051261e9b4e1c66f6f64c97713e1eefd207989","observation_id":"53003682-e36b-4b5f-b7b3-d4371a895f8c","resolution":{"observed_at":"2026-08-06T18:39:29.378999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-06T18:39:29.458323Z","title":"Open-sora plan: Open-source large video generation model.arXiv preprint arXiv:2412.00131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.458323Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:99563fc0ecfd4d701f208e23c58435886a8b6a1a73e87c9ab3d71337e1721f87","observation_id":"76d42315-5f7e-4a08-8361-bb61bc3572d4","resolution":{"observed_at":"2026-08-06T18:39:29.458323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.557805Z","title":"Barf: Bundle-adjusting neural radiance fields","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.557805Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:806a5e0cb2be9ff0b2eb9ed5cfcb2ae05de61c21cdb43c31d8389edcc4b98f20","observation_id":"1e61ebbd-26fe-43ac-bfc5-0d7335376999","resolution":{"observed_at":"2026-08-06T18:39:29.557805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.636927Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.636927Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:42a538c8239bb6644ce224fa18cff379f74ea5ebc9e21aeacd368c78c5479c5a","observation_id":"81e622cb-5d58-4905-a9af-07bb2ec38caf","resolution":{"observed_at":"2026-08-06T18:39:29.636927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.722061Z","title":"Rip-nerf: Anti-aliasing radiance fields with ripmap-encoded platonic solids","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.722061Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:89e1c6ea1a7c59182fce6037a5fc38cb792d0ba2bdb3dfaab116ce5f180abc6e","observation_id":"9e4e74a2-3e56-420b-b332-2567a524535a","resolution":{"observed_at":"2026-08-06T18:39:29.722061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:29.816185Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.816185Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:8ff43df39e20dabc8ed25ca0802c390c07e7253bdc028e9833c98cde049434b7","observation_id":"637e9292-1f90-4598-aa7c-4bf05c4f7eed","resolution":{"observed_at":"2026-08-06T18:39:29.816185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20785","last_updated":"2025-03-26T17:59:44Z","snapshot_observed_at":"2026-08-07T16:34:48.226009Z","submitted_at":"2025-03-26T17:59:44Z","title":"Free4D: Tuning-free 4D Scene Generation with Spatial-Temporal Consistency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20785","snapshot_observed_at":"2026-08-06T18:39:29.925434Z","title":"Free4d: Tuning-free 4d scene generation with spatial-temporal consistency.arXiv preprint arXiv:2503.20785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.925434Z"},"links":{"cited_paper":"/paper/2503.20785","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:e1fc5bb989e4439fe129ba255de277a8e0d7ed4f0580a073317388d4d2c222ce","observation_id":"a8d59a42-a799-4d22-92f7-b7d5b78e6c1c","resolution":{"observed_at":"2026-08-06T18:39:29.925434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.003579Z","title":"See4d: Pose-free 4d generation via auto-regressive video inpainting.arXiv preprint arXiv:2510.26796, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.003579Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:3f371129666643f760842d13797ecb9a6ca2f870dd1a1fb12c31c908a5f8578a","observation_id":"78cdc685-08e7-4f49-a465-f0cf0d440e35","resolution":{"observed_at":"2026-08-06T18:39:30.003579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.094528Z","title":"You see it, you got it: Learning 3d creation on pose-free videos at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.094528Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:729963abe8c96a1aa821018e67d1856057462b599451fe88335f9ace6cdc1945","observation_id":"bbef90e0-4b4d-4de1-b902-fc6c16a76d2e","resolution":{"observed_at":"2026-08-06T18:39:30.094528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18633","last_updated":"2025-08-26T03:18:31Z","snapshot_observed_at":"2026-08-05T16:23:35.382635Z","submitted_at":"2025-08-26T03:18:31Z","title":"ROSE: Remove Objects with Side Effects in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18633","snapshot_observed_at":"2026-08-06T18:39:30.164403Z","title":"Rose: Remove objects with side effects in videos.arXiv preprint arXiv:2508.18633, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.164403Z"},"links":{"cited_paper":"/paper/2508.18633","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:49f92ef3cb5303a670e06f4991a22312d844d832d7b73b9e1395502694b2f646","observation_id":"8c614ffc-41a7-401a-8fa4-e5a0cf4c670b","resolution":{"observed_at":"2026-08-06T18:39:30.164403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.234553Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.234553Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:81dd17d6bac47f1367c9b181939fb57152b927f4fc58aff0f3b1bdec55eb1d12","observation_id":"5615a911-6bbd-495b-8cb6-1355093eec02","resolution":{"observed_at":"2026-08-06T18:39:30.234553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.311305Z","title":"Multidiff: Consistent novel view synthesis from a single image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.311305Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:2325be21fa0da0bb2df0552ef63e0389c26d2a51a7cb232343117528a20f8639","observation_id":"607840ad-6bc8-4ecb-9ed2-15cbba771280","resolution":{"observed_at":"2026-08-06T18:39:30.311305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.355482Z","title":"Instant neural graphics primitives with a multiresolution hash encoding.ACM Transactions on Graphics (ToG), 41(4):1–15, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.355482Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7a2df59775f61abcdc23031e7313394e65b8c6eb1cc997fdfc09e0936fac06fa","observation_id":"38a5225e-3015-436a-a1df-0f87dd53f666","resolution":{"observed_at":"2026-08-06T18:39:30.355482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-06T18:39:30.410302Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation.arXiv preprint arXiv:2407.02371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.410302Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:cfe9cbcdfc95de3ab198f6cc53a34ad31846264e44f2b0821a69d0acdaf268f7","observation_id":"42a0f179-6c15-4652-8d0a-7daaf41cea4a","resolution":{"observed_at":"2026-08-06T18:39:30.410302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:40.144429Z","title":"Carvekit: Image background remove tool","venue":null,"work_id":"7e6bd04c-59a2-4c8f-a3e2-0c3d401b0cb4","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.480062Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:2f03b856b8a347d73ef7f859f1aba8e69180935ae2d6026be5e915443d6b5a0c","observation_id":"e14ab24b-6e45-41ba-9598-040a6e20fe55","resolution":{"observed_at":"2026-08-06T18:39:40.207550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.985958Z","title":"Bridging implicit and explicit geometric transformation for single-image view synthesis.IEEE TPAMI, 2024","venue":null,"work_id":"1a6cbed2-b3ce-434c-bc6e-6b1021816c8a","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.562642Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:672bf4f441d93b3fe375c5ef3886cc1798c878dc785c4e053d7f17c6553cdd0f","observation_id":"ea532d81-ceda-409d-a327-0015772a5721","resolution":{"observed_at":"2026-08-06T18:39:40.062476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.846120Z","title":"Barron, Sofien Bouaziz, Dan B Goldman, Steven M","venue":null,"work_id":"f1c58457-0709-40d5-8745-aaf2996d31c8","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.640281Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:a437b53037c941f11ed5dd826e3733f059b5a13f173f851b71db60d47b45ec0b","observation_id":"7e7457d6-64d8-4bb6-a1db-f4fad87223ad","resolution":{"observed_at":"2026-08-06T18:39:39.911562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:30.721102Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.721102Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:72d4094ae20eaaa5cfd021441c07751abb4ddd3a93272e6db48e9e90f58c0c50","observation_id":"8442c808-db44-4d7e-b770-dd0fec475cb8","resolution":{"observed_at":"2026-08-06T18:39:30.721102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.715710Z","title":"D-nerf: Neural radiance fields for dynamic scenes","venue":null,"work_id":"a31d376b-263e-4911-aac8-d953cbd5fe01","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.785657Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:f7639fc928f2770e07fc8e4052a45ec5414f3a82d1d37dcd5b51651043e60849","observation_id":"feb2ec6d-3315-4216-a0ea-def88a583fb0","resolution":{"observed_at":"2026-08-06T18:39:39.781278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T18:39:30.868075Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.868075Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:2d5b8c5f2cd15d7e46369455e7173fcba0a797f75cff7fbba1539c5a8e960d5b","observation_id":"c4f282a9-0b37-4334-91c8-b31142020280","resolution":{"observed_at":"2026-08-06T18:39:30.868075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.586642Z","title":"Common objects in 3d: Large-scale learning and evaluation of real-life 3d category reconstruction","venue":null,"work_id":"86f7c327-66b4-44c2-9235-b164594e19ba","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:30.950795Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:e1663de491a07320f212f972d41587d69ab62b8d09e52a88f58cb91653035adc","observation_id":"bbeac3e7-74c6-4c29-a40a-ddf5e8c531c9","resolution":{"observed_at":"2026-08-06T18:39:39.648751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.431499Z","title":"Gen3c: 3d-informed world-consistent video generation with precise camera control","venue":null,"work_id":"50130bf2-5ab4-491b-adde-a4a25579da88","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.048960Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:46b33228f53eb42e9a10422d2349825822bb538208a1c4c5d433c54f8522cb11","observation_id":"4a35d1f9-6542-4280-a6c0-8bfcbb170e11","resolution":{"observed_at":"2026-08-06T18:39:39.511183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.318448Z","title":"Pixelsynth: Generating a 3d-consistent experience from a single image","venue":null,"work_id":"de11a620-a00d-4a23-bbbf-3c891b4d340a","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.164464Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1a4d768fcc59d02b4744623bffb77f08e607c34a1142f4ae2a1a1d7980d7326d","observation_id":"42486f41-3f6a-4b39-ae85-6015230db3ce","resolution":{"observed_at":"2026-08-06T18:39:39.371500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.209326Z","title":"Geometry-free view synthesis: Transformers and no 3d priors","venue":null,"work_id":"061310d3-2196-409d-a80c-6778251b3fbd","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.271266Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:738bc8d157db6c572b381c7b4d3568cd21ebf7663692947a1481ead8763a188e","observation_id":"ca39ca71-b0f8-44cb-926b-73c4aac9dace","resolution":{"observed_at":"2026-08-06T18:39:39.251737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:31.396493Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.396493Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:80be470993f15673c2cee4d2e25fb5932588d52854ec3c9b5ef64e2dbddd0cd7","observation_id":"ac180335-7e63-4534-ba1c-b1edb707dbe2","resolution":{"observed_at":"2026-08-06T18:39:31.396493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:39.089337Z","title":"ZeroNVS: Zero-shot 360-degree view synthesis from a single real image","venue":null,"work_id":"b6eb9679-3a64-4c46-a5e0-1d9f1df866d0","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.444560Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:66155d477292bd31f2a7e2435736b0793619f8bbf10d0923d815c1ab6d71c74f","observation_id":"94518c4c-15d8-40fa-b881-88ea086f478c","resolution":{"observed_at":"2026-08-06T18:39:39.148856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.977314Z","title":"Assembly101: A large-scale multi-view video dataset for understanding procedural activities","venue":null,"work_id":"79b9a4d9-a7ce-4e31-b43e-a910ed24fb71","year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.511295Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:5799827da60206c2427725bdc382bad389be36f7e82c9cf494797ea34e19a403","observation_id":"2433159d-a042-4701-8bae-10f9be7b9c14","resolution":{"observed_at":"2026-08-06T18:39:39.020544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07199","last_updated":"2025-03-11T17:06:18Z","snapshot_observed_at":"2026-08-07T04:05:31.893617Z","submitted_at":"2024-04-10T17:57:41Z","title":"RealmDreamer: Text-Driven 3D Scene Generation with Inpainting and Depth Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07199","snapshot_observed_at":"2026-08-06T18:39:31.563419Z","title":"Realmdreamer: Text-driven 3d scene generation with inpainting and depth diffusion.arXiv preprint arXiv:2404.07199, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.563419Z"},"links":{"cited_paper":"/paper/2404.07199","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:8528ab4022938b3f5a58eb376405991abedd2a0abbe57072bc58a92a492b387b","observation_id":"9cb29a50-6b55-4c01-a23b-8676093c2838","resolution":{"observed_at":"2026-08-06T18:39:31.563419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:31.646693Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.646693Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:61918424f5d59257604291a2e671fd48d18be7c38b7830679f7d06f91c1ec1f3","observation_id":"8f6d3d5f-2128-4f2a-8477-5e23fe345789","resolution":{"observed_at":"2026-08-06T18:39:31.646693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.819577Z","title":"Nerfplayer: A streamable dynamic scene representation with decomposed neural radiance fields.IEEE TVCG, 2023","venue":null,"work_id":"818970fd-9566-452e-bbfc-9727f78e2550","year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.711019Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:c213aa28036d53caa2dee9f1711d8d1d97ae38b0a14a53d049b7f008e5ab6da6","observation_id":"20382936-777c-4be5-8b5f-b43c0f843c52","resolution":{"observed_at":"2026-08-06T18:39:38.877071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.662584Z","title":"Dynamic gaussian marbles for novel view synthesis of casual monocular videos","venue":null,"work_id":"ee08e7c2-f4ef-4941-bc76-b3804ee1f3f4","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.793781Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:8be2d22b28d25b2d1c53b22d4bff3522e9906521e6262543efc1608cfffd05e7","observation_id":"0a13f126-ef5b-4111-910d-fa6ef9ae3870","resolution":{"observed_at":"2026-08-06T18:39:38.725859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04928","last_updated":"2024-11-07T18:07:31Z","snapshot_observed_at":"2026-08-06T07:44:13.960536Z","submitted_at":"2024-11-07T18:07:31Z","title":"DimensionX: Create Any 3D and 4D Scenes from a Single Image with Controllable Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04928","snapshot_observed_at":"2026-08-06T18:39:31.932292Z","title":"Dimensionx: Create any 3d and 4d scenes from a single image with controllable video diffusion.arXiv preprint arXiv:2411.04928, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:31.932292Z"},"links":{"cited_paper":"/paper/2411.04928","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:d527335b2cc2057120a1fe45f83eb01c8ba35c7bd052dc0dcc75dade98337158","observation_id":"6da1b104-eadc-4a4e-b66f-74ad57cc3554","resolution":{"observed_at":"2026-08-06T18:39:31.932292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.505739Z","title":"Non-rigid neural radiance fields: Reconstruction and novel view synthesis of a dynamic scene from monocular video","venue":null,"work_id":"acf7bea4-a060-44c8-a81c-43674155077e","year":2021},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.033471Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7fe537f0cc1784db3955f223d7387b64ea216b61e6999065be7f780d6c927396","observation_id":"d4bf4861-3905-45e3-80fe-254b180a0a7f","resolution":{"observed_at":"2026-08-06T18:39:38.573027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.383592Z","title":"Megascenes: Scene-level view synthesis at scale","venue":null,"work_id":"b682f2ca-e109-4c28-8c35-0f012cd539ee","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.143686Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:93ba38cc2c820544c847c0fb8facaa9175148e22b557b6d756518ee8c535d072","observation_id":"9c78607c-fb80-4bde-a3a7-9b8502b783aa","resolution":{"observed_at":"2026-08-06T18:39:38.444883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:32.254366Z","title":"Generative camera dolly: Extreme monocular dynamic novel view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.254366Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:f4eb0e4e9cd0881388485bc61c1cad3cb161d5748425ef1ccc34dc13038b1f47","observation_id":"878e1383-d026-4cfc-899b-e75395707de4","resolution":{"observed_at":"2026-08-06T18:39:32.254366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.231306Z","title":"Ref-nerf: Structured view-dependent appearance for neural radiance fields","venue":null,"work_id":"744b054c-4386-4c01-ade5-0bc1f49571a2","year":2022},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.326764Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:b319564f5ab427858071829a4759c37a2992dcab1619a535850dd9a38a2c31fb","observation_id":"310624c9-b6e8-45c4-b2b1-1c4bca5447c4","resolution":{"observed_at":"2026-08-06T18:39:38.297448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T18:39:32.420823Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.420823Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:589fd26c2eb9a12f45dd9775ab1ed9fb449e5c157254af241f5a3995033fa5e4","observation_id":"25c811b3-865c-470a-929b-1b7a5e1b8344","resolution":{"observed_at":"2026-08-06T18:39:32.420823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:38.099551Z","title":"Vistadream: Sampling multiview consistent images for single-view scene reconstruction","venue":null,"work_id":"dd223281-e317-4621-aa23-8f29233584f9","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.518945Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1e097b3e7661acf23843f879e26973f1d79e0c7e1a46954af6d0899e79ea2ba8","observation_id":"54a68a29-d1f5-4842-b201-de036712bbdf","resolution":{"observed_at":"2026-08-06T18:39:38.160737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.959823Z","title":"Videoscene: Distilling video diffusion model to generate 3d scenes in one step","venue":null,"work_id":"4ba613a5-9569-4122-bdae-0420e30f1859","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.620533Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:60274ac19e944883be00d52501db4b760a694315064ee4ab3b35a839f9193a39","observation_id":"ec1af565-83d8-4062-bd30-3ca606e98cfc","resolution":{"observed_at":"2026-08-06T18:39:38.016938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:32.703246Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.703246Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:b64e7cc779ce36d4f9ced4dc7f32114f0c0e1ca826daf8327f13a39ee6f8793b","observation_id":"ed6e699c-8b3d-40dc-8273-e4cb7455d116","resolution":{"observed_at":"2026-08-06T18:39:32.703246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:32.758157Z","title":"Shape of motion: 4d reconstruction from a single video.arXiv preprint arXiv:2407.13764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.758157Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:b0013596210a855a291a9a53f9b2c6e071b236b1648d09c03c5562c01094911b","observation_id":"002ffc1e-7d16-4376-aba4-55eed83c317a","resolution":{"observed_at":"2026-08-06T18:39:32.758157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.819701Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":null,"work_id":"a5ae15b6-532a-4137-ac82-e84c58075b17","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.837122Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6e3d385934f3b2974b98d81c83aca3d967907fd7678cf11e56e7b5bc52092cb3","observation_id":"2cfec30c-8885-4f1e-9795-80022a519882","resolution":{"observed_at":"2026-08-06T18:39:37.873305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:32.893325Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.893325Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:90ad9b6fdfef1f28118b50f726e76083929e7dde0d8987519c9eb340fdab3ad8","observation_id":"8fb4c8fc-23f7-4444-bd5c-0a6e6d8664a0","resolution":{"observed_at":"2026-08-06T18:39:32.893325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.686243Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"8968cc00-95f8-45da-9bbe-2fbff1cd858c","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:32.953301Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6b012427c009fb7926aac9f2b7014cfb4a350f8ce020c80e608da35975ae2b42","observation_id":"c59d133f-8754-4a71-ba87-ccecfaafd207","resolution":{"observed_at":"2026-08-06T18:39:37.752001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.576788Z","title":"Synsin: End-to-end view synthesis from a single image","venue":null,"work_id":"5278ea03-d917-4970-bb57-6d6d77cc592a","year":2020},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.003635Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:4ed2f34ab21078d71c61ed6badf831809157c53f579dc7c987a8ac4c570fa8f5","observation_id":"81eb40c6-fe82-4380-a418-25c825292155","resolution":{"observed_at":"2026-08-06T18:39:37.631562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.444153Z","title":"4d gaussian splatting for real-time dynamic scene rendering","venue":null,"work_id":"5c9d4927-0cd4-4f3d-a52f-2fb3bfc670be","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.050247Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:6858f46357560c84baf32c5f4bf8e54044b5d06fd9f112fb417ae985b5d5dfb9","observation_id":"388544a4-58ca-4e63-920c-2740ca78c2c9","resolution":{"observed_at":"2026-08-06T18:39:37.518304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18613","last_updated":"2024-12-18T21:21:07Z","snapshot_observed_at":"2026-07-06T19:58:09.591787Z","submitted_at":"2024-11-27T18:57:16Z","title":"CAT4D: Create Anything in 4D with Multi-View Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18613","snapshot_observed_at":"2026-08-06T18:39:33.106709Z","title":"Cat4d: Create anything in 4d with multi-view video diffusion models.arXiv preprint arXiv:2411.18613, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.106709Z"},"links":{"cited_paper":"/paper/2411.18613","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:f4450e2d89142449214933da1638a8de7f16f0ae0be7c094e737daa786ceb2e7","observation_id":"299962af-bbae-44b6-9d78-830c227f65fa","resolution":{"observed_at":"2026-08-06T18:39:33.106709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.337404Z","title":"Reconfusion: 3d reconstruction with diffusion priors","venue":null,"work_id":"ee34808c-d872-4795-8376-dd396fc02787","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.163955Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:dec40ad574ffa0ad9131d5da677985c13e1c70c483072d15cc827089cfb4df86","observation_id":"4aed8aae-d666-438a-bad9-9a7d4618e0f3","resolution":{"observed_at":"2026-08-06T18:39:37.386498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.216997Z","title":"Trajectory attention for fine-grained video motion control","venue":null,"work_id":"3511251b-916d-4067-abda-1331eb72a028","year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.206882Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:ea7719e502a50b9ffb5b01e2d5c0f145976e0d039a364ed828e712fccc49135b","observation_id":"712d0dc5-e496-44f1-8268-7226da6a36a3","resolution":{"observed_at":"2026-08-06T18:39:37.266916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-07-06T16:35:15.777674Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-06T18:39:33.283876Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors.arXiv preprint arXiv:2310.12190, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.283876Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:1c15d16ea4ef03d2a20b0605bea55f46e588c986f9854fa196cbfa25d9d719c8","observation_id":"ab944705-912c-41cb-a689-3907f113dd6c","resolution":{"observed_at":"2026-08-06T18:39:33.283876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-06T18:39:33.351341Z","title":"Camco: Camera-controllable 3d-consistent image-to-video generation.arXiv preprint arXiv:2406.02509, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.351341Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7dea67ab99b7a8f3e278c71d6b6916faea55f2a6607a30bfe04be72850c9d54c","observation_id":"67b4f520-4868-4ab3-9192-88f64021211e","resolution":{"observed_at":"2026-08-06T18:39:33.351341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:33.405744Z","title":"4dgt: Learning a 4d gaussian transformer using real-world monocular videos.arXiv preprint arXiv:2506.08015, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.405744Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:5b7e737b1273b833bd7dfd60099d3724fede31f151ab261b28cc7d339da66553","observation_id":"e01e58e9-c511-467f-aeae-196e39679f86","resolution":{"observed_at":"2026-08-06T18:39:33.405744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-06T18:39:33.462649Z","title":"Depth anything v2.arXiv:2406.09414, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.462649Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:0efa0b53fe9bc91df515fa2f2e7a1172e7820efd726e446f8f1414646c89176d","observation_id":"186a31ad-6fa6-41e0-ab33-aced6f7c7dbc","resolution":{"observed_at":"2026-08-06T18:39:33.462649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:39:37.073065Z","title":"Real-time photorealistic dynamic scene representation and rendering with 4d gaussian splatting","venue":null,"work_id":"c32d2069-fbe7-4bbb-8794-f77f9d2a0b73","year":2024},"citing_paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:33.523972Z"},"links":{"citing_paper":"/paper/2608.04701"},"observation_digest":"sha256:7ba005bba3f6fbab32a66df01625c1759b1cc18d36081d668a5b73f6700e8c24","observation_id":"c90e8d97-0adc-4b54-8dd1-c1e308933ae4","resolution":{"observed_at":"2026-08-06T18:39:37.144279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04701","last_updated":"2026-08-05T11:10:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:16:29.035003Z","submitted_at":"2026-08-05T11:10:52Z","title":"UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":123},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 123 outbound references and 0 inbound Pith citation observations for arXiv:2608.04701."}