{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32dbe5971ca5522cb573e48089c75e5ceae030e54a5f64c8b8890e6b028f434b","coverage":[{"denominator":116,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T22:58:51.792047Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":772,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:57:41.596848Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":67,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:5040ec248c9e8033cc546449c7493904cc35ebe07ee307fd470a9c0427cd0f86","observation_id":"677f517e-ed14-4944-b95a-9fa4b713fb03","resolution":{"observed_at":"2026-05-15T17:51:05.543020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:45:35.754742Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2401.03048"},"observation_digest":"sha256:54aa6c3da6978a26129236dd1f56fe6d169d167f5268fb729cf835ead424ce44","observation_id":"75e31660-5491-4556-88cb-ccdecfdb3d77","resolution":{"observed_at":"2026-05-13T21:45:35.812408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:ef8bb7c252b71e9d6818686f6d86a02d2f105d0723594fccbac4437487db84d3","observation_id":"1f3eaacc-c372-456e-9c1d-a941e73eca30","resolution":{"observed_at":"2026-05-18T04:55:20.419878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T13:43:11.024069Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2402.17177"},"observation_digest":"sha256:209fd7a1a61919549f4221bae7cf135ae7183f6065470ebd216094bb4f4b9185","observation_id":"321e56ae-80eb-47fa-998c-2420a872f1e1","resolution":{"observed_at":"2026-05-13T13:43:11.088767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-12T08:27:53.446686Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2403.03206"},"observation_digest":"sha256:85963e492b53ac684f97959cfc1f09dcb6a85881cff9091449229efce8f4c6f2","observation_id":"076c8b60-ee63-4f63-8fe3-f9764c5aca6e","resolution":{"observed_at":"2026-05-12T08:27:53.615646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-13T02:06:23.410241Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2404.02101"},"observation_digest":"sha256:c819b6e2031487ecd9ae7a5eca2122175129f6e7416ff40129b0f0b4d6299f2b","observation_id":"6425987e-38d7-48ff-841b-678099452bc6","resolution":{"observed_at":"2026-05-13T02:06:23.575572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2404.07191","last_updated":"2024-04-14T16:54:24Z","snapshot_observed_at":"2026-07-06T17:58:25.894552Z","submitted_at":"2024-04-10T17:48:37Z","title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:15:33.430513Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2404.07191"},"observation_digest":"sha256:ef5d9e060f7d0a84baaafc4c67b12142bd4a858e782623b2ce5fecfd4c2b16bb","observation_id":"c828e4c4-3656-491e-84ee-4f08741443cf","resolution":{"observed_at":"2026-05-13T21:15:33.457880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2405.10314","last_updated":"2024-05-16T17:59:05Z","snapshot_observed_at":"2026-07-06T18:15:24.541427Z","submitted_at":"2024-05-16T17:59:05Z","title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T21:29:51.062396Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2405.10314"},"observation_digest":"sha256:5f1d74705b186326555f86b618cd2e55cc0de12d02f92f01f0afd6b6eb6b84c9","observation_id":"a3382bfb-fddc-4c12-a12d-8968b9ab22e9","resolution":{"observed_at":"2026-05-19T21:29:51.094198Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:37.599691Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2406.03520"},"observation_digest":"sha256:46f214c665e49114f1e5efb7a8159014b9d1af8d3ac9c3b0fd94c379a56899e4","observation_id":"0bf5dc40-2682-4de3-8de1-cb57f57c26ad","resolution":{"observed_at":"2026-05-20T11:34:37.690990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:34:53.141898Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2407.02371"},"observation_digest":"sha256:c5c89aa57eee811e28ece56cdf323af125237a6b091b951d20cdff6b517c1a04","observation_id":"bb8bf142-82cf-43d4-874c-aa0f3ee16a3a","resolution":{"observed_at":"2026-05-14T20:34:53.169615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:22.224924Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2408.06072"},"observation_digest":"sha256:1615f9fd1353b88b628e1834c5951b68d9c78358a505541f753e3d5e7b9f9d08","observation_id":"a3cdd265-58fa-4aa8-9359-fb467f8c3595","resolution":{"observed_at":"2026-05-10T22:58:52.491420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T12:04:44.162343Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2408.14837"},"observation_digest":"sha256:85ee2a159bf13c653a699c8a1d72bf58fdf2693fd0ae41c63da529a52d5c36f3","observation_id":"94ea79f7-864c-4058-a759-95fb8bf2e203","resolution":{"observed_at":"2026-05-16T12:04:44.211533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T22:59:03.642189Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2409.02048"},"observation_digest":"sha256:77aadb7ed116cf91d378d8f89691837743ac86a3fe2342f4a9bb2359cca7de8f","observation_id":"20e19241-9f9d-4c4d-8186-82bbbe15b687","resolution":{"observed_at":"2026-05-13T22:59:03.767446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:4b3b68c61667692848b35cac6b1d42dd58d915a61f0b051cc331ee50ba50d1f2","observation_id":"83453ea2-74ea-49e4-aa2b-fcc77435730a","resolution":{"observed_at":"2026-05-11T10:56:06.835877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T15:09:36.982610Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2410.06940"},"observation_digest":"sha256:b2642bebea353dc8624419fe33131efc4726dfcafd3fc7c34531d0be233d2181","observation_id":"c0cdda6d-db31-45f2-a834-168fdac0b0dc","resolution":{"observed_at":"2026-05-12T15:09:37.066514Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:f625ace4241006480c6739c089e22ee70995abf97094776ce35920bb368203a3","observation_id":"10a9d913-aaf0-4b72-8189-aac96663ddfa","resolution":{"observed_at":"2026-05-11T14:16:20.818910Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2411.13549","last_updated":"2026-05-06T19:17:31Z","snapshot_observed_at":"2026-08-06T10:11:40.211121Z","submitted_at":"2024-11-20T18:58:31Z","title":"KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T16:47:09.717923Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.13549"},"observation_digest":"sha256:637a339935a8dc4659196be2175465b6d55082746c88577215b278750810c653","observation_id":"7ed2eb50-bcf6-42f5-9b9a-992f78905002","resolution":{"observed_at":"2026-05-23T16:48:12.512254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T08:25:01.468957Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.15115"},"observation_digest":"sha256:fe2b9aa6cb3e545bdf6242bfebcf475e3fb3222a123a55e0621ba104eecff3d2","observation_id":"a68c16b4-5018-4766-aa85-77a91a44ceab","resolution":{"observed_at":"2026-05-23T08:25:29.354394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:0e64ca0e697ab84139cd68ecc2f969d81269a6e1c925e17b16c6dd4aa6e1b8ae","observation_id":"a49ec532-a065-4d3f-af8b-b838a26ca687","resolution":{"observed_at":"2026-05-23T08:42:45.258752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2412.13111","last_updated":"2026-05-19T09:35:40Z","snapshot_observed_at":"2026-08-02T06:39:30.515427Z","submitted_at":"2024-12-17T17:34:52Z","title":"Motion-2-To-3: Leveraging 2D Motion Data for 3D Motion Generations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T06:36:47.877594Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.13111"},"observation_digest":"sha256:2710de79a376c5ed2ca82dfd597d5c4a6ea1c09332f2c50e613a3542f6179fce","observation_id":"d8b4d63a-1499-4c55-a154-535f05bbab0f","resolution":{"observed_at":"2026-05-23T06:37:38.934014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:43e8a19c15c17302799c51c00a10d0d036cabbf964030fdbfc07b8b39dfc7005","observation_id":"ba50ecb8-fb95-471d-8cc3-a381649a280b","resolution":{"observed_at":"2026-05-17T15:07:39.760358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-12T18:38:11.110166Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.14803"},"observation_digest":"sha256:978859b90d7ad26ad85d56eccb1f0dfbeb4b514553a61be2eeb7ef14b432b112","observation_id":"237ee8d4-f4e8-485d-9b22-6ebb7c73f84f","resolution":{"observed_at":"2026-05-12T18:38:11.182858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2412.15689","last_updated":"2026-05-06T21:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-20T09:07:36Z","title":"DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T06:57:50.897865Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.15689"},"observation_digest":"sha256:6773a9f8d0424f9004c0891e32523927fd1490dea43ca488e33ded8472040959","observation_id":"d2fd1aa2-a656-40b7-806a-a2b09ef43f00","resolution":{"observed_at":"2026-05-23T07:02:41.930633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T12:01:51.366667Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.20404"},"observation_digest":"sha256:9bf70a9fc49d4c57453df4da6b23ba40fcb7b2cd3dcb9e9fa70cb1b3090868e5","observation_id":"85b5b442-404c-4433-a092-63a3a6cb2357","resolution":{"observed_at":"2026-05-11T12:01:51.645355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T10:36:12.058970Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.00103"},"observation_digest":"sha256:d58a3492146e5f7866bab6c6ec99ad51f788a9a78849af6b6d84450a950ce22f","observation_id":"3d83f2f1-fe1f-47b1-a0a0-9656997fa64f","resolution":{"observed_at":"2026-05-11T10:36:12.420709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:57ca724c7a5652612245f97a0bd54c6581b8c320793d15c9e40660765ecfa53d","observation_id":"82540ea0-d2ca-4dd0-b9b6-1a4ebb59f932","resolution":{"observed_at":"2026-05-10T23:38:45.307012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T23:09:34.805552Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.07542"},"observation_digest":"sha256:a24be10373380d100f56a84f3119c901217c1b5b823e18acf477fdc98d39da72","observation_id":"d1ef86b4-a3aa-426c-a2c5-d3587826002b","resolution":{"observed_at":"2026-05-16T23:09:34.836871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T12:47:05.825659Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.09038"},"observation_digest":"sha256:f0f0c1fab64f90c2d8b6166a60236612612f6df4e5d5c3cb2d00b113350c7479","observation_id":"c684a96a-4bfc-4307-bf13-66e160873369","resolution":{"observed_at":"2026-05-20T12:47:05.901531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T15:30:02.578430Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.13918"},"observation_digest":"sha256:d9387625720c3c4885f777fbab4ad4694116b154fba675d8f9df8b674407259e","observation_id":"19b6c2c8-fbcd-475a-a5e6-fc04a0cf07cb","resolution":{"observed_at":"2026-05-13T15:30:02.639174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-07T11:01:49.684719Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T12:00:14.672729Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.06764"},"observation_digest":"sha256:356f34a86e96fb706fbd850fddab9f72a1c6400024e27e4addfb11626bfad2fd","observation_id":"a07b5a0c-4e76-44ab-8e4d-ebed4f18c25f","resolution":{"observed_at":"2026-05-16T12:00:14.707044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T05:57:41.596848Z","title":"Stable video diffusion: Scal- ing latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-08T05:52:26.698219Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.596848Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:3fabb0a6f17f1475a2ba2bef3185e20824af91ad4767d2c192fbeed79a541b0d","observation_id":"4d18419e-e528-4449-a31e-e3c679f8c782","resolution":{"observed_at":"2026-08-08T05:57:41.596848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T05:55:09.466954Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08244","last_updated":"2025-03-25T00:18:07Z","snapshot_observed_at":"2026-08-08T05:49:35.677909Z","submitted_at":"2025-02-12T09:38:41Z","title":"FloVD: Optical Flow Meets Video Diffusion Model for Enhanced Camera-Controlled Video Synthesis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T05:55:09.466954Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.08244"},"observation_digest":"sha256:e44b7c4163d8102cba9304fda9e2ce941d3d122e48139e3c56037be4c8dd8085","observation_id":"03586d14-cf6c-41f3-bc8d-4d9173f64af5","resolution":{"observed_at":"2026-08-08T05:55:09.466954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T05:22:20.016729Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08377","last_updated":"2025-06-27T02:31:48Z","snapshot_observed_at":"2026-08-08T05:15:44.520632Z","submitted_at":"2025-02-12T13:08:35Z","title":"Not All Frame Features Are Equal: Video-to-4D Generation via Decoupling Dynamic-Static Features","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T05:22:20.016729Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.08377"},"observation_digest":"sha256:3889b34e861c0b4feec35cabfac217b33506c0d4830fa255e89d10c802c133eb","observation_id":"cd7b152f-0f7e-4b07-a57c-e6365ea7a45e","resolution":{"observed_at":"2026-08-08T05:22:20.016729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T04:36:41.317565Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08590","last_updated":"2025-03-12T08:38:20Z","snapshot_observed_at":"2026-08-08T04:29:52.703996Z","submitted_at":"2025-02-12T17:24:19Z","title":"Light-A-Video: Training-free Video Relighting via Progressive Light Fusion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T04:36:41.317565Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.08590"},"observation_digest":"sha256:28c3381cab8349bc139ac8ad53e9bf633cf3494b3ae1d556af669cc39e906644","observation_id":"42ba5b92-c111-47b7-9211-011f5a9fe532","resolution":{"observed_at":"2026-08-08T04:36:41.317565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T00:02:56.736420Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08639","last_updated":"2025-02-12T18:55:36Z","snapshot_observed_at":"2026-08-08T00:45:36.500110Z","submitted_at":"2025-02-12T18:55:36Z","title":"CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T00:02:56.736420Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.08639"},"observation_digest":"sha256:aaf40b9da2d957b416d82fa7087b050098c1dc7c12bf56d3aa2b3343a981e01a","observation_id":"3e1da12f-295f-4186-8634-1b0d399dfa8e","resolution":{"observed_at":"2026-08-08T00:02:56.736420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T19:40:21.149980Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10059","last_updated":"2025-07-13T08:12:15Z","snapshot_observed_at":"2026-08-07T19:30:54.254942Z","submitted_at":"2025-02-14T10:21:49Z","title":"RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T19:40:21.149980Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.10059"},"observation_digest":"sha256:8785f5bee88761c1e828c99b8a7a48fbff7c113b8de5620f9407469640c8bd35","observation_id":"c64eb1dd-b605-4c30-9720-0d44fad4a11e","resolution":{"observed_at":"2026-08-07T19:40:21.149980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2502.11537","last_updated":"2026-05-10T12:01:50Z","snapshot_observed_at":"2026-08-06T08:12:31.919308Z","submitted_at":"2025-02-17T08:06:10Z","title":"Simulus: Combining Improvements in Sample-Efficient World Model Agents","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T02:28:23.113408Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.11537"},"observation_digest":"sha256:4e4c6ce6f5dfdb918631a2e28584bb4f5e8b70f465bde0394c0eaea9ae99721c","observation_id":"c9ed1b39-6f05-40ae-a201-0187c86cc3f0","resolution":{"observed_at":"2026-05-23T02:32:26.237116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T17:50:29.675358Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2503.00200"},"observation_digest":"sha256:a5d7fcbe0d56f6f8b92979818a6000913eae344d158c15840ac8ab9954595dc6","observation_id":"97c18906-19cc-4605-b984-8d033d62f0eb","resolution":{"observed_at":"2026-05-13T17:50:29.713280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2503.06310","last_updated":"2026-05-19T15:23:11Z","snapshot_observed_at":"2026-08-02T11:19:30.638087Z","submitted_at":"2025-03-08T19:04:36Z","title":"Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T00:07:39.286486Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2503.06310"},"observation_digest":"sha256:65468acfb107ba4fcde2676b42e18c087f7c2b4cd10fd64fbe4f4655f125e071","observation_id":"841fa45f-0dd9-4ff8-a955-580ab137a3e4","resolution":{"observed_at":"2026-05-23T00:12:17.842739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2503.14505","last_updated":"2026-05-03T19:49:25Z","snapshot_observed_at":"2026-08-06T04:26:20.176735Z","submitted_at":"2025-03-18T17:59:58Z","title":"MusicInfuser: Making Video Diffusion Listen and Dance","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T23:28:51.767845Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2503.14505"},"observation_digest":"sha256:0bb0d9dad7f46a16bd1604931043bd0903876b1492dd55d9194f4172c0e09e2c","observation_id":"9ee9a3d2-797a-4cec-bc35-b0fa26860ba3","resolution":{"observed_at":"2026-05-22T23:32:15.650590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:cb577025b0172b15de19ab2f7e5b174828b70813fc3352326e75902a25a8a62d","observation_id":"54dc07b6-e6ed-4c1f-a7d4-e68f66cbc19e","resolution":{"observed_at":"2026-05-22T23:07:14.286337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:240fc96f3b81ac4b52d2c254c25b8750a697915624f90dcc7d9f297c4dfe153c","observation_id":"bd8ea729-be5e-477f-8d2f-4fe0a3743754","resolution":{"observed_at":"2026-05-14T18:42:03.230991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T16:25:00.365534Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2504.02792"},"observation_digest":"sha256:550a81e681c16576a8de91b5b3f813902a42295897b37c941e1cdb93580ad1e3","observation_id":"fad49ec8-c893-4753-8d51-e77611dd93de","resolution":{"observed_at":"2026-05-13T16:25:00.439355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2504.07940","last_updated":"2026-04-23T02:00:55Z","snapshot_observed_at":"2026-07-30T04:57:12.317374Z","submitted_at":"2025-04-10T17:51:38Z","title":"Beyond the Frame: Generating 360 Panoramic Videos from Perspective Videos","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T19:54:28.310854Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2504.07940"},"observation_digest":"sha256:87d3c9b1b77243b871af6df2d2110ede8b64634e6722a5e7971ae96c6ce62c07","observation_id":"29356544-a18f-4f15-8c3e-a8e86e9056a5","resolution":{"observed_at":"2026-05-22T19:55:05.065284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T20:23:04.022599Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2504.13074"},"observation_digest":"sha256:d29f27342fa3cfb4e8cdc18bb53cb292104bf1ec7b1b7a7f9d2be6337a9d310e","observation_id":"59ba75fe-4e2a-4333-9902-6e3955774afd","resolution":{"observed_at":"2026-05-14T20:23:04.123266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:f3c508367bbb194bbbfce04b35503fd75d54c15c3f2e113644c5f0a392f16cd3","observation_id":"72bf4b04-d20b-46e0-9f5f-3c17aaf69760","resolution":{"observed_at":"2026-05-22T17:51:54.382055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:60f0d6e993117c7f6c5686c194eeadbb2f032f0d4d719a63e03b138843d5ee2e","observation_id":"50cb4175-3ebd-441b-91b3-c4bc0f19128f","resolution":{"observed_at":"2026-05-22T17:51:54.776728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T20:31:15.700943Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.13211"},"observation_digest":"sha256:b041e13f868827f609bf3cec436bf2d1573db0902d9750324be83b4a1b1348d6","observation_id":"108c7b27-eccc-4983-8141-a90ce92558f3","resolution":{"observed_at":"2026-05-13T20:31:15.753806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T15:33:08.118350Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14687","last_updated":"2025-05-20T17:59:59Z","snapshot_observed_at":"2026-08-08T00:07:41.253312Z","submitted_at":"2025-05-20T17:59:59Z","title":"Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:08.118350Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.14687"},"observation_digest":"sha256:30121e74c8f932e2dc684b65e89cd3cee1c5fe9e7b2f4e54443687eb1c55878a","observation_id":"79c19ce1-eb41-4073-bc28-c88e517ff778","resolution":{"observed_at":"2026-08-07T15:33:08.118350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T15:30:10.371648Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14948","last_updated":"2025-05-20T22:17:47Z","snapshot_observed_at":"2026-08-07T15:24:36.652022Z","submitted_at":"2025-05-20T22:17:47Z","title":"Programmatic Video Prediction Using Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:30:10.371648Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.14948"},"observation_digest":"sha256:d750674b3ecc6e5b2fe399cb1526f7397979743ad14d74cb72545fc8c8f33c92","observation_id":"3733353e-b3c8-406b-b5fd-c08f5c811b4d","resolution":{"observed_at":"2026-08-07T15:30:10.371648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T15:10:57.287233Z","title":"Stable video diﬀusion: Scaling latent video diﬀusion models t o large datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16284","last_updated":"2025-05-22T06:26:28Z","snapshot_observed_at":"2026-08-07T22:03:10.571335Z","submitted_at":"2025-05-22T06:26:28Z","title":"Only Large Weights (And Not Skip Connections) Can Prevent the Perils of Rank Collapse","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:57.287233Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.16284"},"observation_digest":"sha256:27c04df5c214dc1d03e8cd7d9234d87e8c26ae6dac15596bcb3c42416582afb3","observation_id":"ae5ca992-6ec5-4dca-b6ea-df7be148469d","resolution":{"observed_at":"2026-08-07T15:10:57.287233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2505.16819","last_updated":"2026-05-19T15:22:52Z","snapshot_observed_at":"2026-08-01T07:12:14.758494Z","submitted_at":"2025-05-22T15:54:42Z","title":"Character-Centered Dialogue Generation from Scene-Level Prompts","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T13:31:43.083678Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.16819"},"observation_digest":"sha256:b6df37658f92474a6501b1c65a62b0de73106fe32f06b4733fcbca7cec927c0b","observation_id":"80a80146-b1a2-410c-ae16-7f506d0205e6","resolution":{"observed_at":"2026-05-22T13:34:53.693751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:57:46.068628Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16959","last_updated":"2025-09-01T20:18:07Z","snapshot_observed_at":"2026-08-07T14:50:14.651913Z","submitted_at":"2025-05-22T17:40:08Z","title":"Bigger Isn't Always Memorizing: Early Stopping Overparameterized Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:46.068628Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.16959"},"observation_digest":"sha256:170d4f7bdc25a1cac8330e48ecc90cd1d77f9b42ff77ed81db90c63ce2d71da9","observation_id":"08de7fa9-7549-45b9-ab5b-35260468a037","resolution":{"observed_at":"2026-08-07T14:57:46.068628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:55:01.759600Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17351","last_updated":"2025-05-23T00:07:59Z","snapshot_observed_at":"2026-08-07T22:43:27.490712Z","submitted_at":"2025-05-23T00:07:59Z","title":"FLEX: A Backbone for Diffusion-Based Modeling of Spatio-temporal Physical Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:01.759600Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.17351"},"observation_digest":"sha256:cc7114766ffbad1546c1c4a15499367f907042c70fbd3cb99ee0633fcaf2acab","observation_id":"cc4d5ea1-9353-4a81-8f99-887df7b99e21","resolution":{"observed_at":"2026-08-07T14:55:01.759600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:46:49.802396Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17727","last_updated":"2025-05-23T10:45:43Z","snapshot_observed_at":"2026-08-07T14:39:33.051670Z","submitted_at":"2025-05-23T10:45:43Z","title":"SafeMVDrive: Multi-view Safety-Critical Driving Video Synthesis in the Real World Domain","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:49.802396Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.17727"},"observation_digest":"sha256:5bae0834374646e4993097290563ffea36edcff7565b3088a907bdfff9d8f6c2","observation_id":"895db193-cda1-4e99-9da2-2ebb221932bf","resolution":{"observed_at":"2026-08-07T14:46:49.802396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:39:28.316171Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18078","last_updated":"2025-05-23T16:37:14Z","snapshot_observed_at":"2026-08-07T21:51:43.030001Z","submitted_at":"2025-05-23T16:37:14Z","title":"DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:39:28.316171Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.18078"},"observation_digest":"sha256:5f148744b7b03e247b2dbfee829879b17bb83ef58bed50a04ee13e13707ee846","observation_id":"df3c0f70-42af-4cd7-8b4c-70e5deb96fb6","resolution":{"observed_at":"2026-08-07T14:39:28.316171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:34:06.596891Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18445","last_updated":"2025-05-24T01:00:20Z","snapshot_observed_at":"2026-08-07T14:29:02.939579Z","submitted_at":"2025-05-24T01:00:20Z","title":"OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:06.596891Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.18445"},"observation_digest":"sha256:c53c0861f1f9fe2495509836f556fbb041667bb04b3abc8736bab6a0ff959380","observation_id":"e074d6b8-00f9-48bc-9769-ae97454657f6","resolution":{"observed_at":"2026-08-07T14:34:06.596891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:31:27.731461Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18650","last_updated":"2025-05-24T11:35:09Z","snapshot_observed_at":"2026-08-07T14:25:57.955968Z","submitted_at":"2025-05-24T11:35:09Z","title":"ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:27.731461Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.18650"},"observation_digest":"sha256:e0fa239a3283b95015ff2bfb392a5350a364b50bdc7b6ea7284a7cf406a77bc5","observation_id":"595c10fa-b923-4a7b-a05e-9ab37d1921e0","resolution":{"observed_at":"2026-08-07T14:31:27.731461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:02:26.769430Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:26.769430Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:8368ff9930b5f272edce63df7628d7931926a3b7120e7fb347101f83ac570421","observation_id":"6286e85a-4e05-42b9-8c58-064be661215b","resolution":{"observed_at":"2026-08-07T14:02:26.769430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:03:13.707554Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-07T13:55:36.207486Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:13.707554Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:e93fd85d229cfb93538d80071cf411e3758932c429d4e40868571d9ff9780fd9","observation_id":"8277f684-58eb-43e6-b379-5c07c7dac116","resolution":{"observed_at":"2026-08-07T14:03:13.707554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:01:07.663909Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20255","last_updated":"2025-07-07T17:56:30Z","snapshot_observed_at":"2026-08-07T13:53:53.640300Z","submitted_at":"2025-05-26T17:32:10Z","title":"AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:07.663909Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20255"},"observation_digest":"sha256:8d4f724d3c5fb1a52f0590149e2660eaf65463ca3f920946cfa14b89657af7e3","observation_id":"bf386271-6711-498d-a1da-8699ffd25bc2","resolution":{"observed_at":"2026-08-07T14:01:07.663909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T14:01:02.807538Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20287","last_updated":"2025-05-26T17:59:03Z","snapshot_observed_at":"2026-08-07T13:53:21.158838Z","submitted_at":"2025-05-26T17:59:03Z","title":"MotionPro: A Precise Motion Controller for Image-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:02.807538Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20287"},"observation_digest":"sha256:ca62058a9c014d55cdfe0e93dbd6195ce0e129f007d2599b40f3544c8c34b463","observation_id":"cb4ddbcb-35d7-4e66-a484-d31ae36417c3","resolution":{"observed_at":"2026-08-07T14:01:02.807538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:52:20.736392Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20827","last_updated":"2025-05-27T07:39:43Z","snapshot_observed_at":"2026-08-08T07:47:50.701180Z","submitted_at":"2025-05-27T07:39:43Z","title":"Frame-Level Captions for Long Video Generation with Complex Multi Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:20.736392Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.20827"},"observation_digest":"sha256:31ff487e737b8273562f8a8c4cceec86c3907aa5e615eaaab0318c6d29dac4e0","observation_id":"d58735dd-48a3-4813-89ea-9807fa66f72b","resolution":{"observed_at":"2026-08-07T13:52:20.736392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:45:07.580972Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21036","last_updated":"2025-06-09T11:33:40Z","snapshot_observed_at":"2026-08-07T13:36:00.763303Z","submitted_at":"2025-05-27T11:15:02Z","title":"RainFusion: Adaptive Video Generation Acceleration via Multi-Dimensional Visual Redundancy","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:07.580972Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.21036"},"observation_digest":"sha256:f04bb2649b891dab7116f2db995efbf4b2c1a5432d0b25c97436235a02cf463f","observation_id":"1ab7e092-0de3-4f98-a2b9-1c61bc9da826","resolution":{"observed_at":"2026-08-07T13:45:07.580972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:44:50.951297Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21050","last_updated":"2025-05-28T05:14:46Z","snapshot_observed_at":"2026-08-07T13:35:48.144286Z","submitted_at":"2025-05-27T11:35:35Z","title":"Advancing high-fidelity 3D and Texture Generation with 2.5D latents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:44:50.951297Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.21050"},"observation_digest":"sha256:a08f566c492546a0be0ca88b4ec8c6d3233c55c1ff0f8ccf3f9ad1aa447b561f","observation_id":"dae2afd7-09f8-4dc9-90a7-63ee88430f72","resolution":{"observed_at":"2026-08-07T13:44:50.951297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:44:13.282358Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21205","last_updated":"2025-08-10T16:23:45Z","snapshot_observed_at":"2026-08-07T13:30:40.001547Z","submitted_at":"2025-05-27T13:53:50Z","title":"EF-VI: Enhancing End-Frame Injection for Video Inbetweening","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:44:13.282358Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.21205"},"observation_digest":"sha256:06ab74a111e9cb36959e52f63955f70c8f2eea523ec9c5aca5471df48a3dc1cf","observation_id":"91cf9163-01d5-42e6-bffd-8366d7b65d4d","resolution":{"observed_at":"2026-08-07T13:44:13.282358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:28:09.174892Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21876","last_updated":"2026-05-28T08:11:37Z","snapshot_observed_at":"2026-08-07T13:18:12.902974Z","submitted_at":"2025-05-28T01:45:26Z","title":"EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:09.174892Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.21876"},"observation_digest":"sha256:0de9b78197ff9e4dc5925d2b5255a3db51be259a43012ca9ae9d2b2f2c8d55de","observation_id":"722a32e1-129b-4b66-ab7f-3785ae1952e1","resolution":{"observed_at":"2026-08-07T13:28:09.174892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2505.21996","last_updated":"2026-05-28T06:02:27Z","snapshot_observed_at":"2026-08-07T13:15:36.558064Z","submitted_at":"2025-05-28T05:55:44Z","title":"VRAG: Learning World Models for Interactive Video Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T12:35:19.379364Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.21996"},"observation_digest":"sha256:b068227c0a4eca90aec10b8dde9ae79e9701cdaee1b76dd71fea6a32004cde11","observation_id":"b0850a3b-bf11-459d-92af-ab65d7745cbb","resolution":{"observed_at":"2026-05-19T12:37:17.516687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:23:20.968150Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21996","last_updated":"2026-05-28T06:02:27Z","snapshot_observed_at":"2026-08-07T13:15:36.558064Z","submitted_at":"2025-05-28T05:55:44Z","title":"VRAG: Learning World Models for Interactive Video Generation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:23:20.968150Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.21996"},"observation_digest":"sha256:79c453db5fb065c46fc341c8f4e297073690d946294359a1c768f9f30d53cd93","observation_id":"852c06ea-7cd2-4d73-aa4e-ee4af2824020","resolution":{"observed_at":"2026-08-07T13:23:20.968150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:22:47.219879Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22016","last_updated":"2025-06-25T15:10:35Z","snapshot_observed_at":"2026-08-07T13:14:57.874374Z","submitted_at":"2025-05-28T06:24:21Z","title":"PanoWan: Lifting Diffusion Video Generation Models to 360{\\deg} with Latitude/Longitude-aware Mechanisms","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:47.219879Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.22016"},"observation_digest":"sha256:648e5ceb88173dfef520c514c344650085f8d83b6d5bf725cbeea3b34a4c384d","observation_id":"ce86fbe5-cf7e-4cc9-b7c6-4b9d09473c20","resolution":{"observed_at":"2026-08-07T13:22:47.219879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:13:41.554664Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22421","last_updated":"2025-05-29T12:41:53Z","snapshot_observed_at":"2026-08-07T13:05:11.824633Z","submitted_at":"2025-05-28T14:46:51Z","title":"GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:41.554664Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.22421"},"observation_digest":"sha256:f5e528fc117d53188abc13c27f8e5f86b7672fbcd224c822f45dde634c4d37d6","observation_id":"35f54321-9100-4419-8bde-24ea86a4925d","resolution":{"observed_at":"2026-08-07T13:13:41.554664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:07:34.493506Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.493506Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:e258a46b02a97a3bcfd0a5df74be57fa5d806ae64842afcca7e04f97e45bc528","observation_id":"45142d58-ff24-4dff-b3ce-ff0fafedebe3","resolution":{"observed_at":"2026-08-07T13:07:34.493506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T13:00:56.872776Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22980","last_updated":"2025-05-29T01:41:10Z","snapshot_observed_at":"2026-08-07T12:53:41.244439Z","submitted_at":"2025-05-29T01:41:10Z","title":"MOVi: Training-free Text-conditioned Multi-Object Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.872776Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.22980"},"observation_digest":"sha256:df8203fc0f697305341f2c4e72bba01b0ad7e5ec619e109221dc2a564cab16ee","observation_id":"842663ce-81b1-4b8c-8aa1-fa07edf8a6ab","resolution":{"observed_at":"2026-08-07T13:00:56.872776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:59:21.225920Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23085","last_updated":"2025-05-29T04:41:04Z","snapshot_observed_at":"2026-08-07T12:51:24.589397Z","submitted_at":"2025-05-29T04:41:04Z","title":"GeoMan: Temporally Consistent Human Geometry Estimation using Image-to-Video Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:21.225920Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.23085"},"observation_digest":"sha256:cb55ee256e755b638e46a6b4f0b8721796f56fc9645b555b54c8b0c67263d4f3","observation_id":"5eeb489c-94f3-4068-90fd-ef64ce9dc5bb","resolution":{"observed_at":"2026-08-07T12:59:21.225920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:57:00.561585Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23134","last_updated":"2025-05-29T06:10:16Z","snapshot_observed_at":"2026-08-07T12:50:25.240639Z","submitted_at":"2025-05-29T06:10:16Z","title":"Zero-to-Hero: Zero-Shot Initialization Empowering Reference-Based Video Appearance Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:57:00.561585Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.23134"},"observation_digest":"sha256:5d84c1136f569667e127bd5b411657cbe53739f1006f3c8fc3da2b1c31b11c48","observation_id":"ea03f960-50ba-41dd-9578-e88f573b1475","resolution":{"observed_at":"2026-08-07T12:57:00.561585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:45:05.474837Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-08-07T12:38:23.686012Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:05.474837Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.23656"},"observation_digest":"sha256:52155fd91c89069475d98ff539932827fd5dc3e64a0f9000b9a7d01a989c470f","observation_id":"cfcd3251-fdca-4688-8d8c-323dae142f30","resolution":{"observed_at":"2026-08-07T12:45:05.474837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:37:04.776426Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24267","last_updated":"2025-05-30T06:45:31Z","snapshot_observed_at":"2026-08-07T12:24:56.758348Z","submitted_at":"2025-05-30T06:45:31Z","title":"MUSE: Model-Agnostic Tabular Watermarking via Multi-Sample Selection","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:37:04.776426Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.24267"},"observation_digest":"sha256:c0ed5a9d6c3a0533b43cd780cb400a8107d0aea21b66494e887a7e3fc7a41ed1","observation_id":"eaaec39b-1b71-4bfd-abc2-1d3a0b864fec","resolution":{"observed_at":"2026-08-07T12:37:04.776426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:26:57.174478Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24521","last_updated":"2025-05-30T12:31:59Z","snapshot_observed_at":"2026-08-07T23:18:32.538517Z","submitted_at":"2025-05-30T12:31:59Z","title":"UniGeo: Taming Video Diffusion for Unified Consistent Geometry Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:26:57.174478Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.24521"},"observation_digest":"sha256:adee90965a3e511393e1a5e1d527624639b048e75b25ab96cbd8174044f67d36","observation_id":"1abbe0f1-7b19-4c3b-bd4e-b28a6580c3dc","resolution":{"observed_at":"2026-08-07T12:26:57.174478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:22:18.681635Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24733","last_updated":"2025-05-30T15:54:34Z","snapshot_observed_at":"2026-08-07T22:11:01.448181Z","submitted_at":"2025-05-30T15:54:34Z","title":"DreamDance: Animating Character Art via Inpainting Stable Gaussian Worlds","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:18.681635Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2505.24733"},"observation_digest":"sha256:b4c143d325d5b80e5c0398fa1987ffa51caab035b0efe1ed5a0fcef4623e7e46","observation_id":"86705e77-ec3e-4622-a47d-b9c43116f61b","resolution":{"observed_at":"2026-08-07T12:22:18.681635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:01:04.358842Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.358842Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:b4bbc8d767c49b14f795f13dbcfa8872bbbe0f2fa65f9a32cfded7ee0e96e7de","observation_id":"ea566ae7-4703-4d94-9f1b-107b32f69767","resolution":{"observed_at":"2026-08-07T12:01:04.358842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:46:58.622785Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01454","last_updated":"2025-06-02T09:12:41Z","snapshot_observed_at":"2026-08-07T11:38:32.827585Z","submitted_at":"2025-06-02T09:12:41Z","title":"DiffuseSlide: Training-Free High Frame Rate Video Generation Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:58.622785Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.01454"},"observation_digest":"sha256:2aa80addccade27ea6a68f198ec9eef5ec2e047d8f6f3ad2197746f9080dcc81","observation_id":"c7b7212c-e8e4-438b-847a-288dcd97ad3b","resolution":{"observed_at":"2026-08-07T11:46:58.622785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:46:59.862351Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01546","last_updated":"2025-06-02T11:19:23Z","snapshot_observed_at":"2026-08-07T11:36:30.744496Z","submitted_at":"2025-06-02T11:19:23Z","title":"LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.862351Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.01546"},"observation_digest":"sha256:47566f2cef6c512484ce2c26043327413d1242f0cfc55e559e3ab604f0ff3140","observation_id":"9b61f0f1-5a4f-4c2f-a8f8-fc1c130bdd69","resolution":{"observed_at":"2026-08-07T11:46:59.862351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:39:46.291047Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01801","last_updated":"2025-06-02T15:42:06Z","snapshot_observed_at":"2026-08-07T11:30:54.713497Z","submitted_at":"2025-06-02T15:42:06Z","title":"OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:46.291047Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.01801"},"observation_digest":"sha256:f79e90e6bb2e18b9c70cb070c74cfbc7f189200253bfb5d99d14a39636fe5b19","observation_id":"273f6702-3d5c-4f94-9a9b-37922d42db71","resolution":{"observed_at":"2026-08-07T11:39:46.291047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:31:48.259736Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02327","last_updated":"2025-06-02T23:50:40Z","snapshot_observed_at":"2026-08-07T11:24:00.832606Z","submitted_at":"2025-06-02T23:50:40Z","title":"Medical World Model: Generative Simulation of Tumor Evolution for Treatment Planning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:31:48.259736Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.02327"},"observation_digest":"sha256:0658cb93f16b025c9282977225697f4e0deb8f571b81b47c25b5c855ccd1e1f0","observation_id":"dbd32306-deb8-46d5-bbf4-c0a563a7253e","resolution":{"observed_at":"2026-08-07T11:31:48.259736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:28:59.510279Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02444","last_updated":"2025-06-05T03:21:54Z","snapshot_observed_at":"2026-08-07T11:21:26.118896Z","submitted_at":"2025-06-03T05:04:29Z","title":"SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:59.510279Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.02444"},"observation_digest":"sha256:eacd4f193838058ea19bd6a8b441e5452396678754959bcf60f5d388c3ec1757","observation_id":"f7cb1d75-dffb-4694-8c49-a23ef5ff2ab0","resolution":{"observed_at":"2026-08-07T11:28:59.510279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:27:12.327322Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02497","last_updated":"2025-06-03T06:25:00Z","snapshot_observed_at":"2026-08-07T11:20:21.698246Z","submitted_at":"2025-06-03T06:25:00Z","title":"LumosFlow: Motion-Guided Long Video Generation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:27:12.327322Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.02497"},"observation_digest":"sha256:347aa4f22f34c4a263d4679d89d3d276edc3a0f7441d00b17f65dc24a375cd11","observation_id":"24fb8d44-64c0-4720-b435-99a064bf509c","resolution":{"observed_at":"2026-08-07T11:27:12.327322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:26:55.883086Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02698","last_updated":"2025-06-06T03:14:26Z","snapshot_observed_at":"2026-08-08T05:11:32.954183Z","submitted_at":"2025-06-03T09:47:22Z","title":"Smoothed Preference Optimization via ReNoise Inversion for Aligning Diffusion Models with Varied Human Preferences","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:55.883086Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.02698"},"observation_digest":"sha256:7149028186b09cba6d28c651e3b9d3fd549ecd6362b73b1aa1403b9e7617204f","observation_id":"d5e3b7bd-97c6-4f1f-b3cf-10468669cf26","resolution":{"observed_at":"2026-08-07T11:26:55.883086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:20:44.689256Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02875","last_updated":"2025-06-03T13:39:57Z","snapshot_observed_at":"2026-08-07T21:50:37.234501Z","submitted_at":"2025-06-03T13:39:57Z","title":"NTIRE 2025 XGC Quality Assessment Challenge: Methods and Results","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:44.689256Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.02875"},"observation_digest":"sha256:c6d317c9ed30a74f898a68272f164cf2341d02dfe19b861527ab7fee6f40c74c","observation_id":"1de799a0-4604-4e43-bb5f-e6791f4cddbe","resolution":{"observed_at":"2026-08-07T11:20:44.689256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:15:14.494535Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03065","last_updated":"2025-06-03T16:42:37Z","snapshot_observed_at":"2026-08-07T11:07:00.812487Z","submitted_at":"2025-06-03T16:42:37Z","title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:14.494535Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.03065"},"observation_digest":"sha256:00126551f7262e4b6173ffc0097352a190bdb5cd5e9ec23f2985c654a435b67f","observation_id":"11ee65f5-0dba-4961-9e6f-9d909588bd2a","resolution":{"observed_at":"2026-08-07T11:15:14.494535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T11:14:42.913552Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03150","last_updated":"2025-06-03T17:59:52Z","snapshot_observed_at":"2026-08-07T20:42:37.812683Z","submitted_at":"2025-06-03T17:59:52Z","title":"IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:42.913552Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.03150"},"observation_digest":"sha256:dd5925bbd9bb60402f0afca7ed85d7f8e3f18073862378774bca394dcd293cc1","observation_id":"a4795bd8-7b9c-4035-b482-3636ec5fffa5","resolution":{"observed_at":"2026-08-07T11:14:42.913552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T10:43:18.898818Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04590","last_updated":"2025-06-05T03:11:48Z","snapshot_observed_at":"2026-08-07T23:18:31.548842Z","submitted_at":"2025-06-05T03:11:48Z","title":"Follow-Your-Creation: Empowering 4D Creation through Video Inpainting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:18.898818Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.04590"},"observation_digest":"sha256:06e9c4ad7a52e315022d18ff33addfb18bdf2bd0613fd8780fc5e210aee4077b","observation_id":"e3b028e7-f192-4c5c-91a8-a383465afc90","resolution":{"observed_at":"2026-08-07T10:43:18.898818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T10:36:27.020201Z","title":"arXiv preprint arXiv:2311.15127 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04956","last_updated":"2025-06-05T12:31:02Z","snapshot_observed_at":"2026-08-07T10:27:19.461334Z","submitted_at":"2025-06-05T12:31:02Z","title":"FEAT: Full-Dimensional Efficient Attention Transformer for Medical Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:36:27.020201Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.04956"},"observation_digest":"sha256:489f9d464a20a83cb068dbbb6ae1f9a7eeff324917b5ed34b5687a3c6d855bf7","observation_id":"0a0adfaf-cba0-4e71-8451-ff8bdfed2e20","resolution":{"observed_at":"2026-08-07T10:36:27.020201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T10:28:36.546649Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05284","last_updated":"2025-06-05T17:42:34Z","snapshot_observed_at":"2026-08-07T11:02:24.060549Z","submitted_at":"2025-06-05T17:42:34Z","title":"Video World Models with Long-term Spatial Memory","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:36.546649Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.05284"},"observation_digest":"sha256:fcecb8ed1120014b7e4dfa0d8ec72414a34a842754903ae26b2d507a6c4efca2","observation_id":"4862582a-f8fc-41a9-a43b-5be1a04433a4","resolution":{"observed_at":"2026-08-07T10:28:36.546649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T10:18:23.849703Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.849703Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:4aec4304bcdbac0874aaddeb2052d53ac04ea63857a59152d17e01596ca3615d","observation_id":"3dd28e69-e6fd-4311-9756-8f0bc0ac0d65","resolution":{"observed_at":"2026-08-07T10:18:23.849703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T10:19:03.643392Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05934","last_updated":"2025-06-06T10:00:39Z","snapshot_observed_at":"2026-08-07T10:10:55.279151Z","submitted_at":"2025-06-06T10:00:39Z","title":"FADE: Frequency-Aware Diffusion Model Factorization for Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:03.643392Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.05934"},"observation_digest":"sha256:52c4fe80b364df2c91d56a9a54a0d3f2740301ec62ccaa928371174747fef02e","observation_id":"832a6ef4-b1f8-436b-9b7c-8c0540a3a82d","resolution":{"observed_at":"2026-08-07T10:19:03.643392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T06:05:38.018637Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06023","last_updated":"2025-06-06T12:14:24Z","snapshot_observed_at":"2026-08-07T11:04:26.886404Z","submitted_at":"2025-06-06T12:14:24Z","title":"Restereo: Diffusion stereo video generation and restoration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:05:38.018637Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.06023"},"observation_digest":"sha256:84969e100641966d408d9b2930077eeabfc3068c9a29736533179abf9d7e15b9","observation_id":"e26b4304-6a79-4051-b170-79441a4a6267","resolution":{"observed_at":"2026-08-07T06:05:38.018637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T06:00:58.231968Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06253","last_updated":"2025-06-06T17:25:48Z","snapshot_observed_at":"2026-08-07T06:19:03.384044Z","submitted_at":"2025-06-06T17:25:48Z","title":"Bridging Perspectives: A Survey on Cross-view Collaborative Intelligence with Egocentric-Exocentric Vision","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:58.231968Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.06253"},"observation_digest":"sha256:cd9749e32c858e973392500d6e7bd71ab7e0589ce832c82f0afe42e0d59d8d17","observation_id":"f5b5f75f-9f0d-438e-97a6-4702d6cbff61","resolution":{"observed_at":"2026-08-07T06:00:58.231968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T06:02:01.159569Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06440","last_updated":"2025-06-06T18:00:46Z","snapshot_observed_at":"2026-08-07T05:54:20.582465Z","submitted_at":"2025-06-06T18:00:46Z","title":"Vid2Sim: Generalizable, Video-based Reconstruction of Appearance, Geometry and Physics for Mesh-free Simulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:01.159569Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.06440"},"observation_digest":"sha256:294f73e94ce9f0c52c18f4a91de376d6e151e1292b90723326a5a580e53c9d47","observation_id":"6d8877ef-506a-48fd-8791-fda7ea1628c4","resolution":{"observed_at":"2026-08-07T06:02:01.159569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T05:59:47.428843Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06483","last_updated":"2025-06-06T19:17:37Z","snapshot_observed_at":"2026-08-07T05:53:21.416034Z","submitted_at":"2025-06-06T19:17:37Z","title":"Noise Consistency Regularization for Improved Subject-Driven Image Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:47.428843Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.06483"},"observation_digest":"sha256:6199a6ee1fe7c9c3a98f7dea33307644d35f2506419f903d243aeab8ccdbe3e2","observation_id":"995ab86c-90b7-454a-b2e8-1b79ade6f371","resolution":{"observed_at":"2026-08-07T05:59:47.428843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T05:53:38.931603Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06825","last_updated":"2025-06-07T15:02:23Z","snapshot_observed_at":"2026-08-07T05:46:22.393815Z","submitted_at":"2025-06-07T15:02:23Z","title":"Identity Deepfake Threats to Biometric Authentication Systems: Public and Expert Perspectives","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:53:38.931603Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.06825"},"observation_digest":"sha256:245230e413431077694f9dcd261bf5057f0e0aaefc185c02fa340c3125f36229","observation_id":"6bdf8b05-6eb3-42cc-80ca-c1bcd9ab4322","resolution":{"observed_at":"2026-08-07T05:53:38.931603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.15127/citation-record","integrity":"/paper/2311.15127/integrity","json":"/paper/2311.15127/citation-record.json","paper":"/paper/2311.15127"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-07-06T15:16:38.500909Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2304.08477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent- shift: Latent diffusion with temporal shift for efficient text-to-video generation","venue":null,"work_id":"bedd3bfc-5b36-4f28-80c6-ccc058c0b411","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:93ad781bef3a903e8264f6ef3b61c4bcd29830c05103dce80ac048270bfa4235","observation_id":"5da6655c-ed78-40ef-bafd-3a4f839b1168","resolution":{"observed_at":"2026-05-10T22:58:52.156087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Renderdiffusion: Image diffusion for 3d reconstruction, in- painting and generation","venue":null,"work_id":"a714454d-cb1e-4784-b885-eb0e4439b8ee","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:a65acd634207303f1d1986d27a38ec2c8bdcf80176a199d2ec70762070b9b109","observation_id":"144bcf58-117e-4840-8e26-ea1f0d350bab","resolution":{"observed_at":"2026-05-10T22:58:52.351279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A general language assistant as a laboratory for alignment","venue":null,"work_id":"810fae76-3f07-4c2d-9250-900f7ea33bf9","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:97c222aef590c516fac33c06dd0586cbf9de907638e486b916c58e3811487c6f","observation_id":"1369ee33-e07b-4808-a922-19ef6454c28c","resolution":{"observed_at":"2026-05-10T22:58:52.354002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Campbell, and Sergey Levine","venue":null,"work_id":"15c72efc-3acc-4890-828a-80791b11569f","year":2018},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:d6b89c78edb6b8cf388162b6c3dbd19fdbf9cd792443f2008e8cb0a048542f80","observation_id":"93cc8df8-95fc-4c9f-be29-a1da5d5b8662","resolution":{"observed_at":"2026-05-10T22:58:52.356405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Character region awareness for text de- tection","venue":null,"work_id":"a2d228e7-70fa-4046-b3a4-5805c6f5feea","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:fd83a606c8bdcc5537fbdcc6021bfe994a4eea635b6d3e7a973c0efd978c05c8","observation_id":"933ef10c-4406-4898-814a-9df65483ee6b","resolution":{"observed_at":"2026-05-10T22:58:52.360851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training a helpful and harm- less assistant with reinforcement learning from human feed- back","venue":null,"work_id":"cb7ffc19-6c12-4050-8ed7-06d525703da2","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:4b4291fe2722b17675507c5564b5f28bf45f1faee73ce8e1c4a99691c39ac13f","observation_id":"db7d9742-6bab-457f-821b-97f97f659745","resolution":{"observed_at":"2026-05-10T22:58:52.367993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"0b780ad1-899b-4349-9c3e-29fa9d6d885b","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:0440bc35c854755ee0c5a1955a35f97910fc1d9758cfded1e16932bc4f3d0031","observation_id":"22aa8867-91ab-44a3-a949-85e04be5d2bb","resolution":{"observed_at":"2026-05-10T22:58:52.372008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ipoke: Poking a still image for con- trolled stochastic video synthesis","venue":null,"work_id":"e1650dc6-f9e9-4730-86b3-3902db53ea4f","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:bf76674fdc19f65a40173b5e4e96c063fd73ff7fde12800b0c24df3a267d8815","observation_id":"50404684-73cb-43f0-aa23-7cf3fbb80143","resolution":{"observed_at":"2026-05-10T22:58:52.374897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08818","last_updated":"2023-12-28T03:31:59Z","snapshot_observed_at":"2026-07-06T15:16:54.905872Z","submitted_at":"2023-04-18T08:30:32Z","title":"Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2304.08818","doi":"10.48550/arxiv.2304.08818","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models, 2023 b","venue":"arXiv (Cornell University)","work_id":"76496561-867d-44bb-9836-fef3004046ca","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2304.08818","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9a20365d94abbc39805b0b953fa1a944b41107d5a24b9cbcd2db2571bec5f4d8","observation_id":"9911c2c8-7ca3-40c2-a592-bbe9e7d0d173","resolution":{"observed_at":"2026-05-10T22:58:52.140275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating long videos of dynamic scenes","venue":null,"work_id":"0f7c81b2-6089-4646-95e9-765905d269fe","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:6b671f5c0ca70fe17312240196aa9fd9cf8e96eadadf18434e2c5ad785f1406c","observation_id":"560ec6c5-ca90-4822-bdfa-d8858b739e0e","resolution":{"observed_at":"2026-05-10T22:58:52.380162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"9e7a9359-3974-402e-a595-b5ab6aea45ff","year":2017},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:5017cca939ed6d0ce02ed8fd5d33d04d2ad4528c01f9861cddc179bde6f17623","observation_id":"84289ebc-a5e0-4436-98b1-657f7e6aac5a","resolution":{"observed_at":"2026-05-10T22:58:52.383092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im- proved conditional vrnns for video prediction","venue":null,"work_id":"d7a15f8e-6e9a-4dd1-892d-ab80667f17a8","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:fccf8daac9e8360b7e4e065c6e6c871b8e52d9fcd8756f61aec1ef8e49ce0ef8","observation_id":"3df0282d-bca6-472d-93e9-a5c7ff611852","resolution":{"observed_at":"2026-05-10T22:58:52.389104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emu: Enhancing image generation models using photogenic nee- dles in a haystack","venue":null,"work_id":"a67ed3ba-ceae-4e6e-a69b-01a9f1c7695f","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:53e4384f80dbf6d9e2cb8629add01ff788a3957407eb76a4f4c2086819efbed0","observation_id":"3a9c73d5-ff6c-42ac-99ee-0e9da43b4573","resolution":{"observed_at":"2026-05-10T22:58:52.395124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05663","last_updated":"2023-07-11T17:57:40Z","snapshot_observed_at":"2026-07-06T15:52:52.180267Z","submitted_at":"2023-07-11T17:57:40Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","version":1},"cited_work":{"arxiv_id":"2307.05663","doi":"10.48550/arxiv.2307.05663","metadata_source":"pith","pith_arxiv_id":"2307.05663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Objaverse-XL: A Universe of 10M+ 3D Objects","venue":"cs.CV","work_id":"1c5475ad-d1ec-4de1-8670-b8cd5a4c85d3","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2307.05663","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:dc9796b3e2634653871227bb6273d3129c40a89b35dc3371ca8666258a74edc2","observation_id":"d0f5b2f2-63ce-40e6-943e-a29cb2343dad","resolution":{"observed_at":"2026-05-17T13:02:11.861391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"7b0e3b67-5d51-47e2-878a-342823c92f0c","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:39b28745c6603eb6183e07d525fdb572f1fb20e00d323493bcc6ccb4d7b2ca08","observation_id":"bd7479d9-f02e-4934-9fdd-5e7b8e090b5d","resolution":{"observed_at":"2026-05-10T22:58:52.398112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nerdi: Single-view nerf synthesis with language-guided diffusion as general image priors","venue":null,"work_id":"f1958f32-3ed1-4792-905c-afdb72466607","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:131ab20184bbcc4b37d5d334a4841294a30d4ea2bca20d424bfc9a2b73d73750","observation_id":"5a104dc8-f20a-4b87-be90-f5352dab01a2","resolution":{"observed_at":"2026-05-10T22:58:52.401071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic video genera- tion with a learned prior","venue":null,"work_id":"e83b6202-4c8e-476d-925e-11dddddf2a95","year":2018},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:0b515a27815a12dbe5c8d66731cd733827f252ef76bcf35dc5052b76efc0413f","observation_id":"320fb33a-6144-4d89-9f0b-560514fdc576","resolution":{"observed_at":"2026-05-10T22:58:52.404300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":"2105.05233","doi":"10.48550/arxiv.2105.05233","metadata_source":"pith","pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Models Beat GANs on Image Synthesis","venue":"cs.LG","work_id":"2eb944bb-93ba-462c-8111-4e8c915dd873","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:619504a502385003fd02b512e68f24db9ccc9c8519592b4c340f775ef41f20fe","observation_id":"6b2076e6-a43b-4069-99c3-f9aa92e5dbba","resolution":{"observed_at":"2026-05-13T11:16:28.664120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Derpanis, and Bj¨orn Om- mer","venue":null,"work_id":"af0932ef-152b-4137-97ac-ac786e46ad7d","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9dcc2292c3c7c5d8bdbeea47f0082e51db92491a87ac47c62995b62677fc923e","observation_id":"020a0ee9-fbcb-44c6-af09-1542b02f5622","resolution":{"observed_at":"2026-05-10T22:58:52.406918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Google scanned objects: A high-quality dataset of 3d scanned household items","venue":null,"work_id":"1a9ed824-8764-48e7-b8f0-8bbc71718005","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:241acded50796dd503a80ed97c656a80f8d8100b77f870820c98bad3a99b5ae9","observation_id":"3f825f0d-913a-4c73-8220-2720c572daeb","resolution":{"observed_at":"2026-05-10T22:58:52.410446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c47aff0-dc26-417d-ba19-268067ba588b","year":1978},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:2b0376cb3576aa226c44bb2c2d3c3315bc9c6795e69ecc33ce40468aeefa8515","observation_id":"8f93d1e6-83f0-4f7e-943b-9d7a023e0fdd","resolution":{"observed_at":"2026-05-10T22:58:52.413748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09841","last_updated":"2021-06-23T16:07:21Z","snapshot_observed_at":"2026-08-07T00:06:20.341178Z","submitted_at":"2020-12-17T18:57:28Z","title":"Taming Transformers for High-Resolution Image Synthesis","version":3},"cited_work":{"arxiv_id":"2012.09841","doi":"10.48550/arxiv.2012.09841","metadata_source":"arxiv_reference","pith_arxiv_id":"2012.09841","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Esser, R","venue":null,"work_id":"b467cc9a-4a7a-4b7e-a4e5-d966dc3be597","year":2012},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2012.09841","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:01f945a109070ccbc3a25653c060da37ea43eac7ac7e357a2ac9cddfe62afb6d","observation_id":"d992ae0f-c056-43e8-8e4b-a13887ea7fe6","resolution":{"observed_at":"2026-05-10T22:58:52.084829Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"322ba24a-2ff8-47c8-922f-78b1d4e527a7","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:0404b8716b0d7bfd2f4f2c364e98c35d4c43393c5b869ca145b5c69a93c41f31","observation_id":"9f6ebd11-36e7-4089-9f9e-849e4be37272","resolution":{"observed_at":"2026-05-10T22:58:52.417956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Two-frame motion estimation based on polynomial expansion","venue":null,"work_id":"fefbe3ba-a03b-4eb4-881a-fd7f552af0a9","year":2003},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:af1448c08fa8bf1c511df54982b40c6b4c33d09d4945b5315074e9f2d4d70ad2","observation_id":"47afb22e-77d8-4081-a419-162fe74e5bef","resolution":{"observed_at":"2026-05-10T22:58:52.423853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylevideogan: A temporal generative model using a pretrained stylegan","venue":null,"work_id":"08949b9f-af04-46a3-ad48-fe97b885923c","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:233f275c00021a2c800a4af5facad9401136e45c7e1b89b70b4531677c8e529e","observation_id":"5c183e3c-648f-488b-8aff-7287d2f187b1","resolution":{"observed_at":"2026-05-10T22:58:52.430349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic latent residual video prediction","venue":null,"work_id":"2abd63b9-e065-4b88-8d3a-ed2abbaa13c5","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:1001664d67a9d33fbd45c21c5e3928eb76ecfbf70036d2f3f32a013c7d7196ea","observation_id":"d13f1608-b9be-4757-a8c6-c7bb497ae565","resolution":{"observed_at":"2026-05-10T22:58:52.433370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:65b34de9f934cc09909ac74f1fe4665cfd7d8060b105dc521e6a5b47ddd0517b","observation_id":"fcf8153a-93af-4fa2-927b-05d260211088","resolution":{"observed_at":"2026-05-10T22:58:52.107162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"6de3a64b-b8ea-444f-9442-8065f22ada64","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:71ac90e8b7e030277ab717d5c76db7ffc2c46f5e2f9a8ff5a5e280929da54dff","observation_id":"690678e9-dadd-49a1-b826-a3233091cbef","resolution":{"observed_at":"2026-05-10T22:58:52.440342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preserve your own cor- relation: A noise prior for video diffusion models","venue":null,"work_id":"2c871b9c-fc12-4672-9002-0df024e2ae10","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:0827863a4686a532d0f5dd4eb36c3db3fa8ebd2aa434ec8b9fe0c38618ef4d89","observation_id":"9a39a536-4f21-4df2-ab0a-6b7b301a3307","resolution":{"observed_at":"2026-05-10T22:58:52.443748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial nets","venue":null,"work_id":"a9a6c32d-820c-46f7-bfe3-284681f9adac","year":2014},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:2a454e73b462499674bde97b2434ce455477f999b718d8c78e3ba533d313ff11","observation_id":"243d2d62-1813-4d4d-a44c-b8a5abda79b6","resolution":{"observed_at":"2026-05-10T22:58:52.446463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03549","last_updated":"2023-09-07T08:12:58Z","snapshot_observed_at":"2026-07-06T16:15:35.656382Z","submitted_at":"2023-09-07T08:12:58Z","title":"Reuse and Diffuse: Iterative Denoising for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2309.03549","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.03549","snapshot_observed_at":"2026-07-08T10:54:49.290119Z","title":"Reuse and diffuse: Iterative denoising for text-to-video generation","venue":"cs.CV","work_id":"95d14a9f-6bb3-4a2a-b557-0c8994b4b509","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2309.03549","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:57db8e50009a78ed1207a8e61d245fb2c1126ec831c821a2c46335ea9ebf1ae1","observation_id":"a5b19aa2-1efc-46ca-bfcf-feb54b55f7e5","resolution":{"observed_at":"2026-05-10T22:58:52.031672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:07f0d9990d6d9661f4a9cff6ebf044b525389caabcb3803ebdd96cfa40bd9c7e","observation_id":"e1db8544-3368-4414-b1c3-2e9bbd7852bb","resolution":{"observed_at":"2026-05-10T22:58:52.081067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rv-gan: Recurrent gan for unconditional video generation","venue":null,"work_id":"93258464-2825-43f7-a524-d4339f2ad5ea","year":2024},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:719b287d9b49881ea82b781f4661528c1367099a816a15978b5c89069562590a","observation_id":"2d998d1c-bee5-4b8c-af61-db9795cfdeb9","resolution":{"observed_at":"2026-05-10T22:58:52.449183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion with offset noise","venue":null,"work_id":"9798da22-22cb-4599-82ee-6592ce3ab91d","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:7e10d5cdfb98f043f49fff92af95a36c53def17832f2fad678b1e9b9e0bd7f3c","observation_id":"91f40faa-f813-4d60-a401-8a1b820a41b4","resolution":{"observed_at":"2026-05-10T22:58:52.453606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent video diffusion models for high- fidelity long video generation","venue":null,"work_id":"e39a2292-c1ee-4273-883e-87bcb432dcf5","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9dc515d2d0fe9ec86b450a7f4759ad633ff0a3e378748ce02d1d4c33c08830f6","observation_id":"7a87548d-6f96-4e28-a5cd-86b861b1dd53","resolution":{"observed_at":"2026-05-10T22:58:52.456584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"bd6fc1af-2a0f-466d-8514-f0e5e02b7a30","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:ab80edd1b1b1b8df6ea18d4039391a23cc952665c19d72ccfac80b311b141574","observation_id":"47f51d8f-25a7-488a-ad22-bbb4152a5a59","resolution":{"observed_at":"2026-05-10T22:58:52.459221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:487907f6fd745601835ed2025338970bf97ba014e7a5189be53b4c32535ea04d","observation_id":"2552e170-3aef-480c-b3d9-88cc076c19d3","resolution":{"observed_at":"2026-05-10T22:58:51.924296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"fa446095-fefa-4286-82a8-9c65913c98f8","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:349eee0e4ddc893d990467a2579adf90b59aba3614db24572237d8718f2eb23f","observation_id":"93c36309-9772-43af-a905-4895897a2b09","resolution":{"observed_at":"2026-05-10T22:58:52.461828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15282","last_updated":"2021-12-17T17:21:04Z","snapshot_observed_at":"2026-08-07T06:41:10.116700Z","submitted_at":"2021-05-30T17:14:52Z","title":"Cascaded Diffusion Models for High Fidelity Image Generation","version":3},"cited_work":{"arxiv_id":"2106.15282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.15282","snapshot_observed_at":"2026-06-30T13:14:41.217333Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":"683a54c3-7d5f-454f-854b-a4aeca9df7d7","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2106.15282","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:2252e16e537ce669d01dbb48994c3cb03561480574fcefa28f75982c28c1b8dc","observation_id":"063774ac-f08c-4560-bad1-c08ba661c7d8","resolution":{"observed_at":"2026-05-10T22:58:51.972482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:be29db4368905328e61780e33bfd9b753c6e98cbac5b030ca03750c0e92eb26a","observation_id":"bac83294-60f9-4168-9ed8-008d896ab7b0","resolution":{"observed_at":"2026-05-11T03:31:08.340948Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2204.03458","doi":"10.48550/arxiv.2204.03458","metadata_source":"pith","pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video Diffusion Models","venue":"cs.CV","work_id":"02e03469-549e-4b5a-9bf0-ac6617a89882","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:18f1b0b501ac6c8fe27a12fdecccb78342ef30da6530c39e2e1b4b2d705aa96d","observation_id":"e481fdc1-9476-4793-8abc-787900d4fca1","resolution":{"observed_at":"2026-05-13T14:38:28.190773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogvideo: Large-scale pretraining for text-to- video generation via transformers","venue":null,"work_id":"8995bb48-6cd6-486f-88dd-b255ae757b71","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:3ce3f6b2623900664eebcdc0deca351d949c30194f210efaa898f86e1d919425","observation_id":"bfa7556b-0994-4e58-9826-50e9a7be80cd","resolution":{"observed_at":"2026-05-10T22:58:52.465451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11093","last_updated":"2023-12-12T14:00:08Z","snapshot_observed_at":"2026-07-06T14:44:52.692991Z","submitted_at":"2023-01-26T13:35:02Z","title":"Simple diffusion: End-to-end diffusion for high resolution images","version":2},"cited_work":{"arxiv_id":"2301.11093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.11093","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":"48d852c5-765d-4517-9771-e8d2c8d52d3c","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2301.11093","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:63083e311b8e7ec34421e3e63be04742ddf4ac4cb65f518b26f92a0cab3a5a58","observation_id":"a2d7b100-b1a6-4787-b0c2-88e567d362a9","resolution":{"observed_at":"2026-05-10T22:58:52.051355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:27fdebb0f0bfdc9a6c4ab33903f9092e62ee919e845c3314afca193ca6c5fac2","observation_id":"80ea7579-f424-4acd-99ee-ffcb0f3bfe4a","resolution":{"observed_at":"2026-05-10T22:58:52.070238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Estimation of Non- Normalized Statistical Models by Score Matching","venue":null,"work_id":"841efe5d-d32d-46ba-8dcf-de44a7c38074","year":2005},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:4f5af00e94ce789d69bd9792d1be168bd92191639346840c39aa35c7e7d9254f","observation_id":"3086b5be-cc65-4653-892e-e2273ce0e237","resolution":{"observed_at":"2026-05-10T22:58:52.467988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open- clip","venue":null,"work_id":"86803498-741d-44e7-9628-5a3308efbf53","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:12d4b726af9364b7169d0b5e7187a7f90e985f84b4cc2f8da6ea0ff892b4c3da","observation_id":"ba979575-0310-45df-ba27-f1508672c505","resolution":{"observed_at":"2026-05-10T22:58:52.470262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open source computer vision library","venue":null,"work_id":"8fae09d3-a1e6-4d3e-a06e-05b5e3c98323","year":2015},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:c7cf5df0e9544564f6592a343df9960c5f1fafe4b95bfbe8e6288fd0c2490a0e","observation_id":"f113f498-f494-41e8-8c7a-0e2fb4feba54","resolution":{"observed_at":"2026-05-10T22:58:52.472725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shap-e: Generating condi- tional 3d implicit functions","venue":null,"work_id":"517d5c1b-31c8-4fb7-8f26-7529fe8863a1","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:4bc0cf924bc22de618c4177ea713f9b42a29f0253785e723b966a43ce4e15141","observation_id":"850225e8-c922-427e-b7ca-a5de58c892b4","resolution":{"observed_at":"2026-05-10T22:58:52.475372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lower dimensional kernels for video discriminators","venue":null,"work_id":"38e715f6-e8c4-4435-bead-ffff7fe84d75","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:71a5b9cdaea7463b1e03095aabdd0f7b8d3666a775cb6c1e696f51c6336ef0cc","observation_id":"a244474e-b377-4cb7-8994-d8f16a92ef16","resolution":{"observed_at":"2026-05-10T22:58:52.478776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00364","last_updated":"2022-10-11T13:20:30Z","snapshot_observed_at":"2026-07-06T13:16:16.926712Z","submitted_at":"2022-06-01T10:03:24Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","version":2},"cited_work":{"arxiv_id":"2206.00364","doi":"10.48550/arxiv.2206.00364","metadata_source":"pith","pith_arxiv_id":"2206.00364","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","venue":"cs.CV","work_id":"a80a774d-caed-4e4c-9b69-471be05076e6","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2206.00364","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:3c08870a181fc55eb69435ea6c3414d16619dbfb6ec24031f9544f0581f5ba38","observation_id":"7a1154aa-5e2d-4727-8b2f-4426575ecb7d","resolution":{"observed_at":"2026-05-14T17:46:53.453910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:30.261846+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:30.261846+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"e7b13d92-a6f6-479b-bac8-7ded064af384","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:5adb08ef4f5c77f21108e17f89991c8d480d21e360ac542c2c3e932d4f880cfd","observation_id":"f98227f2-8af8-4cce-a16a-8e71eb6f1bc0","resolution":{"observed_at":"2026-05-10T22:58:52.481343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variational diffusion models","venue":null,"work_id":"6c42d0fb-c528-4218-bd25-1a17ac72f4d2","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:5b756643641cf6f0480ac47cf3e46c002a56799fea46356ce6a2ee760ea97ac1","observation_id":"0b4bce9d-a8b5-4b0a-90ad-b1ee75f5da75","resolution":{"observed_at":"2026-05-10T22:58:52.483561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pika labs, https://www.pika.art/","venue":null,"work_id":"40cd2190-1149-420c-bbb7-1751b37740b7","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:4b85b15a541b2b40611502fc86b95024981ac905e4319d36b151693f44e10b76","observation_id":"afffa12c-1938-460a-9ce6-adc9320f50a0","resolution":{"observed_at":"2026-05-10T22:58:52.485890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01523","last_updated":"2018-04-04T17:55:40Z","snapshot_observed_at":"2026-07-06T06:31:45.401940Z","submitted_at":"2018-04-04T17:55:40Z","title":"Stochastic Adversarial Video Prediction","version":1},"cited_work":{"arxiv_id":"1804.01523","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.01523","snapshot_observed_at":"2026-06-29T08:43:15.688169Z","title":"Stochastic Adversarial Video Prediction","venue":"cs.CV","work_id":"79566ba2-e12d-4661-895e-bb788b1108e4","year":2018},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1804.01523","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:fe9166aa6d84fd5ffb1d9e92a83d0e83208020c6ec77ef5c0e18347b68b2858a","observation_id":"3fca2898-f60b-487f-af8d-341ceb1f05fc","resolution":{"observed_at":"2026-05-10T22:58:51.976482Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08891","last_updated":"2024-01-23T03:08:28Z","snapshot_observed_at":"2026-08-06T10:32:28.249022Z","submitted_at":"2023-05-15T12:21:08Z","title":"Common Diffusion Noise Schedules and Sample Steps are Flawed","version":4},"cited_work":{"arxiv_id":"2305.08891","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08891","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow matching for generative modeling","venue":null,"work_id":"abdf465f-a666-4bc8-bcc6-1148df861601","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2305.08891","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:f79f08ffa11d85c05a31f1f1fe7022c4652de703761d7a274957b52f99fa084f","observation_id":"3551b37e-644c-4587-ad56-bb649e380c8e","resolution":{"observed_at":"2026-05-10T22:58:51.982261Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-1-to-3: Zero-shot one image to 3d object","venue":null,"work_id":"2ce38952-6cdc-4d2d-ba6c-920a8ca8acec","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:c1d3a861c4d5ae8ad4b0b9b9c30fce8954cc9ebf905b2b1967f866c67b92a7a1","observation_id":"3dc4f274-ad4c-421d-98d0-83360ec06777","resolution":{"observed_at":"2026-05-10T22:58:52.488826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-07-06T16:15:31.848927Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":"2309.03453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-07-08T01:44:26.219240Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","venue":"cs.CV","work_id":"b0c47120-5c87-4e79-8fe8-1be8e49f855f","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:93873ef3185af9e9b2f7386d44ba62afd67fe44a84262c9017806ccfda1afa8f","observation_id":"4f7f2d8c-d0c4-4c54-8d56-1dfd30365503","resolution":{"observed_at":"2026-05-16T10:35:43.296571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:112679e74062ce368d98f5d65f5cc64ae217441ff6bfa79f494fd1a266f64caa","observation_id":"0345f43f-3b3e-4fe8-8b28-1b23a2831069","resolution":{"observed_at":"2026-05-10T22:58:52.010731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformation-based adversarial video predic- tion on large-scale data","venue":null,"work_id":"c727b68f-1fc9-4258-93f0-d10bd1c310d5","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:d8753c9cf2c88a3103db09f896d5b737d4f0695ee7baea3cb059d553a51c4b0e","observation_id":"70223a73-0f29-4875-90ba-cb84849a1dbc","resolution":{"observed_at":"2026-05-10T22:58:52.159200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma, Stefano Ermon, Jonathan Ho, and Tim Salimans","venue":null,"work_id":"02614675-8019-4e64-96aa-3d3f0457c119","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:715a1aabf610caf823660fc619a8d137d7787d918a7e48aee2ff9a24ce2b472f","observation_id":"10ba17ca-7d1e-4955-a69d-afc3eb79366b","resolution":{"observed_at":"2026-05-10T22:58:52.162066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point-e: A system for generating 3d point clouds from complex prompts","venue":null,"work_id":"e6e87b75-5749-4823-86a2-8f573f72fa91","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:28614ee4c9f1f13dcd8a0c03b798b81c16d2b2e4bd151fccccbe3959e90e2965","observation_id":"786d8902-6c1f-4998-8440-9e7b4ba5be80","resolution":{"observed_at":"2026-05-10T22:58:52.165074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":"2306.01116","doi":"10.48550/arxiv.2306.01116","metadata_source":"pith","pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","venue":"cs.CL","work_id":"edfb45ee-84c2-4531-b3cd-bd8eb830f4e1","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:94e6dd9ffb2fbed1f760fd1734220ca23c39267749b45d494e1b4a3f9fdde775","observation_id":"11226907-7541-4eef-8724-e5170230b98f","resolution":{"observed_at":"2026-05-13T20:43:45.999902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:7f7f0ea8cc0efb16eb2f7e163a2c482590201b6927f70322defd6de82df500d6","observation_id":"f9985714-33e4-4fea-a5d7-d10d465cff3e","resolution":{"observed_at":"2026-05-10T22:58:52.063212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training contrastive captioners","venue":null,"work_id":"6d1f5a59-5cff-4087-a9c4-6aa44dbedebc","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:23f7bdd9e49864a0778c0af7f48fbfdc420bc1200551f5be052f8a4741411262","observation_id":"7370bdaa-45ce-411a-8e06-5168591e9001","resolution":{"observed_at":"2026-05-10T22:58:52.167803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:e2e81ed65df3c3cc4b1b0eec82b3a3c9c0224e3f5f68b5e935669ba4473b363f","observation_id":"7d7aaa5e-a0d0-480e-9ad9-22ff8f14c19e","resolution":{"observed_at":"2026-05-10T22:58:52.074775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0bc409f3-448b-4d02-81a7-f32c5786903e","year":2019},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:f5933f9028a8d640ebea54f53a34851d197d59683776b50e22c0a1454ce4bd72","observation_id":"fb34dd4b-1bda-4d08-8db5-3bbd2325aea6","resolution":{"observed_at":"2026-05-10T22:58:52.170395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How dall·e 2 works","venue":null,"work_id":"2329341e-cfc6-43c8-810a-f716d933ee8d","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:6e258a797ed27f9cee48948f85efc538238fa0bd3e5b6676a02f5798cfa39727","observation_id":"a901f9ff-a6a0-41f0-bdbc-c1991e011740","resolution":{"observed_at":"2026-05-10T22:58:52.175437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:b23fbf5fb57566fafd76656a81f71d16c00b8db14e881b4beb0f164ba786995f","observation_id":"e428c13a-b90e-41af-9ee7-d6c201de1a31","resolution":{"observed_at":"2026-05-10T22:58:52.092030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2112.10752","doi":"10.48550/arxiv.2112.10752","metadata_source":"pith","pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","venue":"cs.CV","work_id":"f0270d36-2952-47fb-84c1-95e3ec341126","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:c20cc7e3a0af46deca473c59549ea7c3532d4aa557c1de597c835c2bb3a55639","observation_id":"2f8e63da-c358-482b-9917-e97dcb5efc17","resolution":{"observed_at":"2026-05-10T22:58:52.096430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:24:00.877132+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-08-06T11:05:16.105361Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":"1505.04597","doi":"10.1007/978-3-662-06400-9_9","metadata_source":"pith","pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","venue":"cs.CV","work_id":"5c6b13d6-e704-4bf4-9df7-3a3a4d3b6950","year":2015},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:8d73f494f4f8f3e230d600820ece31bfbd207200b531922638808d10b3f53596","observation_id":"2a66a5ed-5b6f-4efa-9d32-435f2b17b5f2","resolution":{"observed_at":"2026-05-10T22:58:52.103805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen-2 by runway, https://research","venue":null,"work_id":"b2b6e128-8639-47a4-990b-5437c494fc8a","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:237fbd0c96db4b65486e37579d077266ec29135e59de73ff3b42589b45b24f4b","observation_id":"b7c509d8-9f86-4d8a-adcd-54bcf546cf10","resolution":{"observed_at":"2026-05-10T22:58:52.178198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07636","last_updated":"2021-06-30T07:34:57Z","snapshot_observed_at":"2026-08-06T10:36:32.792565Z","submitted_at":"2021-04-15T17:50:42Z","title":"Image Super-Resolution via Iterative Refinement","version":2},"cited_work":{"arxiv_id":"2104.07636","doi":"10.48550/arxiv.2104.07636","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.07636","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Saharia, J","venue":"arXiv (Cornell University)","work_id":"e9b412f4-75e3-4695-be45-4a12069939ac","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2104.07636","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:38139e225b1e540bc95f729399f2af7dbca47974975754ab040238614d2b07ee","observation_id":"5ed6e231-1a11-4c9f-9a22-312c2450f838","resolution":{"observed_at":"2026-05-10T22:58:52.111625Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":"2205.11487","doi":"10.48550/arxiv.2205.11487","metadata_source":"pith","pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","venue":"cs.CV","work_id":"af16442b-a46f-469d-8818-c37b53a504c7","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:025afb438c02ef8fb5edf173a0db68037e7c6a5d379426bd80337f603f8bba22","observation_id":"a642a08a-88d5-43fb-b08f-f323c26ee55f","resolution":{"observed_at":"2026-05-12T07:38:54.138183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tempo- ral generative adversarial nets with singular value clipping","venue":null,"work_id":"0f3e8f94-5bf3-4c75-9dec-0109a4074d2a","year":2017},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:fdcc7c8b80ea27107c2b312139e9734fea6836400c103ee0afe22c795c303a9e","observation_id":"8c4286f9-9084-4c24-8a4e-97f72bd68b88","resolution":{"observed_at":"2026-05-10T22:58:52.187263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train sparsely, generate densely: Memory- efficient unsupervised training of high-resolution temporal gan","venue":null,"work_id":"4c882b02-640f-45f2-9de0-e9bf7ddfd331","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:a3e9a0cff31d1e2c54e0adaebf080678d4fbca60d8c4a455dc1031d5c499f664","observation_id":"41416f5f-b999-466b-91a0-e07ec90dc987","resolution":{"observed_at":"2026-05-10T22:58:52.190766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:74d00bc4bbc66b6d65a1a26c3193e184b06267cef600c8a00db48f02bbf299a5","observation_id":"4ab4e3b3-883d-4fb5-a4a7-c28d21fae26d","resolution":{"observed_at":"2026-05-11T09:37:44.815756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"cc73a8c8-3462-459d-a81c-a05775a195d1","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:de89df14a4eaa99c0f438837abf954cd8e7b7626104d91e75261a503877332b8","observation_id":"c0620f95-20b6-4d95-8a0d-5ebb612dd05b","resolution":{"observed_at":"2026-05-10T22:58:52.195095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-07-06T16:12:38.269310Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":"2308.16512","doi":"10.48550/arxiv.2308.16512","metadata_source":"pith","pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MVDream: Multi-view Diffusion for 3D Generation","venue":"cs.CV","work_id":"269d1cf4-9ad9-4b6b-8f5f-da1567956dd6","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:ee6b8e2fdd34dad027c636352fb63954b98b07f55caeb6d64f19115305475b74","observation_id":"34feb37c-b32b-4396-a56c-7092ec300e26","resolution":{"observed_at":"2026-05-15T08:36:20.266102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:027afdc5158894616cea93d2a4699d3011b4aa85e2d8e535e12964791d837237","observation_id":"9889afaa-6ea3-4723-a270-acb42ef8f891","resolution":{"observed_at":"2026-05-11T01:13:03.403852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"bbafed97-74be-4b81-a5f2-bed5015af75a","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:77e2436cdc1486de5872f3401d53565f9c12dd814f83c4df79acb82a9806d146","observation_id":"a2c8a657-23a3-4415-bf59-d6f14e87f27b","resolution":{"observed_at":"2026-05-10T22:58:52.198584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.03585","last_updated":"2015-11-18T21:50:51Z","snapshot_observed_at":"2026-07-06T04:11:47.439779Z","submitted_at":"2015-03-12T04:51:37Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","version":8},"cited_work":{"arxiv_id":"1503.03585","doi":"10.48550/arxiv.1503.03585","metadata_source":"pith","pith_arxiv_id":"1503.03585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Unsupervised Learning using Nonequilibrium Thermodynamics","venue":"cs.LG","work_id":"986277c3-5997-4593-942c-17cdec737a72","year":2015},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1503.03585","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:84f4a52ea87c383410d57374f3733b546a8d65cef5371924008d2be3562fa786","observation_id":"49a95cb2-cbf4-435d-9106-4b640c78c46d","resolution":{"observed_at":"2026-05-13T20:12:28.687532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T23:21:00.213109+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and mitigating copying in diffusion models","venue":null,"work_id":"a2f02638-7382-476e-bfd0-be3795b3d670","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:7123993d4095de7767582f7676ec2569aa551f6f67b2f6314ff3b2fefd788792","observation_id":"e14a40b7-92cb-4361-9d15-4735feaadbe3","resolution":{"observed_at":"2026-05-10T22:58:52.201576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09011","last_updated":"2020-10-23T19:37:51Z","snapshot_observed_at":"2026-08-06T20:31:52.636592Z","submitted_at":"2020-06-16T09:17:17Z","title":"Improved Techniques for Training Score-Based Generative Models","version":2},"cited_work":{"arxiv_id":"2006.09011","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09011","snapshot_observed_at":"2026-07-10T06:26:51.341581Z","title":"Improved techniques for training Score-Based generative models","venue":"cs.LG","work_id":"5c40fb2a-218b-4d28-a13d-b5302d2f1718","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2006.09011","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:9bd27b52bb16973c430083ca8c8684b98d433c74afc327457adbb208a456304a","observation_id":"94f7f97f-5ae4-4be9-a194-770bd2b6d255","resolution":{"observed_at":"2026-05-10T22:58:51.954301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:6ac85803e835c6bec2aaffd2715b3cd2b3013f5becc580fcf02b5fd3d7d4035e","observation_id":"7e794e55-785f-4775-a471-dc44b8ae111e","resolution":{"observed_at":"2026-05-10T22:58:51.958806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:15ee484847fb0b66777d3a7f5f6b666c101666ac4785207bd4bb111d88741c49","observation_id":"12eb4b0f-eb97-4a00-b0c3-e577c4f0923f","resolution":{"observed_at":"2026-05-11T01:25:00.378223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"b27b2b23-ea71-4978-bc82-86ee21d17c78","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:2377d54822526678898259dd72b06ba2d5a483a9afa5404c75b87f08abaa7f15","observation_id":"2188a425-4618-4d2e-a17a-c9f8587e3775","resolution":{"observed_at":"2026-05-10T22:58:52.209334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metaxas, and Sergey Tulyakov","venue":null,"work_id":"8107840e-bb4e-4d84-afae-a814ca6a4997","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:99ae30f1f02a9962f75a3109fe69eb482b1ca290ab56833f972a28ce01b0a334","observation_id":"10c673ff-2f67-46c1-b8dd-1f2ce189ba37","resolution":{"observed_at":"2026-05-10T22:58:52.212551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Converting video formats with ffmpeg","venue":null,"work_id":"72121954-6d3b-426e-bd74-d0df7b43ff78","year":2006},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:3236b4cc890d44d1a774c61434f6f32743f90060f58c6ef50b7c532dee0b965c","observation_id":"1f66e2b7-e935-4535-9e1f-82f4c0c19672","resolution":{"observed_at":"2026-05-10T22:58:52.220100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based generative modeling in latent space","venue":null,"work_id":"e8ddd3b1-19d9-4afb-b628-2bdadced6768","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:b05c5792703ce0b5e4ee1e71f91705d6f578c8f4587f811c713202a52c4aaa83","observation_id":"f5a396a0-1a76-49d3-bc6f-7c805e91a29b","resolution":{"observed_at":"2026-05-10T22:58:52.230113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decomposing motion and content for natural video sequence prediction","venue":null,"work_id":"7595f25c-e356-4a1d-8daa-1e91fe8a9f38","year":2017},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:5992cda8f44672df8b94df44fd8c6ee284e16dd4766276af0dd1612c283deb4c","observation_id":"1bf1c45a-fbe8-4a90-bbe9-9f7fd079c56a","resolution":{"observed_at":"2026-05-10T22:58:52.234644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-04T09:09:48.463217Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":"2210.02399","doi":"10.48550/arxiv.2210.02399","metadata_source":"pith","pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","venue":"cs.CV","work_id":"a325cd53-6549-4726-b3e9-94509f0df168","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:618c35d8c381da10d1879b8ae26750c1c4dd0af5039708b67cbfd84227671d4a","observation_id":"cd012fbc-e7d0-4450-85b0-cd7b2ad9d52e","resolution":{"observed_at":"2026-05-17T01:43:34.268786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mcvd: Masked conditional video diffusion for prediction, generation, and interpolation","venue":null,"work_id":"041aaa93-44d8-40c1-b01c-9a0a8dd8121d","year":2022},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:e68c8a7799777abea46964b776a7ba90b798948e065fa42541c9745f97089ec0","observation_id":"301c62a7-1e1c-4f9d-b3af-a1b3cce9a07f","resolution":{"observed_at":"2026-05-10T22:58:52.239876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"40ae80f9-62fc-4cdc-a9f8-00d5f0ea8b77","year":2016},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:702b6b5f81e53254884a02525ac432f7f6bc6ac02116799f7e682409a7fae4f1","observation_id":"0ede45f9-e289-4435-a4e4-d06e131f0308","resolution":{"observed_at":"2026-05-10T22:58:52.248191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:db1e939e604856474ae144a308b5c5240d002bc765d9cfc800c76ec530a08231","observation_id":"867eb3c0-1e04-4c90-b25a-f9635e1a6e03","resolution":{"observed_at":"2026-05-12T19:47:29.701736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G3an: Disentangling appearance and mo- tion for video generation","venue":null,"work_id":"ba0f849a-894c-4688-8d18-601f956151b5","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:b6ba3ea155921e3c77667da3d43058c0d03704d811f12fd5c47a5b64432ac23a","observation_id":"ddb335e0-703c-4c00-9b86-35e1f131e0e3","resolution":{"observed_at":"2026-05-10T22:58:52.252462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2309.15103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-06-29T18:43:51.114876Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":"e26464f0-6aed-49c2-b00f-e3639b1da5b1","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:fb896efaf7bf5af03b13baa989a4ae52c8a2063a8b50588d399d0a116d4e1948","observation_id":"16e5198c-4583-429d-bb8b-1eb3433d4008","resolution":{"observed_at":"2026-05-10T22:58:52.038771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"7c6d5652-f5a1-41a6-bb82-6874e92bccac","year":2023},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:5ed725469926c426392f6a1f230471d678490fd887a341a4fe7df3e44dd11e6b","observation_id":"53774ddc-6ab3-4442-aa6b-2eb8bccb4cae","resolution":{"observed_at":"2026-05-10T22:58:52.258107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Novel view synthesis with diffusion models","venue":null,"work_id":"82c5f816-a4b5-444c-9b7c-8721bd22543b","year":null},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:8ab6b5a0b26bdf4b912827a189e19aa46377ec550c3c239b75db1647d221efe5","observation_id":"3deb0188-2f50-4613-a69e-4b1ac2472a23","resolution":{"observed_at":"2026-05-10T22:58:52.262032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling autoregressive video models","venue":null,"work_id":"18025cd2-0e76-428f-8323-f3b4ea295c64","year":2020},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:935fc4fb9773b5b0923ef710574850f36497e2033f02b4ba92f13b7cc1b5cf37","observation_id":"052d33ce-9e4a-4aff-8ad6-a4f078eaff1d","resolution":{"observed_at":"2026-05-10T22:58:52.270162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-07-06T11:05:04.853545Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":"2104.14806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-07-02T00:56:24.869825Z","title":"Godiva: Generating open-domain videos from natural descriptions","venue":null,"work_id":"6f53148b-2cd8-4a9b-9fc5-bfec20977e90","year":2021},"citing_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-10T22:58:51.792047Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2311.15127"},"observation_digest":"sha256:e1602a7100def041e8c13908e009690a7a6771dc0ad10d087c326e967045f032","observation_id":"498e28fe-59c7-4351-9027-343899b4de02","resolution":{"observed_at":"2026-05-10T22:58:52.067091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":2,"verified_exact":32,"verified_fuzzy":60},"total_outbound_references":116},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 116 outbound references and 100 inbound Pith citation observations for arXiv:2311.15127."}