{"as_of":"2026-08-13T05:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b8d9d62c461f0c007cd00c28d72712ef7ff3b997e6dcabe619b74623b00bfef","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:58:57.353357Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17470/citation-record","integrity":"/paper/2411.17470/integrity","json":"/paper/2411.17470/citation-record.json","paper":"/paper/2411.17470"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-12T12:58:57.075789Z","title":"Deepseek llm: Scaling open- source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.075789Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:02f432a2fe7969b16df13d53382a97e2d6a5cf3069eefb3352dec0a385337bf5","observation_id":"6959664b-9adb-4de5-be0e-a573a00b1a82","resolution":{"observed_at":"2026-08-12T12:58:57.075789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17465","last_updated":"2025-01-10T14:22:02Z","snapshot_observed_at":"2026-08-12T23:15:26.466256Z","submitted_at":"2024-07-24T17:58:42Z","title":"u-$\\mu$P: The Unit-Scaled Maximal Update Parametrization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17465","snapshot_observed_at":"2026-08-12T12:58:57.081120Z","title":"u-mup: The unit-scaled maximal update parametrization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.081120Z"},"links":{"cited_paper":"/paper/2407.17465","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:fe226622aa3fbea0a43ff2e43fd4e262a029e55df8ad110218a4b105f32d3fba","observation_id":"121e8797-2caf-4cb6-9959-b24eda427fd7","resolution":{"observed_at":"2026-08-12T12:58:57.081120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:58:57.085344Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.085344Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:db30ec5535184532aff5007eba51be24b0efb6cac1ae2208fec73d4194ac8a36","observation_id":"523ba06a-a3aa-4b23-ab8f-f07675bb14a4","resolution":{"observed_at":"2026-08-12T12:58:57.085344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.243542Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"1835116d-bc7f-4fb9-b215-0a6365979528","year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.089294Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:901057bb72abb24145a3f65fa8a18f33ceb5a1a979c8ac936ae193fa900c9b4e","observation_id":"86828b5b-13e7-4606-aa7e-e8d188465b3d","resolution":{"observed_at":"2026-08-12T12:58:58.247754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:57.093407Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.093407Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:7b308f69f3d17ebdcd6c1674974e9b6074ffc98035aee61ce28468fa24775998","observation_id":"23ae8ba5-13e2-4e27-8e80-3375ba641bb3","resolution":{"observed_at":"2026-08-12T12:58:57.093407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.222622Z","title":"Videocrafter2: 9 Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":"8dcc1918-8488-4374-b6ce-89dbd80d30b3","year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.097072Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:4b26b8c381318fbe9629cf5353963be043c3e77594b0e1d778d24dd0b67062b3","observation_id":"2e5c425c-659c-4459-bf58-d83a745250ba","resolution":{"observed_at":"2026-08-12T12:58:58.227466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-12T12:58:57.104946Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.104946Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:610e4fff161f65cc5437b0729ba2fecbe1883a2cf02457d791fc6fc946b7b5a3","observation_id":"5f67f53a-93e8-4dcb-a53a-c8f44139d549","resolution":{"observed_at":"2026-08-12T12:58:57.104946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.210170Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"c0427d33-e45e-4fe5-b628-0a8375401773","year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.108850Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:51db66d4dc60d9edb9fc2c69e6f0b6a35b0b4c6d55ab1276c91e0d10ba611170","observation_id":"27030f13-9a31-4096-90a1-2e1f9b33cc0a","resolution":{"observed_at":"2026-08-12T12:58:58.214310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.197631Z","title":"Seine: Short-to-long video diffu- sion model for generative transition and prediction","venue":null,"work_id":"701c42a5-5bc8-445f-af11-9edaa71db32c","year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.112801Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:37c17fc5a4626f14fa9aa3457194f094467d9bf249f380735598717278ca12ad","observation_id":"239e98e6-c1dc-4962-b088-5800c70fbf7c","resolution":{"observed_at":"2026-08-12T12:58:58.201523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06571","last_updated":"2019-09-25T16:37:55Z","snapshot_observed_at":"2026-08-10T10:12:45.825450Z","submitted_at":"2019-07-15T16:27:04Z","title":"Adversarial Video Generation on Complex Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06571","snapshot_observed_at":"2026-08-12T12:58:57.116735Z","title":"Adver- sarial video generation on complex datasets","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.116735Z"},"links":{"cited_paper":"/paper/1907.06571","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:551c7493881555b667b4add34a8d7ee96da1496bfff7b05e5e4afc8974f34280","observation_id":"48708aa3-a572-46ae-8c7a-4fb831e2474c","resolution":{"observed_at":"2026-08-12T12:58:57.116735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T12:58:57.120912Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.120912Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:96a9d1428a8d8413d6bf42dae3c2878c982539982f3e3095783fb3337d0ded3f","observation_id":"4ba04073-6539-46c9-bf6f-3e2d34f5ec09","resolution":{"observed_at":"2026-08-12T12:58:57.120912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:57.125086Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.125086Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:d2d2d2ed8fba80fb03d61239b05e328eefdd47ba58db2b4e66d6c9c0a977f2ca","observation_id":"fcb6e01f-93f8-46e6-a087-fff832362720","resolution":{"observed_at":"2026-08-12T12:58:57.125086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-12T12:58:57.129116Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.129116Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:03358287c036ede65d35132218ff2db229badc9ee375dd79db04cb941b340b97","observation_id":"9dd5c5e8-c743-4fee-a509-75eef8c6e838","resolution":{"observed_at":"2026-08-12T12:58:57.129116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-02T11:56:15.393496Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-12T12:58:57.137762Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.137762Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:cfd1d119fb1626506c197b492f45adb00631377808b59d435e23a0df751402bb","observation_id":"f0625430-8b40-479d-b21c-e00cb918bcaa","resolution":{"observed_at":"2026-08-12T12:58:57.137762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-12T12:58:57.141192Z","title":"Accurate, large minibatch sgd: training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.141192Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:02f9edc8748e7e25bb7f52256a79b339483caa0a8ed687912824f5f1ef31953f","observation_id":"0441af0c-0cc6-41de-a59e-fed8017eb81b","resolution":{"observed_at":"2026-08-12T12:58:57.141192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-12T12:48:31.714281Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-12T12:58:57.145574Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.145574Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:00cfa32215b4e22e44b5dd5dd479118edc64ae9dc23a73091589e64ade10340b","observation_id":"69a9fec3-811e-4398-8b6d-48bba4422a5c","resolution":{"observed_at":"2026-08-12T12:58:57.145574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-12T12:58:57.153432Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.153432Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:990cb993e54f983f3c45d4a2c48f948c698b3b632284b78161ad832805fbb80f","observation_id":"073df9a6-4ee6-463a-8f99-ba741dea8c5e","resolution":{"observed_at":"2026-08-12T12:58:57.153432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-13T00:48:23.284957Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-12T12:58:57.156983Z","title":"Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.156983Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:a10fc1161bdc2f1e2348ba7b1c956468a860162bc8b2ec3ba7dcc817ecc33b61","observation_id":"ac41a400-3674-404e-90dc-b7815959f048","resolution":{"observed_at":"2026-08-12T12:58:57.156983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13135","last_updated":"2023-02-09T12:24:54Z","snapshot_observed_at":"2026-08-04T04:32:39.545631Z","submitted_at":"2020-04-27T20:02:04Z","title":"Local Lipschitz Bounds of Deep Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13135","snapshot_observed_at":"2026-08-12T12:58:57.160989Z","title":"Lo- cal lipschitz bounds of deep neural networks","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.160989Z"},"links":{"cited_paper":"/paper/2004.13135","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:46636970eaf84014cca7b34f8f04987c4950cfd95b734d168ceb57402f8c590c","observation_id":"1e98f59e-12d8-4299-8fb0-3b28d16be15e","resolution":{"observed_at":"2026-08-12T12:58:57.160989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-13T03:17:56.153371Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-12T12:58:57.164893Z","title":"Deep learning scaling is predictable, empirically.arXiv preprint arXiv:1712.00409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.164893Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:c2fe04e1d9272c1355bfd5cd93c9bf9e91c1b3b4b8b6ed0f4fdb14fc4419f2d8","observation_id":"b81af0fb-8aa1-4a35-a82c-f5b818c30df7","resolution":{"observed_at":"2026-08-12T12:58:57.164893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:57.169522Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.169522Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:0debd5c251e26a5df01ebfab26008411b6977469c5d7c1022a39acc3ae54a63f","observation_id":"05201b75-7e64-42ba-a163-e90c5599d204","resolution":{"observed_at":"2026-08-12T12:58:57.169522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-12T12:58:57.173429Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.173429Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:0962f11a3a55fd657b3119ed2062a5782992370ca9d6aedb904bf4acf220428c","observation_id":"34aa8a0c-fe31-45a6-a434-57e4226866e0","resolution":{"observed_at":"2026-08-12T12:58:57.173429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T12:58:57.177934Z","title":"Training compute-optimal large language mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.177934Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:80ff08e01432551fe835c2e6fba1e8c212dc6ae02ede553fba89cfe7098444aa","observation_id":"a399adbe-96a3-4e3c-a374-be1b23908883","resolution":{"observed_at":"2026-08-12T12:58:57.177934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-12T12:58:57.182926Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.182926Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:d302a8103b3a85f465764460ed1edcd2038f1132ea8c7dc1b2b6f2a72335ce26","observation_id":"ac75d370-f0fd-461a-9257-8a71e4f11fd1","resolution":{"observed_at":"2026-08-12T12:58:57.182926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-12T22:52:07.327467Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-12T12:58:57.187234Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.187234Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:8fcd92b918dfd970f796321b349110f933adb7cd3ae4c8d1e9ad97420abe95b9","observation_id":"5674c9ff-7cf3-4108-9623-f4809b357269","resolution":{"observed_at":"2026-08-12T12:58:57.187234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T12:58:57.191259Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.191259Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:9a5c71d35c46248646c6361b8025c107fb74a7a20df3e850f677be3e1a5b1ad8","observation_id":"5f808a54-7347-4b75-96ba-73401d1c1386","resolution":{"observed_at":"2026-08-12T12:58:57.191259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.167355Z","title":"Klingai, 2024","venue":null,"work_id":"71cdaed3-fc7b-4bd7-98b3-692fa628321c","year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.195142Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:3dae7f81a2e23cb874081e1ba11967e75078206f27152fbd731c94ef07253344","observation_id":"89143203-6888-476f-b378-3a6c0eaa9a69","resolution":{"observed_at":"2026-08-12T12:58:58.171563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-12T12:58:57.198691Z","title":"Videopoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.198691Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:cf6373a46ac5e03eeb69bd2fb343a422923d39eeb28cfae99840c21b095d5e2e","observation_id":"e703bb33-e5cd-493a-b05e-823776b64579","resolution":{"observed_at":"2026-08-12T12:58:57.198691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.155022Z","title":"On the scalability of diffusion-based text-to-image generation","venue":null,"work_id":"4535bb6c-47aa-4fad-9c62-197ff6315a3a","year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.202621Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:c930d5bb6699577d175b901549ad9a4a87025698f83673c40218edf9cfab32b8","observation_id":"290835e3-5c72-4468-a4f5-ed8240a28293","resolution":{"observed_at":"2026-08-12T12:58:58.159348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:57.206368Z","title":"Scaling laws for diffusion transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.206368Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:3ff87740621e3d6f1887d20be33637bb7c001329248af20eb69f85ea99ecc212","observation_id":"8487dc0d-9166-45f7-a414-4bf0d7732189","resolution":{"observed_at":"2026-08-12T12:58:57.206368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20280","last_updated":"2024-10-26T21:12:32Z","snapshot_observed_at":"2026-08-12T22:14:33.415253Z","submitted_at":"2024-10-26T21:12:32Z","title":"MarDini: Masked Autoregressive Diffusion for Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20280","snapshot_observed_at":"2026-08-12T12:58:57.210336Z","title":"Mardini: Masked autoregres- sive diffusion for video generation at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.210336Z"},"links":{"cited_paper":"/paper/2410.20280","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:9ddbbdf23098a88b93efa5b8a8b9541110a6e8c865a12475745e0caa09bb366d","observation_id":"5f009bd5-a877-460a-884d-dbbf479fee0f","resolution":{"observed_at":"2026-08-12T12:58:57.210336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-12T12:58:57.214702Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.214702Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:6da25ebf0cabcd3d009cea96adba916a3879b06b4e08b77e92e5ebfd782d8389","observation_id":"98c15704-7791-411b-ab39-520ae39c2635","resolution":{"observed_at":"2026-08-12T12:58:57.214702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08740","last_updated":"2024-09-23T15:59:41Z","snapshot_observed_at":"2026-08-13T04:41:48.311151Z","submitted_at":"2024-01-16T18:55:25Z","title":"SiT: Exploring Flow and Diffusion-based Generative Models with Scalable Interpolant Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08740","snapshot_observed_at":"2026-08-12T12:58:57.218694Z","title":"Sit: Explor- ing flow and diffusion-based generative models with scalable interpolant transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.218694Z"},"links":{"cited_paper":"/paper/2401.08740","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:6279923d771c048ac2b379dc4d9838d1a080c8b9b6b39579548c47c23995a823","observation_id":"fe7e8a26-a7e7-4441-b964-838b303adaf5","resolution":{"observed_at":"2026-08-12T12:58:57.218694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-12T12:58:57.222584Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.222584Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:3077725c417196faaca92a664e10a3df1a02187dab31271b46b8a5673f611ecd","observation_id":"e2e0e4c3-8574-464b-b192-af4da32c6d1a","resolution":{"observed_at":"2026-08-12T12:58:57.222584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-12T12:58:57.226574Z","title":"An empirical model of large-batch training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.226574Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:34103af22d3b03d1a79a4bb0ce9984e02603ef6d8e917b465dff324cddb0624b","observation_id":"427014aa-0976-4f90-9497-e97d0f9c1a8a","resolution":{"observed_at":"2026-08-12T12:58:57.226574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01367","last_updated":"2024-12-10T15:10:41Z","snapshot_observed_at":"2026-08-13T00:39:54.451073Z","submitted_at":"2024-04-01T17:59:48Z","title":"Bigger is not Always Better: Scaling Properties of Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01367","snapshot_observed_at":"2026-08-12T12:58:57.230612Z","title":"Bigger is not always better: Scaling properties of latent diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.230612Z"},"links":{"cited_paper":"/paper/2404.01367","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:748f15bfaa9efc5fb913145f6144a42e2441ce66e16e67bf9cb604f0695a96fc","observation_id":"6a5edc9d-e900-49f9-b244-471ee9fdbdb8","resolution":{"observed_at":"2026-08-12T12:58:57.230612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.142680Z","title":"Sora, 2024","venue":null,"work_id":"afdb4a6d-25bb-494b-850d-b77831b13f10","year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.234566Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:eea8718588b978d357c1bed666cfb361983952546301c5490a305950adba9cf1","observation_id":"21b465df-66bc-4b3f-bef9-0cd4dae2f1e8","resolution":{"observed_at":"2026-08-12T12:58:58.146475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:57.241828Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.241828Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:ac9de0f986e631f1c50bff4413cca3806fb1eefda40cdb015b5812b09c796cb2","observation_id":"d17b79ed-2c06-4b43-8b34-a9140e7474e3","resolution":{"observed_at":"2026-08-12T12:58:57.241828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-12T12:58:57.245236Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.245236Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:2f7b4009b23ad1e7a789b84aec57edfb11e0d61d2f2f06b68c5e59866155ffaf","observation_id":"1bb1d455-877d-4e43-aee1-aec96878df42","resolution":{"observed_at":"2026-08-12T12:58:57.245236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.122481Z","title":"Tempo- ral generative adversarial nets with singular value clipping","venue":null,"work_id":"ff63b490-04bd-44c5-8458-d6d8c0c488cd","year":2017},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.249522Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:db03545290b3d9c3bd94e21dadefb7b2181ae360128365636f5d03735aa1e705","observation_id":"43828e3a-0e2e-47ae-a80a-29bdf1ab1509","resolution":{"observed_at":"2026-08-12T12:58:58.126785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12015","last_updated":"2024-03-18T17:51:43Z","snapshot_observed_at":"2026-08-13T00:51:01.462454Z","submitted_at":"2024-03-18T17:51:43Z","title":"Fast High-Resolution Image Synthesis with Latent Adversarial Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12015","snapshot_observed_at":"2026-08-12T12:58:57.253471Z","title":"Fast high- resolution image synthesis with latent adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.253471Z"},"links":{"cited_paper":"/paper/2403.12015","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:83aa407c9fe611d8975204f8b2f80b0abc9444dd95959456a810b6df85a7ba28","observation_id":"8dae8a06-b1a9-44d4-b608-45a4c9204f79","resolution":{"observed_at":"2026-08-12T12:58:57.253471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.111012Z","title":"Measuring the effects of data parallelism on neural network training","venue":null,"work_id":"34aa7f8d-a031-478c-b234-2c907170c2a7","year":2019},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.257816Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:c822b8dd94b743cbcf63e63d2be6ac01c84c73e63071025502f00cb24c28bd60","observation_id":"d2dfee5a-d7fc-4ba3-8374-c14028255dba","resolution":{"observed_at":"2026-08-12T12:58:58.114943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13359","last_updated":"2024-09-11T20:48:05Z","snapshot_observed_at":"2026-08-12T22:58:23.921346Z","submitted_at":"2024-08-23T20:22:20Z","title":"Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13359","snapshot_observed_at":"2026-08-12T12:58:57.261939Z","title":"Power scheduler: A batch size and token number agnostic learning rate sched- uler","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.261939Z"},"links":{"cited_paper":"/paper/2408.13359","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:d64707fb29c668d864f77a0466ba296067a115f498b8c29db8e71a336052f45c","observation_id":"fe91a8cf-b0f1-47ee-b514-f21d73011611","resolution":{"observed_at":"2026-08-12T12:58:57.261939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-12T12:58:57.265902Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.265902Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:e255c0a62b06503288e51a431e546b11f8ebb96389ca5f651a36ac28d54aecc3","observation_id":"b03d27a5-8d73-4733-b022-ab8807ce6ae3","resolution":{"observed_at":"2026-08-12T12:58:57.265902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00489","last_updated":"2018-02-24T00:16:12Z","snapshot_observed_at":"2026-08-10T10:50:51.995764Z","submitted_at":"2017-11-01T18:04:31Z","title":"Don't Decay the Learning Rate, Increase the Batch Size","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00489","snapshot_observed_at":"2026-08-12T12:58:57.270766Z","title":"Don’t decay the learning rate, increase the batch size","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.270766Z"},"links":{"cited_paper":"/paper/1711.00489","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:08b8ef7dd05de722a1d2d71f8576516e99d089e3a1f8c0164832591b0c678aa2","observation_id":"3e98d66c-2eef-48e9-a91d-d09074420dd7","resolution":{"observed_at":"2026-08-12T12:58:57.270766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-12T12:58:57.275848Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.275848Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:ee3c1d3bb495e08108315264321f57f6a81565a52c2c4ff0e1b5bb7bacc51d12","observation_id":"f51b78f6-d8af-438b-afaa-050ceb8d494f","resolution":{"observed_at":"2026-08-12T12:58:57.275848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16260","last_updated":"2024-06-24T01:56:12Z","snapshot_observed_at":"2026-08-12T23:36:32.566132Z","submitted_at":"2024-06-24T01:56:12Z","title":"Video-Infinity: Distributed Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16260","snapshot_observed_at":"2026-08-12T12:58:57.281092Z","title":"Video-infinity: Distributed long video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.281092Z"},"links":{"cited_paper":"/paper/2406.16260","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:18cc8c195c984a7254abe2759becf6738080bb546a3034c24af564dd237af58c","observation_id":"681fb9ba-e4f2-4b34-8b25-418904736e6a","resolution":{"observed_at":"2026-08-12T12:58:57.281092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:57.286579Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.286579Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:32e2adf0f84439730bef086c47ac974d99089d02990b06e3c7b7c3be4d692289","observation_id":"55ce4d28-063a-442a-b43a-e8bf89e8976e","resolution":{"observed_at":"2026-08-12T12:58:57.286579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.091824Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"b5d66bad-b3d4-4b9a-876c-5c6378372ceb","year":2022},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.290684Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:dd85235e45fcbc7245cb9c68724c2b7f0e1f3ea9ecee09db782a43b87975bf29","observation_id":"94561091-ef8d-4d61-aba3-5d5ec211b40f","resolution":{"observed_at":"2026-08-12T12:58:58.096353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.079571Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"748a95b5-57f3-4eb7-a642-baaf2d93923a","year":2016},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.294695Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:b1ea10f8f9de78881e76dd82cc7312b5174867b4089fc3ef8ccafc654673e88c","observation_id":"d62a95e3-e629-4f28-8429-ffcb2c61a67c","resolution":{"observed_at":"2026-08-12T12:58:58.083579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-12T16:58:15.342128Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-12T12:58:57.299416Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.299416Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:bc085fcc733cb7455642c3c2537ea8626c6a2bdc073fcd96dd3235e54adbbe30","observation_id":"0f79c6ea-effe-4c7b-9f36-98830d650975","resolution":{"observed_at":"2026-08-12T12:58:57.299416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.065729Z","title":"Adapting to smoothness: A more universal algorithm for on- line convex optimization","venue":null,"work_id":"6be82d4b-7b7b-4393-8390-b4cdf33a7850","year":2020},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.303450Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:0490cc495b42d9e6997a051ce0f30a829759095c5bf15d0be70e13b95f637e7e","observation_id":"4eeb25bb-cdaf-4e4d-9070-769665fcd4cf","resolution":{"observed_at":"2026-08-12T12:58:58.070711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-12T12:58:57.307392Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.307392Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:5975d7b3333418e61c6f0e541c5a09849d40f8e108e8143f1022aff9a0d74069","observation_id":"a63ae0b9-8093-4009-b810-b9cf60a0ed87","resolution":{"observed_at":"2026-08-12T12:58:57.307392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-12T12:58:57.312178Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.312178Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:939d075f4008df448117df7c12fc2d7144584505127dc26ad560baf77b9049a6","observation_id":"ada8b994-365b-48ae-b22e-69089c4a60e2","resolution":{"observed_at":"2026-08-12T12:58:57.312178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-12T17:49:31.221284Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-12T12:58:57.316711Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.316711Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:0a120f81e56b7c1ab59d4476966a202709753002e661d32fcb1b0b4940592047","observation_id":"a3381a06-ed1b-4b35-9dc9-e8900b1ff2a3","resolution":{"observed_at":"2026-08-12T12:58:57.316711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.051407Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"0468ccd8-ed25-4160-83d1-cfef31bd01e2","year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.322749Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:3e2b442bd06d9c83bcf0e34b9390ccaf651cff6528e31df9d8fa8c333b1e5ac0","observation_id":"efdaa03c-4afe-486d-b26e-1de95e965cc3","resolution":{"observed_at":"2026-08-12T12:58:58.055536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.038994Z","title":"Space-time diffusion features for zero-shot text-driven motion transfer","venue":null,"work_id":"1ec75ba3-b8db-4cc8-9aa4-665ade9b347f","year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.328218Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:09585f2410e298346723006ccc9a372eb524ce84f606fed39b9cd37a51403a4b","observation_id":"e0f695d4-8db7-4e38-90d8-76b3c2e43858","resolution":{"observed_at":"2026-08-12T12:58:58.043210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12346","last_updated":"2023-03-22T07:10:09Z","snapshot_observed_at":"2026-08-11T12:02:39.988539Z","submitted_at":"2023-03-22T07:10:09Z","title":"NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12346","snapshot_observed_at":"2026-08-12T12:58:57.332537Z","title":"Nuwa-xl: Diffusion over diffusion for extremely long video generation.arXiv preprint arXiv:2303.12346, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.332537Z"},"links":{"cited_paper":"/paper/2303.12346","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:b5196aee5feec2676f045af336bc51e31094fa1378761b6052f4500b38a12433","observation_id":"ac178b8d-662a-4fbb-a554-74a39c0478d9","resolution":{"observed_at":"2026-08-12T12:58:57.332537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10571","last_updated":"2022-02-21T23:24:01Z","snapshot_observed_at":"2026-08-08T04:57:58.303438Z","submitted_at":"2022-02-21T23:24:01Z","title":"Generating Videos with Dynamics-aware Implicit Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10571","snapshot_observed_at":"2026-08-12T12:58:57.337071Z","title":"Generating videos with dynamics-aware implicit generative adversarial net- works","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.337071Z"},"links":{"cited_paper":"/paper/2202.10571","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:24170479f6b4261b0af747c77332516a3538f7ab04c2cb1a059b64479c885f1f","observation_id":"16c40c50-f5a8-44e9-8276-668a4013d80a","resolution":{"observed_at":"2026-08-12T12:58:57.337071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21705","last_updated":"2025-03-14T03:03:31Z","snapshot_observed_at":"2026-08-12T23:10:54.142809Z","submitted_at":"2024-07-31T15:53:20Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21705","snapshot_observed_at":"2026-08-12T12:58:57.341054Z","title":"Tora: Trajectory-oriented diffu- sion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.341054Z"},"links":{"cited_paper":"/paper/2407.21705","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:0f8e2c9cc85e5d7c60eac9f043062049e825626ec7e23c44ad78d1aac3e85b7d","observation_id":"2b883efa-dfc3-4297-a227-f26424a6a543","resolution":{"observed_at":"2026-08-12T12:58:57.341054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:57.345097Z","title":"Moviedreamer: Hier- archical generation for coherent long visual sequence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.345097Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:6d02ff78a8209f721e6374aa1e6383665b5d5f0901a4d4fd8898cf407c4044cc","observation_id":"911ded9e-c48a-461a-9aed-eb8f0a5676cd","resolution":{"observed_at":"2026-08-12T12:58:57.345097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:58:58.024411Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"19d638e4-f9f8-4a48-950d-9d6370153970","year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.349217Z"},"links":{"citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:ded6bb44bdf8d9319b729a4d293b0e2d20f1ccd52c6f9177d0b1f3f2d653c869","observation_id":"c661acd3-f623-4a74-8240-08e034d3f65b","resolution":{"observed_at":"2026-08-12T12:58:58.030147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01434","last_updated":"2024-05-02T16:25:16Z","snapshot_observed_at":"2026-08-13T00:16:06.087070Z","submitted_at":"2024-05-02T16:25:16Z","title":"StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01434","snapshot_observed_at":"2026-08-12T12:58:57.353357Z","title":"Storydiffusion: Consistent self- attention for long-range image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.353357Z"},"links":{"cited_paper":"/paper/2405.01434","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:3539786a30470d7c4edfcf1978dcfb815b9d9a6b315ed8c230cea237080b504c","observation_id":"a764416c-a39e-4bc0-b39f-f87f97179d32","resolution":{"observed_at":"2026-08-12T12:58:57.353357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2411.17470."}