{"as_of":"2026-08-08T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13a1af4983143b2e0354e5440ef545e0fd14b04abc822756f80beb4490b6d786","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:24:46.123867Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18789/citation-record","integrity":"/paper/2607.18789/integrity","json":"/paper/2607.18789/citation-record.json","paper":"/paper/2607.18789"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.09047","last_updated":"2024-01-17T08:30:32Z","snapshot_observed_at":"2026-08-04T07:40:19.403363Z","submitted_at":"2024-01-17T08:30:32Z","title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09047","snapshot_observed_at":"2026-08-01T14:24:46.067822Z","title":"VideoCrafter2: Overcoming data limitations for high-quality video diffusion models.arXiv preprint arXiv:2401.09047, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.067822Z"},"links":{"cited_paper":"/paper/2401.09047","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:121fe7bb9bc10bcff6e8e9068ef29c26267cdfe6384ceab333deca7ffb92ad68","observation_id":"693973c7-37fe-447c-abe1-2a7cd9eabb6e","resolution":{"observed_at":"2026-08-01T14:24:46.067822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-01T14:24:46.074247Z","title":"The Pile: An 800GB dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.074247Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:c55d2b05827a46b1e3e6b70f2ffd1406587d3be7d6f7d0944b7eac44fe818e88","observation_id":"0d35a70b-b969-4c19-8217-0940589ede0c","resolution":{"observed_at":"2026-08-01T14:24:46.074247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-01T14:24:46.080717Z","title":"Imagen video: High definition video generation with diffusion models.arXiv preprint arXiv:2210.02303,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.080717Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:249bce17e7f7d5b84878f40edf1e66fc50cfe5f6dbc07dc50b7da72295112d1f","observation_id":"8a13afa6-1a26-45c5-acc6-b8c4bcb271d9","resolution":{"observed_at":"2026-08-01T14:24:46.080717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-01T14:24:46.092789Z","title":"Xin Ma, Yaohui Wang, Gengyun Jia, Xinyuan Chen, Ziwei Liu, Yuan-Fang Li, Cunjian Chen, and Yu Qiao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.092789Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:7ca36f627a1c153f18d353360949f78ae8fa361bad62ea841959316e3c8f35fe","observation_id":"413adb3b-7dc5-4ed3-b8d5-8b34deb0ba8c","resolution":{"observed_at":"2026-08-01T14:24:46.092789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-08-08T06:18:27.640980Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16264","snapshot_observed_at":"2026-08-01T14:24:46.095609Z","title":"Niklas Muennighoff, Alexander M Rush, Boaz Barak, Teven Le Scao, Aleksandra Piktus, Nouamane Tazi, Sampo Pyysalo, Thomas Wolf, and Colin Raffel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.095609Z"},"links":{"cited_paper":"/paper/2305.16264","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:2bfc74440a7d0c0ecf6a88acf1a19a99a68736142fda118e30e2a523a7bd11a3","observation_id":"c9b6c558-2227-4405-a9c4-9c87dd2f600e","resolution":{"observed_at":"2026-08-01T14:24:46.095609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-01T14:24:46.098413Z","title":"Movie Gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.098413Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:de4b632ac22267681ecd3fa6fd81cffc9afcdc6b2fbbf22f2692931538daddd4","observation_id":"58b82d0c-4db1-4c0e-a33d-613e99a7c9d2","resolution":{"observed_at":"2026-08-01T14:24:46.098413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:24:46.101322Z","title":"The layout bet, June 2026.https://reve.com","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.101322Z"},"links":{"citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:352ba4937f6142ff5b1b9406fec039baea3823e26184d52870aabf9ba70fd073","observation_id":"ae690f68-872e-40e2-b250-fb8819585b03","resolution":{"observed_at":"2026-08-01T14:24:46.101322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-01T14:24:46.104418Z","title":"Make-A-Video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.104418Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:00de47ff94a7fe493a5b70c056ee6ab11407f0d50b02440503de7bdbfde398db","observation_id":"dc336a12-9133-4c2f-ac8d-cf08f5064aef","resolution":{"observed_at":"2026-08-01T14:24:46.104418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-01T14:24:46.107195Z","title":"Kimi-VL technical report.arXiv preprint arXiv:2504.07491,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.107195Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:8ded24a321ad2c97fd0b2de7a4e623c41114c360617b3b3389174dfb3037ac69","observation_id":"2d70f25d-88dd-472f-a9bd-ff865892816d","resolution":{"observed_at":"2026-08-01T14:24:46.107195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-01T14:24:46.109969Z","title":"InternVid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.109969Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:3f145074d4c0409fbde628059b27a05de6333cec51a49557fd2977917b4356f1","observation_id":"2c439224-b816-4c81-a181-933ffe2909de","resolution":{"observed_at":"2026-08-01T14:24:46.109969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T14:24:46.112606Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.112606Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:4a92986d9b5cf69642714039bc9fc6bd647d71dc04b72d16c1d6701a5ed86eae","observation_id":"74041b2e-5c19-4a61-af00-d706787a76e5","resolution":{"observed_at":"2026-08-01T14:24:46.112606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-01T14:24:46.115337Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.115337Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:dc029d0849e8df4514f081d4c5e5ab5a0fea64d5b90fc79646805365b0e138b2","observation_id":"769ef145-26bf-4f10-98fb-44334ddf91d5","resolution":{"observed_at":"2026-08-01T14:24:46.115337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-01T14:24:46.118299Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance.arXiv preprint arXiv:2403.16952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.118299Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:e6439cfc8811e160ea1da36a703c3c5471d53896f19407e3239a1b2fe197e417","observation_id":"22de8f3c-08d4-4808-a226-b81939f715aa","resolution":{"observed_at":"2026-08-01T14:24:46.118299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-01T14:24:46.121154Z","title":"Open-Sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.121154Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:c8342cde323bf5639a0c968f98834d5bcbc34f83e053eb6546832e15671664ce","observation_id":"b3bf8dc0-9717-4763-8671-a51cf65f0121","resolution":{"observed_at":"2026-08-01T14:24:46.121154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:24:46.123867Z","title":"4 lists all attributes used in the Moving Alphabet dataset and their possible values","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.123867Z"},"links":{"citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:300f4198d3d7d746ab818724281cccfb5f26d406172bc11454b327564d248952","observation_id":"3d381a34-1eec-44a7-ba60-4cb63def9d77","resolution":{"observed_at":"2026-08-01T14:24:46.123867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-01T14:24:46.086843Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.086843Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:aa923db7a81877b22a3f214ce136b6607b8c9e97c38368744c1264b3ab0a6e50","observation_id":"b2c9eb7a-83df-48e9-b52f-0adfc932bb45","resolution":{"observed_at":"2026-08-01T14:24:46.086843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-01T14:24:46.089947Z","title":"HunyuanVideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.089947Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:08b086eb26cf39b33f58c50498d081c8c9a00bfc89e41216bf7cd469d67a0b83","observation_id":"b6b3cb75-426b-4279-ab51-ca0b52e2215d","resolution":{"observed_at":"2026-08-01T14:24:46.089947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-01T14:24:46.077417Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.077417Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:6a0e9e554c38e4649d95de755274ec2a45bc58030feb08be3c7b9dac3c6a4e2d","observation_id":"ccea6b25-c376-4495-8069-b4f379bc0dea","resolution":{"observed_at":"2026-08-01T14:24:46.077417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-01T14:24:46.083996Z","title":"T2I-CompBench: A comprehensive benchmark for open-world compositional text-to-image generation.arXiv preprint arXiv:2307.06350,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.083996Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:fdf2e5b35c0de3cf78af1df818b833bc12a0901adf647a04ee4f14444497e381","observation_id":"73280caa-25ab-44dd-b35d-df6f459a6509","resolution":{"observed_at":"2026-08-01T14:24:46.083996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-01T14:24:46.064539Z","title":"Andreas Blattmann, Tim Dockhorn, Sumith Kulal, Daniel Mendelevitch, Maciej Kilian, Dominik Lorber, Yam Levi, Zion English, Vikram Voleti, Adam Letts, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.064539Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:004348a25a883421fa99f8dc0bdd722c3164e78751bc724cafd4514389ad321e","observation_id":"fecae1f6-d53c-4734-abb8-b07da78f8706","resolution":{"observed_at":"2026-08-01T14:24:46.064539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-01T14:24:46.060545Z","title":"Lumiere: A space-time diffusion model for video generation.arXiv preprint arXiv:2401.12945,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.060545Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:1cd29491e1ed9ca9031d140219c0d460b7102fa323423b0a2bf047bb6c383a61","observation_id":"1607a6e6-7344-473d-bc6e-1917f964994a","resolution":{"observed_at":"2026-08-01T14:24:46.060545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-04T10:35:00.917001Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-01T14:24:46.071187Z","title":"TinyStories: How small can language models be and still speak coherent English?arXiv preprint arXiv:2305.07759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.071187Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:e338d9f5c582a056fecce86407a579effcb5800a5869f013a073e5a17551dab4","observation_id":"f06cfb1f-d129-48dc-bc79-00a4a6f15663","resolution":{"observed_at":"2026-08-01T14:24:46.071187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:15:01.129521Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2607.18789."}