{"as_of":"2026-08-10T19:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cabe51bcc6ee638a50d11629fe4c98a5ee70e727bd66edcf5691e5114a3a3040","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T14:16:18.521699Z","state":"measured"},{"denominator":188,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":188,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":258,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:29:48.133509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:cf4ea797ea5fca088a3ca5b8352941c4325ca0ea9bae2520dbf5570fb0d2229e","observation_id":"c9813c43-2e1e-4bac-b39d-cbe66d9ae298","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T02:48:44.900467Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2411.04996"},"observation_digest":"sha256:12e94cedb4c5706b5b56fc159ffd88c59049c51780a7bee02b8fc040ae094133","observation_id":"709b48a6-1d7b-44ba-a935-5fc38c489046","resolution":{"observed_at":"2026-05-18T02:48:45.117826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2411.13549","last_updated":"2026-05-06T19:17:31Z","snapshot_observed_at":"2026-08-06T10:11:40.211121Z","submitted_at":"2024-11-20T18:58:31Z","title":"KFC-W: Generating 3D-Consistent Videos from Unposed Internet Photos","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-23T16:47:09.717923Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2411.13549"},"observation_digest":"sha256:57fbc1ab4f4f239f50ee83094f946e9de2a10043585020bd0911114eb2583239","observation_id":"aa6ea669-b771-475c-823c-6bf85f8b8403","resolution":{"observed_at":"2026-05-23T16:48:12.425124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-09T23:28:59.299375Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:614f8c50cc84a9d6471bdc962a0dab32a00efeb4fad63edd82b2542f9a23443a","observation_id":"87101d13-8322-4bb1-9546-2c05cb45c359","resolution":{"observed_at":"2026-05-23T08:42:45.177050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:91a80164e6de306aa0f0219a8e46f16f00b512e2618a2bd6fd941aad2fd2d794","observation_id":"92fe95a1-d7dd-4183-b56e-83c7f1a21dff","resolution":{"observed_at":"2026-05-23T07:42:43.402396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-12T10:28:14.014706Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.06264"},"observation_digest":"sha256:a297c4e6f6c6b9359456acdb01114791aa7833367e27b3615b5ee7cf1bfd4590","observation_id":"e07d4a21-f378-42de-ae5a-1257db2e842c","resolution":{"observed_at":"2026-05-12T10:28:14.134797Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2412.15689","last_updated":"2026-05-06T21:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-20T09:07:36Z","title":"DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T06:57:50.897865Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.15689"},"observation_digest":"sha256:68ec29a974890f3d516eebd6820b91211303f5b8768604853741fd13e9685b0e","observation_id":"e1fa6baa-56ca-4eb8-9cf2-b71fa160e747","resolution":{"observed_at":"2026-05-23T07:02:41.967947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T10:36:12.058970Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.00103"},"observation_digest":"sha256:adda972adee9c4ce5dace7b68e88dcd702d796724d2b3bd1f98c6062c9f7e6d8","observation_id":"826e3003-77b5-4b7d-8f3c-146c73461f66","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:ac9dd3529c7d772f4af8b1c0be9e28d177b1172e3bf45ac46ae17c3f39b9d042","observation_id":"27991783-7e99-4e63-845a-5a77c901b66c","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T11:45:17.473970Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.09732"},"observation_digest":"sha256:07aaa6a70d36f21c72cb2becb4abc358a7601180d77e9ddde870252fdbde523e","observation_id":"4f8e4f5b-41ad-478f-98ff-91296eddb570","resolution":{"observed_at":"2026-05-20T11:45:17.654401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-10T18:29:48.133509Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11311","last_updated":"2025-08-13T01:53:03Z","snapshot_observed_at":"2026-08-10T18:22:45.472222Z","submitted_at":"2025-01-20T07:28:41Z","title":"A2SB: Audio-to-Audio Schrodinger Bridges","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T18:29:48.133509Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.11311"},"observation_digest":"sha256:7e444cd89b5d1e556eff93cdcb967f0c562cca5756833dbb5e1c4371dcac7b6b","observation_id":"a6ce2b44-9dae-4817-b777-321c08de7ded","resolution":{"observed_at":"2026-08-10T18:29:48.133509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T15:30:02.578430Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.13918"},"observation_digest":"sha256:88dc3ea9028b8a889bbb29c54116f207f326ff2feaa84ae9767ca5fb0cb8b157","observation_id":"095024fa-01b2-423f-8d21-7c87e87a35f7","resolution":{"observed_at":"2026-05-13T15:30:02.772291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-10T00:46:08.177469Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18096","last_updated":"2025-01-30T02:16:35Z","snapshot_observed_at":"2026-08-10T00:38:15.725615Z","submitted_at":"2025-01-30T02:16:35Z","title":"LLMs can see and hear without any training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T00:46:08.177469Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.18096"},"observation_digest":"sha256:4e4ec8442274fd075005449002c6cf80e943109bda31e952b447797f16621c4c","observation_id":"c4876983-387a-4576-a046-bea434a1ba8d","resolution":{"observed_at":"2026-08-10T00:46:08.177469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-09T22:56:36.153918Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18593","last_updated":"2025-01-30T18:59:37Z","snapshot_observed_at":"2026-08-10T02:35:35.003821Z","submitted_at":"2025-01-30T18:59:37Z","title":"Diffusion Autoencoders are Scalable Image Tokenizers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T22:56:36.153918Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2501.18593"},"observation_digest":"sha256:de947abbcdcf08daea0313c75c10dad70d4294adb8ee8a9406b5dd6aebd1e90f","observation_id":"6de2d389-5659-4dca-a761-eb794a9eaf20","resolution":{"observed_at":"2026-08-09T22:56:36.153918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-09T18:51:12.602618Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00500","last_updated":"2025-02-04T15:19:12Z","snapshot_observed_at":"2026-08-10T02:49:33.781140Z","submitted_at":"2025-02-01T17:40:11Z","title":"Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T18:51:12.602618Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.00500"},"observation_digest":"sha256:c302381cf9f36f026f07908347807b2950fc5446468ccc5b175e531173742f12","observation_id":"0950bc12-d5bc-4a4f-978d-90274c9b11bc","resolution":{"observed_at":"2026-08-09T18:51:12.602618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-09T16:47:13.008763Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-10T13:26:51.589421Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T16:47:13.008763Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.01061"},"observation_digest":"sha256:1bb53fde419b33cb3a2c865aa06cbb693d3e4fa2281d66d6d6103efce398f883","observation_id":"86449761-abe7-4943-b48c-a2a395cd0e7c","resolution":{"observed_at":"2026-08-09T16:47:13.008763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T22:56:55.208472Z","title":"Movie Gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04299","last_updated":"2025-02-06T18:41:04Z","snapshot_observed_at":"2026-08-09T13:27:12.605217Z","submitted_at":"2025-02-06T18:41:04Z","title":"MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T22:56:55.208472Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.04299"},"observation_digest":"sha256:e401f18de958f439af780ad94aaf753d1bbf5cf03230888b55f06b756eaeb1c1","observation_id":"c00aae12-9b48-4c8a-aae7-4be53d98b9a6","resolution":{"observed_at":"2026-08-08T22:56:55.208472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T22:37:42.108044Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04507","last_updated":"2025-06-04T23:21:39Z","snapshot_observed_at":"2026-08-08T22:25:30.997284Z","submitted_at":"2025-02-06T21:17:09Z","title":"Fast Video Generation with Sliding Tile Attention","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:37:42.108044Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.04507"},"observation_digest":"sha256:888b61470cdb8d0a286e45148cf484423e0e2727c2dfabed3c1c1c909369eb61","observation_id":"dcee6775-7798-4992-915b-6afec6cc2381","resolution":{"observed_at":"2026-08-08T22:37:42.108044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T21:07:32.379704Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-10T10:23:34.227473Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.379704Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:c1a553dba1dbdca7cb452c1f07819d0313b01cb8dee1611e3f2fa3939bc776cf","observation_id":"3f5005d0-01bc-49b2-b5a9-bbff2e9cf3bf","resolution":{"observed_at":"2026-08-08T21:07:32.379704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T20:12:29.536356Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05130","last_updated":"2025-07-29T07:31:59Z","snapshot_observed_at":"2026-08-09T05:08:43.033940Z","submitted_at":"2025-02-07T18:02:47Z","title":"Latent Swap Joint Diffusion for 2D Long-Form Latent Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T20:12:29.536356Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.05130"},"observation_digest":"sha256:09810f685fca16ee8d286c93593fb292f4e23e0c8eae4c58a299d34cdf4dc3a5","observation_id":"e7ecb01a-2f82-4394-9737-e2f9f20c090c","resolution":{"observed_at":"2026-08-08T20:12:29.536356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T17:13:02.804779Z","title":"arXiv preprint arXiv:2410.13720 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05979","last_updated":"2025-04-01T07:54:57Z","snapshot_observed_at":"2026-08-09T01:59:21.861980Z","submitted_at":"2025-02-09T18:12:25Z","title":"VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:13:02.804779Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.05979"},"observation_digest":"sha256:ba38d77997b42daebf1f7f0339e7b9bf265ae0dc50e066b884ea03c95453f309","observation_id":"61a28cc3-124b-4600-be0c-295385ca37f0","resolution":{"observed_at":"2026-08-08T17:13:02.804779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T14:26:46.802121Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06782","last_updated":"2025-02-12T10:07:07Z","snapshot_observed_at":"2026-08-08T14:18:27.556352Z","submitted_at":"2025-02-10T18:58:11Z","title":"Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T14:26:46.802121Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.06782"},"observation_digest":"sha256:0befac7070adddd39c573d92ed339fb82c97b255ea08d0c73fde0945c265f2f7","observation_id":"40317859-3c3c-4ec6-b491-d7a849bf6dbc","resolution":{"observed_at":"2026-08-08T14:26:46.802121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T13:15:15.235839Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07303","last_updated":"2025-09-04T18:36:05Z","snapshot_observed_at":"2026-08-09T23:34:56.353795Z","submitted_at":"2025-02-11T07:01:19Z","title":"Flow Matching for Collaborative Filtering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T13:15:15.235839Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.07303"},"observation_digest":"sha256:1d564755a99216d01d61f3f835a60b1cd0d8f63c8ac9800f0b581188bc09528c","observation_id":"d7afcf0f-186b-41af-af0a-f56541d67858","resolution":{"observed_at":"2026-08-08T13:15:15.235839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T12:19:43.212984Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07578","last_updated":"2025-05-03T04:07:07Z","snapshot_observed_at":"2026-08-09T23:46:38.556049Z","submitted_at":"2025-02-11T14:25:20Z","title":"PIM Is All You Need: A CXL-Enabled GPU-Free System for Large Language Model Inference","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T12:19:43.212984Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.07578"},"observation_digest":"sha256:9fc4e9dafd4f3eb2add0707b3da780a2f345dfd8466d498fe9e3018233453208","observation_id":"b30cd212-45ff-4832-aeff-ec2c75b2361f","resolution":{"observed_at":"2026-08-08T12:19:43.212984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-09T11:21:20.559714Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07802","last_updated":"2025-02-04T22:03:26Z","snapshot_observed_at":"2026-08-09T14:38:43.851921Z","submitted_at":"2025-02-04T22:03:26Z","title":"Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T11:21:20.559714Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.07802"},"observation_digest":"sha256:de43a94d78f84c8df9b2a5292d1fcd311556a4547f163ab9629723b73b477ecd","observation_id":"d0c61e21-094b-4a5f-a7ea-462699649d33","resolution":{"observed_at":"2026-08-09T11:21:20.559714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T15:14:22.347722Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07825","last_updated":"2025-02-10T14:49:09Z","snapshot_observed_at":"2026-08-09T01:46:25.522034Z","submitted_at":"2025-02-10T14:49:09Z","title":"Pre-Trained Video Generative Models as World Simulators","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T15:14:22.347722Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.07825"},"observation_digest":"sha256:7fed853e7eefb223cfcd3de8008446233dfc8041ee72c86334b3d304b442977a","observation_id":"9856ffde-2b26-4825-8889-93ed73b16072","resolution":{"observed_at":"2026-08-08T15:14:22.347722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-08T05:55:09.529053Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08244","last_updated":"2025-03-25T00:18:07Z","snapshot_observed_at":"2026-08-09T00:50:37.157498Z","submitted_at":"2025-02-12T09:38:41Z","title":"FloVD: Optical Flow Meets Video Diffusion Model for Enhanced Camera-Controlled Video Synthesis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:55:09.529053Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.08244"},"observation_digest":"sha256:03ec619604ab49ef65cb9e868faf88968f6e7d7f89c94f86a0bcce0fd89bf625","observation_id":"2bae2d54-4924-47d2-b9dc-e509da7c40d9","resolution":{"observed_at":"2026-08-08T05:55:09.529053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:3a9dd68908f49a500b118d8e976486ca43d12e82efdf0309b42859b095f93c2b","observation_id":"61cba769-5fc5-465b-898d-433d921fd919","resolution":{"observed_at":"2026-05-19T08:02:23.924392Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2503.13821","last_updated":"2026-04-03T20:02:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T01:57:48Z","title":"Stitch-a-Demo: Video Demonstrations from Multistep Descriptions","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T00:30:55.729900Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2503.13821"},"observation_digest":"sha256:b23bc4454bb8553d63360caafb438d5a2ee89ca6092cfc1c03ad81d4ef55cbd3","observation_id":"15d0c5c0-dad7-4a5f-b62d-15b00b28d72e","resolution":{"observed_at":"2026-05-23T00:32:18.245053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:65cdc617be9e33e1d841eca28a47b58dce5f4786cd06ca554b97b431c960edb3","observation_id":"62412fd0-b0cf-4025-8f59-2e028fd65dbd","resolution":{"observed_at":"2026-05-22T23:07:14.423703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-10T02:47:20.223653Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T18:42:02.940250Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2503.21755"},"observation_digest":"sha256:2b5797710660e4bdc3b324ddff0a2b0b29c15513ab32a42f3a80c5e8cf491c9d","observation_id":"ccc8dbbc-c5fa-4857-9c86-a53272c1d1af","resolution":{"observed_at":"2026-05-14T18:42:03.055974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T22:49:23.074271Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2504.06256"},"observation_digest":"sha256:8f64ac373d882d670b392b2ff6ae7eba770f1a4f20ac17a185f7983ecc91eae5","observation_id":"db551e23-efa0-4c74-8d01-ae633181e9f3","resolution":{"observed_at":"2026-05-14T22:49:23.248001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T20:31:15.700943Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2505.13211"},"observation_digest":"sha256:00615d510ef4d369c1e894fdfcdd3c232d6a65d32c1ccc1385221622aab5f3ea","observation_id":"73375d52-4a4f-450e-aef1-81bf8a4ef7b0","resolution":{"observed_at":"2026-05-13T20:31:15.841638Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T14:03:03.532534Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.532534Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:77a2c5b2da9838e62297dcfc3a3d586625b9716094f2315566bf88ef5a645c06","observation_id":"402c1531-b64c-435c-ad8c-4374b7d67849","resolution":{"observed_at":"2026-08-07T14:03:03.532534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T14:03:18.814503Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-10T14:47:31.651213Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:18.814503Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:dc7cb9a1c59c334ca0c891f848ee7a307ea0e0f40f86b9027b01bf3f92b67231","observation_id":"52a3b87a-82de-4dc9-84ff-ed35d2ef92f3","resolution":{"observed_at":"2026-08-07T14:03:18.814503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2505.23884","last_updated":"2025-05-29T17:50:34Z","snapshot_observed_at":"2026-08-08T17:47:51.120243Z","submitted_at":"2025-05-29T17:50:34Z","title":"Test-Time Training Done Right","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T11:25:45.153563Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2505.23884"},"observation_digest":"sha256:0f21973c1597140b8b9d864e66555da0c1e402241b1cc4cdfdc9b0d68b8fb157","observation_id":"b56701b8-6fae-490a-bb47-531247ec1f90","resolution":{"observed_at":"2026-05-16T11:25:45.242488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T12:35:41.561669Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24857","last_updated":"2025-05-30T17:52:55Z","snapshot_observed_at":"2026-08-09T03:22:15.363687Z","submitted_at":"2025-05-30T17:52:55Z","title":"Accelerated Sampling from Masked Diffusion Models via Entropy Bounded Unmasking","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:41.561669Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2505.24857"},"observation_digest":"sha256:b39ebbd5c8781e7e3aa0bbed5bc0c20473605ea124040d50625703f28c62f4f7","observation_id":"73135b7e-14d0-4374-a5a9-d0eb02e715f7","resolution":{"observed_at":"2026-08-07T12:35:41.561669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T12:01:07.866515Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.866515Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:cda382790541dc2c00ee3414f0d155482a96cb4b593a5c0bbab8664b196636fc","observation_id":"16317c3c-7c29-483a-ab92-48d8f5d94aa1","resolution":{"observed_at":"2026-08-07T12:01:07.866515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T11:56:19.077238Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01037","last_updated":"2025-06-01T14:36:25Z","snapshot_observed_at":"2026-08-09T05:08:42.295320Z","submitted_at":"2025-06-01T14:36:25Z","title":"Self-supervised ControlNet with Spatio-Temporal Mamba for Real-world Video Super-resolution","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:19.077238Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.01037"},"observation_digest":"sha256:0a8a72aff42ac3631906f956c6603a9e2cf506bdcb301eaef814e6ad605625a8","observation_id":"57d1a527-e4bd-44ff-82ca-b4125f600380","resolution":{"observed_at":"2026-08-07T11:56:19.077238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T11:54:56.774332Z","title":"Ramesh, A., Pavlov, M., Goh, G., Gray, S., V oss, C., Rad- ford, A., Chen, M., and Sutskever, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01182","last_updated":"2025-07-08T20:18:16Z","snapshot_observed_at":"2026-08-09T08:46:08.835639Z","submitted_at":"2025-06-01T21:33:36Z","title":"Humanoid World Models: Open World Foundation Models for Humanoid Robotics","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:56.774332Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.01182"},"observation_digest":"sha256:10ebf75130a706250f223668fc8f516d0a1734d7143dda0c0b6f2db5b4d3610a","observation_id":"01627c78-aa77-4ca4-8f29-4de28ad38766","resolution":{"observed_at":"2026-08-07T11:54:56.774332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T11:49:44.157194Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-09T05:00:23.474295Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:44.157194Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:bf50eedbc44994bafa4bdd5068bd7027dc184ed4ff7933de6b13bb6a17d6b0ac","observation_id":"36275562-bb18-48f9-bcf3-fcbefeaf1c6f","resolution":{"observed_at":"2026-08-07T11:49:44.157194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T11:07:56.716959Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03448","last_updated":"2025-06-03T23:20:24Z","snapshot_observed_at":"2026-08-09T02:51:32.317520Z","submitted_at":"2025-06-03T23:20:24Z","title":"RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:56.716959Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.03448"},"observation_digest":"sha256:2e35ce77ade5636e94566235e9db117e67d341a8e4aa043c4c636a4089795cfc","observation_id":"b5b36acf-998c-4b4d-a376-8a27a8d6b087","resolution":{"observed_at":"2026-08-07T11:07:56.716959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T10:43:23.757368Z","title":"Movie Gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04590","last_updated":"2025-06-05T03:11:48Z","snapshot_observed_at":"2026-08-08T12:28:30.144231Z","submitted_at":"2025-06-05T03:11:48Z","title":"Follow-Your-Creation: Empowering 4D Creation through Video Inpainting","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:23.757368Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.04590"},"observation_digest":"sha256:e61dd1498bd1a8668d6449cb7629d65fc243d54c0f4c4d997059a17a6dcf6832","observation_id":"e4eac15e-91b5-450b-abcc-7c7a20256a95","resolution":{"observed_at":"2026-08-07T10:43:23.757368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T10:28:33.500496Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, , and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05343","last_updated":"2025-06-11T15:48:38Z","snapshot_observed_at":"2026-08-09T14:23:10.699088Z","submitted_at":"2025-06-05T17:59:54Z","title":"ContentV: Efficient Training of Video Generation Models with Limited Compute","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:33.500496Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.05343"},"observation_digest":"sha256:548023bb71022175a5660abf5bcb61ae4ca067daf9de66faa676e17167bbfc05","observation_id":"ab8e86b3-9e41-49df-ad74-80fdcc9da14f","resolution":{"observed_at":"2026-08-07T10:28:33.500496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T05:41:30.972332Z","title":"Movie gen: A cast of media foundation models.CoRR, abs/2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07280","last_updated":"2025-06-10T11:37:10Z","snapshot_observed_at":"2026-08-09T17:26:05.683665Z","submitted_at":"2025-06-08T20:52:34Z","title":"From Generation to Generalization: Emergent Few-Shot Learning in Video Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:30.972332Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.07280"},"observation_digest":"sha256:bcf25d130fcb0cbe60c85030d78b1379e6eedc1623c66ee0c84bd219ce6ce796","observation_id":"a3fe0e59-0e33-44af-aae3-f965ae67eb2d","resolution":{"observed_at":"2026-08-07T05:41:30.972332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T05:30:32.997934Z","title":"Polyak, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:32.997934Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:f41a3efdda60c94d2c868206b2872f2b840cd129b9dfe5edeac5be5fdee9198f","observation_id":"fe2140d3-0410-4633-b890-35f32edab8e9","resolution":{"observed_at":"2026-08-07T05:30:32.997934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T05:31:42.552979Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-10T08:12:33.197302Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.552979Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:6e9a0a24f888b24fc9bf5f8f549a58f43f20e5171d8414f907c4af74b78e530a","observation_id":"b0563564-1aa4-491d-a10b-6305dffedad5","resolution":{"observed_at":"2026-08-07T05:31:42.552979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:53.029590Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.08009"},"observation_digest":"sha256:a32ae2113884adb1a6a85cdf5ecdf7abc617ed34ff72891e0454636189e6cb93","observation_id":"9ef452e8-00bb-4656-8cfa-3fb41a957153","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T23:20:10.412598Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18851","last_updated":"2025-06-23T17:11:56Z","snapshot_observed_at":"2026-08-08T15:15:43.495121Z","submitted_at":"2025-06-23T17:11:56Z","title":"Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:10.412598Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.18851"},"observation_digest":"sha256:a76ecd52355a08d4ac6aa6b46a6a2e29821247ba7668a416a6b2ba900221e5fb","observation_id":"15c9c35d-d7e8-45c9-918e-6c3ee2b72c86","resolution":{"observed_at":"2026-08-06T23:20:10.412598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T22:45:07.206934Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20995","last_updated":"2026-06-30T12:17:01Z","snapshot_observed_at":"2026-08-09T22:04:39.430483Z","submitted_at":"2025-06-26T04:20:08Z","title":"Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:07.206934Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.20995"},"observation_digest":"sha256:f8617c9d49f5338a24420aadd1622996f1fdc2f5b417339cd6bdbbc0404fc373","observation_id":"186907ed-1502-45d5-82a0-79d9c0153b15","resolution":{"observed_at":"2026-08-06T22:45:07.206934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T22:15:08.717848Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-08T07:14:46.514760Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:08.717848Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.22065"},"observation_digest":"sha256:14bd29f07c57740f347bf24595b1387fbcb5461c1d3f62bbd361e2bacaf60d2c","observation_id":"38041d61-9b3a-4bfc-848d-e573dd9856d0","resolution":{"observed_at":"2026-08-06T22:15:08.717848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T21:46:28.390443Z","title":"Movie gen: A cast of media foundation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-08T08:02:50.830843Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:28.390443Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:068165735d030c12a6dd3c6aac3e86aece043aa23a2ff984f97168d456334866","observation_id":"bf9b0f74-61d1-49b7-9944-2a664f657eec","resolution":{"observed_at":"2026-08-06T21:46:28.390443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T21:28:16.552459Z","title":"Movie gen: A cast of media foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00162","last_updated":"2025-06-30T18:11:21Z","snapshot_observed_at":"2026-08-07T22:12:22.087190Z","submitted_at":"2025-06-30T18:11:21Z","title":"FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:28:16.552459Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.00162"},"observation_digest":"sha256:d2dd6e5c013fb8e1d6a2f381eb584d9a3d2eeb9bffd804c301350d11915b411f","observation_id":"d342d1ca-3627-48bb-950b-6b4d559ff64e","resolution":{"observed_at":"2026-08-06T21:28:16.552459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T21:23:12.731808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.731808Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:a75d3aff15fbe1b74eb8e56fab182390448046b7bbcc84f4b26bbe314052198c","observation_id":"93484021-023b-4bf8-b5db-e9eec2f6ad75","resolution":{"observed_at":"2026-08-06T21:23:12.731808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T20:21:38.696715Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03257","last_updated":"2025-08-02T03:59:32Z","snapshot_observed_at":"2026-08-06T20:12:16.781423Z","submitted_at":"2025-07-04T02:25:36Z","title":"LACONIC: A 3D Layout Adapter for Controllable Image Creation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:21:38.696715Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.03257"},"observation_digest":"sha256:99812780837b753e18b4bc23ba11844b09d4398c720d30ec89ca187cd6c5f5b9","observation_id":"71ae8b05-80e9-422f-b504-85dbe3c8382d","resolution":{"observed_at":"2026-08-06T20:21:38.696715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T19:44:19.944723Z","title":"Polyak, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04765","last_updated":"2025-07-07T08:43:46Z","snapshot_observed_at":"2026-08-08T06:00:56.573621Z","submitted_at":"2025-07-07T08:43:46Z","title":"GraphBrep: Learning B-Rep in Graph Structure for Efficient CAD Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:19.944723Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.04765"},"observation_digest":"sha256:e44ec82a3af588c9b99a0f8415bc7b9f30d06e6fabf831f1f0c07597c628418c","observation_id":"d290f7f3-77c5-4d3d-adbe-9d1b35a8480e","resolution":{"observed_at":"2026-08-06T19:44:19.944723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T19:19:32.766455Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05963","last_updated":"2025-07-09T07:01:34Z","snapshot_observed_at":"2026-08-08T15:17:23.406292Z","submitted_at":"2025-07-08T13:11:40Z","title":"Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:32.766455Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.05963"},"observation_digest":"sha256:c757e614f1a4dde5b5d65de7086410b16d09a41601120a505f2fe159336f32fa","observation_id":"03b093e9-5210-4af3-b679-40633855ac20","resolution":{"observed_at":"2026-08-06T19:19:32.766455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T18:51:27.992227Z","title":"Sampson, Shikai Li, Si- mone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petro- vic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07202","last_updated":"2025-07-09T18:20:33Z","snapshot_observed_at":"2026-08-09T23:14:03.004938Z","submitted_at":"2025-07-09T18:20:33Z","title":"A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.992227Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.07202"},"observation_digest":"sha256:e5a36f73e259b93367d619a05f01c8de46c9fcc901024900b307c940cf5ef9d0","observation_id":"4c1f6efc-ac82-4ad9-b8ea-a7da7c53f5e8","resolution":{"observed_at":"2026-08-06T18:51:27.992227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:5548b7d0897090e7cb63d2c6aaa8ec3cc4d7f858ca2731725785c4564427f79b","observation_id":"21790bed-c2d4-4338-b583-b1c99e62288b","resolution":{"observed_at":"2026-05-19T05:17:06.701163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T16:39:27.790649Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12952","last_updated":"2025-07-17T09:46:43Z","snapshot_observed_at":"2026-08-07T11:02:23.505503Z","submitted_at":"2025-07-17T09:46:43Z","title":"LoViC: Efficient Long Video Generation with Context Compression","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:27.790649Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.12952"},"observation_digest":"sha256:8fbb90836692fbf627ec555d4c746abb0936fef8663a9dda4cb1892ace7c9d87","observation_id":"a526ccb9-1282-4617-a76c-fb6a4f82f176","resolution":{"observed_at":"2026-08-06T16:39:27.790649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2507.13942","last_updated":"2026-04-15T13:59:47Z","snapshot_observed_at":"2026-07-31T09:25:03.034282Z","submitted_at":"2025-07-18T14:14:19Z","title":"Frozen Forecasting: A Unified Evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T03:42:54.620069Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.13942"},"observation_digest":"sha256:769f36894b442c432d3d7189d1000d5e73362d50fe742a79c4cdbb6d8ac48101","observation_id":"efb3fd45-47bb-42d5-8413-fc22bdb2d81d","resolution":{"observed_at":"2026-05-19T03:42:57.318365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T15:26:24.834469Z","title":"Movie gen: A cast of media foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.834469Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:4aa6486d379195bbc511bdb5fe6a90095c546e64922501a4c623e6794a32e9df","observation_id":"28d675ee-7aec-49f7-9bc2-044a2206edf3","resolution":{"observed_at":"2026-08-06T15:26:24.834469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T14:24:20.142280Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19468","last_updated":"2025-07-25T17:54:10Z","snapshot_observed_at":"2026-08-08T15:35:43.235215Z","submitted_at":"2025-07-25T17:54:10Z","title":"Back to the Features: DINO as a Foundation for Video World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:24:20.142280Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.19468"},"observation_digest":"sha256:c2dc1e091047b3e45aeefefb1446d57afdeb4d00689993e2340c054b0c1ff052","observation_id":"bb315865-5db7-4819-bc0d-baafc365e7c2","resolution":{"observed_at":"2026-08-06T14:24:20.142280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T13:07:09.488679Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.488679Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:8e97aad669906be375aab9bc14e596b99ec9e703913af17d7d065d8a6df1cfb9","observation_id":"73329125-5b0e-4757-a629-9c0b07f1bb92","resolution":{"observed_at":"2026-08-06T13:07:09.488679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T01:05:32.217703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03955","last_updated":"2025-08-05T22:44:36Z","snapshot_observed_at":"2026-08-06T21:16:50.885444Z","submitted_at":"2025-08-05T22:44:36Z","title":"Scaling Up Audio-Synchronized Visual Animation: An Efficient Training Paradigm","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T01:05:32.217703Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2508.03955"},"observation_digest":"sha256:3ff4da354e4f22f9fbcfc00316bcb0102759b4de6f5c93d1200feb9a9f1e4984","observation_id":"cb12e912-727d-402a-bdf0-3da2ef9a2a5e","resolution":{"observed_at":"2026-08-06T01:05:32.217703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T22:21:05.448579Z","title":"Movie gen: A cast of media foun- dation models, 2025,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07246","last_updated":"2025-08-10T08:59:32Z","snapshot_observed_at":"2026-08-09T17:42:18.989378Z","submitted_at":"2025-08-10T08:59:32Z","title":"Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T22:21:05.448579Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2508.07246"},"observation_digest":"sha256:84b9050b31c17272ae0d3b08cf2cd964d2217a0d1ba0d99eec687f3e8e7a8e84","observation_id":"086c64f7-92df-4dcc-8745-cc9d75bdf4b7","resolution":{"observed_at":"2026-08-05T22:21:05.448579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T21:09:29.035522Z","title":"arXiv:2410.13720 [cs.CV] https://arxiv.org/abs/2410.13720 Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, and Mark Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09383","last_updated":"2025-08-12T22:47:20Z","snapshot_observed_at":"2026-08-09T05:25:26.185058Z","submitted_at":"2025-08-12T22:47:20Z","title":"X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T21:09:29.035522Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2508.09383"},"observation_digest":"sha256:f9cce9e6751cfb3e0a30ee9b713c6c65bf208e53056d0f3b354d5e9940a5717b","observation_id":"ca3414a6-ae03-4966-9e0a-b5e1e3385ccd","resolution":{"observed_at":"2026-08-05T21:09:29.035522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T17:45:17.695941Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:17.695941Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:40654dd31d057bc884c386d09f1b75be09e9c5d010ab5682bef12fb4520cf2b4","observation_id":"48bb1691-4b6f-40c7-be7f-ab8867cea4cc","resolution":{"observed_at":"2026-08-05T17:45:17.695941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T05:50:17.658718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04957","last_updated":"2025-09-05T09:24:08Z","snapshot_observed_at":"2026-08-07T23:46:34.892649Z","submitted_at":"2025-09-05T09:24:08Z","title":"Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T05:50:17.658718Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.04957"},"observation_digest":"sha256:5d7bfadcafbafab0af64f35ce80ffe34e29f7c8116435e4b1b86ba7bdc1d3e52","observation_id":"4b766f44-b95b-4d07-87df-f4552eaff303","resolution":{"observed_at":"2026-08-05T05:50:17.658718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T00:05:47.639479Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.639479Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:e4476a8db0f0bed7e16d76d3f4eb8c540d8d778d86c2e647bd1d6f462e36ceec","observation_id":"6f395c99-31ce-4824-a34a-07a418acced7","resolution":{"observed_at":"2026-08-05T00:05:47.639479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T23:06:09.088428Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06818","last_updated":"2025-09-08T15:54:55Z","snapshot_observed_at":"2026-08-07T03:29:53.530054Z","submitted_at":"2025-09-08T15:54:55Z","title":"UMO: Scaling Multi-Identity Consistency for Image Customization via Matching Reward","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:06:09.088428Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.06818"},"observation_digest":"sha256:bd97881e3ae6490245bba95f2d1e0b3d554cb0f1670861984f3471d61babe5fb","observation_id":"931b262e-7efa-478f-8884-de43bff657ef","resolution":{"observed_at":"2026-08-04T23:06:09.088428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T20:35:30.324506Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.324506Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:7f3029f3281927ef7e666a10ba5b32550895be264622a0b0d9749c5cec55ca67","observation_id":"dcca47f5-00a3-4da8-9eea-bfe8a32261de","resolution":{"observed_at":"2026-08-04T20:35:30.324506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T18:58:10.972403Z","title":"arXiv:2410.13720","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-08T21:36:02.523510Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.972403Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:d87c93324a8e08a23456fc9aba5823a85b74ed559210c8e02d67e6b23a41ad63","observation_id":"ed61d7da-adb1-4e8f-bfea-3a36ff56f536","resolution":{"observed_at":"2026-08-04T18:58:10.972403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2509.20360","last_updated":"2026-04-18T01:38:10Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:30Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T13:46:05.547669Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.20360"},"observation_digest":"sha256:62f6192804ebf1244c7e60ca91d2c56f2df62ba3661a5bdfd457a5faeaaf69c2","observation_id":"fbe8a28d-ca9e-40c0-87b8-409e3c34bea1","resolution":{"observed_at":"2026-05-18T13:46:25.811975Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-09T09:15:39.740119Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-16T11:15:29.102090Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.25161"},"observation_digest":"sha256:78612a06faf4bc4bebbc0b98954213adb056770f6e3ec04f8054ad465d575ecd","observation_id":"9657f906-d921-4762-a3f6-0f673c839d23","resolution":{"observed_at":"2026-05-16T11:15:29.186788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T13:40:54.549271Z","title":"Movie Gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.26364","last_updated":"2026-03-02T18:11:04Z","snapshot_observed_at":"2026-08-09T09:51:53.215003Z","submitted_at":"2025-09-30T15:03:55Z","title":"Data-to-Energy Stochastic Dynamics","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T13:40:54.549271Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.26364"},"observation_digest":"sha256:892f0e357c3119dc9bcdb031628753507510120dd05fb52dd173a1f883266cf3","observation_id":"00e3431f-70f8-48dd-9f92-8e16ca0104a7","resolution":{"observed_at":"2026-08-04T13:40:54.549271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-09T17:36:50.125769Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T22:39:53.995700Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2510.02283"},"observation_digest":"sha256:368892078dd9f572189d6f18963dd8413a20284b471b5d457a75d6a062866de2","observation_id":"cb1b4a5c-1ab0-4c6e-a790-dbde2f3369f5","resolution":{"observed_at":"2026-05-15T22:39:54.200182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2510.04236","last_updated":"2026-05-03T04:02:22Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T15:03:31Z","title":"Scaling Sequence-to-Sequence Generative Neural Rendering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T10:09:27.285710Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2510.04236"},"observation_digest":"sha256:79fa47ac2a56036cb1b93fda460cc78a4d678299e998f103d143856a727848f1","observation_id":"6c47020f-13a8-4617-885d-61bb9e295630","resolution":{"observed_at":"2026-05-18T10:11:13.931272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T11:25:34.677649Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, and Yuming Du","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04961","last_updated":"2026-06-29T15:33:46Z","snapshot_observed_at":"2026-08-10T02:35:17.449775Z","submitted_at":"2025-10-06T15:57:31Z","title":"SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T11:25:34.677649Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2510.04961"},"observation_digest":"sha256:9b33465de39c9c9548c1366ef1a5a9c5184f9c4428939654559c44fd774d58a7","observation_id":"6b362679-350b-45dc-a69e-b4c80fd4f4b8","resolution":{"observed_at":"2026-08-04T11:25:34.677649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T10:49:48.898580Z","title":"Movie gen: A cast of media founda- tion models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-07T16:29:46.498912Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.898580Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:b7a944de3e36f19936511d51d619aace53a2eb24bd8b8c45d1b520121a2c92d7","observation_id":"6f57bb97-5184-4f30-b402-53c3a92da22a","resolution":{"observed_at":"2026-08-04T10:49:48.898580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2510.14543","last_updated":"2026-04-12T09:52:58Z","snapshot_observed_at":"2026-08-02T15:25:02.299000Z","submitted_at":"2025-10-16T10:32:48Z","title":"Exploring Cross-Modal Flows for Few-Shot Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T06:16:12.608513Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2510.14543"},"observation_digest":"sha256:4b344e1e3cffd8e69895afe99cbdef7518f29149bf8ea61c2dd9d6bd4417b920","observation_id":"eeb0646c-5326-4610-a13f-de4d977799cf","resolution":{"observed_at":"2026-05-18T06:20:58.902679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:4c51063e122faa4fb714e9b615625adad122ab70938bfb4d139642d69388fb6d","observation_id":"ac627e75-7345-4a2f-bc18-0c57f3975541","resolution":{"observed_at":"2026-05-18T05:15:54.306835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T08:20:09.440233Z","title":"org/abs/2410.13720","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.21615","last_updated":"2026-06-17T16:22:08Z","snapshot_observed_at":"2026-08-06T09:36:16.630593Z","submitted_at":"2025-10-24T16:21:37Z","title":"Epipolar Geometry Improves Video Generation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:20:09.440233Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2510.21615"},"observation_digest":"sha256:b8ae4c060bf69b93050573f258e8619ccddfc1fe0d1b859b705b5bef62957bb3","observation_id":"7f3725a6-18a3-4364-9a46-c4ef55f2f7be","resolution":{"observed_at":"2026-08-04T08:20:09.440233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b2ad5b3f72b35007603aafe0c86220151307869125938e9a0d10162df5d6d274","observation_id":"74b9026e-75e5-420d-80d1-c74b354abed5","resolution":{"observed_at":"2026-05-12T23:01:13.725884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T21:34:10.546872Z","title":"Moviegen: Acastof mediafoundationmodels.arXivpreprintarXiv:2410.13720,2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.14993","last_updated":"2026-05-26T15:07:50Z","snapshot_observed_at":"2026-08-03T23:39:38.668973Z","submitted_at":"2025-11-19T00:23:22Z","title":"Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T21:34:10.546872Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2511.14993"},"observation_digest":"sha256:55d4d6192d90ed62321488f45fb2f96274cdda79a103ed783c930b7556084366","observation_id":"5048904e-4a33-4ec9-a37f-2118fcd68ef3","resolution":{"observed_at":"2026-08-03T21:34:10.546872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2511.17844","last_updated":"2026-04-08T06:05:56Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-21T23:41:19Z","title":"Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T19:54:35.190865Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2511.17844"},"observation_digest":"sha256:02105f6cd6de2db2739c8e2254c0e5f8a5682e6ef52f5b2c4da49574a412d282","observation_id":"0b910c79-e744-42dc-8d28-7e6a43603114","resolution":{"observed_at":"2026-05-17T19:55:09.952289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2511.22940","last_updated":"2026-05-19T15:28:34Z","snapshot_observed_at":"2026-08-02T05:15:20.627790Z","submitted_at":"2025-11-28T07:30:10Z","title":"One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T18:25:22.486891Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2511.22940"},"observation_digest":"sha256:4d74d1463fe78c8b49966918e6dacbc6173002cdf628f6663b38b976b9668618","observation_id":"809a7fc8-2bec-47d9-a65a-1324ce235a84","resolution":{"observed_at":"2026-05-21T18:25:28.333573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T18:17:54.943863Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.04678"},"observation_digest":"sha256:d08e5b07a20fc7c21b9e78e3e2be72ee9566713977122ff05537f6f1b73b1393","observation_id":"3d666953-9a2e-456b-bd4e-4adcb8db919d","resolution":{"observed_at":"2026-05-16T18:17:55.002890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T18:25:55.997414Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.05394","last_updated":"2026-07-24T07:04:43Z","snapshot_observed_at":"2026-08-03T18:25:53.262934Z","submitted_at":"2025-12-05T03:20:02Z","title":"Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:25:55.997414Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.05394"},"observation_digest":"sha256:e26385eb62ed1325ce2e2b17d5745594fd3eda9137976d9c52de81a68853d6cd","observation_id":"3ba89b9a-fdca-4522-8621-8962fb5d3926","resolution":{"observed_at":"2026-08-03T18:25:55.997414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-07-06T22:38:35.387503Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T00:03:45.576961Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.09299"},"observation_digest":"sha256:e048b800efe360e4869a0e636b3f16c35bfebdf09eaf76c82a68c65695a76596","observation_id":"223ff78f-d065-4329-b28c-80834dad8de0","resolution":{"observed_at":"2026-05-17T00:08:43.884622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T16:30:37.377778Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.377778Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:028910ce9f3c27f2f9b0f22471eb43895f4b6d8b6d95aae2a2a4d50b3ade8c9c","observation_id":"25ac8a62-8686-42e7-943f-88d069e31bff","resolution":{"observed_at":"2026-08-03T16:30:37.377778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2512.20340","last_updated":"2026-04-29T12:00:44Z","snapshot_observed_at":"2026-08-02T10:18:36.960036Z","submitted_at":"2025-12-23T13:15:31Z","title":"The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T20:06:30.109866Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.20340"},"observation_digest":"sha256:a9816dc8111f81a2e9b455f74f5f5ea3d12df7659d7d02e62d37ef8a4b57bfac","observation_id":"2073f5f2-f292-4d1f-9e60-76c8e47f5ae2","resolution":{"observed_at":"2026-05-16T20:08:22.938728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2512.23421","last_updated":"2026-04-17T11:51:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-29T12:32:27Z","title":"DriveLaW:Unifying Planning and Video Generation in a Latent Driving World","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T19:34:39.518649Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.23421"},"observation_digest":"sha256:4b98701c476c2ac39b5301eda05d232456097c07e784ab90187f0c3e74fff46f","observation_id":"08d3b635-47c6-4998-8303-4f6116ae4a36","resolution":{"observed_at":"2026-05-16T19:38:21.138670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-07-06T22:40:23.205898Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T19:43:37.604351Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:9baa8093bb0d128548bc90dd77eda71360b532a94b3cc17ffecd06d226e424ef","observation_id":"e49c83c9-f2fb-4ec1-af9c-020468693ceb","resolution":{"observed_at":"2026-05-16T19:48:21.893652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-07-06T22:40:23.205898Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T16:10:31.015783Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:3560329103af7f304ca95871ff1c8ad98c988a74ce0bf6269b249bbf00163fd7","observation_id":"3be5f3b9-5644-4ea5-8e7e-b634521d05fb","resolution":{"observed_at":"2026-05-21T16:14:15.245980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T13:24:47.170535Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.24551","last_updated":"2026-06-18T22:13:10Z","snapshot_observed_at":"2026-08-07T22:25:01.573943Z","submitted_at":"2025-12-31T01:19:14Z","title":"PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T13:24:47.170535Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.24551"},"observation_digest":"sha256:ab47c5efe9faf80dc9287fd5f7c51ee318712f1f0124420340f26bfdfa291561","observation_id":"88698636-bd5f-4316-96ed-c4f6daf41ef8","resolution":{"observed_at":"2026-08-03T13:24:47.170535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T13:21:10.238117Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.24731","last_updated":"2026-06-23T06:21:28Z","snapshot_observed_at":"2026-08-08T01:51:47.048928Z","submitted_at":"2025-12-31T08:58:30Z","title":"EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T13:21:10.238117Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.24731"},"observation_digest":"sha256:b864db0cb2de4ced95168e850471b82f4cf6953c3ed923877668ec13e5786004","observation_id":"202b0d33-757f-4ab3-8960-6922fcf1e493","resolution":{"observed_at":"2026-08-03T13:21:10.238117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T17:32:01.642256Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:ce946fff4ec19090b7386cb4c093075cc8317567f80afc72b79aa90f417b2137","observation_id":"e961e207-426f-4de2-a923-b31f657c04a6","resolution":{"observed_at":"2026-05-21T17:32:01.790891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T11:48:00.633421Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:d3b75f4c4a738d0f6db4156e1dbf69d88c13fe6c6bb23e609ce8f871318f5a8d","observation_id":"1c2cd5da-b115-4633-8bad-a115ae8147f3","resolution":{"observed_at":"2026-05-22T11:51:30.012175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T05:30:27.140435Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T05:30:27.140435Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2602.02214"},"observation_digest":"sha256:beb7d6374c2fa5b186e2c9acf1ec25dd505c1882c554adbc4357e79c27aefa42","observation_id":"726170ab-8127-4293-8bea-4e3eaf54f040","resolution":{"observed_at":"2026-08-03T05:30:27.140435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.13720/citation-record","integrity":"/paper/2410.13720/integrity","json":"/paper/2410.13720/citation-record.json","paper":"/paper/2410.13720"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-09T15:04:43.257424Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2304.08477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent- shift: Latent diffusion with temporal shift for efficient text-to-video generation","venue":null,"work_id":"bedd3bfc-5b36-4f28-80c6-ccc058c0b411","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:8f45204c9d473a01fa0c6cb765b8382bf9dad250207b75b0c41c68f490c0e0a1","observation_id":"b4f40554-53e5-46c6-a8c9-86d765e9c2dc","resolution":{"observed_at":"2026-05-11T14:16:26.008358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:8a7b65b1e8fc93be0c99ef64f2267b34e5d956edaf1fe5f1df0e9944bfda5289","observation_id":"758571fd-a831-4955-8a9d-c18f47ea0350","resolution":{"observed_at":"2026-05-15T01:44:22.991611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":"2401.12945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-07-04T17:40:00.874670Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":"8a0a0735-d82c-4090-a039-697d06ccc3f0","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:117ce6e7106ab63405f7b10ce9482ddde49900d6db0ad36299eb668d65527e71","observation_id":"56de7286-24de-4857-8c1d-0491cb7bb1b3","resolution":{"observed_at":"2026-05-11T14:16:19.190665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01973","last_updated":"2018-06-21T14:54:33Z","snapshot_observed_at":"2026-08-07T19:33:19.839652Z","submitted_at":"2018-01-06T05:44:29Z","title":"A Note on the Inception Score","version":2},"cited_work":{"arxiv_id":"1801.01973","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.01973","snapshot_observed_at":"2026-07-04T03:49:29.501368Z","title":"A Note on the Inception Score","venue":"stat.ML","work_id":"4700104e-68bd-4452-bdd6-e68281808831","year":2018},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/1801.01973","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:dfbfc1075765e7a6c995c4a646272a70f0b5d2c7c4f7d75145080c6edb678e88","observation_id":"f67b0561-a37c-4020-8b0b-cee280a14226","resolution":{"observed_at":"2026-05-11T14:16:19.488521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta Open Compute Project, Grand Teton AI platform.https://engineering","venue":null,"work_id":"40d05d5e-9615-45c0-ab55-a2b9957326da","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:45f07893f7d2b9067f075f59a33fe278f4e549de5a41897aa133d9b8e0c39c2c","observation_id":"10aaf17d-a409-483c-b356-a9847c8ba46b","resolution":{"observed_at":"2026-05-11T14:16:26.315128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:94b6e065777da0416acd491febd922b1f7565014ceb7cc142b877623c7d47ab0","observation_id":"10a9d913-aaf0-4b72-8189-aac96663ddfa","resolution":{"observed_at":"2026-05-11T14:16:20.818910Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:5dcefad0d1f2509696e830b7ca2a649408fdd9d7ab95c796d9bde3fb28dc5c64","observation_id":"10de9f58-95d8-495c-aeb6-78fac5139772","resolution":{"observed_at":"2026-05-11T14:16:21.075360Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08674","last_updated":"2024-07-11T17:06:53Z","snapshot_observed_at":"2026-08-08T19:58:33.185924Z","submitted_at":"2024-07-11T17:06:53Z","title":"Still-Moving: Customized Video Generation without Customized Video Data","version":1},"cited_work":{"arxiv_id":"2407.08674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08674","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Still-moving: Cus- tomized video generation without customized video data","venue":null,"work_id":"4ed43778-722b-43ff-9a46-b49e5e9c9650","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2407.08674","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:7fc49428c64ece267f6ba3f4c4e7590cdd038dac24c96d16da293c988895b321","observation_id":"2d70a758-8848-4e50-ac5c-6a570fd5265a","resolution":{"observed_at":"2026-05-11T14:16:21.204598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":"2310.19512","doi":"10.48550/arxiv.2310.19512","metadata_source":"pith","pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","venue":"cs.CV","work_id":"4d4486c5-6317-4d8d-bb5b-3b100d732a83","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:bdf1e980cb1e15d9141df0785ab6043e9c8ebde695b24a44c697fec13b041009","observation_id":"c0b07ee2-4b25-4c54-b1b0-414e9ea2a2ff","resolution":{"observed_at":"2026-05-14T21:40:44.284627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05793","last_updated":"2023-09-11T19:59:43Z","snapshot_observed_at":"2026-08-03T16:16:19.476471Z","submitted_at":"2023-09-11T19:59:43Z","title":"PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2309.05793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05793","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PhotoVerse: Tuning-free image customization with text-to-image diffusion models.arXiv preprint arXiv:2309.05793, 2023b","venue":null,"work_id":"494379ac-d858-422a-b65c-33020a983740","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2309.05793","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:0f6d360f214070f9948278d0a79f429cbaff388f8f41a86ed8d4a2021433fea7","observation_id":"acd00a39-f0ad-4f1d-b9e1-b19623ca0bf6","resolution":{"observed_at":"2026-05-11T14:16:21.576682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":"2309.15807","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-07-08T05:54:33.464514Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","venue":"cs.CV","work_id":"ae882a46-08bc-4ec0-a38c-72bc9eec3afe","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:460fffe612834f674a571ae25695ff65eaeb2436446b3db14dc361da3724be3d","observation_id":"4dcbda89-585f-4398-99ce-c15c70908c72","resolution":{"observed_at":"2026-05-11T14:16:21.686371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":"2309.16588","doi":"10.48550/arxiv.2309.16588","metadata_source":"pith","pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision Transformers Need Registers","venue":"cs.CV","work_id":"57106da4-5420-4778-94eb-e821589aa7a0","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:cec00a3602e99041fa23462e871d001880087eef5dc1b598e4ac280533cb6e08","observation_id":"e305e4cb-e195-4a41-8417-0657d1a9265e","resolution":{"observed_at":"2026-05-13T09:41:38.514155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":"2105.05233","doi":"10.48550/arxiv.2105.05233","metadata_source":"pith","pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Models Beat GANs on Image Synthesis","venue":"cs.LG","work_id":"2eb944bb-93ba-462c-8111-4e8c915dd873","year":2021},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:3d1a8851cf2276bdd036bb2ffdd572103c7dfc1a3031d7a29466c73c21e41eb1","observation_id":"125e7e4e-6b60-4b8f-bc3f-abe3ff5efc77","resolution":{"observed_at":"2026-05-13T11:16:28.664120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:30.424112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:9f0bb49c2bb88f63efa322c8a0229be591ece1c68b8ffe5d7c81a5edba8ab630","observation_id":"0a21340f-8060-4650-b419-127689400f4b","resolution":{"observed_at":"2026-05-11T14:16:22.245197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:7baa02841cb477db7a66d0719701777616839581c8d8fe2034def282c6eae0da","observation_id":"96de64f4-a267-465e-a626-22a6b65b4c74","resolution":{"observed_at":"2026-05-13T21:49:52.306785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09381","last_updated":"2018-10-03T01:42:36Z","snapshot_observed_at":"2026-08-04T02:32:47.288584Z","submitted_at":"2018-08-28T16:05:40Z","title":"Understanding Back-Translation at Scale","version":2},"cited_work":{"arxiv_id":"1808.09381","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.09381","snapshot_observed_at":"2026-07-05T10:30:59.121109Z","title":"Understanding Back-Translation at Scale","venue":"cs.CL","work_id":"5256dab5-cfbb-4b12-9f62-34b8736a395b","year":2018},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/1808.09381","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:9eb1d0b0b5e6e5e0fca0938aeea9751f22ca268a331497c07b97ad620784e2d6","observation_id":"46c02703-c910-4bf1-859a-ba8113296125","resolution":{"observed_at":"2026-05-11T14:16:22.608280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03011","last_updated":"2023-02-06T18:50:23Z","snapshot_observed_at":"2026-08-05T01:06:11.719138Z","submitted_at":"2023-02-06T18:50:23Z","title":"Structure and Content-Guided Video Synthesis with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2302.03011","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.03011","snapshot_observed_at":"2026-07-02T20:37:22.291555Z","title":"2023 , journal =","venue":null,"work_id":"9ec84ad8-517d-4d27-ba1a-447562d63988","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2302.03011","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:a18f10ad45b16abaf8f6bfc004ce4f0072c99fea01f418c7be25f9f3cb410c88","observation_id":"e1adce8f-d3f3-440e-88d8-a21f1d72211b","resolution":{"observed_at":"2026-05-11T14:16:22.728880Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":"2208.01618","doi":"10.48550/arxiv.2208.01618","metadata_source":"pith","pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","venue":"cs.CV","work_id":"ca618c21-3ba6-448e-bd86-bcecff3cdeb5","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:6df5408aafa77c9847b2f27066c8a77320e3c023acdd30ee1d142289513104e9","observation_id":"43201648-175b-40c1-840e-753a491ee7e6","resolution":{"observed_at":"2026-05-11T18:08:55.677650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":"2307.10373","doi":"10.1109/iccv51701.2025.005","metadata_source":"pith","pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","venue":"cs.CV","work_id":"2e967b53-6386-4564-b468-ffd540817064","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:6d77eebbe8da344eb5460fd33d1a3b77e0b497d8f9c56f5c365e4335d4d0db21","observation_id":"611fa5cd-30ef-4f5c-8471-f57c7199ca61","resolution":{"observed_at":"2026-05-17T20:17:47.115702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-10T11:18:06.491859Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":"2304.13731","doi":"10.48550/arxiv.2304.13731","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-audio generation using instruction- tuned LLM and latent diffusion model","venue":"arXiv (Cornell University)","work_id":"492d96c3-fca9-41b7-a64d-3e3313ff9da1","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:ca4e81513ec86d8aea6fd65007e3ef84a2e5c78bcc84e48070e395643197a5c1","observation_id":"707a0d2c-634c-4acf-a713-b365b0ec29d6","resolution":{"observed_at":"2026-05-11T14:16:23.275961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:dde22620f6bf5fbcb00748be67654d934223128c4028f758788bf3428ca0a1e5","observation_id":"481d2025-b1f3-4238-806e-8ffa6a9ef252","resolution":{"observed_at":"2026-05-11T14:16:23.380792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-07T19:06:02.627634Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2312.06662","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-07-03T23:59:06.270972Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"ddd00738-0fa8-47a1-95b7-711cfe1ca04d","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:0cb4268034025c0482372c6e42df8b597da215d2312ae5aa07401002bb207355","observation_id":"fcfa539f-3a60-4c06-91f7-08487f1a35db","resolution":{"observed_at":"2026-05-11T14:16:23.388206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-07-06T18:04:33.726854Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":"2404.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-07-04T21:10:09.688336Z","title":"Id- animator: Zero-shot identity-preserving human video gener- ation","venue":null,"work_id":"e92e42cf-1216-4226-a583-07ff26a3de66","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:25f8e45c214f618e8f38f19ee422a55c090d0c41acbe81b638b4ead51ce7ddb2","observation_id":"5a949d7d-8578-42dc-8a45-39e2139e0c3b","resolution":{"observed_at":"2026-05-11T14:16:23.486698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:5601b1c0d07369506670264f2ddcd044b5ab14189f2abb113b3752e50c7cb5f8","observation_id":"91629891-0dbe-46b6-b66b-b2a5d7f34509","resolution":{"observed_at":"2026-05-11T14:16:23.497613Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14330","last_updated":"2024-02-06T18:44:30Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:57:09Z","title":"DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":"2305.14330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14330","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct2v: Large language models are frame-level directors for zero-shot text-to-video generation.arXiv preprint arXiv:2305.14330","venue":null,"work_id":"20804dee-9431-41ef-9d8b-f735ce786681","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2305.14330","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:c4c68474b7fa46d056c7b19340cfcba9e67041e6476489cd7ef41eae3403dddb","observation_id":"9a1e8cfd-c000-4d99-84b6-247470282895","resolution":{"observed_at":"2026-05-11T14:16:23.576244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:876c5c2f387385a04901e02f8f3325a0b2dc43f0ee256a4c0e41c67cf99d2255","observation_id":"07805306-e726-4c76-b86f-a99a6bf6d7dd","resolution":{"observed_at":"2026-05-11T14:16:23.725103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:c701a37d3781706ec4f6d3dd3b22923b93c6319f43aaf12a2fb6d85b51f04b23","observation_id":"6a113585-72d9-4523-8412-f1324f1b0c02","resolution":{"observed_at":"2026-05-11T14:16:23.840348Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:706cbf5f274df64ad070d1369d304a96936d079004b2dfd69e07da9755d8911f","observation_id":"eca944cf-56c8-4bf3-8dff-1ab0605dd869","resolution":{"observed_at":"2026-05-11T14:16:23.975684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00968","last_updated":"2024-03-04T07:54:31Z","snapshot_observed_at":"2026-07-06T16:42:00.138744Z","submitted_at":"2023-11-02T03:33:00Z","title":"Video2Music: Suitable Music Generation from Videos using an Affective Multimodal Transformer model","version":2},"cited_work":{"arxiv_id":"2311.00968","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00968","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ideogram v2, 2024.https://ideogram.ai/","venue":null,"work_id":"df660e85-88ef-4513-abe1-f041374cf106","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2311.00968","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:927517954d2717b40a35919f54986ca4f1aa74c54597fcf00385bbfc99eb5080","observation_id":"e940fd72-b93e-406a-867d-451dbb5e3c57","resolution":{"observed_at":"2026-05-11T14:16:24.096063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04524","last_updated":"2023-12-07T18:43:45Z","snapshot_observed_at":"2026-07-06T16:58:27.612525Z","submitted_at":"2023-12-07T18:43:45Z","title":"RAVE: Randomized Noise Shuffling for Fast and Consistent Video Editing with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2312.04524","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04524","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rave: Randomized noise shuffling for fast and consistent video editing with diffusion models.arXiv preprint arXiv:2312.04524","venue":null,"work_id":"98e55e39-1a51-4351-a51a-f3d123b64546","year":null},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.04524","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:bb969452ed3377367f20781c94f41a6521665aefa07613adc6bfc120cd7cf8e1","observation_id":"86ab49e8-d686-4f02-83cb-ced1d7aae8f0","resolution":{"observed_at":"2026-05-11T14:16:24.296364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13439","last_updated":"2023-03-23T17:01:59Z","snapshot_observed_at":"2026-08-09T04:35:25.283269Z","submitted_at":"2023-03-23T17:01:59Z","title":"Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators","version":1},"cited_work":{"arxiv_id":"2303.13439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.13439","snapshot_observed_at":"2026-06-29T17:53:46.729515Z","title":"arXiv preprint arXiv:2303.13439 , year=","venue":null,"work_id":"ddea38b0-8bf6-45cd-9c6b-9a5d839f9224","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2303.13439","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:c24bd7846e28abb50a10cef3bf665dced7202899226ca9eb5712103994e56425","observation_id":"fc7a146b-07fd-453d-bbd4-02e2af7e4ee1","resolution":{"observed_at":"2026-05-11T14:16:24.575795Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":"1812.08466","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-07-08T00:04:22.632355Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","venue":"eess.AS","work_id":"64a43367-ac07-49b0-ab37-b8797c50e9d7","year":2018},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:be1deab421ed3d6ca78dcae9e1e62626711d0ce451e9d4e0523ea883b39918ee","observation_id":"357b476f-a538-4eba-a9ca-98310347690b","resolution":{"observed_at":"2026-05-11T14:16:24.646511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11473","last_updated":"2024-11-03T12:40:41Z","snapshot_observed_at":"2026-08-10T11:24:16.483474Z","submitted_at":"2024-05-19T07:48:41Z","title":"FIFO-Diffusion: Generating Infinite Videos from Text without Training","version":4},"cited_work":{"arxiv_id":"2405.11473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.11473","snapshot_observed_at":"2026-07-04T03:29:29.545055Z","title":"Fifo-diffusion: Generating infinite videos from text without training","venue":null,"work_id":"5490963c-4d1f-4f39-a209-bd982ef653b8","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2405.11473","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:7ab0cb0eeb973c898764a2c9e76ff4733a0954c96edf09eb8c16d309e5f94546","observation_id":"2aa304d7-ad32-4dff-81c2-567c3d6a7c5b","resolution":{"observed_at":"2026-05-11T14:16:24.703349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:36465fba54d2b6fe65fc0d10391ee6ee9708c345cc8136aa8199039f00486ef8","observation_id":"4881b9ae-c92b-430f-acc1-7c9177e5e105","resolution":{"observed_at":"2026-05-11T14:16:24.856379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05224","last_updated":"2024-05-08T17:15:18Z","snapshot_observed_at":"2026-07-06T18:11:38.755996Z","submitted_at":"2024-05-08T17:15:18Z","title":"Imagine Flash: Accelerating Emu Diffusion Models with Backward Distillation","version":1},"cited_work":{"arxiv_id":"2405.05224","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05224","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videocrafter2: Open dif- fusion models for high-quality video generation","venue":null,"work_id":"b21360cf-0a63-49d6-abdb-6da12c4f872d","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2405.05224","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:154ecc420ada802a08983e1789bdab5e7abd4047c9a0650e491aaf3310be9d37","observation_id":"8f8008db-29b7-4c2f-8ea4-107feed8b09a","resolution":{"observed_at":"2026-05-11T14:16:24.984341Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:c518050534abf68e60ecb2d5e01293d9a064154d7908c92667259c5e94614dc8","observation_id":"92e00695-367b-4952-9570-f4dc5192e3c9","resolution":{"observed_at":"2026-05-15T17:51:05.830483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:67d570f1b18aade3550a1239776c28f02b801d92b838b03d93f7b1d1570b091c","observation_id":"32b56a7a-2b0d-42f3-9330-44fc7b8f3be1","resolution":{"observed_at":"2026-05-11T14:16:24.998932Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03648","last_updated":"2024-10-16T14:24:53Z","snapshot_observed_at":"2026-07-06T18:41:18.308899Z","submitted_at":"2024-07-04T05:38:49Z","title":"High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching","version":2},"cited_work":{"arxiv_id":"2407.03648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03648","snapshot_observed_at":"2026-07-08T00:04:22.448544Z","title":"High fidelity text-guided music editing via single-stage flow matching","venue":"eess.AS","work_id":"0cbc2c0f-dd08-417a-ad85-222da28f38c9","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2407.03648","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:73ab8e3e6cc793beee1dc20551d2a00c0badb1380cd220fe797e6843ac140b34","observation_id":"ba1ee809-b7f2-494e-8cff-6c3cbe16a9b2","resolution":{"observed_at":"2026-05-11T14:16:25.009553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-10T13:43:11.982910Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":"2306.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-07-02T15:47:06.014261Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":"e877a8f6-5739-4d1e-9bc8-516dd1ed738d","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:7e93605ebab77d85928a8a23535c83e53057adc55ecad1a2ce3c1f3d846af90a","observation_id":"f456c7f4-541e-47cd-856c-1b8ad3962f2c","resolution":{"observed_at":"2026-05-11T14:16:25.046954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-08-10T13:38:24.556897Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:6494fa971467d0c299736edfc01b9f0af21062360a31612afa3092e7341b71e7","observation_id":"d1f8a6af-4077-4cfd-922b-e4af6a01f3a2","resolution":{"observed_at":"2026-05-11T14:16:25.090823Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-08-10T11:29:57.558641Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2309.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-07-04T14:59:55.947520Z","title":"arXiv preprint arXiv:2309.00398 (2023) 6, 1","venue":null,"work_id":"3e0e2f45-9789-4c06-9f52-59d98e898afc","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:785b342562cb6d7b1ba5c797609035d48383999330c09eea4b35729ce6d4d822","observation_id":"9f24a98e-73f5-4c9e-8e51-773911d0a315","resolution":{"observed_at":"2026-05-11T14:16:25.098681Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04461","last_updated":"2023-12-07T17:32:29Z","snapshot_observed_at":"2026-08-10T10:44:02.590050Z","submitted_at":"2023-12-07T17:32:29Z","title":"PhotoMaker: Customizing Realistic Human Photos via Stacked ID Embedding","version":1},"cited_work":{"arxiv_id":"2312.04461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04461","snapshot_observed_at":"2026-07-04T13:29:50.946428Z","title":"arXiv preprint arXiv:2312.04461 (2024) 2, 3","venue":null,"work_id":"4e6569b3-9b48-4b5f-b434-c9526962f460","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.04461","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:aa67e609629d0108a832c612229823c619552e5a08c0ca6ab6da35c0dae5bf47","observation_id":"831561ab-e0b9-430b-ae2e-7424cf18adfc","resolution":{"observed_at":"2026-05-11T14:16:25.109885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":"2310.01889","doi":"10.48550/arxiv.2310.01889","metadata_source":"pith","pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","venue":"cs.CL","work_id":"982498c4-e80e-4e66-8c44-c60813be298d","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:23dfdd91c291a1d52a3be67611c916cde262ff5f2dfb12294600de69f7db868d","observation_id":"b2972eb6-45e4-43df-8fdd-a5e8694e5a67","resolution":{"observed_at":"2026-05-12T19:28:28.418803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dream Machine, 2024.https://lumalabs.ai/dream-machine","venue":null,"work_id":"c113aa52-f246-4181-a634-15288d40095a","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:e787b436805b9b8fedb10731d5a98a46d2fe79d6a1077e3c1df85d5b13978e55","observation_id":"9bb7485d-25d2-4dd5-b681-ee0fd4fb6716","resolution":{"observed_at":"2026-05-11T14:16:26.755064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08320","last_updated":"2023-10-13T01:43:04Z","snapshot_observed_at":"2026-08-05T15:11:09.163965Z","submitted_at":"2023-03-15T02:16:39Z","title":"VideoFusion: Decomposed Diffusion Models for High-Quality Video Generation","version":4},"cited_work":{"arxiv_id":"2303.08320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.08320","snapshot_observed_at":"2026-07-03T22:49:00.811936Z","title":"Videofusion: Decomposed diffusion models for high- quality video generation","venue":null,"work_id":"3c0d22b0-62a7-4957-910d-b77cce740f9c","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2303.08320","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:d3e143fabcdf2c0eca825d5f18c73ea4a59e6e3d22cf7c8a01d16e9aeefb2163","observation_id":"6d5d256a-5199-48db-903f-0e6f59148992","resolution":{"observed_at":"2026-05-11T14:16:25.123993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":"2401.03048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-07-10T01:46:41.160163Z","title":"Latte: Latent Diffusion Transformer for Video Generation","venue":"cs.CV","work_id":"5328e907-7278-4781-a2bb-c5ef40dc87fb","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:d15f3329709ba44a51abe4aa861017ff0e81ff44adfef24a5de4e2e06fd37c90","observation_id":"3ea8ea41-e9b2-4782-a974-32caf4efad47","resolution":{"observed_at":"2026-05-13T21:45:35.835056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09956","last_updated":"2024-07-17T16:17:50Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:31:22Z","title":"Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":"2404.09956","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09956","snapshot_observed_at":"2026-07-08T00:04:22.588067Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization","venue":"cs.SD","work_id":"8237a5a7-f0bd-43ad-b6eb-725b5d16930b","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2404.09956","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:449393aea512fdf85f9f475bc8300de9141f5b9473d9252dc236081873e5596b","observation_id":"660d8a96-811c-40bf-88fb-5779fd49f8e0","resolution":{"observed_at":"2026-05-11T14:16:25.186220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10537","last_updated":"2023-09-19T11:33:43Z","snapshot_observed_at":"2026-08-03T15:07:22.214539Z","submitted_at":"2023-09-19T11:33:43Z","title":"FoleyGen: Visually-Guided Audio Generation","version":1},"cited_work":{"arxiv_id":"2309.10537","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.10537","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FoleyGen: Visually-guided audio generation.arXiv preprint arXiv:2309.10537","venue":null,"work_id":"bbaeae7f-e776-48a0-9d73-2cc0a810406e","year":null},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2309.10537","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:35dd7babd4044c9af55d86cf9abfb58fa9bc71c347402124e7f56f5e75b60d0a","observation_id":"ae437815-b30d-4f71-ab37-1ba08bbe4f93","resolution":{"observed_at":"2026-05-11T14:16:25.365557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Midjourney, 2024.https://www.midjourney.com/","venue":null,"work_id":"a700b01b-ec2b-424a-9a5f-efee7dac341c","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:24439c57dfdc17ca21beae41c0e7c385f9833fc45c9982a95f0d96c82341120f","observation_id":"0ac9f63f-b997-4a5f-86d4-481b2492225b","resolution":{"observed_at":"2026-05-11T14:16:26.776652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dall-E 3, 2024.https://openai.com/index/dall-e-3/","venue":null,"work_id":"e2c6f377-b985-4775-9c9e-8e03f08245ae","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:5a27314e258d3c2e78fb9bf217d8db5ab570630cab234f94f126dc260c323656","observation_id":"b9a4cb6f-2ddc-4641-bdf0-8484336b2e6a","resolution":{"observed_at":"2026-05-11T14:16:26.342590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11565","last_updated":"2024-05-06T16:29:15Z","snapshot_observed_at":"2026-08-10T09:52:33.176299Z","submitted_at":"2024-04-17T17:08:05Z","title":"MoA: Mixture-of-Attention for Subject-Context Disentanglement in Personalized Image Generation","version":2},"cited_work":{"arxiv_id":"2404.11565","doi":"10.48550/arxiv.2404.11565","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11565","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Daniil Ostashev, Yuwei Fang, Sergey Tulyakov, Kfir Aberman, et al","venue":"arXiv (Cornell University)","work_id":"6a1e28d3-4367-40ec-9b5a-5f7fc6b1f361","year":null},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2404.11565","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:896f364ec7791d62f1e6e1b097d544f0d4f0d24f79f9ebd03b88035e48eefe8f","observation_id":"5aff580c-4b2c-4911-ba14-a07eb89cf218","resolution":{"observed_at":"2026-05-11T14:16:25.567978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:9548803dbeca5f9c9748e665f3403ba24a0979ec9f577a6d9607bffea79c4f33","observation_id":"8e086225-2a11-4d16-b618-041cdd2f1083","resolution":{"observed_at":"2026-05-11T14:16:25.652695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12328","last_updated":"2024-05-29T11:08:41Z","snapshot_observed_at":"2026-08-08T20:21:47.806706Z","submitted_at":"2023-05-21T03:28:13Z","title":"InstructVid2Vid: Controllable Video Editing with Natural Language Instructions","version":2},"cited_work":{"arxiv_id":"2305.12328","doi":"10.48550/arxiv.2305.12328","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.12328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2310.03739 [cs.CV] Mihir Prabhudesai, Russell Mendonca, Zheyang Qin, Katerina Fragkiadaki, and Deepak Pathak","venue":"arXiv (Cornell University)","work_id":"ce62c470-4e6e-4b33-b45a-1b7eb86ac80b","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2305.12328","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:4f8a769d5ab61aaa4f1bf6bc0b8be1ec94f232486088b5bea8d45e4df07e8180","observation_id":"887b98e6-a3de-4a9f-b974-282d74b91c5b","resolution":{"observed_at":"2026-05-11T14:16:25.765970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:24:41.452344+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:24:41.452344+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15169","last_updated":"2024-01-30T16:44:20Z","snapshot_observed_at":"2026-08-03T19:40:46.693368Z","submitted_at":"2023-10-23T17:59:58Z","title":"FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling","version":3},"cited_work":{"arxiv_id":"2310.15169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.15169","snapshot_observed_at":"2026-07-10T01:46:41.165409Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling.arXiv preprint arXiv:2310.15169","venue":"cs.CV","work_id":"772f3c4a-a84d-4ec2-9735-7d4cda51575c","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2310.15169","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:77445085887d65e5e4b667af3742e7f48613570bee68c3c5c80b975bfdd045b5","observation_id":"7d6d1bbb-bfe4-4228-8b6d-3fa8cf4ca357","resolution":{"observed_at":"2026-05-11T14:16:25.800863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":"1910.02054","doi":"10.48550/arxiv.1910.02054","metadata_source":"pith","pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","venue":"cs.LG","work_id":"c5e9ad7b-c11d-43b7-b02d-c46d74a77fa9","year":2019},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:143ce49fd47ecdab577fd61b6106fe3697049d2ada9e5e15674858f2466879fd","observation_id":"53186047-57d1-4956-868e-db57d2d2864a","resolution":{"observed_at":"2026-05-16T09:24:35.924862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10708","last_updated":"2024-11-27T00:15:47Z","snapshot_observed_at":"2026-07-06T16:49:08.648847Z","submitted_at":"2023-11-17T18:58:16Z","title":"SelfEval: Leveraging the discriminative nature of generative models for evaluation","version":2},"cited_work":{"arxiv_id":"2311.10708","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10708","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SelfEval: Leveraging the discriminative nature of generative models for evaluation","venue":null,"work_id":"a2aa0a64-9570-4f8c-958d-be675f37e459","year":null},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2311.10708","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:57c102a70a240edb536cabc5b0ba625754cb18560ffc6211f13f7d9648762341","observation_id":"1a7118b6-1eb4-4633-84a3-1b4629c6c3b5","resolution":{"observed_at":"2026-05-11T14:16:25.866446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:00aef0132d70432c8100f56cf111c0f4f0d2883296b4236b93bc20f67e7b01a1","observation_id":"bb25cb3d-836f-45aa-84b9-1edcdb2a1352","resolution":{"observed_at":"2026-05-11T14:16:25.872212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:2a977f11b4a907c4587fe99379e7826ca47f0e2fbc1dfc4089719531ff6abc44","observation_id":"41a104e2-9a64-4a5a-acb8-61a944f11321","resolution":{"observed_at":"2026-05-11T14:16:25.876967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-07-06T10:33:17.427927Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":"2101.06840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2101.06840 [cs.DC]https://arxiv.org/abs/2101.06840","venue":null,"work_id":"3ed4aeb5-782f-4417-ab19-e37973a89707","year":2021},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:3a9d5ca6fd603aaa60276fc651fbf4e89f610e79ad957d92bdfaa355aa219687","observation_id":"6f09a7bd-06a9-4200-b46f-e61178dc17e7","resolution":{"observed_at":"2026-05-11T14:16:25.884336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06949","last_updated":"2024-10-16T23:55:27Z","snapshot_observed_at":"2026-08-05T18:08:09.431897Z","submitted_at":"2023-07-13T17:59:47Z","title":"HyperDreamBooth: HyperNetworks for Fast Personalization of Text-to-Image Models","version":2},"cited_work":{"arxiv_id":"2307.06949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06949","snapshot_observed_at":"2026-07-10T17:17:25.603984Z","title":"Hyperdreambooth: Hypernet- works for fast personalization of text-to-image models","venue":"cs.CV","work_id":"70917957-43b5-49dc-b56c-565d7350a92f","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2307.06949","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:326288b777156050548da17ca3de7cb1d87f0d1cc49be5b97cfb8c79138e7473","observation_id":"993aad31-2db0-44d6-a98e-2b6f38318d86","resolution":{"observed_at":"2026-05-11T14:16:25.895979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:7d81d0803b140cb39f7e44e6e3332c680b72e3c48dadc550629230f9c075fd7f","observation_id":"e166fa77-6b7b-4e61-8217-80499a309916","resolution":{"observed_at":"2026-05-11T14:16:25.901409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-10T11:35:12.111094Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":"2304.09116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-07-04T18:40:03.192889Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":"b19ab7ab-bff2-408d-a77d-b3e845d33277","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:8df4f16441b9ac86f7188780ac1df4f84930cfa58126423d81c312e63617cee1","observation_id":"0c322811-7749-48e4-bc4b-4936f82b6af3","resolution":{"observed_at":"2026-05-11T14:16:25.914341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:23c28a7f448fc2b0c269eb0d8b402c449921bb668fa75ab36439a59d427fe453","observation_id":"e2a7c3e8-d3c0-4ab9-8695-9d710bf77841","resolution":{"observed_at":"2026-05-11T14:16:25.965837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:bcf0fc149c68b6873649d8a59464f7a9d57e3742641c569f6a19f510fe380850","observation_id":"a071d6f9-bf51-46d3-b3b8-51387df54c6c","resolution":{"observed_at":"2026-05-11T14:16:25.970806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05131","last_updated":"2023-02-28T17:20:36Z","snapshot_observed_at":"2026-08-08T23:22:00.655876Z","submitted_at":"2022-05-10T19:32:20Z","title":"UL2: Unifying Language Learning Paradigms","version":3},"cited_work":{"arxiv_id":"2205.05131","doi":"10.48550/arxiv.2205.05131","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.05131","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unifying language learning paradigms.arXiv preprint arXiv:2205.05131, 2022a","venue":"arXiv (Cornell University)","work_id":"140d045f-bac6-4ab3-8d76-b527416fd007","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2205.05131","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:9f11ff0d683a585c5fccee4a6edc9e0f8eac163f19a99730a1eae289251d4b6f","observation_id":"f1062967-4a22-4856-b582-4dab59e1dc67","resolution":{"observed_at":"2026-05-11T14:16:25.979094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:c2fd2a3e099ca5b09a4d636717bea03cf3af77736c31a0f66839419a3fb7611c","observation_id":"f645beed-5c44-42e3-9c5a-88de7fa1b484","resolution":{"observed_at":"2026-05-11T14:16:18.885225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04321","last_updated":"2025-05-07T15:59:51Z","snapshot_observed_at":"2026-08-08T22:58:13.365481Z","submitted_at":"2024-06-06T17:58:11Z","title":"VidMuse: A Simple Video-to-Music Generation Framework with Long-Short-Term Modeling","version":3},"cited_work":{"arxiv_id":"2406.04321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04321","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VidMuse: A simple video-to-music generation framework with long-short-term modeling.arXiv preprint arXiv:2406.04321","venue":null,"work_id":"9df700a8-b245-4f1a-8137-940b50505154","year":null},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2406.04321","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:a940a92603a0f70965b32e3106cf2947c8ba1981cf838f74a4ba77f0f462fba1","observation_id":"9f54eb01-8fd8-4a42-9a8b-610b770f4a19","resolution":{"observed_at":"2026-05-11T14:16:26.050224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:de6ad6cf8d85cb7a014006a74275d571929ae0900c808872b613f98f7e94bc25","observation_id":"79fdecf5-0fdb-4d88-8b3c-335bfad65e33","resolution":{"observed_at":"2026-05-11T14:16:26.056021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:380643a6250b14e00a9198d44f2508efc7667eeced2917bf8ddb9cbbf7bfa903","observation_id":"c1ec0f3c-064d-4904-b008-082d18969987","resolution":{"observed_at":"2026-05-11T14:16:26.065148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":"2308.06571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-11T01:57:50.025885Z","title":"ModelScope Text-to-Video Technical Report","venue":"cs.CV","work_id":"1b1baf78-58ec-44d0-b700-84dff57b2f1f","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:81ace0754817aed149b5558fe47f195c2918f7379ebb2e429dd94dd2023bb360","observation_id":"35c5ac29-625f-4074-ba40-ac750fb6c7c7","resolution":{"observed_at":"2026-05-12T19:47:29.701736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":"2309.15103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-06-29T18:43:51.114876Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":"e26464f0-6aed-49c2-b00f-e3639b1da5b1","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:54929943f3747fa5ee267cc77b0f5b8614d62b6d740368ac1c6937f471f30305","observation_id":"bb53d8dc-8d8b-4238-93d8-991e0a4f701a","resolution":{"observed_at":"2026-05-11T14:16:26.088346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13834","last_updated":"2023-12-20T01:49:47Z","snapshot_observed_at":"2026-07-06T17:06:29.162729Z","submitted_at":"2023-12-20T01:49:47Z","title":"Fairy: Fast Parallelized Instruction-Guided Video-to-Video Synthesis","version":1},"cited_work":{"arxiv_id":"2312.13834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.13834","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fairy: Fast parallelized instruction-guided video-to-video synthesis","venue":null,"work_id":"d70bc882-0122-45dc-a654-db856de667cc","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.13834","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:632d656ecc2d648ac0c2a499860338d7527b755a4fc5eb1744e89a49286a7e75","observation_id":"2bb6ef7b-b685-4a05-b161-1c8d3ac8d042","resolution":{"observed_at":"2026-05-11T14:16:26.095848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16003","last_updated":"2023-10-24T16:56:58Z","snapshot_observed_at":"2026-08-01T15:51:11.290263Z","submitted_at":"2023-10-24T16:56:58Z","title":"CVPR 2023 Text Guided Video Editing Competition","version":1},"cited_work":{"arxiv_id":"2310.16003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.16003","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2310.16003 (2023)","venue":null,"work_id":"81510b39-7fe6-4ade-a71e-e3f97344dba9","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2310.16003","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:7963aa5dfed17817031243740d2af85ddc375b3016ec4b1df038a37f7745367c","observation_id":"03869817-10c4-4591-a028-89fdaf83f69b","resolution":{"observed_at":"2026-05-11T14:16:26.103933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-10T11:27:42.505104Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":"2310.12190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-07-04T14:59:55.949933Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"cd60d897-1a74-482c-84b4-93dfa38c1c33","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:b8963d866fb1cf84812d8defb56dd1ed4781c6743fa2513058a29c29cd748312","observation_id":"cbed8755-5703-4767-8392-ac2162c8b1b2","resolution":{"observed_at":"2026-05-11T14:16:26.115356Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":"2309.16671","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-07-04T20:50:12.667951Z","title":"Demystifying CLIP Data","venue":"cs.CV","work_id":"7af932a5-c6d2-4f55-9522-7777cc3fa5ae","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:d3ae4fecded4a8625a8687b928029a76bf6beb53c344b93de51424ec67023104","observation_id":"6a07cdce-6986-4bcd-8f44-a161a423fb90","resolution":{"observed_at":"2026-05-16T09:20:20.637207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07464","last_updated":"2025-03-11T15:57:51Z","snapshot_observed_at":"2026-08-10T02:39:03.412777Z","submitted_at":"2024-07-10T08:40:39Z","title":"Video-to-Audio Generation with Hidden Alignment","version":3},"cited_work":{"arxiv_id":"2407.07464","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07464","snapshot_observed_at":"2026-07-02T04:56:39.412382Z","title":"Video-to-audio generation with hidden alignment","venue":null,"work_id":"b5f7c0dc-77fa-4b6c-a5df-17ce10d0e870","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2407.07464","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:8c1e54ebec0dbe498efeb08439ab8ace00a2d70e9e973108e3e90aa8896286d7","observation_id":"07b7ac75-c128-441c-a497-5f555665cb84","resolution":{"observed_at":"2026-05-11T14:16:26.132308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:a96301196f4a013a43c3fdcfc577e24fabc39d64bb5a2499c5a6931d4d77c1c8","observation_id":"8cbc9df8-350b-4c85-8651-22f58ff425ba","resolution":{"observed_at":"2026-05-13T17:24:33.857072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18827","last_updated":"2023-11-30T18:59:06Z","snapshot_observed_at":"2026-08-09T15:22:42.770366Z","submitted_at":"2023-11-30T18:59:06Z","title":"Motion-Conditioned Image Animation for Video Editing","version":1},"cited_work":{"arxiv_id":"2311.18827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18827","snapshot_observed_at":"2026-07-01T22:46:19.866408Z","title":"Motion-conditioned image animation for video editing.arXiv preprint arXiv:2311.18827","venue":null,"work_id":"a6299610-4abc-4531-b4da-c424c9a186a1","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2311.18827","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:aeb8f04c783008e00985e50da2d6db03502dc9c6f7fc5006f60f9f76c7da76a6","observation_id":"145f84c5-5b18-4668-9a5b-338d7de8ca5d","resolution":{"observed_at":"2026-05-11T14:16:26.175885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17009","last_updated":"2023-12-03T12:30:05Z","snapshot_observed_at":"2026-08-10T10:45:41.326600Z","submitted_at":"2023-11-28T18:03:27Z","title":"Space-Time Diffusion Features for Zero-Shot Text-Driven Motion Transfer","version":2},"cited_work":{"arxiv_id":"2311.17009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17009","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arxiv:2311.17009 (2023) CoMoGen 19","venue":null,"work_id":"fafac8fe-1f50-472e-a2cd-51cd1f5edcf2","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2311.17009","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:9480d2efa61b0c4f8376e34f4152bcf19c5895198a7d3e30d74acc6059f53f1d","observation_id":"59064447-c7da-474e-b8cd-b9705acf7a61","resolution":{"observed_at":"2026-05-11T14:16:26.240376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2308.06721","doi":"10.48550/arxiv.2308.06721","metadata_source":"pith","pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"98e51b10-54bd-4251-8a2d-f79bd6215c19","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:1cfd99339f09c32752a62cfc89f55c5189ab926e9a42c71432bbf9dfbb5a6c19","observation_id":"51de4d56-1e0e-4dfd-8222-31d2b3940a51","resolution":{"observed_at":"2026-05-11T14:16:26.257948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":"2110.04627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-07-04T09:49:44.490632Z","title":"Vector-quantized Image Modeling with Improved VQGAN","venue":"cs.CV","work_id":"8ba56539-4766-42a4-868c-f9bef1281034","year":2021},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:5d00151045fed79c333434575c3507e77eaedac9530b35d3086c3ec0936b5432","observation_id":"7e63f620-5c23-4b22-8d79-8cb28d10a96d","resolution":{"observed_at":"2026-05-16T18:40:37.571629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:ccb455552a3d68065d4b85d1074b17928a6e361ba04961d4746142d5c218caeb","observation_id":"86105db8-b705-4c88-b1ba-c5b8893b03e3","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":"2311.04145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-07-04T14:59:56.012796Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","venue":"cs.CV","work_id":"aa5d5317-9965-4f23-ba7e-8e2941e66385","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:e9ca70b42c5117c880521f9b3a2c61e6e345cedfee7ea839cb7373bbc5240c73","observation_id":"b7633aa8-744c-4b5d-a698-2e0585f569d6","resolution":{"observed_at":"2026-05-17T23:51:24.156433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12588","last_updated":"2025-02-27T07:00:30Z","snapshot_observed_at":"2026-08-10T10:06:00.739281Z","submitted_at":"2024-08-22T17:54:21Z","title":"Real-Time Video Generation with Pyramid Attention Broadcast","version":3},"cited_work":{"arxiv_id":"2408.12588","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12588","snapshot_observed_at":"2026-07-04T08:49:41.578583Z","title":"Real-time video generation with pyramid attention broad- cast","venue":null,"work_id":"2db87de3-d572-4e25-a809-1dc376dfed60","year":2024},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2408.12588","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:74a7a60bbf009e3d989e92ca6aaa81c9e634015dd04c569f3ccce969b6d82410","observation_id":"068449c1-770e-4e67-ab01-2487027d9d06","resolution":{"observed_at":"2026-05-11T14:16:20.266812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:f5683101da2785f4eb77a3f9dfd5fe35be25493e464e653be1780d8192aa7e0d","observation_id":"8e6105ec-4847-4d40-814d-98941fcfc30b","resolution":{"observed_at":"2026-05-12T04:15:20.153254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00604","last_updated":"2022-07-19T17:17:14Z","snapshot_observed_at":"2026-08-07T05:15:16.015002Z","submitted_at":"2022-04-01T17:53:39Z","title":"Quantized GAN for Complex Music Generation from Dance Videos","version":2},"cited_work":{"arxiv_id":"2204.00604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.00604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tulyakov","venue":null,"work_id":"7ebf8ed3-24d7-47fb-a52d-3c232352b654","year":null},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2204.00604","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:8ec55b073cdceb445edc00d06f275597dc2d0a0300b54b8d84a37f386dbe1b5b","observation_id":"25ffd022-69b0-4bda-a8d1-7ba83cf4be25","resolution":{"observed_at":"2026-05-11T14:16:20.657018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hence, we include the dates on which we collected the videos from website","venue":null,"work_id":"8668d112-157e-4cb9-934a-4c7f9a9c4f1f","year":1920},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:40a351512fb80c78c76cd200ddf04142d121e165f3ed7430ca7ad29cb5eac1b6","observation_id":"8aeff77e-6c0e-4244-93af-762991a51bc6","resolution":{"observed_at":"2026-05-11T14:16:26.365134Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overall” audio quality for the Audio Quality pairwise task and the “Correctness","venue":null,"work_id":"c4f5f491-ac37-46bf-bc0d-0a74ca576d4b","year":1920},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:289f1f488d1358a90d82d163458d243a96fb820f2184aa4befbabb397c9d9190","observation_id":"ce07aaf1-b868-4697-8855-0a28d4439aa8","resolution":{"observed_at":"2026-05-11T14:16:26.524980Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":2,"metadata_mismatch":16,"parse_uncertain":0,"unresolved":0,"verified_exact":66,"verified_fuzzy":4},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 100 inbound Pith citation observations for arXiv:2410.13720."}