{"as_of":"2026-08-05T18:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b05417f434f8226d95ef2fb72dab6ef813f8c123f6b842c772d6c9a27a4e478","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T07:41:58.617477Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":596,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:34:26.112442Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T21:45:35.754742Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2401.03048"},"observation_digest":"sha256:1814901354abf121f223cb3206bee26ac71221089b5f3471d3490ff8213b411d","observation_id":"84700953-d876-43b1-94a6-2d095bb6f923","resolution":{"observed_at":"2026-05-13T21:45:35.793876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2405.14430","last_updated":"2025-12-03T10:59:23Z","snapshot_observed_at":"2026-08-04T10:57:26.733885Z","submitted_at":"2024-05-23T11:00:07Z","title":"PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-24T01:17:11.261301Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2405.14430"},"observation_digest":"sha256:b8c852422687fb980082180397d606e4aabfff01838c64970c1c61752d9fff83","observation_id":"9e7fac36-4113-4dfd-9c5c-7b332578cd53","resolution":{"observed_at":"2026-05-24T01:18:42.366516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T10:36:12.058970Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2501.00103"},"observation_digest":"sha256:28644d290c9f558426016ac9f62580597984d21882b1ac75d2bd9f7a67a2b8e7","observation_id":"79c0bd49-a129-4041-a8c3-c95a5db26552","resolution":{"observed_at":"2026-05-11T10:36:12.260358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:222a577bb5d0827dd5b1fc6ec6a2033ea3f584f55d09851c4038763d5139fb87","observation_id":"75c603e5-8230-4bf1-8e31-a2bfc1722210","resolution":{"observed_at":"2026-05-10T23:38:45.615723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2501.12202","last_updated":"2026-05-14T15:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-21T15:16:54Z","title":"Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T04:53:58.465445Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2501.12202"},"observation_digest":"sha256:8badbec59b9e67162d3e2563d86bfe4aa4341031387f9d7f2f7931613ff1d7ad","observation_id":"89f803ed-4b2d-4538-bb4c-7480acaa1ffd","resolution":{"observed_at":"2026-05-23T04:55:24.895404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T15:30:02.578430Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2501.13918"},"observation_digest":"sha256:0446951a20eafa0ee227677e16ce35b61d2c9582d93cc7d1f4bf83b19ccb75de","observation_id":"d66e9e1c-1e90-4a2a-95eb-9a9db11f5dd8","resolution":{"observed_at":"2026-05-13T15:30:02.704365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-16T12:00:14.672729Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2502.06764"},"observation_digest":"sha256:067408cac397b441760accc38cca68c85e29be000c57e0a8fb0f0491974b2154","observation_id":"ad71c6a6-74c2-4721-a295-821ec4004ad1","resolution":{"observed_at":"2026-05-16T12:00:14.744304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:73bf98753fdea98868682c5a81132a6be272f5463096d07cd0bde6726b3f8c5d","observation_id":"ce52b633-263e-4d43-b961-5582384821aa","resolution":{"observed_at":"2026-05-19T08:02:23.931507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T00:53:53.855965Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2503.07598"},"observation_digest":"sha256:fbf790ed770f4aecdd93ac8a3936e372576039d95597782dc422b5503a707e4a","observation_id":"e29feea0-d941-44e2-b3b8-ec7206d553f7","resolution":{"observed_at":"2026-05-16T00:53:53.940174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T23:05:17.201790Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2503.19325"},"observation_digest":"sha256:08bd6e7b116a3ab04e6d18cade079d0f2e3781c6f3f7d9cd50073177bf599321","observation_id":"134fbd94-6400-4bfa-99eb-84289c2fb8b7","resolution":{"observed_at":"2026-05-16T23:05:17.255739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:6caf35aef7c897cf4b866f4e689184f9e6121c4da25734f4002b0a7bb4837cd7","observation_id":"c245c804-1333-4874-890a-9798ce7c57da","resolution":{"observed_at":"2026-05-22T23:07:14.392735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T18:56:39.735334Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2504.17180"},"observation_digest":"sha256:2470840a7ae50ac5b350dbbd003450c8eaa1f6fbf1ed20e678ea33ae5518b5bd","observation_id":"6ddd7a80-58c8-4ad5-bfff-70d90d25a405","resolution":{"observed_at":"2026-05-22T18:56:58.336898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T14:36:41.467429Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2504.17761"},"observation_digest":"sha256:6cdceccea0df181803bbad4f33529c023644bb43e6271dd562c5003ab6b707e7","observation_id":"2c569132-841d-466c-8002-09f7ccb4f6b0","resolution":{"observed_at":"2026-05-11T14:36:41.658854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T18:45:16.641012Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.05470"},"observation_digest":"sha256:7b3beeec9f2773b1f42b2e3f27601da1ace114cd5bd48cb888260c092b686686","observation_id":"f31e647e-fd2d-4bac-8514-6a3729d1e7e9","resolution":{"observed_at":"2026-05-11T18:45:16.868292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T22:28:24.929046Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.07818"},"observation_digest":"sha256:ced033c1972459b1deef7e6b25aebe533cbaaeff96b90bec928c82649eec2b57","observation_id":"3ab6331c-aa81-4c44-b3ef-d421b22191e2","resolution":{"observed_at":"2026-05-11T22:28:26.762461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T23:50:45.332466Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.12705"},"observation_digest":"sha256:53c72c54969ee625c6bd895297277c200d9067b0b6918c61bb5441d4f5b454bb","observation_id":"b174ec06-e8f6-40a6-b3b1-1ed888a51823","resolution":{"observed_at":"2026-05-15T23:50:45.447431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T20:31:15.700943Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.13211"},"observation_digest":"sha256:2c390dac8442cb5c14f425d3e4dd384691227cf702549630e5553c7ec842a7ae","observation_id":"f65506e8-04b8-4284-85d3-668d7cecf64a","resolution":{"observed_at":"2026-05-13T20:31:15.805001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:87377a33acfb0c483158a6df67c1d6c715efbc58136306a29795474520bd7a30","observation_id":"43fc7807-9237-4cae-b9f5-66485888a76e","resolution":{"observed_at":"2026-05-17T03:46:06.227621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2505.18875","last_updated":"2026-05-06T23:08:29Z","snapshot_observed_at":"2026-08-02T05:41:40.015287Z","submitted_at":"2025-05-24T21:30:29Z","title":"Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T12:31:11.886858Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.18875"},"observation_digest":"sha256:bb2924fbac6e16a06ea484e604679059800b6fd8043f5483acddc9ccbbb81ecf","observation_id":"2537f70f-da02-4681-bfd4-6bbaeb52fb21","resolution":{"observed_at":"2026-05-19T12:32:17.794853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T01:36:53.029590Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.08009"},"observation_digest":"sha256:73fb62790fd82e56f9135f2775674d5038f8d4377536474dbc7742d6251b9331","observation_id":"611dfa89-06ed-4ec1-ab3c-c1103e286331","resolution":{"observed_at":"2026-05-11T01:36:53.103420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T12:09:56.836351Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.09113"},"observation_digest":"sha256:a1712a24795aad2afe0c27d74bd423aeb6188edba3029b30ba0ad1dc77935515","observation_id":"f286e790-868a-4b31-baf7-0838d7eb9f09","resolution":{"observed_at":"2026-05-11T12:09:57.514485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2506.22832","last_updated":"2026-04-09T11:44:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-28T09:53:17Z","title":"Listener-Rewarded Thinking in VLMs for Image Preferences","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T07:38:52.273903Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.22832"},"observation_digest":"sha256:a434749682e32d22ba9dfe468059269b967c9aad6e49e4189dba938823d18e5e","observation_id":"753aaacc-db8e-416a-b1e3-8f9fd9bb2c10","resolution":{"observed_at":"2026-05-19T07:42:09.222937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:c6db24aa3116bb76c4356fd259c399cce43d1273c08f8d7943f86c099cc102ce","observation_id":"761f4169-abc1-442e-b9b1-f9172730d5af","resolution":{"observed_at":"2026-05-19T08:02:10.298464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-19T05:13:28.767788Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.07982"},"observation_digest":"sha256:0587e61e53f34edf48bb12129c1051da830d41c8a88c331cccea634b0918676a","observation_id":"8cef9893-fe22-4c92-961b-232a7f7931b9","resolution":{"observed_at":"2026-05-19T05:17:06.748987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T09:54:28.271928Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.12898"},"observation_digest":"sha256:504b4e2e1b649602c9ec5fc01aed3c31ed53dd1bca04df8b20b610cfce5ba6e4","observation_id":"309ec80c-d386-427c-9532-5799d2598f39","resolution":{"observed_at":"2026-05-16T09:54:28.298405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T14:29:06.883874Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.02324"},"observation_digest":"sha256:90166be2b512eba1ac7bb7905b8ba12f41f77eea7838261208dee38223eeeb92","observation_id":"f1905e0f-6e67-447a-9a6d-271ff85b10a5","resolution":{"observed_at":"2026-05-10T14:29:06.998061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T22:36:31.044743Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.13009"},"observation_digest":"sha256:c22de030ea2075d8ccdfdcc46bc9dc6383e7749d5ebaeedd131135ffa09dc07f","observation_id":"a9ff98aa-1958-41dd-b0bf-798a44317501","resolution":{"observed_at":"2026-05-18T22:36:53.228732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T18:34:26.112442Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14465","last_updated":"2025-08-20T06:40:34Z","snapshot_observed_at":"2026-08-05T18:33:48.716624Z","submitted_at":"2025-08-20T06:40:34Z","title":"DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T18:34:26.112442Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.14465"},"observation_digest":"sha256:6d0b469953be62fc5be30877129e4ced7349df4d95cbaca6f2d72522e216a021","observation_id":"4b48f66b-ec26-48ce-b7f0-4c5e09c2b47e","resolution":{"observed_at":"2026-08-05T18:34:26.112442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T17:45:16.523471Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:16.523471Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.15761"},"observation_digest":"sha256:7f618272a19bf409a85bdfc640e44193d5a8078fcb0fa1a60baf3ff023f0e57f","observation_id":"9c3efc15-a793-4aea-914f-7e338b8d88e8","resolution":{"observed_at":"2026-08-05T17:45:16.523471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T17:46:34.618756Z","title":"Hunyuanvideo: A systematic framework for large video generative models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.15774","last_updated":"2025-08-21T17:59:57Z","snapshot_observed_at":"2026-08-05T17:46:31.112694Z","submitted_at":"2025-08-21T17:59:57Z","title":"CineScale: Free Lunch in High-Resolution Cinematic Visual Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:46:34.618756Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.15774"},"observation_digest":"sha256:c49d92639c9265c5f28a8859b3ddba15735f83280fb921260bd2b04d2a6aedb3","observation_id":"6acc98cf-eb0c-4040-8cb9-bb7745ed377c","resolution":{"observed_at":"2026-08-05T17:46:34.618756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2508.17588","last_updated":"2026-05-14T09:03:20Z","snapshot_observed_at":"2026-07-06T22:17:57.808775Z","submitted_at":"2025-08-25T01:22:15Z","title":"HERO: Hierarchical Extrapolation and Refresh for Efficient World Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T22:10:16.645510Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.17588"},"observation_digest":"sha256:1ff25b3883c7e43b7a855d281a5cda19b3ce3f63565afcc08ad057197e134bd7","observation_id":"aa3dac1f-fb0c-4b63-b8fb-ecd279bfcce3","resolution":{"observed_at":"2026-05-18T22:11:52.834147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T16:32:30.841102Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18271","last_updated":"2026-05-27T17:09:12Z","snapshot_observed_at":"2026-08-05T16:32:05.772456Z","submitted_at":"2025-08-25T17:59:40Z","title":"ObjFiller3D: Scaling 3D Object Inpainting to Dense Multi-View Consistency","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:30.841102Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.18271"},"observation_digest":"sha256:220096b83e65d4bc2446e2bff1ba5bd2ea23a0fc94f38aac071d618ef9059ae9","observation_id":"b0133e61-3f1b-41b0-869b-5c97632f62cc","resolution":{"observed_at":"2026-08-05T16:32:30.841102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T16:24:58.824740Z","title":"Hui Li, Mingwang Xu, Yun Zhan, Shan Mu, Jiaye Li, Kaihui Cheng, Yuxuan Chen, Tan Chen, Mao Ye, Jingdong Wang, and Siyu Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-05T16:24:58.284739Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.824740Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:98d4f9c5ac94cb3d3532f1b5e9575150ca24795402e91e656cc7567167601452","observation_id":"7fb76f94-98a9-4e52-b57a-a60ac840fe62","resolution":{"observed_at":"2026-08-05T16:24:58.824740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T14:42:22.264641Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21016","last_updated":"2025-08-28T17:18:31Z","snapshot_observed_at":"2026-08-05T14:42:03.148900Z","submitted_at":"2025-08-28T17:18:31Z","title":"Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T14:42:22.264641Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.21016"},"observation_digest":"sha256:8d1997917a147fa8f15cb948ed152db94d4147f7077be0fc7757764d0be6ad55","observation_id":"2e1a7866-4c6d-4c1a-90a4-0b68584b0c53","resolution":{"observed_at":"2026-08-05T14:42:22.264641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T12:42:40.545632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01362","last_updated":"2025-09-01T11:03:13Z","snapshot_observed_at":"2026-08-05T12:42:39.136561Z","submitted_at":"2025-09-01T11:03:13Z","title":"Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:42:40.545632Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.01362"},"observation_digest":"sha256:4c66ea0c52b3361395a279e242edb83385273a63ef40e8fbb7b9218369f3959d","observation_id":"e79f3ce6-b458-4db6-a974-3be0c80eac10","resolution":{"observed_at":"2026-08-05T12:42:40.545632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T00:05:46.492137Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:46.492137Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:d338f9d05e52d2b62be0fc6a01cc97ddf82c035943f865ab3db02abb980ba72b","observation_id":"1750f22e-10b1-440f-a70b-d49a49f0a5d5","resolution":{"observed_at":"2026-08-05T00:05:46.492137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T20:35:30.290001Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-04T20:35:29.456194Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.290001Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:7da64a0bade9c7855520ae52bdebe0528a9ae071c889911bf8f2a902b45cd811","observation_id":"e02591c5-48db-4050-9bf1-7b32005ecb64","resolution":{"observed_at":"2026-08-04T20:35:30.290001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T20:08:57.666163Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08826","last_updated":"2025-09-10T17:59:31Z","snapshot_observed_at":"2026-08-04T20:08:51.890283Z","submitted_at":"2025-09-10T17:59:31Z","title":"RewardDance: Reward Scaling in Visual Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:08:57.666163Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.08826"},"observation_digest":"sha256:5d1513ca27ae19c2a71bdcf2cf61dac7a9f1ae5a8820b80eb0966ba1e7d7e405","observation_id":"836d2260-1b27-41f8-82c9-82b7380589d3","resolution":{"observed_at":"2026-08-04T20:08:57.666163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":257,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:2f9cdbee6b440c88adff83b3ad32c33158c4e6d91861e7dfe6a1f4e4c09b3932","observation_id":"e0f7e400-8ebc-4ee8-9383-21a235fa7205","resolution":{"observed_at":"2026-05-18T00:02:24.647347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T18:58:10.939891Z","title":"arXiv preprint arXiv:2412.03603","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-04T18:58:10.341082Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.939891Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:fc4bb84a28b8d2415917d3a10901775984c0ae5410838aebe1bd54bb62c9cad4","observation_id":"a74e50d2-734c-49bc-bfd3-f7faa0312de4","resolution":{"observed_at":"2026-08-04T18:58:10.939891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T16:07:02.039951Z","title":"Hunyuan- video: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.16518","last_updated":"2026-06-04T19:42:40Z","snapshot_observed_at":"2026-08-04T16:06:57.570070Z","submitted_at":"2025-09-20T03:48:32Z","title":"FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:02.039951Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.16518"},"observation_digest":"sha256:33e6c639ed7c4300e08f86c8c015c3396746d9b06fefe85137513d4e339c0681","observation_id":"1299a658-34d4-4a53-b674-62e4a1b9e299","resolution":{"observed_at":"2026-08-04T16:07:02.039951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T15:57:09.017436Z","title":"Hunyuanvideo: A sys- tematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.17773","last_updated":"2026-06-24T02:44:22Z","snapshot_observed_at":"2026-08-04T15:57:08.080783Z","submitted_at":"2025-09-22T13:37:37Z","title":"LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T15:57:09.017436Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.17773"},"observation_digest":"sha256:74bd74417215c67eafe1f1f016391cfdeea0c9acf6617fc13a13c99398f51052","observation_id":"629a8416-51ca-4dbd-9cea-206891ce50cc","resolution":{"observed_at":"2026-08-04T15:57:09.017436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2509.20360","last_updated":"2026-04-18T01:38:10Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:30Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T13:46:05.547669Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.20360"},"observation_digest":"sha256:193d3e6aa065ca735dca19ad84de6ba77a39a426338fc565f32d5482adfeac0f","observation_id":"7b6498c4-3adb-49cd-b5c3-b290dfe548ab","resolution":{"observed_at":"2026-05-18T13:46:25.831875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-15T03:52:59.287555Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.22622"},"observation_digest":"sha256:2e9fc6ca48243d204dcb7b5128540c7a963d8196dc72669d9646e6651b24f483","observation_id":"faad3cd3-396f-4c35-9273-fb1519a9133d","resolution":{"observed_at":"2026-05-15T03:52:59.529743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2509.23800","last_updated":"2026-05-13T11:18:10Z","snapshot_observed_at":"2026-07-31T08:36:15.249566Z","submitted_at":"2025-09-28T10:50:06Z","title":"Sample-Efficient Optimisation over the Outputs of Generative Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T12:58:33.173828Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.23800"},"observation_digest":"sha256:ab9aeeb399a9867ea93fff00dc06227726e888e376773e07b0908f2e6941cd3d","observation_id":"ceb4ec91-c080-4fa6-aeea-b787520464a3","resolution":{"observed_at":"2026-05-18T13:01:23.721555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T02:02:32.806844Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.23951"},"observation_digest":"sha256:86dab36d9d05b0edbaf8553e26800620270d4fcf93c16c074e513e9263adf403","observation_id":"ed7604c9-d1f4-43a2-81a7-e1817c14df89","resolution":{"observed_at":"2026-05-16T02:02:32.847972Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T14:42:14.426058Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T14:42:14.426058Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.23951"},"observation_digest":"sha256:cd4513dc4187df7f2a3c447d21427646c2d1030143b68f32b02c2bbdc06358a5","observation_id":"86f357cf-c9ff-4caf-82dc-612523d9f1cb","resolution":{"observed_at":"2026-08-04T14:42:14.426058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2509.23980","last_updated":"2026-04-28T18:02:49Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-28T17:08:51Z","title":"Towards Redundancy Reduction in Diffusion Models for Efficient Video Super-Resolution","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T11:47:22.725217Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.23980"},"observation_digest":"sha256:1ef1b7b81064ebc19665b520c2a2eecf4f9dd3072b181e6adc6d4d588877279c","observation_id":"f647d21b-fc35-4af8-a8c0-5cc8cf6368a5","resolution":{"observed_at":"2026-05-18T11:51:20.383078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-16T11:15:29.102090Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.25161"},"observation_digest":"sha256:245ea0dd071fe9d11e320d1340ac18d951188508b42b20795fc0e09cb5848563","observation_id":"d79cef52-2b7c-426b-895c-43e038b7b525","resolution":{"observed_at":"2026-05-16T11:15:29.145086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-04T22:22:45.362136Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:50c01fd7f4f5e3fb7da312895988b08bb4ec2a1888ff57e408b5ce835e2d895a","observation_id":"9a20bef6-f011-4a87-b2a5-9ca7114d999f","resolution":{"observed_at":"2026-05-17T01:03:15.244132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-02T07:40:05.046770Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T22:39:53.995700Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.02283"},"observation_digest":"sha256:897826022d87151596fbbaabacdd8fcc42a281617350bc24be6b22b622a20166","observation_id":"6d82c558-2ac6-4f03-894e-078c41c0b990","resolution":{"observed_at":"2026-05-15T22:39:54.070210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T12:38:59.460371Z","title":"Shuchen Weng, Haojie Zheng, Zheng Chang, Si Li, Boxin Shi, and Xinlong Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-04T12:38:54.877124Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.460371Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:392dc7063193e28d411224af564bb86f57cfd98c780d66e92d9cf580842285f1","observation_id":"d0ec8403-afbd-4bd5-8376-38d561ef2c3f","resolution":{"observed_at":"2026-08-04T12:38:59.460371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T10:49:48.115320Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-04T10:49:46.339959Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:49:48.115320Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.08377"},"observation_digest":"sha256:3f2f2839d07931ad965c4b2ef57b9b20fe24add67fd5ed2283523c5f11bc4f08","observation_id":"cbe1dc13-452b-4167-b290-dd39e60f4179","resolution":{"observed_at":"2026-08-04T10:49:48.115320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T10:45:58.886091Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08555","last_updated":"2026-05-27T13:14:12Z","snapshot_observed_at":"2026-08-04T15:58:21.664751Z","submitted_at":"2025-10-09T17:58:59Z","title":"VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:45:58.886091Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.08555"},"observation_digest":"sha256:63220f2f6866e3dc57613c1605ffb8dbb866005567a52632fb310ad191c8f712","observation_id":"0f3d864e-139b-49dd-afe5-816e2fd1a42a","resolution":{"observed_at":"2026-08-04T10:45:58.886091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T10:44:09.131224Z","title":"Chun-Mao Lai, Hsiang-Chun Wang, Ping-Chun Hsieh, Frank Wang, Min-Hung Chen, and Shao-Hua Sun","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09222","last_updated":"2026-06-01T11:49:06Z","snapshot_observed_at":"2026-08-04T10:44:01.525320Z","submitted_at":"2025-10-10T10:08:10Z","title":"FM-IRL: Flow-Matching for Reward Modeling and Policy Regularization in Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:44:09.131224Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.09222"},"observation_digest":"sha256:275c988912613ed32c39ec5c3b8b9a8cdbca03d359847f451b9209b9754b8ab2","observation_id":"597b68e7-fdc0-455f-8f3a-978c4e3c6503","resolution":{"observed_at":"2026-08-04T10:44:09.131224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2510.17991","last_updated":"2026-05-21T08:36:29Z","snapshot_observed_at":"2026-07-30T04:57:19.929589Z","submitted_at":"2025-10-20T18:11:29Z","title":"Demystifying Transition Matching: When and Why It Can Beat Flow Matching","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T13:27:09.343975Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.17991"},"observation_digest":"sha256:92d9f7d82be6088f886f9d97d3435bc454537dc3f91dc15318f4e925e8b639a8","observation_id":"ee0587aa-c9b9-464c-afcd-dfaf06f68c69","resolution":{"observed_at":"2026-05-22T13:31:36.530182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T08:57:10.411369Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18313","last_updated":"2026-06-29T02:20:45Z","snapshot_observed_at":"2026-08-04T08:57:04.106391Z","submitted_at":"2025-10-21T05:49:01Z","title":"OmniNWM: Omniscient Driving Navigation World Models","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T08:57:10.411369Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.18313"},"observation_digest":"sha256:9c50ed5215f6af34dccde080b4b82b461d1cf4999710abac3355f992940a7566","observation_id":"1cbaa0e5-0270-4eb1-95a2-5f66c6f04b5a","resolution":{"observed_at":"2026-08-04T08:57:10.411369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2510.20206","last_updated":"2026-05-14T08:53:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-23T04:45:09Z","title":"RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:13:42.934115Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.20206"},"observation_digest":"sha256:6a032d3f0811fd5749043adc142701bae20bf5d9057545e572ab6db596b1b477","observation_id":"f08137bb-858b-4c51-b4aa-feaf40f2d22e","resolution":{"observed_at":"2026-05-18T05:15:54.504794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T08:20:08.446380Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.21615","last_updated":"2026-06-17T16:22:08Z","snapshot_observed_at":"2026-08-04T08:20:06.021700Z","submitted_at":"2025-10-24T16:21:37Z","title":"Epipolar Geometry Improves Video Generation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T08:20:08.446380Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.21615"},"observation_digest":"sha256:cc57c33f0bd6ae80db83c6bdce33aef226815459bec56dc3f32a0e82061d464c","observation_id":"62294a1f-e490-429a-80c0-87f0bf0a9a53","resolution":{"observed_at":"2026-08-04T08:20:08.446380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2510.24718","last_updated":"2026-04-09T20:07:12Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T17:59:58Z","title":"Generative View Stitching","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T02:53:03.898500Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2510.24718"},"observation_digest":"sha256:a1092cf7b63aec0ba0e9af3d937fff20db64db0d7f700b8346e5854602eb396f","observation_id":"9254576b-b5d8-4ea8-a881-8fe662e59d44","resolution":{"observed_at":"2026-05-18T02:55:46.631739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b59e24ea91e15023c26786a05118a01e166a396ddd167debe09e36607aa66f74","observation_id":"665fad89-9f5f-469c-a9e5-a035537641f5","resolution":{"observed_at":"2026-05-12T23:01:13.624574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:31f773ba3e1cddde0d2bee278ba3a50e5778270eb152cec64373e1f4e1efe3f3","observation_id":"33abd66d-501a-4660-9dca-bb67f03953cf","resolution":{"observed_at":"2026-05-18T00:55:35.113178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T23:27:48.846912Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05865","last_updated":"2026-07-21T17:59:41Z","snapshot_observed_at":"2026-08-05T16:39:10.329347Z","submitted_at":"2025-11-08T05:38:18Z","title":"CGCE: Classifier-Guided Concept Erasure in Generative Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T23:27:48.846912Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.05865"},"observation_digest":"sha256:9492ae16964303f259ed0e621d87802e1da387a750c3ddf58088ff041634e511","observation_id":"6b19ba5a-aac7-4f23-9844-69623a89d02d","resolution":{"observed_at":"2026-08-03T23:27:48.846912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T22:12:43.829418Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12035","last_updated":"2026-07-21T06:26:07Z","snapshot_observed_at":"2026-08-05T14:57:18.691563Z","submitted_at":"2025-11-15T05:07:31Z","title":"Timeripple: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T22:12:43.829418Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.12035"},"observation_digest":"sha256:c4e96e00b14f56ebe50734a23b6f53440b3400c6fd37cfab82fc6393ef51e390","observation_id":"50d456e2-f19e-402d-934e-b5c4cc5a3a59","resolution":{"observed_at":"2026-08-03T22:12:43.829418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T21:01:08.144786Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.17185","last_updated":"2026-05-29T08:17:11Z","snapshot_observed_at":"2026-08-03T21:01:05.108421Z","submitted_at":"2025-11-21T12:05:46Z","title":"PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:01:08.144786Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.17185"},"observation_digest":"sha256:5b0aaeadcbb40c7997e5eae77df9bc0470f601ea5e8ba8d9159911403c50bb19","observation_id":"3ad9ba29-fd5d-4b66-9abd-9d67ea5f28ae","resolution":{"observed_at":"2026-08-03T21:01:08.144786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.17844","last_updated":"2026-04-08T06:05:56Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-21T23:41:19Z","title":"Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T19:54:35.190865Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.17844"},"observation_digest":"sha256:e76787138d2da8d822139a878b840def8107c4d1d0f59bfe02976a903717506a","observation_id":"ace2c002-f65f-4b86-93ff-17534c32308f","resolution":{"observed_at":"2026-05-17T19:55:09.960106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T02:31:34.927101Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.18870"},"observation_digest":"sha256:de4b026818cad5e9e8fbb4c3c9de0b80337be65eebdb21795a48e4a3116f6c94","observation_id":"2822162d-e4c3-4759-a83f-4f402d5bb595","resolution":{"observed_at":"2026-05-15T02:31:35.082213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.19320","last_updated":"2026-05-18T02:38:41Z","snapshot_observed_at":"2026-08-02T10:22:49.004993Z","submitted_at":"2025-11-24T17:15:55Z","title":"SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T18:21:08.172735Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.19320"},"observation_digest":"sha256:b0d94693837c756c35d6c3aa4b1f1997229ca2c6812160ed447bd7bd060b8da9","observation_id":"d3d85427-7f60-48d7-82cd-40bc2d32a586","resolution":{"observed_at":"2026-05-21T18:24:18.309415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T20:36:06.225043Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-03T20:36:00.140753Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.225043Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:940d6486c2071d3d41ed05aa76cb6aaac00389e33aa6b9d400c30772fdf94a3a","observation_id":"dfe3484d-e872-494c-8a88-fb3fa698eb21","resolution":{"observed_at":"2026-08-03T20:36:06.225043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T20:23:55.200351Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20295","last_updated":"2026-05-31T10:05:38Z","snapshot_observed_at":"2026-08-03T20:23:50.496384Z","submitted_at":"2025-11-25T13:31:30Z","title":"Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:55.200351Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.20295"},"observation_digest":"sha256:30c98f8f6e1604fd4c6be7eaf166afe8f46bb11cdc27d13c53e863475b834019","observation_id":"79ca9d28-9f9c-48b2-b3d3-ea0458dc9a7c","resolution":{"observed_at":"2026-08-03T20:23:55.200351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T06:47:05.784126Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-05T17:22:52.986519Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:05.784126Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:97924c5c0665374ca245530c8e7563801eab0fde4f6e4db77abef890ec33df17","observation_id":"bef57812-93d2-4e07-a8cf-e4998f49a69b","resolution":{"observed_at":"2026-08-04T06:47:05.784126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T19:54:48.562703Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22098","last_updated":"2026-07-16T03:47:27Z","snapshot_observed_at":"2026-08-03T19:54:46.253087Z","submitted_at":"2025-11-27T04:40:37Z","title":"WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T19:54:48.562703Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.22098"},"observation_digest":"sha256:f246a1429017a6a12e50db5b461be88ad8c28585586942b85f8dce30d77278b9","observation_id":"f96a9cb3-76d4-475d-b607-ed08ad924797","resolution":{"observed_at":"2026-08-03T19:54:48.562703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.22940","last_updated":"2026-05-19T15:28:34Z","snapshot_observed_at":"2026-08-02T05:15:20.627790Z","submitted_at":"2025-11-28T07:30:10Z","title":"One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T18:25:22.486891Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.22940"},"observation_digest":"sha256:4ee46d8392ef927fff158410498ef510d2f65a6decf67f580e1d479b4d6e36c7","observation_id":"e2fbe6af-36b9-4237-9bef-baa4124df15c","resolution":{"observed_at":"2026-05-21T18:25:28.343463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T19:11:49.466700Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01803","last_updated":"2026-07-09T15:41:25Z","snapshot_observed_at":"2026-08-05T17:52:52.660599Z","submitted_at":"2025-12-01T15:36:33Z","title":"Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:49.466700Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.01803"},"observation_digest":"sha256:b5e83f88a7bfc724216e4af2917a1f08fb008ee5d22bbb2afab6b838f7442806","observation_id":"3419c7af-9678-46fd-a89a-f333b3941dd7","resolution":{"observed_at":"2026-08-03T19:11:49.466700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.01843","last_updated":"2026-05-18T11:10:13Z","snapshot_observed_at":"2026-07-06T22:37:26.652349Z","submitted_at":"2025-12-01T16:28:13Z","title":"PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T17:57:57.263574Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.01843"},"observation_digest":"sha256:6ddc4895b1678cac7801cc527b1ff97850f7d820001bc6a8d11fc4945c4bad34","observation_id":"4fa19502-a264-4a5f-874b-17340f71bcf9","resolution":{"observed_at":"2026-05-21T18:00:27.297144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T18:13:44.802747Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:d9a5e3ddba96302d97bc9d65529e65b1ae1d66cb870e8feab1af715db5be4399","observation_id":"f04f5eee-251a-4dd1-a099-a025906e6801","resolution":{"observed_at":"2026-05-17T01:58:51.454329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T18:39:41.373827Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T18:13:44.802747Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.373827Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:355dba42653d9e2869701c3b68ff768cfa2aaac0d5c581eab51df4e49cc86634","observation_id":"abc910a8-b0b3-480e-828e-57e52457be0a","resolution":{"observed_at":"2026-08-03T18:39:41.373827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T18:17:54.943863Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.04678"},"observation_digest":"sha256:741d6f7156eda5de966356e0a28fd83e9cde9cdc8ba395f9e7c72e534c1710c8","observation_id":"ee29985e-7d6e-4b31-93ed-5d24e60c9a78","resolution":{"observed_at":"2026-05-16T18:17:55.181751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.05564","last_updated":"2026-04-12T02:52:57Z","snapshot_observed_at":"2026-07-06T22:37:50.431948Z","submitted_at":"2025-12-05T09:39:26Z","title":"ProPhy: Progressive Physical Alignment for Dynamic World Simulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T01:05:08.087136Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.05564"},"observation_digest":"sha256:df2616c6873888c50ef7cfe54529ca0f73d0559b395709a973cd5e0405a6ff67","observation_id":"00edf025-6713-4902-a718-aa54e6d3ab5a","resolution":{"observed_at":"2026-05-17T01:08:47.993615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T18:26:34.119227Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05672","last_updated":"2026-07-06T07:23:46Z","snapshot_observed_at":"2026-08-04T17:03:44.669117Z","submitted_at":"2025-12-05T12:31:09Z","title":"InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:26:34.119227Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.05672"},"observation_digest":"sha256:b9acbc772d9795267bd34c2c58c7c279510f136efe5cbbc567f6040991806a48","observation_id":"9fd97775-b1cd-4578-bad0-c80f1a3e7aff","resolution":{"observed_at":"2026-08-03T18:26:34.119227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T18:09:49.547789Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06628","last_updated":"2026-07-05T11:17:31Z","snapshot_observed_at":"2026-08-03T18:09:44.634080Z","submitted_at":"2025-12-07T02:28:06Z","title":"MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:09:49.547789Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.06628"},"observation_digest":"sha256:5333537fa577865126634a5a07d18062b3f7972e4231612ec928b2be479a648d","observation_id":"ea62bf59-d49e-45b8-b50f-5c7fbf00fdb6","resolution":{"observed_at":"2026-08-03T18:09:49.547789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:2e22b1c443deb2d944b133ef7589156e642d1013c3f601d4acfaa8416f88d67b","observation_id":"93f590a6-4fe2-488f-b5eb-3577149b11c0","resolution":{"observed_at":"2026-05-17T00:08:43.104090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.09646","last_updated":"2026-04-08T15:03:02Z","snapshot_observed_at":"2026-08-03T08:11:41.374378Z","submitted_at":"2025-12-10T13:40:24Z","title":"VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T23:30:14.969895Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.09646"},"observation_digest":"sha256:5c0fb9157b16a85ba0d5969bed2ac407597889e04e0a38c204d4a5ef64bd8518","observation_id":"bdf091f5-c608-45e1-9cae-fd84df69a343","resolution":{"observed_at":"2026-05-16T23:31:21.971293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.10571","last_updated":"2026-05-02T11:27:08Z","snapshot_observed_at":"2026-07-31T11:34:00.884185Z","submitted_at":"2025-12-11T11:58:53Z","title":"AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T23:26:21.855485Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.10571"},"observation_digest":"sha256:4d0ea497fba7d2dce522852500d4bbaf0ea28090e08f7deeb05222de3c795a94","observation_id":"55361951-6ae8-4684-b1f0-7dbecfdc3109","resolution":{"observed_at":"2026-05-16T23:28:40.788123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T19:59:06.214617Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11815","last_updated":"2026-05-23T23:07:49Z","snapshot_observed_at":"2026-08-03T19:58:58.153442Z","submitted_at":"2025-11-26T18:59:43Z","title":"Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T19:59:06.214617Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.11815"},"observation_digest":"sha256:9092f13da6d061f57c13cd0aee434dbfdd2b2788525cad0a4d4ef255afc2d02a","observation_id":"d86a5b82-9294-4adf-aaa8-c2705b28c545","resolution":{"observed_at":"2026-08-03T19:59:06.214617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.12598","last_updated":"2026-05-18T03:43:51Z","snapshot_observed_at":"2026-08-02T05:49:44.908815Z","submitted_at":"2025-12-14T08:35:04Z","title":"Setting the Stage: Text-Driven Scene-Consistent Image Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T17:40:25.779794Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.12598"},"observation_digest":"sha256:27434ec41e280ce6a9c885784f5cd40177b74ab440005703b8e2c4da125ba178","observation_id":"31881e81-69eb-4538-ae80-d1fe6afc964d","resolution":{"observed_at":"2026-05-21T17:44:17.307598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T16:30:35.074851Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-03T16:30:30.727629Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.074851Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:8ec45401dca5ddefd5085990895cfa5418fa702490368da39cabdec90367e031","observation_id":"808651a2-bde0-4c82-9029-654d3ead2f1b","resolution":{"observed_at":"2026-08-03T16:30:35.074851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.13281","last_updated":"2026-05-07T09:33:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T12:41:23Z","title":"VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T21:46:43.353305Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.13281"},"observation_digest":"sha256:ce94d85b944d189f965c0c9a22b3a9b81a2b692a6cf9aecd582a23ee0023fe78","observation_id":"bfe6faaf-de51-4bd5-8b36-5fd5c5a1b3f5","resolution":{"observed_at":"2026-05-16T21:48:34.451321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T01:35:37.817082Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.13507"},"observation_digest":"sha256:2020110501c6db868aa342c4da887c1784eede4de49c410c0e5cd8f73ffd128f","observation_id":"576ba46b-a0b7-4efe-a2b4-84cfe3b974c7","resolution":{"observed_at":"2026-05-16T01:35:37.877410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T16:25:56.736283Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-05T18:37:36.718352Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:56.736283Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:8e7853605f9ec1e6547cc2d6a7a8b235ff8cc66e0f8d889a4ed6fd2e4233cd81","observation_id":"11c20f79-fd10-4c1e-b34b-bba0579a3fc9","resolution":{"observed_at":"2026-08-03T16:25:56.736283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T14:29:56.348733Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.14614"},"observation_digest":"sha256:b137d712161b7b021ed99fee2e03dbce31219d9e16bb95fb2590090e55eb3a16","observation_id":"9024fe7d-5d1e-4016-acdd-90ad88f4b1ef","resolution":{"observed_at":"2026-05-15T14:29:56.389990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T16:11:12.825647Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:11:12.825647Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.14614"},"observation_digest":"sha256:97b8b41d60ca5f3e3c0568eb0df1325a36ea369aa9dec0d354c89188f2d09b04","observation_id":"f637feb6-232e-4e94-a8d4-c2a9a8ce9ad6","resolution":{"observed_at":"2026-08-03T16:11:12.825647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.15693","last_updated":"2026-05-15T14:16:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:48:26Z","title":"Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T16:43:11.995960Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.15693"},"observation_digest":"sha256:0e8c2f99f28e6b29cd81e0fca128e90ede90bc83c69575c8fc774a45ffb293e1","observation_id":"e2675f78-181a-42c4-8c29-b475e1bfaad9","resolution":{"observed_at":"2026-05-21T16:44:16.012591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T15:46:08.841274Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15702","last_updated":"2026-07-01T03:39:09Z","snapshot_observed_at":"2026-08-03T15:46:03.731716Z","submitted_at":"2025-12-17T18:53:29Z","title":"End-to-End Training for Autoregressive Video Diffusion via Self-Resampling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T15:46:08.841274Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.15702"},"observation_digest":"sha256:ac6f1c74ff7bf926e67a3e69a032af1bc8e9158048db918210b551d3ab43bbc9","observation_id":"0662f10a-f8a5-4274-83de-6542cceca7fa","resolution":{"observed_at":"2026-08-03T15:46:08.841274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T21:26:32.048309Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.15840"},"observation_digest":"sha256:5698f22e00353de79088c1536b52fd93db72ef9ac80a9370aee264e9e0792934","observation_id":"d95b703e-7b6c-4353-a75d-f6217517ad01","resolution":{"observed_at":"2026-05-16T21:28:33.943330Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T15:28:53.569578Z","title":"Hunyuanvideo: A systematic frame- work for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17796","last_updated":"2026-06-24T08:52:20Z","snapshot_observed_at":"2026-08-03T15:28:47.055786Z","submitted_at":"2025-12-18T18:59:18Z","title":"CustomX: Unified Character, Action, and Scene Customization in Video World Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T15:28:53.569578Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.17796"},"observation_digest":"sha256:25c89a806938e552f289849f443a7f715cc0d96c7c24407caba4094ce0427674","observation_id":"ce27b337-1791-4b72-9574-29ba28556629","resolution":{"observed_at":"2026-08-03T15:28:53.569578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.20340","last_updated":"2026-04-29T12:00:44Z","snapshot_observed_at":"2026-08-02T10:18:36.960036Z","submitted_at":"2025-12-23T13:15:31Z","title":"The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T20:06:30.109866Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.20340"},"observation_digest":"sha256:b2ff6d937b88a7c46b57c8bfa115260f7e0ce939e8d55afb167bb0ef8bea5a2d","observation_id":"5072f660-e94e-4547-84f7-5b4202deaca8","resolution":{"observed_at":"2026-05-16T20:08:22.948024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T14:24:49.944520Z","title":"HunyuanVideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-03T14:24:48.216973Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.944520Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:9ec1fd957ea2cc1656d51ac8d50aa3ef3cde14e5526178ea4ff666d1f1c93bbd","observation_id":"701615fe-de36-4a32-b6f8-a275d82f03d0","resolution":{"observed_at":"2026-08-03T14:24:49.944520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.22274","last_updated":"2026-07-17T03:15:56Z","snapshot_observed_at":"2026-08-03T14:09:39.318796Z","submitted_at":"2025-12-25T03:28:28Z","title":"GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T20:08:23.319013Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.22274"},"observation_digest":"sha256:c307f06276662f500fc2950b418639dc82b2bdee98f531595c3d7b783572530a","observation_id":"fb6c9ec9-1add-43d7-9563-6a433f84bd5c","resolution":{"observed_at":"2026-05-16T20:11:13.702288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T14:09:40.361628Z","title":"HunyuanVideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.22274","last_updated":"2026-07-17T03:15:56Z","snapshot_observed_at":"2026-08-03T14:09:39.318796Z","submitted_at":"2025-12-25T03:28:28Z","title":"GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T14:09:40.361628Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.22274"},"observation_digest":"sha256:03d88a689093008229ca3577a6b064c1fb5ca28e7073bc696432ff288b8c2a77","observation_id":"e50ab9c7-99be-4212-886c-6d84e069dc1a","resolution":{"observed_at":"2026-08-03T14:09:40.361628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03603/citation-record","integrity":"/paper/2412.03603/integrity","json":"/paper/2412.03603/citation-record.json","paper":"/paper/2412.03603"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:6d5e41a2c7a946d6db45c506447f7869164f7fc703d89ec7577576fbe34dbff8","observation_id":"f87e7832-d83c-4b53-811d-12b611e78139","resolution":{"observed_at":"2026-05-23T07:42:43.505184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2305.10403","doi":"10.48550/arxiv.2305.10403","metadata_source":"pith","pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM 2 Technical Report","venue":"cs.CL","work_id":"905ee9a7-ea61-4a94-bd62-2600cbe3e315","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:346ea257ffbd284679b410a8e9a5e4eccb1b5b62d23d4bc8c2d7f2747f731540","observation_id":"b3bff811-f25c-452b-b7c9-f6c95c4232ed","resolution":{"observed_at":"2026-05-23T07:42:43.529917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":"0c42ffe4-2768-437b-b519-14d14f6e5550","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:276ee52e4528c02b26f713f99d97d5aac3eb6367d0a363a427cecea9a154ffac","observation_id":"dc180955-82c4-43b4-99f8-f223cb660db5","resolution":{"observed_at":"2026-05-23T07:45:30.766053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving image generation with better captions","venue":null,"work_id":"6343940d-8234-4fb8-b520-36103e611de1","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:08eaddd69022f0d59f9ab893d0a2bbb866757ec0ed7bb0d7bdb263e4adadc7c0","observation_id":"4c7ac835-9c54-4331-9e14-13c4d1d1969a","resolution":{"observed_at":"2026-05-23T07:47:43.151619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":"5c19a184-1e9e-4999-9532-8c98a1b88429","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:72beb3fb3574ab7477ee46556813ff5bb67a2275bf96fc53e0e96567569fe824","observation_id":"28483edd-24a5-435f-bdad-3934449300e5","resolution":{"observed_at":"2026-05-23T07:45:30.752242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.11096","last_updated":"2019-02-25T21:32:06Z","snapshot_observed_at":"2026-07-06T07:04:57.275371Z","submitted_at":"2018-09-28T15:38:49Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","version":2},"cited_work":{"arxiv_id":"1809.11096","doi":"10.48550/arxiv.1809.11096","metadata_source":"pith","pith_arxiv_id":"1809.11096","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","venue":"cs.LG","work_id":"244e6f06-bad2-4f34-8186-ff370286427f","year":2018},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/1809.11096","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:37e6b09685eac14aac5e5c23da55fe95e9790287de4d61378f5493d9874f183e","observation_id":"2d1a36f8-6d60-4fbd-987a-25fb561eae33","resolution":{"observed_at":"2026-05-23T07:42:43.493380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T12:08:12.712369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T12:08:12.712369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation models as world simulators","venue":null,"work_id":"b48f0847-8c2b-4d64-a3e7-7ed56b053c92","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:95c041a94d8790c8649ef5049fcc2e83380bbc2c599716fe18d8e77b4841c5f7","observation_id":"d3cc1320-25b4-4966-8e61-2d9a63f93f80","resolution":{"observed_at":"2026-05-23T07:45:30.760996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:b76e90feb265b15803dba9c4e8c0dd95a8032fbaade2fb459e36507918c6b2d5","observation_id":"95d9111a-e91a-4aa0-ab45-5ff1235b8891","resolution":{"observed_at":"2026-05-23T07:42:43.600927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:9bc025f504ca381a861340173cfb24d7741659cc705a2c9834df9beb5fd6483c","observation_id":"0a7f01ee-53b4-4875-8d9e-c8fb5a13e918","resolution":{"observed_at":"2026-05-23T07:42:43.543335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:6b64b49b5425c48148366937124652667d69c7332e009f20f126a22aca9e9b64","observation_id":"111ec42d-5624-46bc-9f4d-494adccba1d7","resolution":{"observed_at":"2026-05-23T07:42:43.549699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01199","last_updated":"2024-09-09T13:49:53Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T12:20:42Z","title":"OD-VAE: An Omni-dimensional Video Compressor for Improving Latent Video Diffusion Model","version":2},"cited_work":{"arxiv_id":"2409.01199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01199","snapshot_observed_at":"2026-07-03T20:28:55.552767Z","title":"Od-vae: An omni-dimensional video compressor for improving latent video diffusion model","venue":null,"work_id":"49697806-28ff-4fed-a6f1-8fa0d23aa3d3","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2409.01199","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:a6c9aa8620a541e00a047b5a545c4009094f4679baee63fe39dc6052e525e1c1","observation_id":"83549f5d-b81c-47a5-96ee-f2ad7e40d315","resolution":{"observed_at":"2026-05-23T07:42:43.415858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01055","last_updated":"2024-09-02T08:28:57Z","snapshot_observed_at":"2026-07-06T19:09:10.244642Z","submitted_at":"2024-09-02T08:28:57Z","title":"Follow-Your-Canvas: Higher-Resolution Video Outpainting with Extensive Content Generation","version":1},"cited_work":{"arxiv_id":"2409.01055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01055","snapshot_observed_at":"2026-07-02T02:36:26.428928Z","title":"Follow-your-canvas: Higher-resolution video outpainting with extensive content generation","venue":null,"work_id":"15e9dc54-68f3-4bc7-ae5e-83d7170f6d50","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2409.01055","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:12d55c831745cbff72b514f3ff17568b2f1074ec0d2e9df91e5d4fd3d6debdb1","observation_id":"4e3563ef-8bf6-4984-872d-62fc3c5b0134","resolution":{"observed_at":"2026-05-23T07:42:43.429546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural ordinary differential equations","venue":null,"work_id":"01f38ec8-476c-4be5-9ba2-e3f5869c2e45","year":2018},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:174d17212fa88d0bbd4787ba2fa5891ab5356c6d671f4d872fc2fadaa42e5c31","observation_id":"d254dd77-5fb5-49a0-a84f-0edac3d8b9a0","resolution":{"observed_at":"2026-05-23T07:45:30.735161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"6185d2bc-ab16-4740-87f0-3cf6753d578e","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:92ef91d74550a511fa15044ded7ad43964d655b694bd0ba9a7debbc7fe090702","observation_id":"31feb07e-70da-4df7-9e17-e7b5140ce30e","resolution":{"observed_at":"2026-05-23T07:45:30.727799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seine: Short-to-long video diffusion model for generative transition and prediction","venue":null,"work_id":"deaec59d-64d7-49d9-8d52-f6da5326e70f","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:752608e0cd80d275cc6a787c6cc810cafc539b364972c76c8fff0cd3ea4f0414","observation_id":"adc7da84-8c73-4ada-92ca-56f5a9e694e8","resolution":{"observed_at":"2026-05-23T07:45:30.731479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-07-06T18:44:33.767588Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":"2407.08136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Condi- tions","venue":null,"work_id":"d61530f3-e5d2-4f87-8cae-f67b8caf90da","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:e1ff5c70c72e2765a4e207613a9dea4a0be5456e9782a76341dbb1a480f8a3f8","observation_id":"1c22e319-d0ba-4505-95bf-b858d41972fa","resolution":{"observed_at":"2026-05-23T07:42:43.511917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":"970089a7-8b7d-4ecf-b933-886afd0001f6","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:5a7ad3c5290879d1d3f195d3a6b8fcf27c79dac121f340ed75e367f402e8f515","observation_id":"90944d98-7c00-4f48-b91c-70eb56d38e1e","resolution":{"observed_at":"2026-05-23T07:45:30.738946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9d177855-1a71-402b-bf6e-65b9da341edc","year":null},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:5305e2a167c56e2286414894e2091d73f11d910e6cf8a0ebebe76b09ac6935ad","observation_id":"7de844a2-4a85-4229-ad96-51c2392558b1","resolution":{"observed_at":"2026-05-23T07:45:30.755853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyscenedetect","venue":null,"work_id":"b56276dc-85ce-4a7e-a130-9207aa677dd9","year":null},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:6f76633310500d9dc7041b96435f10910c8b61ab8abec1609f43dca6392e8b83","observation_id":"c0da432b-82e0-426a-be60-90e1840a1f7b","resolution":{"observed_at":"2026-05-23T07:45:30.779625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-07-06T16:00:29.832559Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":"2307.16372","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-07-08T19:25:32.407848Z","title":"Lp-musiccaps: Llm-based pseudo music captioning","venue":"cs.SD","work_id":"bee63e50-4471-4228-8887-79c704a06b8f","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:8774a84cb080c00178a654d696813ecb2571e89a9d7ae76a953c25eaf7580a47","observation_id":"ef3c6ed6-235b-405c-8a20-632aec7bb33a","resolution":{"observed_at":"2026-05-23T07:42:43.525030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":"02e4ecdb-e3d0-4ecc-867e-58d3ff321b4f","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:aaecd478d3336a8a5d3285d2f1b6fd9643f30054e156849b6a04b73414359142","observation_id":"ed61aa5e-c8cd-4a80-aa89-57007cb92c20","resolution":{"observed_at":"2026-05-23T07:45:30.772333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"f548b05a-5bcf-41a8-9b7a-6302352ed6c3","year":2021},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:309bd7549a8411846941b681456035a8ee305e6fe7d252164648764f3ff006f8","observation_id":"83289cb7-8a21-47b6-b599-5400eef718a4","resolution":{"observed_at":"2026-05-23T07:47:43.148772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:4a57418b6e6a62de210a2a12ecbbaa45cbd0c1602b689fe2ad0e07bf2a675a30","observation_id":"1a8be5e9-fde3-4620-85d7-e12ba2b9effc","resolution":{"observed_at":"2026-05-23T07:42:43.487031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08430","last_updated":"2021-08-06T03:22:14Z","snapshot_observed_at":"2026-07-06T11:30:06.143581Z","submitted_at":"2021-07-18T12:55:11Z","title":"YOLOX: Exceeding YOLO Series in 2021","version":2},"cited_work":{"arxiv_id":"2107.08430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.08430","snapshot_observed_at":"2026-07-04T19:20:06.601231Z","title":"YOLOX: Exceeding YOLO Series in 2021","venue":"cs.CV","work_id":"112b3cd9-8fe6-49fe-bbaa-90a3f46045c7","year":2021},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2107.08430","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:8fb76b3fc676f721fba1a0d58c916fe074971a846f65d96319af7cf3e44b43fc","observation_id":"97818f2d-4076-4acc-b36b-43d9bfd8a2c6","resolution":{"observed_at":"2026-05-23T07:42:43.473250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-02T11:56:15.393496Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":"2311.10709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-07-02T12:36:57.125908Z","title":"Emu video: Factorizing text-to-video generation by explicit image conditioning","venue":null,"work_id":"7d56a470-9715-47bc-bf18-dec97e1c8fc5","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:754aa9524be5d7913bb117f5717d1d8f86ece0eab431c495bdd9afc9a3b9f412","observation_id":"681ba316-c6ff-45ab-9fc8-5b1b6a570203","resolution":{"observed_at":"2026-05-23T07:42:43.581649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":"27f78a6a-b7e3-4ff5-98a9-d62853ed9832","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:4113d70294c4bd420f6b40937966c122542d3a5b0cb7173dae71ced71b6a3082","observation_id":"9e025068-4a03-4ac7-8c21-1b76f093d448","resolution":{"observed_at":"2026-05-23T07:45:30.694293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":"d27d25bb-be62-4e7e-88a8-bb1b73128a5e","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:d311d1be9ea21803d146ac1672f53eaa9a303fb65754f5a677d430fb55bad098","observation_id":"2efde1ec-cbb7-403f-97e4-ee617f57fa7a","resolution":{"observed_at":"2026-05-23T07:45:30.680885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"71f5a1fa-99e0-4b5b-a674-8a468facfc29","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:62da050f1f04fa7389504c6964690d7c82df8b2072a5a240bbdde1557eabe692","observation_id":"1ee511d2-1cc7-48ba-ae11-6016c51a4f55","resolution":{"observed_at":"2026-05-23T07:45:30.686783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-07-06T18:38:05.229292Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":"2406.19388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-07-08T00:04:22.552662Z","title":"Taming data and transformers for audio generation","venue":"cs.SD","work_id":"1b6fb07a-4dff-4086-ae8f-3e16903cf206","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:ddad9bedc3b5b56d818067345749a1c8f12d0047f0804161f030a82ffb8b8fa1","observation_id":"62c79e91-2061-402c-a6bf-6f4d89e674ee","resolution":{"observed_at":"2026-05-23T07:42:43.395027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-07-06T16:26:58.234941Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":"2310.01889","doi":"10.48550/arxiv.2310.01889","metadata_source":"pith","pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","venue":"cs.CL","work_id":"982498c4-e80e-4e66-8c44-c60813be298d","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:bdeed7184f94e5e8ed54f8d270f1dd473fdfdadda3cc4931965a1b30748da68c","observation_id":"c5c2acad-0f60-4a7a-95d0-0e30f961b19f","resolution":{"observed_at":"2026-05-23T07:42:43.479249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animate-a-story: Storytelling with retrieval-augmented video generation","venue":null,"work_id":"83b2f100-995a-41da-8805-985cba088635","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:e5dee83fca0fba37068e8bb61e3fea9b131bc92f97c65b83f18760f59bdd24e3","observation_id":"ea725561-f526-4fd6-9de3-e9e16f5ad336","resolution":{"observed_at":"2026-05-23T07:45:30.667337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video diffusion models","venue":null,"work_id":"f041bdae-4f9b-486d-9226-9981afe74ebe","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:eb6eaa62dcf5a5072648a3b5cf254a254e6679696364fec8fdadd4768c48d3ec","observation_id":"3429933b-ea54-410d-b472-b6e66343360d","resolution":{"observed_at":"2026-05-23T07:45:30.676589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":"d8ee297c-bec8-45a4-b870-b4222558c799","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:86e8d6489a922c6dfa734869e444af802cfe4f09a6b091be10304cd3141715b4","observation_id":"6c6d7cc5-ea49-41a1-a29a-a980ef84283e","resolution":{"observed_at":"2026-05-23T07:45:30.690521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"56652958-8904-4de3-b986-8799a1e5b493","year":2020},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:91eae3a7627db5c8faf468403b6838e6e7e1e8fe5bcd77f853d97706527e11f5","observation_id":"00443d7e-a206-45e0-b0c3-26f88b5e67e3","resolution":{"observed_at":"2026-05-23T07:45:30.701677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"cdda8585-e95a-41eb-a946-a91e94fc9d91","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:f1559c7ddbbb60168f86db6d441b6ace587fad6d3b27a7118fb39275d80058d6","observation_id":"1da26971-7e2c-4dc9-94d2-94617802165d","resolution":{"observed_at":"2026-05-23T07:45:30.717015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:4516da12303238dc14dbf632f7ee3cd8c7e68038d8d7527df360ddcbf59a1193","observation_id":"3748e25a-ea43-4cb6-b32a-6aaf71edd70f","resolution":{"observed_at":"2026-05-23T07:42:43.385871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"d2440f24-c031-4171-b8eb-f4b3f9fb1f80","year":null},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:6b17933668bdd2ae20f24daa859ae416aa4b095b86e40c0766f640b5bceeab4d","observation_id":"163631e8-7e64-4d52-b1b8-ab8153047d06","resolution":{"observed_at":"2026-05-23T07:45:30.654328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A large tv dataset for speech and music activity detection","venue":null,"work_id":"6103f578-5118-48c4-947d-4fd0092570c9","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:dac5e455019b629816199b1f0c44228923a4fab318b35d2aa324ac6fba0a63df","observation_id":"85bf1a45-8951-4726-89a7-18bba89e0f87","resolution":{"observed_at":"2026-05-23T07:45:30.628834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"General data protection regulation (gdpr), n.d","venue":null,"work_id":"708404c3-8c70-4b1f-bf6c-21159b7d252e","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:c041db2ea82aefe509a3ec06df932dfc6c6b797be8d6c8bec13820da36995ad5","observation_id":"7442c48a-3ff7-4b31-b28e-ae63811ee1b3","resolution":{"observed_at":"2026-05-23T07:45:30.632107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text2performer: Text-driven human video generation","venue":null,"work_id":"cf71d7a6-2669-43a0-bae4-c6c1a9078e22","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:44795462f5102d987eb6842b63f9a5fd690f543fce2c23fdd0f85c23cb237a36","observation_id":"503240b0-3920-426b-843f-cae5c39b30ab","resolution":{"observed_at":"2026-05-23T07:45:30.632669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:dfe10ba8a44d9b9e5bfd2337e461662805631e92deff18cdeec0501cdb43b499","observation_id":"1ee66aff-535f-4e44-b3d6-89b09351a20b","resolution":{"observed_at":"2026-05-23T07:42:43.422916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13218","last_updated":"2024-05-24T13:58:09Z","snapshot_observed_at":"2026-08-05T13:25:11.556305Z","submitted_at":"2024-05-21T21:49:39Z","title":"Computational Tradeoffs in Image Synthesis: Diffusion, Masked-Token, and Next-Token Prediction","version":2},"cited_work":{"arxiv_id":"2405.13218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13218","snapshot_observed_at":"2026-06-29T23:14:01.800899Z","title":"Computational tradeoffs in image synthesis: Diffusion, masked-token, and next-token prediction","venue":null,"work_id":"123d0b33-9b70-4d3b-b3f4-eee3e5c871af","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2405.13218","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:3a1c5cca5f4cfca4e751dc52af98f9c2236dc6378227c9820bd41f0143dc6eff","observation_id":"9ef91b16-b4fb-4f37-b5f9-d44985a5c925","resolution":{"observed_at":"2026-05-23T07:42:43.589084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re-ex: Revising after explanation reduces the factual errors in llm responses","venue":null,"work_id":"fe102eb2-27b0-4b84-b128-61aa0132afd4","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:f16afaeef44f0f2a50296b4c720a549d8b62ddb17e91db9d13868b220e570c89","observation_id":"29838383-0f70-4178-9bec-d5b8f37e14d2","resolution":{"observed_at":"2026-05-23T07:45:30.648012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"57c94592-fbe7-415c-9918-d8bb6103f062","year":2020},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:55a3f0018dc01c9df45a604e60f470ca781e85bc465efa1eb68a30830eb5cbb9","observation_id":"34651ef2-a3cc-4ef0-af76-d55f969319f7","resolution":{"observed_at":"2026-05-23T07:45:30.654154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":"43ebdc81-b32c-48d2-b4c2-d01d23231bfc","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:3cd64f89687fd40ad29154f57d2331b7b3b4f47249a3528a2d34f85017f8bd87","observation_id":"77f0c4c5-23e5-4e4f-baac-8cdc25dcf84c","resolution":{"observed_at":"2026-05-23T07:45:30.680561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-sora-plan, April 2024","venue":null,"work_id":"825772a6-3a7d-48a6-ac31-a953c249c7e0","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:7a5d17819375fcd2b50398ecf983ded05ac10db595ca753216b4c76a5f2608cf","observation_id":"733d18cf-51b5-4020-bf26-9ad6657567ce","resolution":{"observed_at":"2026-05-23T07:45:30.688665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flux","venue":null,"work_id":"ce58d1a6-351b-4e19-ba2b-c97556075798","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:133b923901ae1df77527e47c9f61b3bd5e76ad2121d29a8bfa9d6c86563c6d73","observation_id":"75ee155b-368f-4054-b6af-a92fe22e9457","resolution":{"observed_at":"2026-05-23T07:45:30.692197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tccl: Co-optimizing collective communication and traffic routing for gpu-centric clusters","venue":null,"work_id":"be1ab518-91d9-4032-8310-0773805d0d1a","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:5daf1b7227baad5f90a2878f5a0941691c58eedc145e4f33d4674f3b4aa5d46a","observation_id":"7b917617-b89a-4519-a312-d894cc1ef6b9","resolution":{"observed_at":"2026-05-23T07:45:30.664094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the scalability of diffusion- based text-to-image generation","venue":null,"work_id":"8db624eb-ad63-4bbb-863c-576988a95048","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:632e73a0e450c44fd8ae4bde5fc4b9ead9895a2a8103617c4dd9582abc11426b","observation_id":"9b26706e-bd1e-4d71-99cb-b0068e78e994","resolution":{"observed_at":"2026-05-23T07:45:30.592965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"969e8733-69a4-4841-b222-2126955a3888","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:86effb02f54627d69b3650e97b3fc9358d05867a1dae51f987c057deb8b02522","observation_id":"73ef7e2a-3e32-4558-a044-a6faec100e48","resolution":{"observed_at":"2026-05-23T07:45:30.667703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":"11de4f80-fbd2-4703-9afb-b2c51b8f115c","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:ae6efa3446878c6d9a939403bbd582598f49a881ea4fab90dfd7abef30b6e895","observation_id":"65626552-a074-4b41-8f63-7dcb03c465da","resolution":{"observed_at":"2026-05-23T07:45:30.671594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:b647e9750647521fcf434e0f9dc2adc9ca2cb6ae1dee3cced5fdbd6bfcc465dc","observation_id":"a0c5f80b-bb98-445e-b31b-da4750850e1f","resolution":{"observed_at":"2026-05-23T07:42:43.453642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"dd3590d0-0f43-419a-94b3-023093e11205","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:7ff99025c1a109e177298555b553ba1b7de967a60e857c094fbdc5978c409dc9","observation_id":"e1730fd4-76c0-4b73-b5e2-b63f3cdd53c6","resolution":{"observed_at":"2026-05-23T07:45:30.592214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diff-foley: Synchronized video- to-audio synthesis with latent diffusion models","venue":null,"work_id":"111d819d-045f-4342-9461-dc1a8486ef12","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:6da4d559f086d85649176952b2f7ec0694980a077492ddd9e6fbc74ec097f81f","observation_id":"5c4688c3-2a54-4e6a-9e9a-8e9542e764f9","resolution":{"observed_at":"2026-05-23T07:45:30.600539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11831","last_updated":"2024-12-05T04:06:09Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:43Z","title":"Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models","version":3},"cited_work":{"arxiv_id":"2406.11831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11831","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the role of large language models in prompt encoding for diffusion models","venue":null,"work_id":"1dd7657c-7792-4564-be52-74a11031245e","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2406.11831","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:959a6000d6e7bbe07d2fa56716204c135871bb8faea32fe7134eb4fafb8f02c8","observation_id":"0bb5ee22-f104-4072-9403-c58cfb3fea3b","resolution":{"observed_at":"2026-05-23T07:42:43.556148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Follow your pose: Pose-guided text-to-video generation using pose-free videos","venue":null,"work_id":"b35e4479-1608-4b48-9892-c6446541354f","year":null},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:44a9d8c346814d737c6dd50a5bbb94ef6c77af7bc9d8c3de7673b4f6d73519cf","observation_id":"0ad29f0b-ea33-4bae-9c16-742e9bf01671","resolution":{"observed_at":"2026-05-23T07:45:30.621616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08268","last_updated":"2024-03-13T05:44:37Z","snapshot_observed_at":"2026-07-06T17:43:44.153710Z","submitted_at":"2024-03-13T05:44:37Z","title":"Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts","version":1},"cited_work":{"arxiv_id":"2403.08268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08268","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Follow-your-click: Open-domain regional image animation via short prompts","venue":null,"work_id":"8e5acd09-d7f4-4d92-8074-b66ea5cb1782","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2403.08268","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:6fd4a37bc0dfeb1ce47631801b97ef08987559153cc4aac197a1c2b4269680c2","observation_id":"405e66aa-e59d-42b0-9120-41c0515e4381","resolution":{"observed_at":"2026-05-23T07:42:43.562270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-07-06T18:24:52.604412Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":"2406.01900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":"d727c479-4aaf-4996-8040-bc5068751574","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:f74c45240a895fe12a6432f2bf1ace6a59c5bf19d2b6b1416b9925af8209d754","observation_id":"8fbf0ae3-2d93-4596-a5bc-febc0b7728b7","resolution":{"observed_at":"2026-05-23T07:42:43.460841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Some methods for classification and analysis of multivariate observations","venue":null,"work_id":"5bedead1-ce8f-490a-b990-8ad169a3df8f","year":1967},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:d7ceab56e4ea9f06d232a41f11dfb722cf84c555d5f4038f82fd85f616c434fb","observation_id":"94cadbfa-a056-4350-9480-5ec5d94df178","resolution":{"observed_at":"2026-05-23T07:45:30.624970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On distillation of guided diffusion models","venue":null,"work_id":"a1d80e05-c384-4e2e-a282-f5b835ee6bab","year":null},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:1a52237d03ea259c464a2ebade09b452b7d86950cd0cad2fffe6abc2859e9299","observation_id":"3de46200-e716-4788-839a-c2dcf41feed9","resolution":{"observed_at":"2026-05-23T07:45:30.567906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional image-to-video generation with latent flow diffusion models","venue":null,"work_id":"136548ec-d8cd-4f55-ac5c-cd96c976d7ec","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:6f2b931f2405629be5d3244647c8dda13c32cca555702a82335c18739b915463","observation_id":"a822031d-26ef-48cc-a32d-ceffe019581e","resolution":{"observed_at":"2026-05-23T07:45:30.705216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02868","last_updated":"2023-03-06T03:36:26Z","snapshot_observed_at":"2026-07-31T13:29:57.932652Z","submitted_at":"2023-03-06T03:36:26Z","title":"Angel-PTM: A Scalable and Economical Large-scale Pre-training System in Tencent","version":1},"cited_work":{"arxiv_id":"2303.02868","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.02868","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Angel-ptm: A scalable and economical large-scale pre-training system in tencent","venue":null,"work_id":"c0bea5ad-728f-4484-9785-05d8c45d094d","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2303.02868","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:298abe8169473b666dcc8474dc6dbc3d3b3ec63a5f1074b55519abfce7fdd03b","observation_id":"47627293-853b-410e-ab9d-4efd1514e583","resolution":{"observed_at":"2026-05-23T07:42:43.536547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context parallelism overview","venue":null,"work_id":"0cac6e8b-2916-45f1-97fd-e0f606328dac","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:0de037f9f812b8bbb025c00078828492279be6df28a45df4c95373e8b5f14e67","observation_id":"73117fa4-bde3-4d63-9e6c-caf57fea83c1","resolution":{"observed_at":"2026-05-23T07:45:30.708639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cosmos-tokenizer","venue":null,"work_id":"409821eb-ff0d-46f0-a0b7-5dc8107e476f","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:271425f6d2113462b7a57e9fde66ef2fbaba95fc2ed4584fe3cf80e377084b18","observation_id":"fd890e38-a8ff-421b-a99b-c7dd10d6058b","resolution":{"observed_at":"2026-05-23T07:45:30.607741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c04b058-d91c-4d4e-8727-10e999e31664","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:89ca1e4f95dc2d85078d5fe162f84892b9f398ec332595c64732fc8582463d85","observation_id":"025bb97d-38da-44bf-bea7-df8dc5e7a94c","resolution":{"observed_at":"2026-05-23T07:45:30.571430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"dc1bdc98-55ef-496e-8514-a5df74f55598","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:ae0a016da96d0a49719d0b100326ebfc7620ff58941b69b63ddc992f9025e9e9","observation_id":"63ad5918-fb7a-4fdd-a401-bcadfc4e3f2d","resolution":{"observed_at":"2026-05-23T07:45:30.578971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:ffc70a03c22f63cd572661f7ad72037cb1817632843b830a67c76207739093f5","observation_id":"92fe95a1-d7dd-4183-b56e-83c7f1a21dff","resolution":{"observed_at":"2026-05-23T07:42:43.402396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"63984daa-159b-421e-83c5-6f2895158bc9","year":2020},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:5ff213e5ded05c2f4f597dd91fba033563eb66430b21c456765750ad37636cf0","observation_id":"219e9a0a-7b4c-49f7-b326-75422074460b","resolution":{"observed_at":"2026-05-23T07:45:30.551586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"02550135-2de9-4356-a6d5-fac12d55c973","year":2021},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:0fdd35ccb552cfbb9ef2156e085af2a2fed33373a425e7dd18058aefe1ef9671","observation_id":"4cdcf38d-4934-4d01-bf85-214d923adbcf","resolution":{"observed_at":"2026-05-23T07:45:30.574835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"635bf34b-42f9-4074-8915-e59920ca0ccf","year":2021},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:a769fd0ab5e63a246f1d24c2be53aeeefe259761851e4fc4af374831c164ad69","observation_id":"613d70e3-9d0d-4d9e-a84e-af797ed0951a","resolution":{"observed_at":"2026-05-23T07:45:30.604277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"745a21a8-cce0-4bfc-83c9-323266cc5375","year":2020},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:1178d021166e2b372b7da85ea16b1c2a38ee34eacbc6b56573858e266dcd2c9b","observation_id":"f54297b9-4d21-4e4f-9964-1aaf99a0a296","resolution":{"observed_at":"2026-05-23T07:45:30.582436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"0d87eca2-3367-4b94-9761-c619b0df3317","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:4344bd4dd08c5c41f46367ed3fb6a2e29d67977d3cb722876bf171ef3a8ed1fe","observation_id":"46286e98-2719-426c-b2a7-77f31d88d3f3","resolution":{"observed_at":"2026-05-23T07:45:30.742616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:bdb210d941988eb784d3dfa289dd5d494f0075ca7eb360b272606b73c26071ec","observation_id":"3c16f9b3-94f9-4fb8-b4d9-ca5fe0be41aa","resolution":{"observed_at":"2026-05-23T07:42:43.409132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:9f34aa4dcc8cfa544f043d11826a2a1d39927ffc5988887766097ee38a9464e9","observation_id":"a5652ae3-f68e-4c14-84de-88f417e5fa37","resolution":{"observed_at":"2026-05-23T07:42:43.467254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"ee5826ef-53cd-4bbc-b644-1fcf1dfdae14","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:32acbea9386695224fb93881bc13d49c7f8763bb17107f38f1a0b4d0a9ebef98","observation_id":"6f0e9c00-2fee-41cc-9458-d9f4f180d937","resolution":{"observed_at":"2026-05-23T07:45:30.718025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-03T19:11:12.569454Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":"2008.04838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-07-04T06:29:36.931995Z","title":"arXiv preprint arXiv:2008.04838 (2020)","venue":null,"work_id":"16ef49be-5783-4e0a-a993-09cdb1ab77c3","year":2008},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:c8ffb52943c3e019df17986e3cc313deee3b7968686c23b295799b9981fcf3eb","observation_id":"fe2c8e8a-b8a9-42d5-bc3e-50beb37ef41d","resolution":{"observed_at":"2026-05-23T07:42:43.518678Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"032ed519-4451-406e-bc4b-84dec7351e31","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:2d4dcaa2026f901d7ae4ee7d07bcbda420fa24f0286f2460d87d05e8c61c7ba8","observation_id":"fc07dbaf-3ac6-49f0-b891-83791ae9a1a1","resolution":{"observed_at":"2026-05-23T07:45:30.542794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hunyuan-large: An open-source moe model with 52 billion activated parameters by tencent","venue":null,"work_id":"58971027-9f84-4d0f-aefe-0dc1843786ba","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:eb4c4b2cd54b465c2b7167274dc5e611f5351ef0fab991a3cdca8a3920edb947","observation_id":"eab2c802-dbcb-423b-8a37-f050989a5c89","resolution":{"observed_at":"2026-05-23T07:45:30.547864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mochi 1: A new sota in open-source video generation","venue":null,"work_id":"adcefb05-368e-4129-a565-7b0c5114fc80","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:741d25e251afe73994628b7822add5739caaadd7411d6c2dae39f2bc0b85a1c6","observation_id":"109665dc-14c2-489e-9312-06ae507da4e5","resolution":{"observed_at":"2026-05-23T07:45:30.585921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo: Emote portrait alive – generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"7644f34b-41ff-45eb-9580-48f90a8dafbe","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:f93f38a13d4bd4544cb764119976a5390f9acb886b2a5d9e479c7d98d9b95cc0","observation_id":"d60f8fc1-faf6-4600-ac83-fd8495fc472d","resolution":{"observed_at":"2026-05-23T07:45:30.545034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:cba127570a7ffd8240a4f0a1c2e0ba1f6c21dea1f33349979cd3e0c1295acdfd","observation_id":"522f56cc-09e7-4be3-b119-cf51e2050af0","resolution":{"observed_at":"2026-05-23T07:42:43.574426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":"8d9a9ea1-dfb0-4f68-bbc8-9ed3c847077f","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:4dd8f210c3d992b03965524c45a7f03d9ce445cf635ec4edf049a951ae97c84e","observation_id":"ca1ab31b-09a4-416f-b965-d6e3527f791f","resolution":{"observed_at":"2026-05-23T07:45:30.531232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disco: Disentangled control for referring human dance generation in real world","venue":null,"work_id":"aefb7e84-51eb-4744-ab3f-7cb81e0f2d4d","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:087f87127e4662bc4e9e73580d305df41734c9aead87bf68d0cd78df679bb26c","observation_id":"e5625999-4b75-4bc6-b6ee-d9a9a544ad89","resolution":{"observed_at":"2026-05-23T07:45:30.534857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"4852b065-c0e4-47c7-b495-919ef64ce2d3","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:4939101df54b5ab75a407a6177e10b27d1cdb0ce6cf4f7ff47892302af2b5c19","observation_id":"e012f27f-3640-42ac-8c20-32fe93a5a6f9","resolution":{"observed_at":"2026-05-23T07:45:30.575048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"6913ac06-3909-469c-a661-fdbb0cd22618","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:c62bb86fc3c2d5cff3b96e194542fa48af71d5885325d1098b0d4076a902d431","observation_id":"ab0240ff-9e55-46cd-bd93-0e93a9050387","resolution":{"observed_at":"2026-05-23T07:45:30.713336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lamp: Learn a motion pattern for few-shot-based video generation","venue":null,"work_id":"58b2c037-3781-49d6-9f25-43100a499655","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:09514737bb82f95ca9b7b1f1ad755900b76a921be93e7f245256ba9ca9fb86fd","observation_id":"22dccad6-4b74-40b2-b2de-6ec4348a3492","resolution":{"observed_at":"2026-05-23T07:45:30.720923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":"e13b4510-7528-40d5-b1bd-3d6af1c9ecc8","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:d386b8fd95391c5fba1381efbd7e5a3c0a7368e03aca3bd519f06b926eb7f636","observation_id":"cd43debe-5541-4263-8851-668201f28254","resolution":{"observed_at":"2026-05-23T07:45:30.628547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:59c7eefafb63122a2a6da65adb0c6b01c5e4e31a27ef22750b3b2cfd5b0b2f4a","observation_id":"3f856197-4b28-4730-8dcd-60b72f236c56","resolution":{"observed_at":"2026-05-23T07:42:43.499945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":"dc244f4e-cca7-4b90-9d09-f7a165a7bcc3","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:de9d99833b18b9f6622c35659dade215f251455d4eb829270b542db7e2968fe2","observation_id":"85c39580-26f2-4795-b242-d89b3f0d8509","resolution":{"observed_at":"2026-05-23T07:47:43.166913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03035","last_updated":"2025-03-01T09:24:04Z","snapshot_observed_at":"2026-07-06T18:25:44.620682Z","submitted_at":"2024-06-05T08:03:18Z","title":"Towards Multiple Character Image Animation Through Enhancing Implicit Decoupling","version":4},"cited_work":{"arxiv_id":"2406.03035","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03035","snapshot_observed_at":"2026-07-04T03:09:29.427940Z","title":"Follow-your-pose v2: Multiple-condition guided character image animation for stable pose control","venue":null,"work_id":"1b882c60-fbd4-48b6-895d-95402eef31b0","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2406.03035","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:a5061a62355938390e1ec680d6a8fbaf052a3640918eeaee9ef60c23df3d95a7","observation_id":"e6a9df93-bf42-42d2-b046-6a56d05374bd","resolution":{"observed_at":"2026-05-23T07:42:43.434632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Probabilistic adaptation of text-to-video models","venue":null,"work_id":"c159433d-2c36-49c5-968a-35c6cbfd2d67","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:6897c7432978aed588d594552905737e3330def871d678babfa49a6b562d0eca","observation_id":"d037db2e-f21d-4d2a-bd1a-93f3b10156c5","resolution":{"observed_at":"2026-05-23T07:47:43.158459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effective whole-body pose estimation with two-stages distillation","venue":null,"work_id":"20f20770-1434-454d-811b-4dff189223eb","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:c7aede6975882ca367296a0b1d6947e2bfaa04bb4b284f0b834d3f4823a8271f","observation_id":"8cbe08e1-538a-4907-b13c-26fc5483d42b","resolution":{"observed_at":"2026-05-23T07:47:43.139696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:503654456879ff294107bde75cd679983666dfbdf023d219cd8138e7c28b6fa3","observation_id":"99807af0-6961-4840-912f-b909bf817533","resolution":{"observed_at":"2026-05-23T07:42:43.568261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mimictalk: Mimicking a personalized and expressive 3d talking face in minutes","venue":null,"work_id":"746d779d-461e-4fe6-bb34-b03f475c5bc1","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:284c0e5b88dcd2fb3476a0e532362f3448f138cd4e1ad89bb1895a25fe289366","observation_id":"077a7a8f-a87b-418a-ac0e-fe4d87044a24","resolution":{"observed_at":"2026-05-23T07:47:43.176668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:5ea3933092d1e7a15ff8ef69839de606d906ec269bfa18f060c5a7f22e6303de","observation_id":"59659b5e-f1e0-40d6-9c41-f52e293a3c1b","resolution":{"observed_at":"2026-05-23T07:42:43.594956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":"a7cdaec3-cf5c-4aec-bd62-9359ba7fb977","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:64e8f61c04c6e09bb811f4ed71b537c5b744b0fe2c6d3bffbf6a56649ee39956","observation_id":"103c2871-7c49-4886-b672-224701d4cd14","resolution":{"observed_at":"2026-05-23T07:47:43.143193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dinet: Deformation inpainting network for realistic face visually dubbing on high resolution video","venue":null,"work_id":"5470fd89-ff2b-4a47-95ca-d59ca9ae6558","year":null},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:c59e15bdcd334724eefd4a2302b42af7aed7de048686e659b1e70c4cc577b72a","observation_id":"125693be-6e1f-4129-b910-edca402e066d","resolution":{"observed_at":"2026-05-23T07:47:43.155401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised representation learning from pre- trained diffusion probabilistic models","venue":null,"work_id":"323cbcbc-954a-42a6-994c-0b03a9decc42","year":2022},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:be3c4c95b7cff02065a0609e8c9b178a9421f34a8f6cbf59b88c72086076818d","observation_id":"d9151573-43e4-4377-9de5-c696a57b9044","resolution":{"observed_at":"2026-05-23T07:47:43.161443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shiftddpms: exploring conditional diffusion models by shifting diffusion trajectories","venue":null,"work_id":"b31d88eb-5ca5-4ae8-8ab9-736daab7216b","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:d0d29053f620713216a5ec744462c8bbff391716522eb80158ebb96aa4d7f3e6","observation_id":"d5c316bd-3dbf-4ef5-8ef1-87f738ed02e8","resolution":{"observed_at":"2026-05-23T07:47:43.164041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motiondirector: Motion customization of text-to-video diffusion models","venue":null,"work_id":"655ea45c-045c-4dd8-a9b0-e0c65be8b136","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:efe109db32f064461deb651769346fc7f04a49cadb812e8037b71102dbf018b2","observation_id":"c59ceede-0061-4ce5-b0be-995d1557dc75","resolution":{"observed_at":"2026-05-23T07:47:43.173586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","latest_version":6,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":31,"verified_fuzzy":67},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 100 inbound Pith citation observations for arXiv:2412.03603."}