{"as_of":"2026-08-21T02:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccf7e694d6b70c06233574ae740a738a5e09912b821ac536c59af70e5f64c0e9","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T14:58:37.383749Z","state":"measured"},{"denominator":141,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":141,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":123,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:31.264007Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:375c40aef03212abacf5f0e7b8eccfde19e241ba5d7553b2df45d39aacd56a85","observation_id":"e95e4235-bd61-4cc4-98c2-271aa5e4a753","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-08-20T10:31:24.549119Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:50.009149Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2410.10629"},"observation_digest":"sha256:598241b40b59273c6b3e4ddb9857f66982e00aaede2e37922db6ef61f73c4ea7","observation_id":"b784b988-ed8e-4877-8bf6-3f1c26089a6a","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-12T14:55:42.108525Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14808","last_updated":"2025-03-02T08:53:47Z","snapshot_observed_at":"2026-08-19T13:28:24.510124Z","submitted_at":"2024-11-22T09:08:58Z","title":"High-Resolution Image Synthesis via Next-Token Prediction","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:42.108525Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2411.14808"},"observation_digest":"sha256:3d89bc87263248ad1bfbe9ec6755d29b136e6574586fe4415e2b8dfa6a203d74","observation_id":"981345a0-6025-41c6-a7b9-3e4e260114b9","resolution":{"observed_at":"2026-08-12T14:55:42.108525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-12T13:33:38.760346Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16164","last_updated":"2024-11-25T07:40:32Z","snapshot_observed_at":"2026-08-17T23:16:51.618908Z","submitted_at":"2024-11-25T07:40:32Z","title":"Text-to-Image Synthesis: A Decade Survey","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-12T13:33:38.760346Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2411.16164"},"observation_digest":"sha256:c7338e8401ed7b27de6e4d70436e57e5cd61c9bffbb2e863484609ba117c7ba0","observation_id":"35a26a3b-db9c-4b16-a921-46dc957d7ccf","resolution":{"observed_at":"2026-08-12T13:33:38.760346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-12T13:19:54.633105Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16318","last_updated":"2025-06-12T23:46:13Z","snapshot_observed_at":"2026-08-14T17:37:42.664893Z","submitted_at":"2024-11-25T12:11:05Z","title":"One Diffusion to Generate Them All","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T13:19:54.633105Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2411.16318"},"observation_digest":"sha256:e5d653246a784092bf5400c5d7f45c201c51c44e0d1ae10641ee034e93c4586b","observation_id":"3153ac62-9931-449c-a407-586072d518d3","resolution":{"observed_at":"2026-08-12T13:19:54.633105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-12T12:25:00.345323Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-19T14:08:56.839152Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.345323Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:14eda2006245d1c488b51c669dbc1aedcbdbaa22f34680382dd25b33cf7c1452","observation_id":"0358a844-7806-4255-9a7c-cc027c1d2bf3","resolution":{"observed_at":"2026-08-12T12:25:00.345323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:a8302dbfa9dc3673120a1892883b59034564f2b25a62c9b7f847f9913d165668","observation_id":"41b9b3fb-433a-4e58-a9b7-1e3ab7cd8412","resolution":{"observed_at":"2026-05-23T08:42:45.165303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-12T04:27:47.864360Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01407","last_updated":"2024-12-03T13:14:39Z","snapshot_observed_at":"2026-08-14T19:05:44.674820Z","submitted_at":"2024-12-02T11:50:35Z","title":"HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:27:47.864360Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.01407"},"observation_digest":"sha256:64c990fdbf4a364eae88d8927aaeb577b31e75ef06b6fb0fe15e2d5b756c258b","observation_id":"f1b82155-c6c3-4532-b83a-08dd778c6193","resolution":{"observed_at":"2026-08-12T04:27:47.864360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T22:10:42.746365Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03812","last_updated":"2025-08-06T09:14:21Z","snapshot_observed_at":"2026-08-19T23:32:12.200689Z","submitted_at":"2024-12-05T02:08:19Z","title":"Pinco: Position-induced Consistent Adapter for Diffusion Transformer in Foreground-conditioned Inpainting","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:10:42.746365Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.03812"},"observation_digest":"sha256:58da1646ec4a69bcf57840e0d1dafa67a13b6eb76e79f4c033225c8993301426","observation_id":"7765ed2f-9fb4-482c-a343-69def11b1db7","resolution":{"observed_at":"2026-08-11T22:10:42.746365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T16:56:01.695752Z","title":"Hunyuan- DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09619","last_updated":"2024-12-12T18:59:53Z","snapshot_observed_at":"2026-08-18T17:16:22.737486Z","submitted_at":"2024-12-12T18:59:53Z","title":"SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:01.695752Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.09619"},"observation_digest":"sha256:bc6d192594fa0043b1120b8ac7b4a0a170eac555deee46ec97e6a0dc4d5f1c09","observation_id":"7d696d16-2c28-4696-ba80-897ca68eead4","resolution":{"observed_at":"2026-08-11T16:56:01.695752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T15:36:11.704510Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10891","last_updated":"2024-12-17T05:23:42Z","snapshot_observed_at":"2026-08-17T15:26:52.711980Z","submitted_at":"2024-12-14T16:42:41Z","title":"Zigzag Diffusion Sampling: Diffusion Models Can Self-Improve via Self-Reflection","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:36:11.704510Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.10891"},"observation_digest":"sha256:38acb6baad74967fb88bf2f4121298d279f66b3ee37b8bde4c546b7faab1d419","observation_id":"29af3adc-1aeb-4752-b769-eb686e7c6d92","resolution":{"observed_at":"2026-08-11T15:36:11.704510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T14:11:00.567171Z","title":"Manmatha, Ashwin Swaminathan, Zhuowen Tu, Stefano Ermon, and Stefano Soatto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-16T21:22:40.755328Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.567171Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:6d7ce89fcdddcf4e60f1200b25951ea7e05989217272100d792fa38cc163094c","observation_id":"cb023b8d-cfb7-4994-8ec8-83b8fd4eff4d","resolution":{"observed_at":"2026-08-11T14:11:00.567171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T13:28:09.360430Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13155","last_updated":"2025-09-10T13:21:10Z","snapshot_observed_at":"2026-08-17T10:02:56.866170Z","submitted_at":"2024-12-17T18:28:48Z","title":"F-Bench: Rethinking Human Preference Evaluation Metrics for Benchmarking Face Generation, Customization, and Restoration","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T13:28:09.360430Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.13155"},"observation_digest":"sha256:fc0f42c15a085b58eb6ff72d07c4409b06a3e7129e49ffcbb187acf976d97acd","observation_id":"cbb84cfd-0e08-491d-b4e3-b9c6eb9be24d","resolution":{"observed_at":"2026-08-11T13:28:09.360430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T10:54:30.876054Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16112","last_updated":"2024-12-20T17:57:09Z","snapshot_observed_at":"2026-08-15T20:19:47.193159Z","submitted_at":"2024-12-20T17:57:09Z","title":"CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:54:30.876054Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.16112"},"observation_digest":"sha256:e266602ca74e8ce758151f6c333bcfb83544b35140d84e55906048521da0be93","observation_id":"c8803063-afa4-44ac-98f4-725ef1f37e45","resolution":{"observed_at":"2026-08-11T10:54:30.876054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T11:19:55.532992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16257","last_updated":"2025-03-28T08:39:46Z","snapshot_observed_at":"2026-08-15T08:47:09.472285Z","submitted_at":"2024-12-20T07:24:32Z","title":"PromptLA: Towards Integrity Verification of Black-box Text-to-Image Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:19:55.532992Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.16257"},"observation_digest":"sha256:1edafb66fca8decb6985ca36b74463c4b09de96adb38aacdabdaa5a150b10811","observation_id":"9abed91e-9e08-447c-94ad-77d2fa0eafaf","resolution":{"observed_at":"2026-08-11T11:19:55.532992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T05:02:21.029310Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-19T18:58:04.469177Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:21.029310Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:9cc3933d20ab22e4a5a37e800648125d03102a1c7ec95aebccb6c944e2e85d29","observation_id":"6decca13-abc0-427c-a26b-d644163b295b","resolution":{"observed_at":"2026-08-11T05:02:21.029310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T04:24:20.032698Z","title":"Hunyuan-DiT: A power- ful multi-resolution diffusion transformer with fine-grained 9 chinese understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18928","last_updated":"2024-12-25T15:19:02Z","snapshot_observed_at":"2026-08-19T14:09:54.689546Z","submitted_at":"2024-12-25T15:19:02Z","title":"UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:24:20.032698Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.18928"},"observation_digest":"sha256:cfde020315590ef7c5acbfeba6ba0d7189f9987fd0f865f51b90b09067541f67","observation_id":"f5a4f1d5-8e79-4e79-bb7a-dcb878fd2cb5","resolution":{"observed_at":"2026-08-11T04:24:20.032698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-10T22:33:42.710583Z","title":"Hunyuan-DiT: A powerful multi- resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01320","last_updated":"2025-03-22T07:44:02Z","snapshot_observed_at":"2026-08-17T16:11:59.326855Z","submitted_at":"2025-01-02T16:19:48Z","title":"SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:33:42.710583Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2501.01320"},"observation_digest":"sha256:6ecb61af032b838e178a9c3eb50f31ccb8a50f402e154dbb28a28731da3b553d","observation_id":"f407df20-bd64-4035-920a-d02445d15108","resolution":{"observed_at":"2026-08-10T22:33:42.710583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-10T20:52:46.053945Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07070","last_updated":"2025-01-13T05:48:32Z","snapshot_observed_at":"2026-08-15T04:09:52.450179Z","submitted_at":"2025-01-13T05:48:32Z","title":"Enhancing Image Generation Fidelity via Progressive Prompts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:52:46.053945Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2501.07070"},"observation_digest":"sha256:f84735dba2b920bf4a587e185f3f3c863f6dbe1b7a8c9b1682dddc9ccac07d78","observation_id":"007b7b0d-6cae-4683-9d25-75725bc7c622","resolution":{"observed_at":"2026-08-10T20:52:46.053945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-10T20:01:21.485520Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09503","last_updated":"2025-05-01T09:16:20Z","snapshot_observed_at":"2026-08-14T15:32:46.083706Z","submitted_at":"2025-01-16T12:28:39Z","title":"AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:21.485520Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2501.09503"},"observation_digest":"sha256:8f0c006439145548e15ee51a7b604d8f6f4c55e0abe89a71d7ec46172b2cdbc7","observation_id":"82d4b05c-a5fa-4a76-8362-e9ebb2c09444","resolution":{"observed_at":"2026-08-10T20:01:21.485520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-10T17:05:50.691701Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12612","last_updated":"2025-07-25T08:18:26Z","snapshot_observed_at":"2026-08-16T17:38:44.657176Z","submitted_at":"2025-01-22T03:29:43Z","title":"T2ISafety: Benchmark for Assessing Fairness, Toxicity, and Privacy in Image Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:05:50.691701Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2501.12612"},"observation_digest":"sha256:2c61fddf7bec8de8fde42f1c24d7c2d09c83ec903a9c8ca22bed8905a36a9e7f","observation_id":"4287647a-e996-43af-9b67-db4af3afc96b","resolution":{"observed_at":"2026-08-10T17:05:50.691701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-10T16:12:00.121311Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13452","last_updated":"2025-02-27T06:55:41Z","snapshot_observed_at":"2026-08-18T21:45:51.574465Z","submitted_at":"2025-01-23T08:06:11Z","title":"EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T16:12:00.121311Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2501.13452"},"observation_digest":"sha256:5bc359f423b6dd2a53254e799d4a5dc0df6cf9c1d5571a52af2ecb4aa49290c2","observation_id":"abb4556a-db91-4677-9123-e5c6d201c538","resolution":{"observed_at":"2026-08-10T16:12:00.121311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:b0757edbe48a5a1ec334643b8e54498fdc9def295c607dfa695fe9899d02adce","observation_id":"1b77b361-f091-4e10-b15f-9c6f63666604","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-09T23:37:12.585450Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-20T06:24:59.340130Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T23:37:12.585450Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2501.18427"},"observation_digest":"sha256:caad0e95b42f31ce94ab623f8835489d623dde721ca298998083f13649809993","observation_id":"613fc111-a701-4619-92a3-5df42363d9a0","resolution":{"observed_at":"2026-08-09T23:37:12.585450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-08T19:32:31.875847Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-19T23:42:35.575400Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.875847Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:df0def4fab76bdc5eb2efeda99589b33642fb21ccb16d1245f4a87fdf4f3588a","observation_id":"8bc4c100-3750-4c4e-a460-f2075022732a","resolution":{"observed_at":"2026-08-08T19:32:31.875847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-08T17:13:02.774524Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05979","last_updated":"2025-04-01T07:54:57Z","snapshot_observed_at":"2026-08-17T18:51:11.937846Z","submitted_at":"2025-02-09T18:12:25Z","title":"VFX Creator: Animated Visual Effect Generation with Controllable Diffusion Transformer","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T17:13:02.774524Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2502.05979"},"observation_digest":"sha256:fc61dbe2ff2f434a54a7e80937e5accb12fca7571bc83d6efab47867fa26676d","observation_id":"ea13ae8c-cd82-4109-969a-4b4c3f4fa44f","resolution":{"observed_at":"2026-08-08T17:13:02.774524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-08T11:56:49.457187Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07685","last_updated":"2025-03-21T15:10:32Z","snapshot_observed_at":"2026-08-14T17:37:01.859040Z","submitted_at":"2025-02-11T16:36:55Z","title":"Matrix3D: Large Photogrammetry Model All-in-One","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T11:56:49.457187Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2502.07685"},"observation_digest":"sha256:c4de1adb374fe490ecb7c7ac775bc441ffe58e711714a0ef18dc2266793fbb99","observation_id":"f728abfe-1ac2-47eb-b4a0-b36b74f59ed7","resolution":{"observed_at":"2026-08-08T11:56:49.457187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:073c86ade8965b4a044db1eddccaddcf88fb52c92e6db7571a52d074c27a0f88","observation_id":"93a71d0d-a75f-49d1-ac8b-be50586c74c0","resolution":{"observed_at":"2026-05-19T08:02:23.310121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2503.02537","last_updated":"2026-04-09T09:03:54Z","snapshot_observed_at":"2026-08-14T06:25:24.218829Z","submitted_at":"2025-03-04T12:03:26Z","title":"RectifiedHR: Enable Efficient High-Resolution Synthesis via Energy Rectification","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T01:33:49.962427Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2503.02537"},"observation_digest":"sha256:0d1daace6d7a63b53c42a35a514a347c737a19c0321065f737276129a0bcb7b6","observation_id":"3ea81b16-5537-4f3f-8adb-e6216c3153de","resolution":{"observed_at":"2026-05-23T01:35:19.497719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T00:53:53.855965Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2503.07598"},"observation_digest":"sha256:2a06a20b6ec3fe8d2b2dc327a7f4ab1fc3e88a7c03048d11d22819d9adf779ea","observation_id":"76dcd2c9-854b-48f0-8874-9b2212109e86","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-08-19T23:30:02.968735Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T08:27:36.242416Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2503.07703"},"observation_digest":"sha256:b71979ae41ce8a1ba0a5a57e1afd730407c58f1ab457feec75a6b82343e68673","observation_id":"619bf7e2-d1fb-4938-8c63-eea9a23e6b4e","resolution":{"observed_at":"2026-05-17T08:27:36.309996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-16T12:40:26.523312Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12018","last_updated":"2025-04-16T12:21:49Z","snapshot_observed_at":"2026-08-18T10:41:09.205775Z","submitted_at":"2025-04-16T12:21:49Z","title":"Instruction-augmented Multimodal Alignment for Image-Text and Element Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:26.523312Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2504.12018"},"observation_digest":"sha256:d4473625f1b5766942ff0d004a6989a091e9bdb5318c74cdb6860bb818d27b27","observation_id":"7ac6b9e6-7cf5-4f49-9e6d-cb4c928b463f","resolution":{"observed_at":"2026-08-16T12:40:26.523312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-16T12:40:31.264007Z","title":"Hunyuan-dit: A powerful multi- resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12027","last_updated":"2025-04-17T01:49:31Z","snapshot_observed_at":"2026-08-18T20:58:48.833901Z","submitted_at":"2025-04-16T12:37:08Z","title":"Understanding Attention Mechanism in Video Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:31.264007Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2504.12027"},"observation_digest":"sha256:c6e334d69ae82af12de5aaa9bd6b898ddcd6472146e89f469d8960cefc36d375","observation_id":"dc9f41c5-f5f1-47ab-b673-6f68df039d55","resolution":{"observed_at":"2026-08-16T12:40:31.264007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-16T11:49:17.767084Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14534","last_updated":"2025-04-20T08:18:27Z","snapshot_observed_at":"2026-08-18T15:30:15.094667Z","submitted_at":"2025-04-20T08:18:27Z","title":"SUDO: Enhancing Text-to-Image Diffusion Models with Self-Supervised Direct Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:49:17.767084Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2504.14534"},"observation_digest":"sha256:67a7e665ab779809bd04a545c7758c6c45ae1dd2b686aa4ffa8ea53d39312417","observation_id":"19f56009-acaa-4905-9dd4-7fb6034a54fe","resolution":{"observed_at":"2026-08-16T11:49:17.767084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-16T11:15:34.933445Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16080","last_updated":"2025-04-22T17:58:07Z","snapshot_observed_at":"2026-08-19T00:26:01.518545Z","submitted_at":"2025-04-22T17:58:07Z","title":"From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:15:34.933445Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2504.16080"},"observation_digest":"sha256:b033164ad20e1c5adfee6ab8b5567693154411ca06858bd6b0c48bcc4565d14c","observation_id":"2dea6047-9081-4053-ae64-92d6faf54234","resolution":{"observed_at":"2026-08-16T11:15:34.933445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-12T22:02:52.918587Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:d31b7628004969a9a56c084f8b32f3742d8766b78eecab71d3ed1c221906c35b","observation_id":"5ccc9090-6d8b-4dcb-bc33-982fb70a9314","resolution":{"observed_at":"2026-05-17T07:24:04.875390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-15T20:46:46.313528Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12098","last_updated":"2025-05-17T17:49:26Z","snapshot_observed_at":"2026-08-17T17:30:06.121487Z","submitted_at":"2025-05-17T17:49:26Z","title":"LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T20:46:46.313528Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.12098"},"observation_digest":"sha256:f86e4c24f28b3c5c03604cf2288c8c2831f251489631e0faa82f2eda21b9caf8","observation_id":"e11c36e8-7e6e-4681-8621-271b32ffcb65","resolution":{"observed_at":"2026-08-15T20:46:46.313528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T15:43:31.425024Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14135","last_updated":"2025-05-28T13:11:02Z","snapshot_observed_at":"2026-08-14T08:02:29.963745Z","submitted_at":"2025-05-20T09:39:48Z","title":"Hunyuan-Game: Industrial-grade Intelligent Game Creation Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:31.425024Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.14135"},"observation_digest":"sha256:e268d6a9d1ce2c576b82cc12a7e5ab3067b8426eac9de33b550e792f3e874a61","observation_id":"4cd9816c-ceae-437d-a5f7-7a33db577638","resolution":{"observed_at":"2026-08-07T15:43:31.425024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T15:34:53.968678Z","title":"Hunyuan-dit: A powerful multi- resolution diffusion transformer with fine-grained chinese understanding.arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-13T02:57:53.245907Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.968678Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:b016f0aaf1015c316d97c84c70f17535e8cdacbb03609c52f2f3ec915c97cf15","observation_id":"9bbb5788-a59c-4612-a250-14e6e2bce774","resolution":{"observed_at":"2026-08-07T15:34:53.968678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T15:26:13.390675Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Under- standing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15172","last_updated":"2025-05-21T06:42:17Z","snapshot_observed_at":"2026-08-13T01:45:46.110293Z","submitted_at":"2025-05-21T06:42:17Z","title":"Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:13.390675Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.15172"},"observation_digest":"sha256:7ed43003668a03014d132ccab81e3a0b50673eb1f5308de65b2d3ce5c8edf81e","observation_id":"25088bc4-a1f9-4f6b-90a1-acd6d0d13a56","resolution":{"observed_at":"2026-08-07T15:26:13.390675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T14:34:08.431458Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18445","last_updated":"2025-05-24T01:00:20Z","snapshot_observed_at":"2026-08-14T15:33:29.385759Z","submitted_at":"2025-05-24T01:00:20Z","title":"OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:08.431458Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.18445"},"observation_digest":"sha256:36a9f1f01993820ea84067ff62ed3ba9389d56a14a711acf06da9a7255a5f4d0","observation_id":"3a1a8f78-555b-489e-b3db-a88b273631c5","resolution":{"observed_at":"2026-08-07T14:34:08.431458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T14:17:34.926538Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19415","last_updated":"2025-05-27T20:10:09Z","snapshot_observed_at":"2026-08-17T01:54:45.003378Z","submitted_at":"2025-05-26T02:07:24Z","title":"MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:34.926538Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.19415"},"observation_digest":"sha256:fb5ca85f77688c75276d98042574f7f8dfebca0862b2d092feb53c96aeb1ba91","observation_id":"7464fcef-16b5-4120-bebc-5a2d6fff5501","resolution":{"observed_at":"2026-08-07T14:17:34.926538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T14:06:47.850143Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-18T20:10:07.636309Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:47.850143Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:dc9a653dc10a351b48740cba52521bc080a5d4b3cc37afe37b36aac54a4cbcab","observation_id":"a4c39549-f37a-4bdc-b515-ceb6be0a7050","resolution":{"observed_at":"2026-08-07T14:06:47.850143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T14:05:06.764006Z","title":"Hunyuan-DiT: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-18T22:51:20.969084Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:06.764006Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:c7177954eb6e7a5dee578bd844bf97ab0146ef0c97cb15339c94bb0315b8032c","observation_id":"586e70c8-b0c4-4609-b585-1b9f4cbb586b","resolution":{"observed_at":"2026-08-07T14:05:06.764006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T14:01:10.567223Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20255","last_updated":"2025-07-07T17:56:30Z","snapshot_observed_at":"2026-08-14T10:03:15.306691Z","submitted_at":"2025-05-26T17:32:10Z","title":"AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:10.567223Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.20255"},"observation_digest":"sha256:02cd9be2346efdf508d57c99279315c8f36a9e23de74e4a957aecd4412981770","observation_id":"cfd03ea0-5c34-4716-b360-59d3162780ea","resolution":{"observed_at":"2026-08-07T14:01:10.567223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T12:44:16.037523Z","title":"Hunyuan-DiT: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-08-10T18:05:39.926456Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:44:16.037523Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.23661"},"observation_digest":"sha256:d9d7c3a2183e270f9363ce986f4482823230920b469c61fc41c601f26cbd3611","observation_id":"2077f18a-effd-48eb-be04-092b0ee7208c","resolution":{"observed_at":"2026-08-07T12:44:16.037523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T12:21:23.182573Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24870","last_updated":"2025-06-06T14:51:40Z","snapshot_observed_at":"2026-08-14T02:14:48.628979Z","submitted_at":"2025-05-30T17:59:26Z","title":"GenSpace: Benchmarking Spatially-Aware Image Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:21:23.182573Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.24870"},"observation_digest":"sha256:5d86384da7c6dab576e6495873ccee358c8175a76f8569f900c9a4dd49e5f6d4","observation_id":"0ba3e372-9816-449e-8acf-d4a831eb2ab6","resolution":{"observed_at":"2026-08-07T12:21:23.182573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T11:51:33.213194Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01337","last_updated":"2025-06-02T05:32:35Z","snapshot_observed_at":"2026-08-18T11:26:36.857219Z","submitted_at":"2025-06-02T05:32:35Z","title":"NoiseAR: AutoRegressing Initial Noise Prior for Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:33.213194Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.01337"},"observation_digest":"sha256:aab0f45a3270aa25582d1f0e014564ca38e0353be42c41115234fbb27e799ef9","observation_id":"90fc9349-56ef-4074-ae6e-9e5335767cba","resolution":{"observed_at":"2026-08-07T11:51:33.213194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T11:39:52.770522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01801","last_updated":"2025-06-02T15:42:06Z","snapshot_observed_at":"2026-08-21T01:56:40.656907Z","submitted_at":"2025-06-02T15:42:06Z","title":"OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.770522Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.01801"},"observation_digest":"sha256:854ebb2127822b0779d2b0ca9e465b2150a46cc0f57fa5598234a86c8c17bd55","observation_id":"33884d4d-d15d-40be-8aad-eb28daf44fed","resolution":{"observed_at":"2026-08-07T11:39:52.770522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T04:52:55.047546Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09482","last_updated":"2025-08-20T06:57:17Z","snapshot_observed_at":"2026-08-17T20:55:27.994502Z","submitted_at":"2025-06-11T07:50:31Z","title":"Marrying Autoregressive Transformer and Diffusion with Multi-Reference Autoregression","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:52:55.047546Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.09482"},"observation_digest":"sha256:b9e77866c09e91630e86cc61f2ba450db402e2ac7e0d5507bae0c7ac35bc5102","observation_id":"ce85b1c3-0fda-4b7a-b908-926aba5f9c5f","resolution":{"observed_at":"2026-08-07T04:52:55.047546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T00:40:59.660776Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-15T12:56:12.374901Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:59.660776Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:0d9442be8a57560ec9faa0b6eba8f52f4154d1f0ca4a3a9e7c76c4e3a31646b9","observation_id":"4158dac0-cec8-4cd3-bf99-534b47953d49","resolution":{"observed_at":"2026-08-07T00:40:59.660776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T00:41:30.764087Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13260","last_updated":"2025-06-16T09:01:09Z","snapshot_observed_at":"2026-08-17T22:43:40.990518Z","submitted_at":"2025-06-16T09:01:09Z","title":"COME: Adding Scene-Centric Forecasting Control to Occupancy World Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:30.764087Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.13260"},"observation_digest":"sha256:c361875c5f809b588d3c2aae85f45258facee76588862220116bdbbeebf127bd","observation_id":"b75c20ac-9734-4f78-8c5f-350876d716c1","resolution":{"observed_at":"2026-08-07T00:41:30.764087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T23:28:05.645405Z","title":"Hunyuan-DiT : A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-16T04:27:28.158427Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:05.645405Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:2e930cf01f5d7b11ad3c1db430c5fb55a4434009151204d9921408714d2a7f0d","observation_id":"7ba124ae-8510-4cb4-890d-62a2b53796e0","resolution":{"observed_at":"2026-08-06T23:28:05.645405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-08-18T21:48:45.801096Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:c11e9c8514eb822db2dbc6891bdea4f561471859c9860cac43621ae6734a9044","observation_id":"c9305dfa-6c32-4c91-ab1e-c02c83693a8d","resolution":{"observed_at":"2026-05-19T07:52:10.879158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-15T18:46:10.710650Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-08-15T23:43:47.561047Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:10.710650Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.18898"},"observation_digest":"sha256:4ac5a2fdeb1b7608d2b00d5e5a73b8f7c208adf6ba7f39e45a64dd3004ff1b08","observation_id":"ca526121-fa56-4e51-8f05-80d22f967955","resolution":{"observed_at":"2026-08-15T18:46:10.710650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T22:59:14.172131Z","title":"arXiv preprint arXiv:2405.08748 (2024) 9, 25","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20294","last_updated":"2026-07-03T05:27:17Z","snapshot_observed_at":"2026-08-18T10:13:10.055353Z","submitted_at":"2025-06-25T10:01:00Z","title":"Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:59:14.172131Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.20294"},"observation_digest":"sha256:a87ffeb8d84a97d1b8f835ce116851ede4e7237d13b37efeaec9ea256190140f","observation_id":"a179ed4e-2cdc-4e92-a040-54e4580ed319","resolution":{"observed_at":"2026-08-06T22:59:14.172131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T22:53:13.531583Z","title":"arXiv preprint arXiv:2405.08748 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20449","last_updated":"2025-06-25T13:56:48Z","snapshot_observed_at":"2026-08-07T21:48:06.227537Z","submitted_at":"2025-06-25T13:56:48Z","title":"Med-Art: Diffusion Transformer for 2D Medical Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:13.531583Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.20449"},"observation_digest":"sha256:d5688139f7405ffd6fff38234270436a33c68b7afeaadb2379ebbe5043141693","observation_id":"83f93069-964f-43f1-bc48-b538e56401bb","resolution":{"observed_at":"2026-08-06T22:53:13.531583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T22:42:45.233124Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20967","last_updated":"2025-06-27T08:42:17Z","snapshot_observed_at":"2026-08-13T23:16:20.107234Z","submitted_at":"2025-06-26T03:10:13Z","title":"DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:42:45.233124Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.20967"},"observation_digest":"sha256:9fd5916fefe40e5e54541ee53a83c46c21cf72e7a40e622b8a4f424cd35a6d66","observation_id":"887d158b-933f-4a91-9be9-639b82c323dd","resolution":{"observed_at":"2026-08-06T22:42:45.233124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T22:23:42.916538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21874","last_updated":"2025-06-27T03:13:47Z","snapshot_observed_at":"2026-08-20T00:10:34.605453Z","submitted_at":"2025-06-27T03:13:47Z","title":"On the Feasibility of Poisoning Text-to-Image AI Models via Adversarial Mislabeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:42.916538Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2506.21874"},"observation_digest":"sha256:cf1bddf099dc215d0e3ceaf23d7bff1f975f390df77a539512e3fea97e97b870","observation_id":"1011fda0-9765-4d35-9bc8-af0f014b05e4","resolution":{"observed_at":"2026-08-06T22:23:42.916538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T20:26:37.875779Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-16T08:39:04.954558Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.875779Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:53c3ea316d83abcde00d236117b5efcda82f8c8e8b7ef35492434d1c7dd00a26","observation_id":"01613cf8-1f4b-4777-9245-2199ba8b590b","resolution":{"observed_at":"2026-08-06T20:26:37.875779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T19:55:02.899597Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04451","last_updated":"2025-07-06T16:17:32Z","snapshot_observed_at":"2026-08-17T05:05:00.761342Z","submitted_at":"2025-07-06T16:17:32Z","title":"CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.899597Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2507.04451"},"observation_digest":"sha256:04b4ddf04f345aa54bedde5157178d0819cd3560c305019bd69a7a9169322330","observation_id":"8e175b62-cf9c-4935-acea-0f58edf05a1d","resolution":{"observed_at":"2026-08-06T19:55:02.899597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T17:10:55.041081Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11533","last_updated":"2025-07-15T17:58:08Z","snapshot_observed_at":"2026-08-18T05:28:30.258983Z","submitted_at":"2025-07-15T17:58:08Z","title":"CharaConsist: Fine-Grained Consistent Character Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:10:55.041081Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2507.11533"},"observation_digest":"sha256:ca7f99f328db31e350f16d36507e68eb986bb30e039cb1e21ccc8b229080bb01","observation_id":"131fe098-44f5-4301-a768-3fb169eca97f","resolution":{"observed_at":"2026-08-06T17:10:55.041081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T13:47:46.235477Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20158","last_updated":"2025-07-27T07:25:08Z","snapshot_observed_at":"2026-08-13T22:30:50.936919Z","submitted_at":"2025-07-27T07:25:08Z","title":"AnimeColor: Reference-based Animation Colorization with Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:47:46.235477Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2507.20158"},"observation_digest":"sha256:e60d5438c3f6ed88083730caab9ed4eb56699d047f496e0d0479e34e28c7c508","observation_id":"cc134c95-a660-44d6-be19-d5fa8236b61e","resolution":{"observed_at":"2026-08-06T13:47:46.235477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-15T17:47:25.587462Z","title":"Hunyuan-DiT: A powerful multi-resolution diffusion trans- former with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20536","last_updated":"2025-07-29T06:16:18Z","snapshot_observed_at":"2026-08-17T20:35:25.403332Z","submitted_at":"2025-07-28T05:41:22Z","title":"T2I-Copilot: A Training-Free Multi-Agent Text-to-Image System for Enhanced Prompt Interpretation and Interactive Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:47:25.587462Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2507.20536"},"observation_digest":"sha256:42c5f48599531fdcbde8b8de9ec7370b8219fa5081299804d8c85f0655a23d8d","observation_id":"f39972e5-3f49-4445-ae4a-8fa12728a4a4","resolution":{"observed_at":"2026-08-15T17:47:25.587462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T05:59:15.539301Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-19T17:39:50.081703Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.539301Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:2c00296f504a4c05a792b961dca0f43ab3be045d3f748d0a56709e2324f7e18f","observation_id":"0a12d2be-2083-4d49-a18a-e96e4b528ae4","resolution":{"observed_at":"2026-08-06T05:59:15.539301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-06T04:44:57.916258Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03032","last_updated":"2025-08-05T03:18:04Z","snapshot_observed_at":"2026-08-17T07:13:37.990846Z","submitted_at":"2025-08-05T03:18:04Z","title":"A Summer Meridional Subsurface Temperature Dipole Mode in the South China Sea","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:44:57.916258Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2508.03032"},"observation_digest":"sha256:d3ab965556b38e7378460b901aabfcffb9040f945dd764b664922d10892fbbda","observation_id":"d6a96f96-3294-407b-ac8c-dd8960487d9b","resolution":{"observed_at":"2026-08-06T04:44:57.916258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T20:44:13.554546Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-19T18:52:45.346695Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:13.554546Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:44d52b704fa58b266c313e0efbfaee271e82ebc27f7e49ef29c034b96483a5ba","observation_id":"e7854012-5878-4145-a2f3-f0b127f40fdd","resolution":{"observed_at":"2026-08-05T20:44:13.554546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T10:19:54.393763Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-16T13:24:04.947329Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:19:54.393763Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.04394"},"observation_digest":"sha256:2532d3e9788c308f3871adc96416841934b617e9c58cef3fd7956e22bbe791dd","observation_id":"cf68c54a-d28b-4b4e-887a-decbab4b14fc","resolution":{"observed_at":"2026-08-05T10:19:54.393763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T04:34:36.974733Z","title":"org/abs/2405.08748","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06068","last_updated":"2025-09-07T14:21:57Z","snapshot_observed_at":"2026-08-15T07:14:05.011541Z","submitted_at":"2025-09-07T14:21:57Z","title":"Home-made Diffusion Model from Scratch to Hatch","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:34:36.974733Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.06068"},"observation_digest":"sha256:7b2168a7eac9af54dc73a4b05bf30c5c741c0849439f357848975f3cce672c1b","observation_id":"9ca1c93a-5adc-46ee-935f-5a453af8e7e3","resolution":{"observed_at":"2026-08-05T04:34:36.974733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-04T22:58:08.801305Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06942","last_updated":"2025-09-11T17:14:11Z","snapshot_observed_at":"2026-08-14T05:10:53.900739Z","submitted_at":"2025-09-08T17:54:08Z","title":"Directly Aligning the Full Diffusion Trajectory with Fine-Grained Human Preference","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T22:58:08.801305Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.06942"},"observation_digest":"sha256:632a72f27b4c456347bdd287742c6db7dec9d97a59d1b00a187d83c7dff88f6e","observation_id":"2aea1fa6-9b79-49d5-af67-7cdfd5a622c4","resolution":{"observed_at":"2026-08-04T22:58:08.801305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-04T18:48:03.745641Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-20T21:06:45.900297Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.745641Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:10175908f1e85cdf38873cfe1f4c0028a56099b56e10b9b917e947cd524df6c2","observation_id":"0356551c-13d7-480c-8ac5-f129a797c09f","resolution":{"observed_at":"2026-08-04T18:48:03.745641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-15T16:00:04.618874Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10312","last_updated":"2025-09-12T14:53:45Z","snapshot_observed_at":"2026-08-18T15:45:46.023219Z","submitted_at":"2025-09-12T14:53:45Z","title":"Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:00:04.618874Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.10312"},"observation_digest":"sha256:fb12e7499ed0be1a0703f462fd0622329adefcf215b7bebd2404f38525636f04","observation_id":"f70f34df-e7cb-4993-9ec6-9e54491e60ec","resolution":{"observed_at":"2026-08-15T16:00:04.618874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-16T05:43:37.647093Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T02:02:32.806844Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.23951"},"observation_digest":"sha256:8746f82da605e62024fc507d8a6abad80488088ec25ac8f2ee298ed06348a4dc","observation_id":"4560414f-06f5-4d1a-aada-954181a4b0ea","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-04T14:42:14.415987Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-16T05:43:37.647093Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T14:42:14.415987Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.23951"},"observation_digest":"sha256:f86653a72faefbcf8cc479b73dc5c1ce96ca1bdd2e5c77d1935a9e2b769eea7d","observation_id":"d4482470-c6fe-4ea1-985e-0cb3fa272087","resolution":{"observed_at":"2026-08-04T14:42:14.415987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-04T13:44:08.667828Z","title":"Ziqiang Li, Jiazhen Yan, Ziwen He, Kai Zeng, Weiwei Jiang, Lizhi Xiong, and Zhangjie Fu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25682","last_updated":"2026-06-30T07:06:33Z","snapshot_observed_at":"2026-08-15T23:03:06.159778Z","submitted_at":"2025-09-30T02:36:40Z","title":"Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:44:08.667828Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2509.25682"},"observation_digest":"sha256:631b473d6ed680cdcdf15b65847d421d64468f63701d154f8c6ce19b2d742070","observation_id":"37ccd311-6343-46c1-921a-b5e96caee0ab","resolution":{"observed_at":"2026-08-04T13:44:08.667828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2510.16888","last_updated":"2025-11-04T13:15:36Z","snapshot_observed_at":"2026-08-16T11:51:43.064429Z","submitted_at":"2025-10-19T15:38:06Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T18:01:19.748677Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2510.16888"},"observation_digest":"sha256:e3afc944fce8a7e5b435ab0179aded0b2519795c44cf0a2c388a197a5e6cbc48","observation_id":"59025a7d-7553-453e-b225-0d57ba994af1","resolution":{"observed_at":"2026-05-21T18:01:19.828310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T20:30:31.643191Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-15T16:22:05.631288Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.643191Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:7710f529de1b506a256311c90766067eb53bd31bb88722ab297523696cfa8530","observation_id":"001e6a19-564b-40af-aef8-eb00406fd66b","resolution":{"observed_at":"2026-08-03T20:30:31.643191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2511.20645","last_updated":"2026-04-16T17:04:25Z","snapshot_observed_at":"2026-08-16T01:24:03.000139Z","submitted_at":"2025-11-25T18:59:25Z","title":"PixelDiT: Pixel Diffusion Transformers for Image Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T04:30:07.417197Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2511.20645"},"observation_digest":"sha256:e77d40442ad1d7f4d55ad249e79c7617db4545f21c2b91b29a50dca7644b18ee","observation_id":"c8596c85-a782-40fc-af9d-409f28cb433c","resolution":{"observed_at":"2026-05-17T04:31:31.175892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-16T18:20:01.123890Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T14:08:36.801359Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:95ac16c1fe8ce7b71e4dcce915bdff69b43261c51f84baf35e52f7f909643df2","observation_id":"5a541b64-c887-40fd-9858-c92028ea12a4","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T19:47:32.749977Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-16T18:20:01.123890Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.749977Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:97d018a6021fc37c94c0a60a5bbb182b4fbd411b411fe8c14abcf8a0507da44c","observation_id":"31537b14-4724-42bc-9266-d28b5e4755c2","resolution":{"observed_at":"2026-08-03T19:47:32.749977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T14:24:49.959310Z","title":"Hunyuan-DIT: A power- ful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-18T10:56:26.306288Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.959310Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:0805b2947cca3bc6e42f816a96e2320763803a09f14f408153f5f8984d0911b7","observation_id":"c0bbf535-9216-4c07-8dea-6120b2872110","resolution":{"observed_at":"2026-08-03T14:24:49.959310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T12:50:57.283172Z","title":"Hunyuan-dit: A powerful multi-resolution dif- fusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01608","last_updated":"2026-05-26T14:50:02Z","snapshot_observed_at":"2026-08-14T12:49:28.468056Z","submitted_at":"2026-01-04T17:18:27Z","title":"Guiding Token-Sparse Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T12:50:57.283172Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2601.01608"},"observation_digest":"sha256:d1bb5c0dcf4fb8ec49165bf20502b08b8b184e0df399ba77be14eca81d27b13b","observation_id":"86bdbf9d-1baa-4439-b1af-bf37f8db312f","resolution":{"observed_at":"2026-08-03T12:50:57.283172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T12:39:55.224838Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-17T20:29:47.427905Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.224838Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:b2aaf579f30d089ed749bb8086c3ae68cb72981cb5eb45f8515a6bf1cdcefab9","observation_id":"caba5c44-c215-4525-95ee-5dcf5f2a0fab","resolution":{"observed_at":"2026-08-03T12:39:55.224838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2601.09896","last_updated":"2026-04-30T21:54:22Z","snapshot_observed_at":"2026-08-14T22:05:57.559462Z","submitted_at":"2026-01-14T21:59:44Z","title":"The Algorithmic Gaze of Image Quality Assessment: An Audit and Trace Ethnography of the LAION-Aesthetics Predictor","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T14:03:00.513248Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2601.09896"},"observation_digest":"sha256:74c1046e19d071c5032d806e46d4765b7eccf9f89ed17b0bcb48bffb7dea0958","observation_id":"21edd1ef-12eb-47a5-9ea5-5c5afc398638","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T09:52:19.476716Z","title":"arXiv:2405.08748 [cs.CV] arXiv preprint","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.00032","last_updated":"2026-06-22T15:21:09Z","snapshot_observed_at":"2026-08-10T04:01:36.239787Z","submitted_at":"2026-01-18T13:35:51Z","title":"Happy Young Women, Grumpy Old Men? Emotion-Driven Demographic Biases in Synthetic Face Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T09:52:19.476716Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2602.00032"},"observation_digest":"sha256:e23ec5bd3ed05072cd369c73a39ac1f96377edde4a12edb765a451b91ffa9296","observation_id":"59d9d0a1-507c-4d17-a774-c773e8bfe673","resolution":{"observed_at":"2026-08-03T09:52:19.476716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-11T15:55:44.194747Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:478f9ab9645926c57dd523bee3109d84fd98103825f4532daf6a068c6e09935d","observation_id":"2345c93a-837e-4460-9f5c-7cc8a2a04a41","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2604.08546","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-08-10T23:58:04.364158Z","submitted_at":"2026-04-09T17:59:57Z","title":"When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T18:39:26.420463Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2604.08546"},"observation_digest":"sha256:3820d67ec922825ef1f1ed91a1bf084060bcc0d8cd5873d977204cfd9ad66a87","observation_id":"c127b862-4de1-4325-8945-a6b1fdd850c9","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2604.23579","last_updated":"2026-04-26T07:34:41Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T07:34:41Z","title":"CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T05:08:37.971891Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2604.23579"},"observation_digest":"sha256:82a914bf6407ce6a4c90b0e22ba44333ba240ec789f0e6c0d0cb78ebbd1dd274","observation_id":"e1e45613-ed44-4f95-b3ec-b929758b557b","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2604.24351","last_updated":"2026-04-27T11:44:45Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:44:45Z","title":"Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T04:24:53.023047Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2604.24351"},"observation_digest":"sha256:bbeb08c8359c402a9f716e80f58fbef9dd8ecb9b945736b3b3d94fa1a50dc686","observation_id":"6ff9371d-2cf4-4076-a9de-44dc210e2828","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2604.26348","last_updated":"2026-04-29T07:00:00Z","snapshot_observed_at":"2026-08-15T16:46:44.721416Z","submitted_at":"2026-04-29T07:00:00Z","title":"ACPO: Anchor-Constrained Perceptual Optimization for Diffusion Models with No-Reference Quality Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T14:05:05.560294Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2604.26348"},"observation_digest":"sha256:774b5c3ea5e33748bfb9d33042ace763e5a66ef33c91faef9cdfd2fcad6d8b5e","observation_id":"25a3dff3-6d9e-4f6a-9200-69e4c2d47ff8","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2604.26365","last_updated":"2026-04-29T07:22:16Z","snapshot_observed_at":"2026-08-16T01:18:15.059702Z","submitted_at":"2026-04-29T07:22:16Z","title":"Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T13:51:23.367393Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2604.26365"},"observation_digest":"sha256:be8c87272e51a0f2c73a134b569c36370046eda49624c5fddce3380eac61fdf5","observation_id":"ae66cecb-b76a-418f-85d1-e2da5783fb5d","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-08-14T02:06:16.181569Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:4f7c4c7ca0b081d736d4b86cf71c5e7e1b004047c3181152b473047347885f76","observation_id":"9717243b-4342-4726-a454-7c5b71be061e","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-08-14T02:06:16.181569Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:d8e8713bc0956b89f91d8b22aba5c99634fd0a885a831611314174c6ca8da4f8","observation_id":"c6b71185-2754-4f18-9e0b-4ec7af0773b4","resolution":{"observed_at":"2026-05-21T09:14:05.955534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.10127","last_updated":"2026-05-13T05:54:11Z","snapshot_observed_at":"2026-08-15T19:21:08.670726Z","submitted_at":"2026-05-11T07:40:03Z","title":"Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:56:43.640874Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.10127"},"observation_digest":"sha256:f820cd777993b58ccab483d61d1c4172dee1d5b7d534d97e800dc4d370ba7589","observation_id":"6e4765f9-5092-4f08-b420-40ba1ec391cd","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.10127","last_updated":"2026-05-13T05:54:11Z","snapshot_observed_at":"2026-08-15T19:21:08.670726Z","submitted_at":"2026-05-11T07:40:03Z","title":"Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T21:56:10.499014Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.10127"},"observation_digest":"sha256:ed30b4086bd9daa692d0cf36d0a372f0b14403865add8b73d3422068a8fac2db","observation_id":"48430f21-1021-4096-b0ec-2ca5c20ff89a","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.10730","last_updated":"2026-05-11T15:34:56Z","snapshot_observed_at":"2026-08-12T22:15:05.384992Z","submitted_at":"2026-05-11T15:34:56Z","title":"Qwen-Image-2.0 Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:21:18.312613Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.10730"},"observation_digest":"sha256:3d2e98f87f816498e1c0b1d07d9abd1326135bc3611b9d3cbcef659c3eb27b9c","observation_id":"b4877599-743e-4b84-b4c6-fa145bfe051b","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-12T23:15:37.229219Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:28d8ac477a9a2165ac4fba1a93ffae24f7508012154ae4d0b854c37c7dcd17ac","observation_id":"9d5a4e95-03ff-4132-8a32-06f8e89223cb","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.12964","last_updated":"2026-05-25T05:34:21Z","snapshot_observed_at":"2026-08-12T21:22:12.685700Z","submitted_at":"2026-05-13T03:58:01Z","title":"Asymmetric Flow Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T19:28:21.625879Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.12964"},"observation_digest":"sha256:188e7687a75a2529667980614cc7294aef53b2759c6403e8b6597ce52000a4d7","observation_id":"732da0c5-a6ad-416c-b3d1-10d99fddbe1c","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.12964","last_updated":"2026-05-25T05:34:21Z","snapshot_observed_at":"2026-08-12T21:22:12.685700Z","submitted_at":"2026-05-13T03:58:01Z","title":"Asymmetric Flow Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T22:07:44.850763Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.12964"},"observation_digest":"sha256:614d0668f98ee2b7355341ed60e3213321c7a860122f155f006548ad74ccf258","observation_id":"f164c029-7467-4a9b-bf47-e53501ccf378","resolution":{"observed_at":"2026-07-01T14:15:47.401196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.15684","last_updated":"2026-05-15T07:13:27Z","snapshot_observed_at":"2026-08-20T19:53:02.790734Z","submitted_at":"2026-05-15T07:13:27Z","title":"ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T20:00:27.987481Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.15684"},"observation_digest":"sha256:c6e96c70106df559a37ddea81c71231561e827cd7dfc68460b1858a39943dcd6","observation_id":"1a4b0297-079b-4eb6-b530-1bcf3220cd70","resolution":{"observed_at":"2026-05-20T20:03:43.903399Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.08748/citation-record","integrity":"/paper/2405.08748/integrity","json":"/paper/2405.08748/citation-record.json","paper":"/paper/2405.08748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://www.midjourney.com/home","venue":null,"work_id":"795b1fa1-556e-485b-9d28-16aaf6e1e8dc","year":null},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:34f92be6c914ac7ec309cf69a6d11c82398501f90da47b34f03744ace975b934","observation_id":"0c574b84-5f3a-4d03-a150-467b23204e7d","resolution":{"observed_at":"2026-05-16T14:58:37.495138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:653dc89397bc807189cd371d46fda14223f27a9be7f9beab33993137e20e421b","observation_id":"039c4d4d-be1b-4460-9f15-a82fceac5df1","resolution":{"observed_at":"2026-05-16T14:58:37.407084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-08-20T09:01:51.889199Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":"2211.01324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-07-04T13:29:51.539140Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","venue":"cs.CV","work_id":"2cd7b629-ab37-4ce5-b51e-aa4d99547468","year":2022},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:9b8a3a394953b6896453416986975f370ce466fcb9979dafb317c2e30844f172","observation_id":"40c7ac0e-f72c-4415-a366-1a4b84bb0193","resolution":{"observed_at":"2026-05-16T14:58:37.412582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":"89898e1d-a850-4f1b-a8db-ff8620eda7bd","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:0fc657d20c336de7a4b9283128b2ad9a92008906c6569753ef08f6dc0dee1af0","observation_id":"8593d81b-356a-4f68-bda6-e9926667a283","resolution":{"observed_at":"2026-05-16T14:58:37.524125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.744380Z","title":"Improving image generation with better captions","venue":null,"work_id":"aa4e9e1a-4c37-468d-bdb4-412819771b5e","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:f5bd358f7f10c0f024b5d978ee290f3881a8efce7dcc7ca7513d2ba288a76544","observation_id":"6f64cbf0-2d0b-42a1-9e50-5cca60d37f1a","resolution":{"observed_at":"2026-05-16T14:58:37.527389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":"22c310a9-a981-494c-b03a-e7b958932218","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:d9e4415e5d8001592b0d6d735460a67dab6d21815c869e3349a1d823f7dc557f","observation_id":"40350f7a-cdac-4ba3-a06b-6a626f54c1f9","resolution":{"observed_at":"2026-05-16T14:58:37.530183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixart-\\alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":"6bf1df9c-0e56-41ae-9288-36366b95fa76","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:50526e77a61cbdfdca01307af77233d5408a17bbe6def3d372ba3a0d656ad043","observation_id":"581e6b9a-8d09-4f9d-8b70-64f55df30ad4","resolution":{"observed_at":"2026-05-16T14:58:37.532988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"b2aec505-c300-4a61-92b3-34533a96f7ae","year":2022},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:07778b399ce9522d0ced33dc28181bc88090dc19efe1cce7e17a69c603ad8b92","observation_id":"d7ee4fbd-c76c-454f-919d-0c74c54748df","resolution":{"observed_at":"2026-05-16T14:58:37.535720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"282f8133-1b3d-4933-b68c-70ee9cdd289e","year":2020},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:6a7b8fac8da3b704d4af9bee7609c9aeefe3b81ac6ab3b29dded9918fcd31621","observation_id":"0723abeb-487a-49fd-aebf-02d570f19eed","resolution":{"observed_at":"2026-05-16T14:58:37.538916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-08-13T01:47:21.043519Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2403.03206","doi":"10.48550/arxiv.2403.03206","metadata_source":"pith","pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"4dc55d76-271e-42dd-878f-c20546599c69","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:d0d3e4eb0995ae9212899c44c10ce90d82fe7712ebab4386ff9c91a43b3b0ef6","observation_id":"06ea00d7-df55-4979-8d97-edf34b1c8b75","resolution":{"observed_at":"2026-05-16T14:58:37.424102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T11:19:49.764146+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T11:19:49.764146+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-16T14:55:51.246316Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":"2310.01218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-07-09T20:16:29.588718Z","title":"Making llama see and draw with seed tokenizer","venue":"cs.CV","work_id":"9453feaf-a19d-4603-b9de-da50593c5d43","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:9e7c4b27e95e534c6ee3b3df106cb052a57ca81e01c617d8e43581ccbaa98e2b","observation_id":"239459fe-7563-48fd-a297-eca4d5de87d5","resolution":{"observed_at":"2026-05-16T14:58:37.478355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Matryoshka diffusion models","venue":null,"work_id":"eb712e45-0be2-4854-8f9e-ada7ee82cf60","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:ba7f94783efe9c31cca96ef40af6b40caf949c8f1fbb909a3b3292dddbef37ed","observation_id":"fc659712-5713-49dc-8a1e-11a9fa8ebe90","resolution":{"observed_at":"2026-05-16T14:58:37.542066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Query-key normalization for transformers","venue":null,"work_id":"522abe66-f837-46db-870c-eabac53fb71e","year":2020},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:16a07ed154f2b7261e2f0c3e683ee4a95e05b38bd07e1eb4edb3c86702f2f4a4","observation_id":"a562c28b-18a9-4b2f-ae70-b6f40eb956c4","resolution":{"observed_at":"2026-05-16T14:58:37.545151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"467420fe-e893-4a77-8c1a-00dc82c7e35c","year":2017},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:6957c78ee16da7ddfb7498b35984cef70ad8fc19aa6d5846c8bcf7f6d34398bb","observation_id":"e738f32f-cb26-4a95-abd1-213b077cb13f","resolution":{"observed_at":"2026-05-16T14:58:37.548073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08857","last_updated":"2025-04-18T11:51:22Z","snapshot_observed_at":"2026-08-16T14:10:04.180546Z","submitted_at":"2024-03-13T18:00:01Z","title":"DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":"2403.08857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08857","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dialoggen: Multi-modal interactive dialogue system for multi-turn text-to-image generation","venue":null,"work_id":"e2da4964-8292-4dce-9a74-d3105d67bcdc","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2403.08857","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:ad1bff838b2075b33f577297441a6e15c6330662d263f052e553079f832f6caa","observation_id":"aab99592-907a-43ce-8e5b-57bfea5fa980","resolution":{"observed_at":"2026-05-16T14:58:37.443989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-08-16T13:11:20.195602Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2402.17245","doi":"10.48550/arxiv.2402.17245","metadata_source":"pith","pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","venue":"cs.CV","work_id":"53c64fda-8566-434d-bc10-2fdfbc6a55ad","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:548f1a9249c428121503dae9a0fb5e7d6d4cdb37b8aeb258dc66420f46a59aee","observation_id":"c828b109-e8ce-4c3f-acb1-6a46c0f85c15","resolution":{"observed_at":"2026-05-16T14:58:37.450305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"ccb789e1-6ba8-42f5-a97b-2ee648a1de49","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:8eca3a00884f575e1b73dcc8bd393fb85a765c39a7bc9375c00300026279ea63","observation_id":"906aa91c-7c34-497a-9f21-d74968aeaabe","resolution":{"observed_at":"2026-05-16T14:58:37.550615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swinv2-imagen: Hierarchical vision transformer diffusion models for text-to-image generation","venue":null,"work_id":"c7d178c8-7a7a-4268-bc86-e55309f63444","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:74c8f12566adde3f1d53659db8c063791f7ecc7a1fdffb1660e29a8c4a691a0f","observation_id":"ce80a498-3bb0-424a-997e-2e225d8a2be4","resolution":{"observed_at":"2026-05-16T14:58:37.554109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"89d4d85c-8574-4422-bdcb-bba9c6ee309a","year":2014},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:697c019cb004d4de3e234b4f3bde2b18e616fb558d5b08fbc05bda4faa68fbef","observation_id":"cf3631ec-65a9-4c21-8fa0-8c3f833a8f41","resolution":{"observed_at":"2026-05-16T14:58:37.556896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:d282116fc687cdb4462fb6c60a98963ca3ae4da345c620fec256849a39df2b95","observation_id":"0357996c-8a73-4404-a89a-9b856e3d90b5","resolution":{"observed_at":"2026-05-16T14:58:37.418068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instaflow: One step is enough for high-quality diffusion-based text-to-image generation","venue":null,"work_id":"f91c46e0-abc2-4ae0-afa2-408777e4e075","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:3d2e93fb3961fad6f6b82025532b692a9999207d35a5484d75459db37ba199a8","observation_id":"49898400-25a7-4fab-a029-f035f9f43716","resolution":{"observed_at":"2026-05-16T14:58:37.559561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-08-20T13:49:06.053430Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":"2310.04378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-07-08T10:54:49.201621Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","venue":"cs.CV","work_id":"53b1d836-7feb-402c-97c7-87b9bc51196f","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:c0178fd1f9f3cc9583b7b78ff317532d33fbe91e40e28335cf42ccd608d672b0","observation_id":"f1f8c7b2-f33b-44f0-8ca5-ec49c773b450","resolution":{"observed_at":"2026-05-16T14:58:37.430827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"42834237-2231-4eb6-9344-da600a2a604f","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:d58e20ef76e1c7c02eb8d606940c68e95ad7e91233f1953e84a50ae9076fb417","observation_id":"92525b43-496a-4e6a-b0fb-3ad6866b5bd9","resolution":{"observed_at":"2026-05-16T14:58:37.562527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"4052a737-4340-45e9-90b7-fadc2efe49e6","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:bc160b7f52d1a8adf466b2cb89662e88df2b726a229d73cef83d5dc50c33b774","observation_id":"4b421b8b-cce4-43ef-9a75-aa9814a74e6c","resolution":{"observed_at":"2026-05-16T14:58:37.565049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.814697Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"311419a3-c410-4617-b43d-114cfd5498bf","year":2021},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:1e4d33045dd1d4ad1f0c2c8a173ca2a9cd354a96b9a2b84ac78dd850f899da59","observation_id":"e044e6b6-5b34-4e22-a1ee-91824dfd3ba5","resolution":{"observed_at":"2026-05-16T14:58:37.491793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"eb47c630-8bcd-4f31-bc25-f7c73903d972","year":2020},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:ad72dc4910b50cb190e584241ecb92effec2e9534dbbddceeb58a2197d31e03d","observation_id":"ff7379f4-2eff-4f58-baf3-6277d9280564","resolution":{"observed_at":"2026-05-16T14:58:37.521112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"a90290fc-a462-4e0b-a104-44399619beab","year":2020},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:9646a04699b8305c4fcff5c51a41de441ecfad29d6c6f052734cd20c4e10bd29","observation_id":"0817e3f4-34ad-4a5f-874d-fb924a198d12","resolution":{"observed_at":"2026-05-16T14:58:37.498331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.405511Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"4055c382-1505-417a-a4bf-813919c20dc1","year":2022},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:65a268b38e91e3e9e1086be14fe14b299f97619e2865cca1af30851a36cb5922","observation_id":"6f26e00a-fc3d-4085-9615-d1c07f0055b0","resolution":{"observed_at":"2026-05-16T14:58:37.501856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"5c8b99fc-96c4-494a-b6d2-729fc7d6c5f6","year":2022},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:d337c148ff4760ddcb327faef0b81c609896704e6a4fc4f4d62afdf400bf0835","observation_id":"e2deabf2-87a2-4bd1-bc43-1c41295c135b","resolution":{"observed_at":"2026-05-16T14:58:37.505419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":"8c314275-cf6b-452c-a2fe-1d78f6ee394f","year":2021},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:e50a9326b164c3a96da20ca6c1daa01f9818f10d62aed1645772efeddad02a76","observation_id":"e12772ff-067d-4b1e-b59f-3caea0ed7bf1","resolution":{"observed_at":"2026-05-16T14:58:37.508949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17042","last_updated":"2023-11-28T18:53:24Z","snapshot_observed_at":"2026-08-20T04:22:54.116747Z","submitted_at":"2023-11-28T18:53:24Z","title":"Adversarial Diffusion Distillation","version":1},"cited_work":{"arxiv_id":"2311.17042","doi":"10.48550/arxiv.2311.17042","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adversarial diffusion distillation","venue":"arXiv (Cornell University)","work_id":"44af4d16-10bc-4469-8a04-589d0aecf9bf","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2311.17042","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:379a7f163a114d41dca979faf4c0c99c0eb08796d31fbaae2299ebc4e2f18912","observation_id":"40df8d60-f4ca-468b-b68b-8d4529eddc54","resolution":{"observed_at":"2026-05-16T14:58:37.436697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"73ab2f58-5a1a-4c24-b31a-eb3c402222c9","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:83e5a1679518dc2602aace5efa6b9d0eb6e66daa22942aed6ecf83e507592755","observation_id":"496b6f5b-db62-4586-8d14-79b01dd9ae0f","resolution":{"observed_at":"2026-05-16T14:58:37.512083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"ac9d72e5-eb60-417e-963d-25671207074e","year":2017},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:7e63de36dd456119019b60f967b23cf6dd1ac476432003b861fdf83c8ce606c9","observation_id":"cf757cd1-032d-4489-9283-539769e0af20","resolution":{"observed_at":"2026-05-16T14:58:37.514892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05534","last_updated":"2023-09-11T15:18:28Z","snapshot_observed_at":"2026-08-16T15:01:41.742989Z","submitted_at":"2023-09-11T15:18:28Z","title":"PAI-Diffusion: Constructing and Serving a Family of Open Chinese Diffusion Models for Text-to-image Synthesis on the Cloud","version":1},"cited_work":{"arxiv_id":"2309.05534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05534","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pai-diffusion: Constructing and serving a family of open chinese diffusion models for text-to-image synthesis on the cloud","venue":null,"work_id":"8bd552f8-b1d0-4466-bdca-a69cee810263","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2309.05534","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:558dacbd8249a09932baf1aac7c1c69685d6c966cd652bb132505785e015a3ff","observation_id":"9c83a454-109f-4355-af2b-7413fc309d7d","resolution":{"observed_at":"2026-05-16T14:58:37.455502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:0b9fc441542b585e947748d13bd45ce7af627cc6042418464b49ff99c28843f6","observation_id":"082d8ffd-e82a-4384-9e7f-0bc07055dbf8","resolution":{"observed_at":"2026-05-16T14:58:37.460606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14688","last_updated":"2024-06-18T03:17:18Z","snapshot_observed_at":"2026-08-16T14:24:20.320071Z","submitted_at":"2024-01-26T07:17:50Z","title":"Taiyi-Diffusion-XL: Advancing Bilingual Text-to-Image Generation with Large Vision-Language Model Support","version":3},"cited_work":{"arxiv_id":"2401.14688","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14688","snapshot_observed_at":"2026-07-01T15:45:48.789215Z","title":"Taiyi-diffusion-xl: Advancing bilingual text-to-image generation with large vision-language model support","venue":null,"work_id":"c3476db7-097b-4441-b22e-535882e92f1e","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2401.14688","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:1232d331c70c1db471290d30c38a06ce832abcca8b3a04da3a0ed83968b0193e","observation_id":"17dcc32c-0090-4f4f-b188-e71e1e898e35","resolution":{"observed_at":"2026-05-16T14:58:37.465038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09257","last_updated":"2023-12-07T03:56:56Z","snapshot_observed_at":"2026-08-16T14:43:15.693719Z","submitted_at":"2023-11-14T23:07:50Z","title":"UFOGen: You Forward Once Large Scale Text-to-Image Generation via Diffusion GANs","version":5},"cited_work":{"arxiv_id":"2311.09257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.09257","snapshot_observed_at":"2026-07-09T22:36:36.160048Z","title":"Ufogen: You forward once large scale text-to-image generation via diffusion gans","venue":"cs.CV","work_id":"1925f255-217b-47e8-aeed-899d96d308aa","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2311.09257","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:5c909a267eb985bcec6f3280bca1108afd4b9ebcf3c66567a46b4c74224239e6","observation_id":"e03bf071-645a-47ad-8781-513f76be546c","resolution":{"observed_at":"2026-05-16T14:58:37.469901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11708","last_updated":"2024-05-05T04:50:54Z","snapshot_observed_at":"2026-08-16T14:25:42.389620Z","submitted_at":"2024-01-22T06:16:29Z","title":"Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2401.11708","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.11708","snapshot_observed_at":"2026-06-29T13:23:28.257830Z","title":"Mastering text-to-image diffusion: Recaptioning, planning, and generating with multimodal llms","venue":null,"work_id":"bd988759-4f55-4079-8131-1162ced8f017","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2401.11708","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:0dd297c168e830f8c1c38a2582e62b1f60dba8a8fec8f62dd8ba3af04261b715","observation_id":"d2c356f3-c195-426d-8230-ba8200344824","resolution":{"observed_at":"2026-05-16T14:58:37.473771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Altdiffusion: A multilingual text-to-image diffusion model","venue":null,"work_id":"fdd5ff69-4281-447d-9f5b-ede04ba23f34","year":2024},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:7c6ce4bcc8b4b6ba2fefe0022b9f3c9674f5ef1021a6275e55b91dd67d66f7fc","observation_id":"5bfd222e-5971-46f7-b3aa-f0b6e370dbaa","resolution":{"observed_at":"2026-05-16T14:58:37.517888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18828","last_updated":"2024-10-04T04:41:06Z","snapshot_observed_at":"2026-08-20T14:16:53.799372Z","submitted_at":"2023-11-30T18:59:20Z","title":"One-step Diffusion with Distribution Matching Distillation","version":4},"cited_work":{"arxiv_id":"2311.18828","doi":"10.48550/arxiv.2311.18828","metadata_source":"pith","pith_arxiv_id":"2311.18828","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Freeman, and Taesung Park","venue":"cs.CV","work_id":"b7f7dc30-a5c5-4364-a21a-2d0a9e50e741","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2311.18828","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:dca5c50c9cdffe94c44eb89c6c836d1f56d8f0687cb76b67c010fddc7ddb5642","observation_id":"b7dc518b-cf5d-429f-8d5c-aa5a690bb261","resolution":{"observed_at":"2026-05-16T14:58:37.483479Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-08-16T14:47:11.091928Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":"2310.20550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-07-04T06:39:37.507046Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"74c6af5e-21d8-426b-bf6d-91f2049fc16f","year":2023},"citing_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T14:58:37.383749Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2405.08748"},"observation_digest":"sha256:0cc49aa944105d1af9e50d0a47aae36145890a2df81a7c3fd2bfdd51a4a83600","observation_id":"a7276b04-4dc2-40a0-9297-790122fa7487","resolution":{"observed_at":"2026-05-16T14:58:37.488355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":15,"verified_fuzzy":25},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 100 inbound Pith citation observations for arXiv:2405.08748."}