{"as_of":"2026-08-08T01:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0415cd12cdeea1549b290ae8f9563b755dbd7e13ee283ccebc48a18365c85860","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T07:30:53.939221Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:08:33.270841Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:59:58.072695Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":"2605.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-07-04T16:59:58.072695Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","venue":"cs.CV","work_id":"e27fd188-a299-4254-8580-d9aa56c73281","year":2026},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:115eb9a5cee9b6585cd098da2f53950cb329c682d75c2c562fd46a21d93786c8","observation_id":"0f9da1a7-4a34-4082-940f-c732308e2808","resolution":{"observed_at":"2026-06-29T23:04:01.951693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":"2605.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-07-04T16:59:58.072695Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","venue":"cs.CV","work_id":"e27fd188-a299-4254-8580-d9aa56c73281","year":2026},"citing_paper":{"arxiv_id":"2606.20100","last_updated":"2026-06-18T11:20:05Z","snapshot_observed_at":"2026-08-05T19:44:52.217038Z","submitted_at":"2026-06-18T11:20:05Z","title":"WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T17:54:09.656061Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2606.20100"},"observation_digest":"sha256:8e23872b724144e39020dc0dae533c33a9dc8c0e49f55d664c86bfa9399a84be","observation_id":"bb2a5259-2619-4d5c-89ba-806ec6451423","resolution":{"observed_at":"2026-07-04T03:39:29.342711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":"2605.11061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-07-04T16:59:58.072695Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","venue":"cs.CV","work_id":"e27fd188-a299-4254-8580-d9aa56c73281","year":2026},"citing_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-07-06T23:59:23.407216Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"reference_index":213,"source":"arxiv_source","source_observed_at":"2026-06-26T00:06:11.951205Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2606.24888"},"observation_digest":"sha256:969239965a12d0c447d9c6ed549d0a515180fffcfea993e0bc6d6e1e2ec4a506","observation_id":"19428b20-9a48-46a5-b5a0-e7084c4bf3a8","resolution":{"observed_at":"2026-07-04T16:59:58.074828Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-08-02T06:13:50.834073Z","title":"Hidream-o1-image: A natively unified image generative foundation model with pixel-level unified transformer.arXiv preprint arXiv:2605.11061, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:13:50.834073Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:48b1960a1eca32a99a957d4e9c69ba40d0c39b23085787f7db263de6d1454d2f","observation_id":"7c448b51-6336-4511-b2b3-f0c670e2ca42","resolution":{"observed_at":"2026-08-02T06:13:50.834073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-08-01T17:35:35.295064Z","title":"Hidream-o1-image: A natively unified image generative foundation model with pixel-level unified transformer,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17585","last_updated":"2026-07-22T07:24:13Z","snapshot_observed_at":"2026-08-06T07:20:20.809986Z","submitted_at":"2026-07-20T06:04:08Z","title":"Pixel-Space Diffusion Transformers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T17:35:35.295064Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2607.17585"},"observation_digest":"sha256:a4f6b2b7f629edb2ae41ebb49406f3e87455fc4953421d1ff6202ba08702fb6b","observation_id":"28ae26fe-1b61-4390-a6b2-06388b361900","resolution":{"observed_at":"2026-08-01T17:35:35.295064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-08-01T08:26:05.138511Z","title":"arXiv preprint arXiv:2605.11061 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21118","last_updated":"2026-07-23T09:54:25Z","snapshot_observed_at":"2026-08-05T16:24:08.444598Z","submitted_at":"2026-07-23T09:54:25Z","title":"The Second LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T08:26:05.138511Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2607.21118"},"observation_digest":"sha256:514b6c4ddf03d4cc762648e897d56b701528fff9782f6ba8e61c2522fe1f46db","observation_id":"a6902df7-c41c-4bd3-a0a3-b84a0323650e","resolution":{"observed_at":"2026-08-01T08:26:05.138511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-08-05T00:46:23.336119Z","title":"arXiv preprint arXiv:2605.11061 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00559","last_updated":"2026-08-01T09:42:45Z","snapshot_observed_at":"2026-08-06T23:17:27.466923Z","submitted_at":"2026-08-01T09:42:45Z","title":"Test-Time Curriculum for Open-Set AIGC Detection","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T00:46:23.336119Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2608.00559"},"observation_digest":"sha256:fe2c453da58dd4592ca4abc15a4f7d19f228bb49c13e77e30106cc451d93f3b0","observation_id":"6cbb03c2-804e-43c6-96bc-03936f7f091a","resolution":{"observed_at":"2026-08-05T00:46:23.336119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11061","snapshot_observed_at":"2026-08-07T23:08:33.270841Z","title":"arXiv preprint arXiv:2605.11061 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05811","last_updated":"2026-08-06T09:44:00Z","snapshot_observed_at":"2026-08-08T00:15:30.906118Z","submitted_at":"2026-08-06T09:44:00Z","title":"Energy-Guided Flow Matching","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:33.270841Z"},"links":{"cited_paper":"/paper/2605.11061","citing_paper":"/paper/2608.05811"},"observation_digest":"sha256:d8f5cef5250dd0e26157be1f8ce7f01f7deb33b6212d594d7cff9a3b9277a1a5","observation_id":"7c538e97-25ef-45b7-9465-00b384fa2dba","resolution":{"observed_at":"2026-08-07T23:08:33.270841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.11061/citation-record","integrity":"/paper/2605.11061/integrity","json":"/paper/2605.11061/citation-record.json","paper":"/paper/2605.11061"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:3e057b1d4d664e6db85e803a057a3450bf17dd1ed8072ed5170455bbb20838bb","observation_id":"e1fb42cc-2f91-4e74-b6e1-bc990d373d7b","resolution":{"observed_at":"2026-05-13T07:32:29.671231Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-07-30T00:45:52.058972Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":"2505.22705","doi":"10.48550/arxiv.2505.22705","metadata_source":"pith","pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","venue":"cs.CV","work_id":"68d4c0f7-3dfd-438d-a823-6a93fd0a835d","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:5a8b395deb3a895ed45bb37af12e9c638da5c2113388c5a08dba305ab042f4b4","observation_id":"a268411b-4ec7-45a1-a5c3-dc428dfecbc5","resolution":{"observed_at":"2026-05-16T17:13:39.137651Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on Image Processing (2024)","venue":null,"work_id":"a89f9e21-a19b-4039-a0ae-6827e4dd9bae","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:9f09c62c765b61715a8823fea955f1ca1969576710a8454328dd10390a8cac80","observation_id":"27a4dcd7-9984-4154-8190-7705781966c1","resolution":{"observed_at":"2026-05-13T08:17:32.510490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ECCV (2024)","venue":null,"work_id":"9110a419-5ca6-4b70-bee7-1c7ff0506b07","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:c76622bb8f324e73e6bf8e113d814deb6ecb4399a05fea822a047c97b5c153b1","observation_id":"5c6bd396-b527-4ba4-af0e-c97c61658af9","resolution":{"observed_at":"2026-05-13T08:17:32.514587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:c90a1c4fb4af202d5a220d83a36863cf7c332fbc65f3ffaba5a97ca21c63c27a","observation_id":"7f266e11-021d-4f5e-856f-0dacaccfa619","resolution":{"observed_at":"2026-05-13T07:32:29.665378Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICLR (2024) 22","venue":null,"work_id":"b7a565a0-a024-4000-8dee-e5901e7c012d","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:2a9bbbd2d4b473b72200c8f6e17323d8070346321c8ef5b997eb84b0a2d587f5","observation_id":"cc9faee1-1340-44ad-9a61-c304c3207aa8","resolution":{"observed_at":"2026-05-13T08:17:32.518594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:014d85663afada0844b7ada9936decb434f667e3b62477bb12bd543e4806b12d","observation_id":"c58e6441-eafc-4645-a827-ce671e78440d","resolution":{"observed_at":"2026-05-13T07:32:29.659035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06558","last_updated":"2024-11-15T14:38:32Z","snapshot_observed_at":"2026-07-06T19:48:10.800324Z","submitted_at":"2024-11-10T18:45:41Z","title":"Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement","version":2},"cited_work":{"arxiv_id":"2411.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06558","snapshot_observed_at":"2026-07-04T00:19:13.837374Z","title":"arXiv preprint arXiv:2411.06558 (2024)","venue":null,"work_id":"f9d700cb-bb3f-4fa2-b8ba-ea4a616649bc","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2411.06558","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:ef17516403d89e449f84967938d6bb4ec0a52a2311f88e15dfbb8bf0ed0dcc0d","observation_id":"9452ff85-47dc-466c-b7de-e940990143e7","resolution":{"observed_at":"2026-05-13T07:32:29.676226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:9b549bf20f3dad00fe68af311aa355cbabd6e6e4d0438e16a69a9d37b8886f9d","observation_id":"dca98682-6c96-4ed9-af04-0b76425374d2","resolution":{"observed_at":"2026-05-13T07:32:29.647389Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":"2401.08281","doi":"10.48550/arxiv.2401.08281","metadata_source":"pith","pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Faiss library","venue":"cs.LG","work_id":"41b4c732-3a63-4106-9e7c-50d61cfb2126","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:19013fbd0549a0a1adca3dc2cac79061aca62ff076844841b956bed917e4c1ff","observation_id":"5ffcc56b-5c24-4464-9a6f-82f8ccbcc1da","resolution":{"observed_at":"2026-05-13T07:32:29.652839Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T08:23:03.866957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T08:23:03.866957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.047391Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes","venue":null,"work_id":"4d349026-15b1-433b-ace5-5104109b2bef","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:2f4d4dd638da1cbf158591022201c2db004d9738fe9803e296a9a7bc28bb7a0e","observation_id":"a7d83bad-d66e-4afb-a0dd-a33196e45e7e","resolution":{"observed_at":"2026-05-13T07:32:29.544298Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICML (2024)","venue":null,"work_id":"f07698eb-1ba8-4d05-846d-67a5dcdb1a5d","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:b0e52ae9e75c37a15aeb4af633052dd69a46b212c3d10a9d5fc49ce35fc62e0c","observation_id":"43bbd542-371f-4f18-8a75-f97f8ff72d41","resolution":{"observed_at":"2026-05-13T08:17:32.465507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-06T15:57:37.748671Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":"2507.22058","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-07-04T13:39:51.493261Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again","venue":null,"work_id":"3ee0ee57-31b9-49d4-98fc-c12c499a14b9","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:00fab30c2043f3d96e6742f8278bd2e132d7dbc53d60c047f72796569989a42d","observation_id":"a3c5b42c-02a1-4d9c-b151-b7003dcd0d6c","resolution":{"observed_at":"2026-05-13T07:32:29.598535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2023)","venue":null,"work_id":"ab7753c9-997c-4e44-a660-6530fde42fcf","year":2023},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:9302c2218c8094ab1b8680fc88bc868f7db627090085b208dba9609cf9ff539a","observation_id":"a256db51-9c80-4cfa-b861-f4031ce526f3","resolution":{"observed_at":"2026-05-13T08:17:32.489482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://gemini.google/overview/image-generation/ (2025)","venue":null,"work_id":"17b31a51-2917-47ed-8e7e-ff86dde27d93","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:937b6821c63b3afa5f1b877e8a579f44e05b5a224359a8e1f5987f9d7b1c2e03","observation_id":"27d25ff8-dede-4758-b9c9-f325ee42c3a5","resolution":{"observed_at":"2026-05-13T08:17:32.469584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https: //blog.google/innovation-and-ai/technology/developers-tools/gemma-4/ (April 2026)","venue":null,"work_id":"a8183991-2aca-4f8b-b346-b070a989d6d1","year":2026},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:246742e2828af1fa04e48e0ede09517ce2d04b83266a89b86cbd168505aa62ed","observation_id":"adb59fe0-7f20-4585-b94e-df0571979689","resolution":{"observed_at":"2026-05-13T08:17:32.499884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2020)","venue":null,"work_id":"783fe038-9c22-43ba-93c7-f995439312f6","year":2020},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:1070d7dcbd598995eaff38540e26145f852f25cfe935c668c2741f8b45a7a20c","observation_id":"74446acd-b424-469b-9c49-e6452fec12b8","resolution":{"observed_at":"2026-05-13T08:17:32.453213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2025)","venue":null,"work_id":"885ab5ee-3b90-42b0-89fd-87884fbc0e67","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:9dd75241792378be9f86522941eef07004f22920386961067885d25927fb37bb","observation_id":"b24eb85d-2d0f-4d81-96b6-7a4e04ef2012","resolution":{"observed_at":"2026-05-13T08:17:32.356506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:b3700cd29eef7cb8cc2d6b92a2bb7bdbc72bbdf445046d4f51e86e73d0e4ddab","observation_id":"bce87889-9f27-4c14-a2a9-efd15e3e9397","resolution":{"observed_at":"2026-05-13T07:32:29.579242Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICLR (2014)","venue":null,"work_id":"46444cfa-a85a-4678-99b9-6e6d01818a48","year":2014},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:061e9928e529ce48fee1f217da55cb22cb9a8dae7fa2e3913c31cc569876f24d","observation_id":"9154e600-e148-43f2-9d23-fb2a4be881b2","resolution":{"observed_at":"2026-05-13T08:17:32.481888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ACL (2024)","venue":null,"work_id":"d543c060-93b2-4bb8-823f-a6d0d3ba3979","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:cab779749f683fef1f8b35e015cdff288bade0aac24d51f5e665e4919974c4a6","observation_id":"23cc2dc6-1f3e-4c7c-90aa-91c104fec71b","resolution":{"observed_at":"2026-05-13T08:17:32.461793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://huggingface.co/black-forest-labs/FLUX .1-dev(2024)","venue":null,"work_id":"e47aa221-e85e-4570-bb7a-f51651fbec48","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:37968a5b3bfe6b74f10b512e5772dcabd35046523003e3117f773ea186f1ed2d","observation_id":"93c9a460-489d-491a-82ad-a9d156bd91ca","resolution":{"observed_at":"2026-05-13T08:17:32.448683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e96badff-6196-424a-9544-7ca4a9baa632","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:df46fc83a7bc5f8823ed665c08005f69d4ed0c89419caa8177a5fb056a96bb88","observation_id":"60f97e5b-9aba-4527-983d-2f621cb8814b","resolution":{"observed_at":"2026-05-13T08:17:32.492703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":"2506.15742","doi":"10.48550/arxiv.2506.15742","metadata_source":"pith","pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","venue":"cs.GR","work_id":"5dfe19d5-3541-4803-8fe9-3c8b9e29b281","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:a445271b9ff588c47481d863f665e43a2090eb4076df01359006f0396d58aee0","observation_id":"9820ca73-c620-4e73-a237-5557071a865d","resolution":{"observed_at":"2026-05-13T07:32:29.621485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.581238+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/LAION-AI/aesthetic-predi ctor(2024), gitHub repository","venue":null,"work_id":"1d60f967-19d8-42b8-8e76-8f93b2dc256c","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:cf1db8a649075dfbfd27e9654a68607d18b15d36e09ce30f1110f2c9e856aa01","observation_id":"468fb069-db85-467c-9a7e-28c94ac8f3f8","resolution":{"observed_at":"2026-05-13T08:17:32.496287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/LAION-AI/CLIP-based -NSFW-Detector(2024), gitHub repository","venue":null,"work_id":"b462561c-7384-40d0-89f2-8e504ea16914","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:ccf6205484b8976f18357532094edfab4ce29aa67d846b04a31c2cfc9de6dbf7","observation_id":"6a67e039-9482-45db-9104-8d9f55e2104b","resolution":{"observed_at":"2026-05-13T08:17:32.382380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/LAION-AI/LAION-5 B-WatermarkDetection(2024), gitHub repository","venue":null,"work_id":"305a3383-9bf4-4232-8690-4412d43832ec","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:56772b22c6c1dc66c76891521792bc9bbb1570bbbc8dd0cc3cb2b81ad2e9f0c8","observation_id":"9c8b9787-480d-48de-baf2-96dbfbd966f5","resolution":{"observed_at":"2026-05-13T08:17:32.360618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":"2511.13720","doi":"10.48550/arxiv.2511.13720","metadata_source":"pith","pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Back to Basics: Let Denoising Generative Models Denoise","venue":"cs.CV","work_id":"37973de8-a5e6-4d92-897b-a98fa9f7f2f3","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:a4e688eece4649f977e07c7fc2e0339f62b6a8f642a9f4b0c543b24f6bbc9442","observation_id":"bcf1b7a8-d449-43f1-8056-77ceb73bb902","resolution":{"observed_at":"2026-05-13T07:32:29.591394Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":"2405.08748","doi":"10.48550/arxiv.2405.08748","metadata_source":"pith","pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","venue":"cs.CV","work_id":"fde63b0b-25e7-43d9-9867-7d6a2ba6d710","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:747e3b639145d69b979c64c61d59489d8191d2aa622bc3b394424b55f7dbc044","observation_id":"9d5a4e95-03ff-4132-8a32-06f8e89223cb","resolution":{"observed_at":"2026-05-16T14:58:37.566044Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2026)","venue":null,"work_id":"4ba234f2-ba06-4b96-a60d-9642c7fe9251","year":2026},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:545b782c80d6d4c0ca096cd8ced72c7ca3a6779ea34f6a364e862af278697c16","observation_id":"ae1ef9dc-505b-491f-ad74-21551f2d61eb","resolution":{"observed_at":"2026-05-13T08:17:32.370076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:b093eaab8bd5d3801ff7721d1d688bbef67c8179a8c1a40266c32fec254b1761","observation_id":"3fb64024-787f-4e87-8272-6e948da6cd59","resolution":{"observed_at":"2026-05-13T07:32:29.531987Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2025)","venue":null,"work_id":"509da7ef-188a-4c79-b0a8-d1bfb2fc25d9","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:235c80e1db123c3c3027dbbf8ee182da5b2ec381967ff850ddbc76d96af4c436","observation_id":"99f182e1-2c93-46a7-94c8-bb316d6f7dd8","resolution":{"observed_at":"2026-05-13T08:17:32.377758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICCV (2025)","venue":null,"work_id":"4633e281-4d2d-412d-93aa-93e6dee7814e","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:eb9c4e76f439341f587dc983fb076e1f92c9c9bd98e8e11c4476fa1b6b6f04f6","observation_id":"c5be07b6-eeef-4801-88ca-84d3256d1b2b","resolution":{"observed_at":"2026-05-13T08:17:32.444719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.15772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2508.15772 (2025)","venue":null,"work_id":"80fb8d2c-ff42-48e8-80a6-ce90195463ac","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:7100ac0e84453284bb61822ab5345c3c604f61dc7b7365f12c9ef68868ba00bb","observation_id":"bb919cf6-f5db-4efa-bdb3-477d3ee66a54","resolution":{"observed_at":"2026-05-13T07:32:29.560958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://openai.com/research/dall-e-3 (Sep 2023)","venue":null,"work_id":"e5131044-4c61-47ce-a723-9b37f18cae3c","year":2023},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:5cc4053e0c5cbe9a99a0ca2da64f83580b91ae702af4f3c390fb56d3437a2d2b","observation_id":"35b65d5a-2178-4b0a-8bd8-5c3341e6ffc2","resolution":{"observed_at":"2026-05-13T08:17:32.405444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://openai.com/index/introducing-4o-image-gen eration(2025)","venue":null,"work_id":"c65a4f32-065d-4a7b-a54d-ca19590a910d","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:21ad19f667d4165f0d5d99a560460a69fa2fff52db05f9db0a2d2c5639dfb158","observation_id":"8165d0c7-f382-4cd4-8351-a2c831575824","resolution":{"observed_at":"2026-05-13T08:17:32.374055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T19:46:29.633380Z","title":"In: ICCV (2023)","venue":null,"work_id":"73b1470f-68c2-4540-ba62-6177a1e99ee2","year":2023},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:7c85714250714343868c31accfeff389d0007e7c7540a57bf10d22394a7664bc","observation_id":"016da473-5e59-4b05-bdfe-2952d6c7b0b8","resolution":{"observed_at":"2026-05-13T08:17:32.364922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2022)","venue":null,"work_id":"88183225-5a9c-46e9-87c3-6b2edd918c0a","year":2022},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:70e5a644dfd8b3b6abfa014ae39186b78b20f46a9fb81c561d56af75afd9069a","observation_id":"f0e266e1-cf2d-40de-b6ab-01bc9d4892e2","resolution":{"observed_at":"2026-05-13T08:17:32.425399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:a4dffe8c9044444a09c65c1bdd48f5b80189db9d5bc6987c76e4ac01497d798d","observation_id":"4f87267d-49a1-49eb-8ac7-aede43ad6df7","resolution":{"observed_at":"2026-05-13T07:32:29.610426Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICML (2021) 24","venue":null,"work_id":"cebffbf7-bb79-4d10-aa72-e4439ad10d7f","year":2021},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:68fde9ad920316c0d6e50ad4b19ce5a76485b77a3e5c95554f0e9ffcba68c172","observation_id":"43665c71-0b3d-4d79-8dca-aac461f56e88","resolution":{"observed_at":"2026-05-13T08:17:32.412736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JMLR (2020)","venue":null,"work_id":"6ce7501f-189d-45e2-94dd-b9c5e34b16f0","year":2020},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:370903e4e8f6bd686b1f297bfdb96a095b20d8b4abf1585cb80a56b052109c9c","observation_id":"97d7a366-2576-44c2-b432-4d7f49bcb8c3","resolution":{"observed_at":"2026-05-13T08:17:32.400986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2022)","venue":null,"work_id":"1afc191d-4c00-42c8-85c8-9b16cfe1c148","year":2022},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:1ce660f4590b80ffbba14eee0c284060ee4f4e59b983ef4a970ea1aa06813f17","observation_id":"c61d1ed0-9308-41e4-bd81-02d159546de8","resolution":{"observed_at":"2026-05-13T08:17:32.386140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-08-07T08:10:15.764742Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":"2509.20427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-07-11T00:07:42.259448Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","venue":"cs.CV","work_id":"15c839a0-48a3-4218-82b6-cac5b7f66e13","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:edabd7f96bf29bd0669aaf5612bb287753d49d2479a59a24111dd43e1290ee2a","observation_id":"5cbf63d3-4aad-4267-bac8-e2833cd20959","resolution":{"observed_at":"2026-05-13T07:32:29.615987Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:1582df4fcd7204b7f5d877c3d27ae26820bafff7f5a43bccc4a25b1db56e1ebf","observation_id":"d25aad1e-c1a4-42a2-a647-e71adebd6cc8","resolution":{"observed_at":"2026-05-13T07:32:29.626212Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2023)","venue":null,"work_id":"1053388c-c011-40d9-b0ff-2a6770c794c3","year":2023},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:24b244f6962e6c2eca50f4c2f9bf31ce05fc526aeba4bad9aeb16a0f445b0f97","observation_id":"6422eda1-78aa-4224-968f-29ef9f1e2ec6","resolution":{"observed_at":"2026-05-13T08:17:32.457522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neurocomputing (2024)","venue":null,"work_id":"930289b9-a400-44f2-ae9d-fc8e133ceb18","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:c4a8038be6fd625ee3f38c4c8bd2f913947473309429caaf9435471b16080dff","observation_id":"c185cd1f-f978-4aaa-94a1-14a9704782ca","resolution":{"observed_at":"2026-05-13T08:17:32.421498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://app.klingai.com/cn/ (2025)","venue":null,"work_id":"7bf4be9a-2f1b-4d14-95a5-5dc1544cd680","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:1eb019c8113576b33fafae3c0e1231f98bb47af5ec80ae9eec83d0d7b447e8ce","observation_id":"2078cf8d-408a-4d12-90ec-83363d006897","resolution":{"observed_at":"2026-05-13T08:17:32.429379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:25cb0e274d0d9f82550a7db1b34c48c7397ac888504956d1303bc66a5caaf2d6","observation_id":"e9b3cfab-41d8-4c3d-af72-011b99644dcf","resolution":{"observed_at":"2026-05-13T07:32:29.555288Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:fe1621504e2d972303ce864f22297f433c2810b85b73ee5f666ccc6026ddb905","observation_id":"b3a7d686-3b0e-4660-8277-8b974026f496","resolution":{"observed_at":"2026-05-13T07:32:29.566822Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICLR (2024)","venue":null,"work_id":"d30898e7-a7a2-4fcc-94e7-2b5dbfe47d82","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:7b2045143968fb0c5c646fffdfe629aebcd75d8d9a5b75ca88cdac52d32ae4c2","observation_id":"203a4629-c506-40b1-95c7-6fcfb3c8b415","resolution":{"observed_at":"2026-05-13T08:17:32.434234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:276a75aeb270026d6c8ede99447d88286649231f8da583f7dbb85d4641bcf4ac","observation_id":"3e383fbd-8d9e-4b13-b95c-92907063b594","resolution":{"observed_at":"2026-05-13T07:32:29.538240Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12675","last_updated":"2026-06-09T11:29:25Z","snapshot_observed_at":"2026-08-03T16:37:02.565200Z","submitted_at":"2025-12-14T12:58:19Z","title":"Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling","version":3},"cited_work":{"arxiv_id":"2512.12675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.12675","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling","venue":"cs.CV","work_id":"447a4c46-bc2f-46db-90b7-07ace292fada","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2512.12675","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:ecf0c46632f1de452d6b22c7eaa6c424985af212611289f8f524a8727c65c56b","observation_id":"a69cbe8a-95f7-42eb-953b-17f17f639ad3","resolution":{"observed_at":"2026-05-13T07:32:29.572856Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:76976ca35fc86a2bffa61b71a812af7b7546cfaee883854809cca4b915317fac","observation_id":"8e92a159-38c2-46c8-8648-4e9bc6221ff3","resolution":{"observed_at":"2026-05-13T07:32:29.549443Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:9e594ffd71a6250fb66d31f4ca572c1f018f943b1ebd2efef6cfe335776e74d4","observation_id":"cdfc8470-3fbd-4dda-8c09-5149de8c4930","resolution":{"observed_at":"2026-05-13T07:32:29.636734Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06679","doi":"10.48550/arxiv.2510.06679","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dreamomni2: Multimodal instruction-based editing and generation","venue":"ArXiv.org","work_id":"caa956fb-4bc6-4cba-ab91-329773bba8a1","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:0c9e48eaa3e0545182703650b2c9755a5b8ea633291ec28a44a05f45e78af697","observation_id":"ab2dc494-82ce-4b4f-8278-ecf47f15a06d","resolution":{"observed_at":"2026-05-13T07:32:29.585504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2025)","venue":null,"work_id":"de7ee575-fbf7-41a6-8d00-382b2f651f26","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:0d058eb2da37752b608140e955ec44e5c0f7a965d826996aa232360144087a93","observation_id":"7477b3ce-c5a3-4628-a231-aca8af8a4cec","resolution":{"observed_at":"2026-05-13T08:17:32.473659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICLR (2025) 25","venue":null,"work_id":"7a82ecff-f9e3-47b2-9542-afe5d0ab9a06","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:a13a6e24caeafe14ec24dcdcf335dc012d831ba36655683fe308fa851c3bf9cc","observation_id":"5573006f-2d1b-4f44-a2ee-0ec082133e03","resolution":{"observed_at":"2026-05-13T08:17:32.503507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICCV (2025)","venue":null,"work_id":"4a5a8eff-26f1-4b17-8216-b9f5ec7bb954","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:2e5b3ffdc7c617b543003cfc25ba90e5cd36ff7e565654de31786922ffb4525e","observation_id":"2982a70a-14f9-4342-a1c6-7fe1933be2b5","resolution":{"observed_at":"2026-05-13T08:17:32.477658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:7c3b8ea641b745205b342be4e6cc34d614d2cab2853f29464d88da82d87d107b","observation_id":"e6f3e836-e3b6-44dd-b520-5a428ec346ac","resolution":{"observed_at":"2026-05-13T07:32:29.604208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:88aeaf468884dd5504a8afc3ceac3065aa3b615fe73dba696889b12abae879a1","observation_id":"d9128e45-ad7f-46fc-9c97-2100d66e12b1","resolution":{"observed_at":"2026-05-13T07:32:29.631186Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2024)","venue":null,"work_id":"280223e2-09b7-46d4-9a50-3a3290780772","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:dd65b316cea57f7ba71455dfd0971f23691c1617737993ae2a43e5e7bb5c544a","observation_id":"fe45bf9d-c02d-4410-86c3-4c05307a13db","resolution":{"observed_at":"2026-05-13T08:17:32.485756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2019)","venue":null,"work_id":"661d4701-7e23-4489-99ce-9a6ef6e81ced","year":2019},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:81a6e91d07325e96fe8ab7ed1823bd3c631233c8d30411e81d71df96cce31865","observation_id":"dcf373ce-94b9-4cd5-aa47-b8b4c624181e","resolution":{"observed_at":"2026-05-13T08:17:32.417266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2018)","venue":null,"work_id":"4277c6ee-08da-40be-9f50-e387c68fa640","year":2018},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:c410a4eee30d7b71edb4b9f2021babc93e2be2d82cb9a84b671395415f51feb5","observation_id":"de7575d5-74f1-4162-8156-c548dbad2634","resolution":{"observed_at":"2026-05-13T08:17:32.440984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2025)","venue":null,"work_id":"b9d92690-8646-4ba5-90cf-d2e57579c8c3","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:59ca376224a82622162f78cf0bdcafe1356c5ce0ece4dc8987016b2196ac10e5","observation_id":"f17b5f57-04d9-41ca-b0d4-c7584fe0f8b1","resolution":{"observed_at":"2026-05-13T08:17:32.409293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICML (2025)","venue":null,"work_id":"f747c2b1-290d-4391-bd8d-032066104afb","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:2cbe60d6001f64931f2a89f52014fc447d2fb6ead5d297dcd7eb4a4a1988b672","observation_id":"28a75958-6235-47de-8e2b-b2ed87465a26","resolution":{"observed_at":"2026-05-13T08:17:32.397045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.12669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:39.661947Z","title":"3dis: Depth-driven decoupled instance synthesis for text-to-image generation","venue":null,"work_id":"962a1fc4-b045-4fab-a202-0f1bdb67fb6c","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:8d18c1ead31040baf5177541cbc0309f2b0820fd31e63915ea900ea3cfa11435","observation_id":"8389586f-d5f0-4e84-9b5a-46348f880015","resolution":{"observed_at":"2026-05-13T07:32:29.642149Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: CVPR (2024)","venue":null,"work_id":"0cc5348a-7244-4359-8361-45d999e1d7ff","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:b4125033f629b017b12797d4e947ccc19e6c82da6b5ec984c0707364dca4c728","observation_id":"d0cbfb05-184b-4380-9bd7-e4c47abf3c3d","resolution":{"observed_at":"2026-05-13T08:17:32.507089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2024) 26 Appendix A","venue":null,"work_id":"170ca2cc-fe1d-42ee-bc64-9392417a05b9","year":2024},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:85496de261b9ef2c34ff6ae8481d926405eb86888cbc5cc9c14e7ac92c2ebe52","observation_id":"3ea6c37c-51fc-494b-8114-0a2e06b9586a","resolution":{"observed_at":"2026-05-13T08:17:32.391035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":25,"parse_uncertain":0,"unresolved":1,"verified_exact":3,"verified_fuzzy":39},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 8 inbound Pith citation observations for arXiv:2605.11061."}