{"as_of":"2026-08-06T02:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a631c51359b6021f75a4e6009ea2396e2a22278acb9ff804af33d79d7ae1832","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T19:47:32.986689Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":154,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:47:20.091819Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-03T21:47:20.091819Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.13649","last_updated":"2026-07-03T19:09:38Z","snapshot_observed_at":"2026-08-03T21:47:18.352895Z","submitted_at":"2025-11-17T17:59:54Z","title":"Distribution Matching Distillation Meets Reinforcement Learning","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T21:47:20.091819Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2511.13649"},"observation_digest":"sha256:50eb36be043e45776dc2dd3b002f5836ff1ef1f3f349a361f6bbc4c9680340b0","observation_id":"c81ea765-ef6b-477a-a082-dd27135b2b35","resolution":{"observed_at":"2026-08-03T21:47:20.091819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T13:00:22.875471Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:2877d91ba40727e67e37ef5ab43e2c88cd960a49bec0f3ad5fa56445db2f6b6f","observation_id":"9689cddf-a710-43e7-a250-f549ef12df32","resolution":{"observed_at":"2026-05-21T13:04:10.565559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-03T03:50:45.140207Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:50:45.140207Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:88eac16d0a35a38db0c9f042d3bddb1f6c74c06e1c358d3f88f79b254b9a1ff3","observation_id":"61207d22-6a08-47c7-beb3-4a670fc9c49a","resolution":{"observed_at":"2026-08-03T03:50:45.140207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2602.11146","last_updated":"2026-05-22T14:43:10Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T18:57:29Z","title":"Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T06:41:33.493927Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2602.11146"},"observation_digest":"sha256:0b4011770c9c5d9d72944dc44c584f19925b4b29f30c9ee2a57dc79a7e2f0a61","observation_id":"e47ed3b2-0d9a-45f7-a42c-d69329f70c11","resolution":{"observed_at":"2026-05-25T06:45:26.193206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-02T23:59:13.166878Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion transformer.arXiv preprint arXiv:2511.22699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12155","last_updated":"2026-06-29T06:08:55Z","snapshot_observed_at":"2026-08-04T12:11:40.185011Z","submitted_at":"2026-02-12T16:36:33Z","title":"FAIL: Flow Matching Adversarial Imitation Learning for Image Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T23:59:13.166878Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2602.12155"},"observation_digest":"sha256:6ebc993f381f7b139a8dab0626332579c247cefa96d7a084ab0e00707bf32f5c","observation_id":"fd15ab86-c4cc-4ca0-a4f3-28920028d1b0","resolution":{"observed_at":"2026-08-02T23:59:13.166878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-15T14:36:31.220132Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion transformer.arXiv preprint arXiv:2511.22699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05425","last_updated":"2026-05-27T15:11:58Z","snapshot_observed_at":"2026-07-30T08:29:32.410469Z","submitted_at":"2026-03-05T17:45:47Z","title":"RelaxFlow: Text-Driven Amodal 3D Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-15T14:36:31.220132Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2603.05425"},"observation_digest":"sha256:6f987ae274101ae8d350553150bb858ad31b67922b7a6f35f80a89a9929af21e","observation_id":"f0c45f18-6d24-4c4f-8610-5b361a36f76d","resolution":{"observed_at":"2026-07-15T14:36:31.220132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-15T13:54:54.362524Z","title":"arXiv preprint arXiv:2511.22699 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06275","last_updated":"2026-07-01T09:15:25Z","snapshot_observed_at":"2026-07-15T13:54:53.884621Z","submitted_at":"2026-03-06T13:33:40Z","title":"Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-15T13:54:54.362524Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2603.06275"},"observation_digest":"sha256:c5f58e285fed60d52d5fbc8b1453b8869dee721ca9d9f86d2a180b6b797a5f40","observation_id":"7ad30ae1-7a54-4881-9abe-9c7863b9657c","resolution":{"observed_at":"2026-07-15T13:54:54.362524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-14T22:28:35.981853Z","title":"arXiv preprint arXiv:2511.22699 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12506","last_updated":"2026-07-03T16:51:28Z","snapshot_observed_at":"2026-08-04T19:31:37.089549Z","submitted_at":"2026-03-12T22:51:39Z","title":"Na\\\"ive PAINE: Lightweight Text-to-Image Generation Improvement with Prompt Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T22:28:35.981853Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2603.12506"},"observation_digest":"sha256:74e9556b5c68fd527c7072e915febcd5c3bad247d9fc30e268e6c313dc05ba6a","observation_id":"3f06452c-899d-4cbe-8af5-7c5b96768746","resolution":{"observed_at":"2026-07-14T22:28:35.981853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T21:18:10.087258Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:89574ce07664d77b464251166f99b88c6f66a3f3c59aa6bf235e83f00be29997","observation_id":"f7f73945-cecc-42ca-ae2d-8aa94eb462d6","resolution":{"observed_at":"2026-05-14T21:19:28.174364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T06:31:13.232880Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:cabafacb256c5712af82db15fabe2a05ec1f6d2f5e0c64359e9ccc673bccbead","observation_id":"5dabeb3f-6b33-458e-a361-9663a75f3a2d","resolution":{"observed_at":"2026-05-25T06:35:25.098083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-15T11:41:34.003655Z","title":"Z-image: An efficient image generation foundation model with single-stream diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03059","last_updated":"2026-07-14T13:14:26Z","snapshot_observed_at":"2026-08-02T15:59:44.173878Z","submitted_at":"2026-04-03T14:20:00Z","title":"The Darkside-20k Data Acquisition System","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-15T11:41:34.003655Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.03059"},"observation_digest":"sha256:301b3eda5a728710951d4147e9dc03897c5ad7f6c11ce9f590dc4742a24001ff","observation_id":"8b77b497-933e-4086-9e0d-f277a852add0","resolution":{"observed_at":"2026-07-15T11:41:34.003655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.03061","last_updated":"2026-05-12T16:08:53Z","snapshot_observed_at":"2026-08-02T05:59:14.242322Z","submitted_at":"2026-04-03T14:33:29Z","title":"Can Nano Banana 2 Replace Traditional Image Restoration Models? An Evaluation of Its Performance on Image Restoration Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T20:11:44.590571Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.03061"},"observation_digest":"sha256:6643afb83ce02d5089857d4ee4f16bd97677d3f5b7bd8b138b783af3cebb6437","observation_id":"3f2f45c2-1057-43f1-be25-518e96e59c0a","resolution":{"observed_at":"2026-05-13T20:13:13.384687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.04451","last_updated":"2026-04-06T05:55:13Z","snapshot_observed_at":"2026-07-06T22:53:24.585766Z","submitted_at":"2026-04-06T05:55:13Z","title":"Beyond Few-Step Inference: Accelerating Video Diffusion Transformer Model Serving with Inter-Request Caching Reuse","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:50:20.499116Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.04451"},"observation_digest":"sha256:c3388f91b037ab7dda9ee3b89ba00c77d50d70a06e9f6a6c4b3fb1c9a3766e69","observation_id":"f996419c-c92a-4bdb-8b41-27907867f2e5","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:66c8377b229bebacb30a12321234333546ce138ad4db4f085f178efba7141a76","observation_id":"1a7e33da-a28a-4c72-b3fe-9c75e168f906","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.07101","last_updated":"2026-04-08T13:55:02Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T13:55:02Z","title":"SurFITR: A Dataset for Surveillance Image Forgery Detection and Localisation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T18:23:48.168061Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.07101"},"observation_digest":"sha256:e5c633744413ab3c1ba6eeb9c4d4f817afa6fbc3d75ff6004fd8af267e6bd511","observation_id":"d75b1bd7-cfe4-4999-99be-cd9f949c808d","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.07879","last_updated":"2026-04-09T06:49:43Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T06:49:43Z","title":"FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:03:35.420451Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.07879"},"observation_digest":"sha256:3f4a9ab017cb509ad3ddd50a44f00444162967b7002f01c4165cd1eb03ca2f93","observation_id":"e4c7aac1-ebda-46a6-a70f-503b84790f99","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.08641","last_updated":"2026-04-09T17:30:10Z","snapshot_observed_at":"2026-08-02T18:54:30.375399Z","submitted_at":"2026-04-09T17:30:10Z","title":"On Semiotic-Grounded Interpretive Evaluation of Generative Art","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T18:35:53.179645Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.08641"},"observation_digest":"sha256:7a726b2e36cdc5215391bcf9ed3d914198f8ef4725bbc249159eb9a6a4315521","observation_id":"48fdee11-6ed5-4f2b-b553-24007ea23e7a","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.08915","last_updated":"2026-04-10T03:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T03:21:17Z","title":"Large-Scale Universal Defect Generation: Foundation Models and Datasets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:58.002432Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.08915"},"observation_digest":"sha256:dd57bf2e30c9213a3c1eb71f1ccb39a649bfaab5f906746df0f5e9e3baa27e85","observation_id":"7e7cb078-fdec-46b6-ad90-1fd8751cb2ff","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.09201","last_updated":"2026-04-10T10:43:18Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T10:43:18Z","title":"CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:53:54.166457Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.09201"},"observation_digest":"sha256:d455338f438d9f9848413b44c1601b06b11f50e6d0b83d901bc50935ee715732","observation_id":"92aac240-6ecb-478c-9dad-be700d893396","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.10532","last_updated":"2026-04-15T11:48:29Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T08:49:14Z","title":"The Second Challenge on Real-World Face Restoration at NTIRE 2026: Methods and Results","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:14:44.509619Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.10532"},"observation_digest":"sha256:fa7ba8747a9d260322d032eb0a88c931179a9c3045636a02720587130a6a70a0","observation_id":"099445d6-f0a5-4aad-b13c-c522b680c04d","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.11521","last_updated":"2026-04-13T14:23:31Z","snapshot_observed_at":"2026-07-31T08:57:40.954187Z","submitted_at":"2026-04-13T14:23:31Z","title":"Continuous Adversarial Flow Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:25:53.420119Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.11521"},"observation_digest":"sha256:b67dd5948073f7a73e1b627c610022e5f3d9337e3a95505f26a9b008ec0ca8fc","observation_id":"d5935658-43c1-4359-a2b0-689c357093db","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:41:23.057949Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:b364f049f0fa06fc79d48e49d57ad83c4e02e9f657173847b79942b079d1bd16","observation_id":"b5ff860e-bbb6-4c15-a1fd-bd4fb9d41786","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-12T21:00:35.123495Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T21:00:35.123495Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:8f06c5e33025240e404739df4f16138b221516c5771e34245aceb7d8bfca6aa8","observation_id":"b10757ed-f2b8-4fb0-884c-5e5a2b9ce54b","resolution":{"observed_at":"2026-07-12T21:00:35.123495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.13856","last_updated":"2026-08-05T03:17:18Z","snapshot_observed_at":"2026-08-06T02:37:09.314449Z","submitted_at":"2026-04-15T13:24:47Z","title":"Any3DAvatar: Fast and High-Quality Full-Head 3D Avatar Reconstruction from Single Portrait Image","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:21:36.209440Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.13856"},"observation_digest":"sha256:1643dae645489a9452a950575e9e7783998ada6a4b59522623eee059609cf0c8","observation_id":"f9f8c86e-05db-46ce-a1dc-b0859e697aa2","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.14558","last_updated":"2026-04-16T02:41:53Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:41:53Z","title":"The Fourth Challenge on Image Super-Resolution ($\\times$4) at NTIRE 2026: Benchmark Results and Method Overview","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T11:41:11.253990Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.14558"},"observation_digest":"sha256:234368802f277f718ad99600ef973b53ffceba293864835c9911933af607e882","observation_id":"77041e8f-db5e-49b2-9d15-3f1d466ba68f","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.19009","last_updated":"2026-04-21T02:57:13Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T02:57:13Z","title":"Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:45:35.600729Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.19009"},"observation_digest":"sha256:56ed873b8c20d932146b5e7b7f6da1cc2e8238747532f6cb1ff8ed244f82a438","observation_id":"b0892c14-ad66-425e-a09e-f4a8187004c6","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.19039","last_updated":"2026-04-21T03:44:13Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T03:44:13Z","title":"Generative Texture Filtering","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T03:16:37.509163Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.19039"},"observation_digest":"sha256:f5119c6f3c65fea6c91725e444b6e13cad796bb170ef9a017c3a8f2819eec72d","observation_id":"4ff27e17-cf46-4aa6-a733-f62ccdf10847","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.19632","last_updated":"2026-07-14T14:46:21Z","snapshot_observed_at":"2026-07-17T23:19:00.762206Z","submitted_at":"2026-04-21T16:20:19Z","title":"CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T03:19:10.670279Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.19632"},"observation_digest":"sha256:94d6b2cdc44770d5d4d73c47068d67aa8ea836c0453d083ad5924b2d8ab214ed","observation_id":"dbf6b477-aadd-4885-a492-4d722f1dbd7e","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.19636","last_updated":"2026-04-21T16:25:43Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:25:43Z","title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:45.834520Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.19636"},"observation_digest":"sha256:ec2fb63812a9cc267691add8335068c539407bda36342361ef41f7a8d90ece3c","observation_id":"5428014a-1fe5-4524-bdc6-b1ef0aff91bd","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.20796","last_updated":"2026-04-22T17:20:42Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-22T17:20:42Z","title":"LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T00:49:38.156237Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.20796"},"observation_digest":"sha256:707b35f47b5b0988a4ec37b945dde0419f042ad8ebf509aefda0174bf0251bea","observation_id":"dd4be4e1-ee35-4e95-a56f-c341d9bdf020","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.21921","last_updated":"2026-04-23T17:58:38Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:58:38Z","title":"Context Unrolling in Omni Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T22:02:57.841111Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.21921"},"observation_digest":"sha256:7a54a5ecbae46dfa30acec4cbd073dd5f54a873d2da9e871f4e6891233f0552e","observation_id":"27fca583-69d2-4df7-852a-6acb7e861bb8","resolution":{"observed_at":"2026-05-11T14:21:04.931128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.22855","last_updated":"2026-04-22T12:28:04Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-22T12:28:04Z","title":"Evaluating Remote Sensing Image Captions Beyond Metric Biases","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T01:06:35.604862Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.22855"},"observation_digest":"sha256:6b29747cd9c27ff2994a2f9b35d0df9605347f919a36ce7b79a3a7b75f73b6cb","observation_id":"e1a80a04-44b1-4eb5-a0b4-8f57ef3288c8","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:8e8f9428b74954dae8aafba15eaf3ec1bbe3e206c38a0974dae07d95740fc5d7","observation_id":"3c9c3ed0-f207-4226-b77f-0dc902f4d138","resolution":{"observed_at":"2026-05-11T21:41:18.866479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:aef225bd040c9aa425d1bfd76eb1e769d7f85375a66b96138e3edf654264973e","observation_id":"a95c9959-6841-4ac8-b32b-bcfbbdf71840","resolution":{"observed_at":"2026-05-20T23:43:51.133147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.25289","last_updated":"2026-04-28T06:53:57Z","snapshot_observed_at":"2026-07-30T22:24:38.173345Z","submitted_at":"2026-04-28T06:53:57Z","title":"Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T16:52:29.681159Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.25289"},"observation_digest":"sha256:aa3e74ffc7625e6c3f258709c42fea9b968cc84ec3576e109e3015aeeedac474","observation_id":"db9e4650-eadd-442f-80c2-32e8716eb0b9","resolution":{"observed_at":"2026-05-11T23:31:15.532397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.28185","last_updated":"2026-04-30T17:59:02Z","snapshot_observed_at":"2026-07-06T23:13:29.310140Z","submitted_at":"2026-04-30T17:59:02Z","title":"Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T06:38:04.459129Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.28185"},"observation_digest":"sha256:84093323fc260053ff75a44bcf503f8fd12bc9fb3d2c8b635ccad1733fffa344","observation_id":"447a3ff7-4aba-47f8-90f5-f57ee42ad371","resolution":{"observed_at":"2026-05-12T10:21:27.778015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.00526","last_updated":"2026-05-01T09:04:17Z","snapshot_observed_at":"2026-07-06T23:13:57.367556Z","submitted_at":"2026-05-01T09:04:17Z","title":"IdentiFace: Multi-Modal Iterative Diffusion Framework for Identifiable Suspect Face Generation in Crime Investigations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:33:24.911067Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.00526"},"observation_digest":"sha256:7e7ed886fb60b57e0dc743948ac86b25e3469fdba7342fe37f3a5ccacccabb85","observation_id":"f969dd79-c707-434e-b7f4-416d4c3c0c94","resolution":{"observed_at":"2026-05-11T15:36:09.875360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.02417","last_updated":"2026-05-27T16:50:14Z","snapshot_observed_at":"2026-08-02T07:39:16.492916Z","submitted_at":"2026-05-04T10:09:18Z","title":"DirectEdit: Step-Level Accurate Inversion for Flow-Based Image Editing","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T19:02:52.090839Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.02417"},"observation_digest":"sha256:4f2afaea25766cc87a5fee5abb27f4d4e8c49c555781ae7781afe0b473d29fa0","observation_id":"f7fb7cef-3eb9-4c96-b3cc-8f1de6789977","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:08.606559Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:ea80c4c43731faf6064cca6a11b99080f291cf9013668535d18b5ce7ea6345f4","observation_id":"3839a43e-4ad8-4af3-afde-3e5328c28376","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T08:15:58.020894Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:0821ad3a3a94c39458ce9fa65d87b2ba436a2bb7d5beef4389c4229cf3669df0","observation_id":"3a047d48-282c-4393-929b-712f74b3d7de","resolution":{"observed_at":"2026-05-21T08:19:52.748945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:46f1abf7594ec5bb29d46990d8f3fb3fa496f8541e8740d0398c45452d44ccb7","observation_id":"b9e6f6f5-29df-494c-b074-86a36ec0e97a","resolution":{"observed_at":"2026-07-01T00:25:09.309077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.05204","last_updated":"2026-05-26T15:05:04Z","snapshot_observed_at":"2026-08-03T09:59:43.729293Z","submitted_at":"2026-05-06T17:59:34Z","title":"D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-08T17:25:26.391582Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.05204"},"observation_digest":"sha256:06a6a07cabcd6cc0324f988852916aefff4ff13db47be4d5602d4aeddbb3e8db","observation_id":"38cc7c59-5d00-4bf4-a5d2-3eb91df2f4b2","resolution":{"observed_at":"2026-05-11T17:36:05.880328Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.05204","last_updated":"2026-05-26T15:05:04Z","snapshot_observed_at":"2026-08-03T09:59:43.729293Z","submitted_at":"2026-05-06T17:59:34Z","title":"D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-20T23:18:35.390642Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.05204"},"observation_digest":"sha256:608201206f391532350b9b538c65c000ce41a2c90f273ab8c984c5845fb5e85d","observation_id":"3c512b63-7543-4e52-958a-3235cd013849","resolution":{"observed_at":"2026-05-20T23:19:13.387338Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.05204","last_updated":"2026-05-26T15:05:04Z","snapshot_observed_at":"2026-08-03T09:59:43.729293Z","submitted_at":"2026-05-06T17:59:34Z","title":"D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-30T23:44:10.302520Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.05204"},"observation_digest":"sha256:6885cad3240cdfc481c02b40200a20df860734abcd45fd5af4d1ed393eb07da9","observation_id":"a8b77ce6-e2a8-43b4-8300-545bc9362a7e","resolution":{"observed_at":"2026-06-30T23:45:07.774888Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.06170","last_updated":"2026-05-07T12:53:51Z","snapshot_observed_at":"2026-08-03T02:25:15.814006Z","submitted_at":"2026-05-07T12:53:51Z","title":"DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T13:54:00.141439Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.06170"},"observation_digest":"sha256:6f4c46644ed9a616373765e6e838872d109f2ffddea27d18a18de777eeee9632","observation_id":"55e44ee2-ca52-4881-943e-9a1c8d803520","resolution":{"observed_at":"2026-05-11T18:46:10.551454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.06761","last_updated":"2026-05-07T17:17:10Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:17:10Z","title":"Weblica: Scalable and Reproducible Training Environments for Visual Web Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:44.578007Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.06761"},"observation_digest":"sha256:7a2f26be85b05410360df2acc2de57bdb4444e131f7a0994ff9a0c8a9e897b15","observation_id":"c583c316-ad95-453d-8501-413389feb0b6","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.08043","last_updated":"2026-05-08T17:32:30Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:32:30Z","title":"SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-11T02:27:36.104714Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.08043"},"observation_digest":"sha256:c515caa81f41c1e8f2cf9e4cb808eabb171b5de1ced06f10265d42db2a8af97b","observation_id":"d0aeee1d-3b38-4a49-b64a-d2f586c94d92","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.10180","last_updated":"2026-05-11T08:31:57Z","snapshot_observed_at":"2026-08-01T15:31:49.304094Z","submitted_at":"2026-05-11T08:31:57Z","title":"What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:39.370969Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.10180"},"observation_digest":"sha256:95de8a8948bed0fba4c28558e92b3eba924f6c60c92c1ed127e1f792fda4c7f5","observation_id":"3fcf03f2-dcb1-4a58-8713-a067cb85b8dd","resolution":{"observed_at":"2026-05-12T06:06:26.554232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.10730","last_updated":"2026-05-11T15:34:56Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T15:34:56Z","title":"Qwen-Image-2.0 Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:21:18.312613Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.10730"},"observation_digest":"sha256:6acdddafec8f68f0a3f52bd2dc4920622091fc8027d0f0550ce3c9f97be49379","observation_id":"abdb0e5c-0307-4df3-83f4-b1c34a40fc55","resolution":{"observed_at":"2026-05-12T04:21:21.908923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.11061","last_updated":"2026-05-11T17:59:09Z","snapshot_observed_at":"2026-08-04T23:08:22.402675Z","submitted_at":"2026-05-11T17:59:09Z","title":"HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:53.939221Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.11061"},"observation_digest":"sha256:55105bcacc6cf7e00e685111b0badba8ac1e594cd72dce55e4ed843807c203ec","observation_id":"e9b3cfab-41d8-4c3d-af72-011b99644dcf","resolution":{"observed_at":"2026-05-13T07:32:29.555288Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.11818","last_updated":"2026-05-12T09:09:01Z","snapshot_observed_at":"2026-08-02T21:46:06.216835Z","submitted_at":"2026-05-12T09:09:01Z","title":"RevealLayer: Disentangling Hidden and Visible Layers via Occlusion-Aware Image Decomposition","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-13T07:46:50.540528Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.11818"},"observation_digest":"sha256:a62a4304976976d51ed660220f27005cd38d788e932ad2781b1270caa20d8628","observation_id":"4d395256-cd06-4085-ae0e-b61278a91c60","resolution":{"observed_at":"2026-05-13T07:47:32.694082Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.12013","last_updated":"2026-05-12T12:01:35Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T12:01:35Z","title":"L2P: Unlocking Latent Potential for Pixel Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T07:12:28.181595Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.12013"},"observation_digest":"sha256:aca721bf6bbb611504f4443af4bc45af0e82bef2c44e37247bc4e6fd713a993f","observation_id":"cb153ed3-bed7-4ca1-ac32-331d3ef8d85a","resolution":{"observed_at":"2026-05-13T07:17:29.693414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:53:21.851578Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:9068701664d5ceb0409de5e8c040d097c7e3dfb2fcdb61cf238e47be6df87143","observation_id":"5dbc52be-3602-4f6d-9dd4-6e6d071ff3e5","resolution":{"observed_at":"2026-05-13T06:02:23.965122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T22:00:01.349754Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:5ece0334d548ec872d640038a60176ebc75ada0c84924459bde5f6c1f65d4790","observation_id":"6cde5d40-9720-49ae-ac79-82fb15a9599b","resolution":{"observed_at":"2026-05-14T22:03:03.380931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:51a3eadbe2bfcc5565b3c0dc5f45f1dd92b5f110122360beb9661a78ab02e0f0","observation_id":"1595dcbd-9599-46a1-a445-a10c6da4c2a8","resolution":{"observed_at":"2026-05-13T05:17:18.556563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.12964","last_updated":"2026-05-25T05:34:21Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T03:58:01Z","title":"Asymmetric Flow Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-14T19:28:21.625879Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.12964"},"observation_digest":"sha256:74e2596f5b98d2c8252da0b506016a9829680843aba91fcd719f2af74796069b","observation_id":"a4c8bf21-737f-4cc2-aec3-215709b58134","resolution":{"observed_at":"2026-05-14T19:29:23.980182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.12964","last_updated":"2026-05-25T05:34:21Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T03:58:01Z","title":"Asymmetric Flow Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T22:07:44.850763Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.12964"},"observation_digest":"sha256:07a3ee04c58c9dece2c1c170ca589a698621dacd57530d5037eb732cb20b3542","observation_id":"82e6df93-5d93-43ce-9b5f-608c6c6eef25","resolution":{"observed_at":"2026-07-01T14:15:47.403870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.12967","last_updated":"2026-05-13T04:01:10Z","snapshot_observed_at":"2026-08-02T17:48:26.431725Z","submitted_at":"2026-05-13T04:01:10Z","title":"ImageAttributionBench: How Far Are We from Generalizable Attribution?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T19:38:41.659261Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.12967"},"observation_digest":"sha256:5f974da1757209d126da6ff4eb0a59829efa6e0de347ce79679a84d07421b0ca","observation_id":"37b7dcd6-5027-43e7-88bb-71d9018296e6","resolution":{"observed_at":"2026-05-14T19:39:23.941699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.13122","last_updated":"2026-05-13T07:48:05Z","snapshot_observed_at":"2026-07-06T23:24:42.799888Z","submitted_at":"2026-05-13T07:48:05Z","title":"Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T19:44:36.511647Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.13122"},"observation_digest":"sha256:a33822668f1e9450039a1787220b379af3283cbbcdc51899eba3acee6445cd8b","observation_id":"60678dc0-9456-4475-83a5-6107738bb82e","resolution":{"observed_at":"2026-05-14T19:47:53.663940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.13223","last_updated":"2026-05-13T09:14:31Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:14:31Z","title":"Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T20:13:21.750639Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.13223"},"observation_digest":"sha256:89956fc328399925ec08bfd92388a9a1c5aee75571fa6e8cf49fab076a76202d","observation_id":"b760ebc0-0715-456c-bc1b-67cdc84f6ed0","resolution":{"observed_at":"2026-05-14T20:19:28.523947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.14664","last_updated":"2026-05-26T03:55:48Z","snapshot_observed_at":"2026-08-02T00:36:02.181810Z","submitted_at":"2026-05-14T10:19:19Z","title":"MiVE: Multiscale Vision-language features for reference-guided video Editing","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-15T05:23:20.179387Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.14664"},"observation_digest":"sha256:8b5ca2fe2a36a78b7ed69b7e4ec91c86f948ff916cf993f49080ec91cde210f5","observation_id":"23a48b4a-a355-48e2-9816-b1a4461148fc","resolution":{"observed_at":"2026-05-15T05:25:03.107055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.14664","last_updated":"2026-05-26T03:55:48Z","snapshot_observed_at":"2026-08-02T00:36:02.181810Z","submitted_at":"2026-05-14T10:19:19Z","title":"MiVE: Multiscale Vision-language features for reference-guided video Editing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T21:38:25.600916Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.14664"},"observation_digest":"sha256:fad1966ff5f8c08ab616deb1a227efa1c8464c0c8b3f51f0c0ff58b47570b157","observation_id":"aa9d0521-cb63-4926-b5ca-dd15af61dabe","resolution":{"observed_at":"2026-07-01T14:25:46.287958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-02T23:16:15.609028Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:471a39cc0605936b7a6f19a3919d47a1c6b8abbfa2e5908a3cd1410f0be3be58","observation_id":"a7a59463-21f3-462f-b3e0-321f4ebdceab","resolution":{"observed_at":"2026-05-19T16:37:39.687982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.15375","last_updated":"2026-07-27T17:09:38Z","snapshot_observed_at":"2026-08-02T14:00:28.242334Z","submitted_at":"2026-05-14T20:04:16Z","title":"ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T15:52:00.691858Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.15375"},"observation_digest":"sha256:f0c7d198856f577abcfeabba14734cc436194d1fbb082762311411e822cf9f8b","observation_id":"fa1d10c9-266c-4d35-9f88-e295a47ef820","resolution":{"observed_at":"2026-05-19T15:52:37.994981Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-02T14:00:31.040146Z","title":"arXiv preprint arXiv:2511.22699 (2025) 13","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.15375","last_updated":"2026-07-27T17:09:38Z","snapshot_observed_at":"2026-08-02T14:00:28.242334Z","submitted_at":"2026-05-14T20:04:16Z","title":"ChangeFlow -- Latent Rectified Flow for Change Detection in Remote Sensing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:00:31.040146Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.15375"},"observation_digest":"sha256:a86dca296131d3ac0264c5bb017a7491a3228e42f6cb73680c883c296135e0bf","observation_id":"be3b8e36-4603-411f-ba70-facfd708f8e4","resolution":{"observed_at":"2026-08-02T14:00:31.040146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.16355","last_updated":"2026-05-08T17:54:25Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-08T17:54:25Z","title":"Generative 3D Gaussians with Learned Density Control","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-20T22:32:45.251599Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.16355"},"observation_digest":"sha256:4dc3708c745eff620a07505658cec69139d93f52643524c354bfabf622bd13ef","observation_id":"de55417a-ad8e-4275-9140-d6e2c400a9d6","resolution":{"observed_at":"2026-05-20T22:33:48.274173Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.16842","last_updated":"2026-05-16T06:59:54Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T06:59:54Z","title":"Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T21:18:03.005508Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.16842"},"observation_digest":"sha256:bfea032b384d7e1bf4e5d2af9aa488ae33f938a5ec02631278de5d5382287982","observation_id":"f460ee5a-99ca-4f56-8772-4d02b46ad0d8","resolution":{"observed_at":"2026-05-19T21:22:48.589217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:41e64974cc89b2c5d44e1dbfb4a53bdb3603cb7b4ffd86d5a62654523f27e6eb","observation_id":"45151883-4db4-4572-b394-baf24449adb6","resolution":{"observed_at":"2026-05-20T12:08:15.771619Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.18748","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-08-02T06:15:05.492636Z","submitted_at":"2026-05-18T17:59:03Z","title":"Aurora: Unified Video Editing with a Tool-Using Agent","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T10:47:05.038308Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.18748"},"observation_digest":"sha256:5cc814ec44c76e6d01ba084fd32b609ced66b8fbe50ec62a89e79a1b2d38e712","observation_id":"316a5af7-dff3-435d-a625-0c6a031864de","resolution":{"observed_at":"2026-05-20T10:48:12.763848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.19320","last_updated":"2026-06-02T07:39:57Z","snapshot_observed_at":"2026-08-02T16:37:25.437984Z","submitted_at":"2026-05-19T03:55:59Z","title":"TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T06:59:27.578911Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.19320"},"observation_digest":"sha256:07edd00869837973e2f41fdf623cb9ea7e05d2a613375b348e92e8c6a6bd487d","observation_id":"dbe23e63-4e81-44f5-8cfc-af82c5c626aa","resolution":{"observed_at":"2026-05-20T07:03:06.383496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.19320","last_updated":"2026-06-02T07:39:57Z","snapshot_observed_at":"2026-08-02T16:37:25.437984Z","submitted_at":"2026-05-19T03:55:59Z","title":"TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T18:51:00.698045Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.19320"},"observation_digest":"sha256:e6893b6e45164dc10adad576c6696b640d8c812eea58633d566bdc8020e83aea","observation_id":"f92daffe-b3ff-42ef-9028-b32cebb42f6d","resolution":{"observed_at":"2026-06-30T18:55:00.426710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.20147","last_updated":"2026-05-19T17:35:09Z","snapshot_observed_at":"2026-07-06T23:30:44.092395Z","submitted_at":"2026-05-19T17:35:09Z","title":"PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:19:30.372528Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.20147"},"observation_digest":"sha256:86098fe067c121c02dd8469b44d022ea6115af68cc4279488bd12965af59f7a0","observation_id":"37248da7-a389-43e1-af83-b006d5a92ffb","resolution":{"observed_at":"2026-05-20T05:23:03.844651Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T05:29:19.111071Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:b83d1383c7b97e9b5e07bf3b3509211c78c0ab0d6aecfb312b8ef3b6422483e6","observation_id":"ea07c8b7-d30c-4016-b316-ad23bfb8c304","resolution":{"observed_at":"2026-05-21T05:29:39.442913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T17:50:22.258541Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:e9023ff34b25b85bf3c2b884ad2522e3c75e6ea0026873c294e5c093a29a2914","observation_id":"2b72e306-7a7a-4c3a-8aca-594a70baad0f","resolution":{"observed_at":"2026-06-30T17:54:58.000219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-02T11:48:01.614885Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:0402dbd6cac258656f5a4dece282ec057c050810dd51ff511fce400fbb4a4f80","observation_id":"93fe4d9c-ca9d-4f57-81ca-9437f9c2e4e9","resolution":{"observed_at":"2026-05-21T05:19:39.382658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.21190","last_updated":"2026-05-23T12:57:01Z","snapshot_observed_at":"2026-08-03T06:37:06.694741Z","submitted_at":"2026-05-20T13:53:13Z","title":"Semantic Granularity Navigation in Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T05:51:19.211778Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.21190"},"observation_digest":"sha256:4dfd75acd0e43470a340b5a3c32489c58c20674ad50a73be87b2b6e190dbad0e","observation_id":"7b9b421a-11ce-4d42-82fc-8e380c91cbf4","resolution":{"observed_at":"2026-05-21T05:53:59.253255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.21190","last_updated":"2026-05-23T12:57:01Z","snapshot_observed_at":"2026-08-03T06:37:06.694741Z","submitted_at":"2026-05-20T13:53:13Z","title":"Semantic Granularity Navigation in Image Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T17:13:18.594937Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.21190"},"observation_digest":"sha256:3185cba82cbe677a63532ceca7a596eb1c2a20570fda7fe16aca33e1e9e6b90a","observation_id":"f0e0c0f8-f4cb-42a5-b874-ee8466ec0beb","resolution":{"observed_at":"2026-06-30T17:14:56.723749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.21272","last_updated":"2026-05-20T15:04:56Z","snapshot_observed_at":"2026-08-02T13:53:05.548583Z","submitted_at":"2026-05-20T15:04:56Z","title":"MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-21T05:21:18.369534Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.21272"},"observation_digest":"sha256:bea48f368483c15da78e3758330ccb4f5616e0f31ddfef25492e1c0e5eab0ae3","observation_id":"13c4cd87-0da6-4b54-b76e-0c73654c64aa","resolution":{"observed_at":"2026-05-21T05:23:58.462333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.21573","last_updated":"2026-05-20T17:59:58Z","snapshot_observed_at":"2026-08-02T08:45:09.575827Z","submitted_at":"2026-05-20T17:59:58Z","title":"Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T09:34:14.596976Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.21573"},"observation_digest":"sha256:1a5eb2ba77e14a22f0550280de1bc7454618c06fc58c69461f7027e0788d9750","observation_id":"63013c4a-e02c-4a8b-a597-70b05bca2e5f","resolution":{"observed_at":"2026-05-22T09:34:46.672966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.21605","last_updated":"2026-05-22T02:16:59Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:12:29Z","title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T09:29:05.360018Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.21605"},"observation_digest":"sha256:77158fecb342c25203c08473cacfc71905578b4da76302d0ae8fe6a37c7fdac8","observation_id":"0b614969-39fc-42e9-b966-8695b3e27b3a","resolution":{"observed_at":"2026-05-22T09:31:22.956361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.21605","last_updated":"2026-05-22T02:16:59Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:12:29Z","title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:33.676797Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.21605"},"observation_digest":"sha256:80ac404bfe622fdfa060ac28a8545c0848c8116df8e8d74451a976e38abb2411","observation_id":"4e27a481-fc03-474b-8b43-0303f01f40a4","resolution":{"observed_at":"2026-05-25T05:40:24.016810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.23381","last_updated":"2026-05-22T08:50:10Z","snapshot_observed_at":"2026-07-06T23:33:34.409634Z","submitted_at":"2026-05-22T08:50:10Z","title":"VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T04:57:03.913813Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.23381"},"observation_digest":"sha256:431962ae8934c87fabc48a1db0765d5611dfdb6e22a69a0e68d27d60c923a22b","observation_id":"556454ff-12bf-4794-89d3-88c733105e57","resolution":{"observed_at":"2026-05-25T05:00:22.644501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.23902","last_updated":"2026-05-22T17:59:42Z","snapshot_observed_at":"2026-08-02T23:45:38.334397Z","submitted_at":"2026-05-22T17:59:42Z","title":"PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T04:18:45.403718Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.23902"},"observation_digest":"sha256:b3ce951623bd387e2c096806f6cecd29e3ae7438cd91839bce9820417516a58a","observation_id":"720c0356-bc8b-4626-bbf2-b701df67983a","resolution":{"observed_at":"2026-05-25T04:20:19.320175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.25347","last_updated":"2026-05-25T02:04:10Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T02:04:10Z","title":"ERNIE-Image Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:55:06.711872Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.25347"},"observation_digest":"sha256:56347b5588b27b45a57b001691c65e8cd3e0a00ea8d437c0d2a1c6ae672d75fd","observation_id":"ea21e8d1-4834-4059-b13e-3185bd86d825","resolution":{"observed_at":"2026-06-30T00:14:04.688925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.26108","last_updated":"2026-06-06T16:11:19Z","snapshot_observed_at":"2026-08-02T21:36:48.643552Z","submitted_at":"2026-05-25T17:59:21Z","title":"Reinforcing Few-step Generators via Reward-Tilted Distribution Matching","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T22:21:06.005125Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.26108"},"observation_digest":"sha256:a02d06c2f4131e7fdff34e2031a9c6029a31338a05b6f9a0638e406524d5b53e","observation_id":"92ade3b5-999d-4ee1-a5f4-630b0460b8c9","resolution":{"observed_at":"2026-06-29T22:24:00.295379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.26632","last_updated":"2026-06-01T03:03:29Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T07:09:49Z","title":"RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T19:40:42.033793Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.26632"},"observation_digest":"sha256:542510065acd513af526d1e74ee7fd3308a5acc36b7a83ae09f1f9728f1b30f4","observation_id":"1c9a2b82-a5a7-4ba5-bdc1-99e85f94e06a","resolution":{"observed_at":"2026-06-29T19:43:54.684926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.30062","last_updated":"2026-05-28T15:13:31Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:13:31Z","title":"FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T07:59:44.436264Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.30062"},"observation_digest":"sha256:652872390c92805b6e6d49f2193824f3187544042358f157f81737872d3d487a","observation_id":"8fa55d78-00bc-496d-8704-a3ffb4032cf9","resolution":{"observed_at":"2026-06-29T08:03:14.172762Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.30248","last_updated":"2026-05-29T03:57:25Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:13:18Z","title":"GenClaw: Code-Driven Agentic Image Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:54.292448Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.30248"},"observation_digest":"sha256:0f0d240d7dea4707bfb2f1eac26070cc304d4e2d5263222ea26b771783efce87","observation_id":"6c31b516-3052-4135-b574-9cec68c14a39","resolution":{"observed_at":"2026-06-29T07:43:13.965775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T22:54:10.460872Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:f7e168f208fc1ca4f7cc9ede340c00b24d9777c61ad54630c83ef1c6eba14e28","observation_id":"13eec3df-aae4-4317-9945-ad92c785e957","resolution":{"observed_at":"2026-07-01T19:16:00.955045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-12T15:31:57.426559Z","title":"Z-Image: An efficient image generation foundation model with single-stream diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T15:31:57.426559Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.31604"},"observation_digest":"sha256:17c43d8ba55bda2c4070f5a4cb38e1e7605949805db6be844924d0bc8ef1fe5a","observation_id":"1ea2d78c-ba30-4fbc-9249-11a3c2607b33","resolution":{"observed_at":"2026-07-12T15:31:57.426559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.00204","last_updated":"2026-05-29T17:59:31Z","snapshot_observed_at":"2026-07-06T23:40:56.510371Z","submitted_at":"2026-05-29T17:59:31Z","title":"APE: Agentic Prompt Enhancer for Image Generation and Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T22:58:17.807988Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.00204"},"observation_digest":"sha256:cfc07f6ef950f5c941c8325f99a4f88d44a25b3d5c1b713e1c14870cbbf23b75","observation_id":"6ac07a1a-1c56-4107-af36-6adacb35cd8c","resolution":{"observed_at":"2026-06-28T23:02:46.691177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.03243","last_updated":"2026-06-02T07:04:51Z","snapshot_observed_at":"2026-08-02T20:02:29.970136Z","submitted_at":"2026-06-02T07:04:51Z","title":"MemoGen: Can Past Experience Improve Future Text-to-Image Generation?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T10:48:18.630777Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.03243"},"observation_digest":"sha256:0891f0a870fdb65ae8ec79ae0387377024f4bc4b2969077aa5abcd8b72e16d13","observation_id":"99549bc5-3916-4355-85bf-4c8b726b27d2","resolution":{"observed_at":"2026-07-02T02:36:27.152945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.05290","last_updated":"2026-06-03T18:00:04Z","snapshot_observed_at":"2026-07-06T23:45:19.055840Z","submitted_at":"2026-06-03T18:00:04Z","title":"Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T06:16:53.305354Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.05290"},"observation_digest":"sha256:6c8997050b65aff3d94964f3620dc7f4cb2a33e973165abc10b4b0aa68bb1909","observation_id":"84b95862-e056-43f9-b6d3-40817345acc6","resolution":{"observed_at":"2026-07-02T08:16:47.710013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.05730","last_updated":"2026-06-04T05:43:24Z","snapshot_observed_at":"2026-08-02T13:55:48.184123Z","submitted_at":"2026-06-04T05:43:24Z","title":"TextWand: A Unified Framework for Scene Text Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T01:56:46.514177Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.05730"},"observation_digest":"sha256:12718770eaac10bf0684229c7117a40ca77badc5fc639ef1d5d26a6eb08f3610","observation_id":"00b2c270-c0c3-4a1f-822e-07dff5e6702f","resolution":{"observed_at":"2026-07-02T12:36:57.307931Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.05949","last_updated":"2026-06-05T06:49:31Z","snapshot_observed_at":"2026-08-03T16:26:25.101066Z","submitted_at":"2026-06-04T09:49:02Z","title":"Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T03:00:00.288142Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.05949"},"observation_digest":"sha256:f03c91802f5769b7efe1b708a63ecd7b091a08f6ce0cf1e0dc50e6a2893a2685","observation_id":"873e85cf-971b-4c71-8d0f-8c502e25b75b","resolution":{"observed_at":"2026-07-02T11:46:55.812192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.08948","last_updated":"2026-06-08T02:50:08Z","snapshot_observed_at":"2026-08-01T23:39:53.686995Z","submitted_at":"2026-06-08T02:50:08Z","title":"NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T17:22:29.806105Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.08948"},"observation_digest":"sha256:993068e03be7df7daf9464d88a2765cd6646f9f3e69ef59c4877838774c77081","observation_id":"3da1bde6-f4c2-476d-84de-f8287c8eef86","resolution":{"observed_at":"2026-07-03T00:17:28.839137Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.09076","last_updated":"2026-07-14T12:46:55Z","snapshot_observed_at":"2026-07-17T23:19:03.633221Z","submitted_at":"2026-06-08T06:20:12Z","title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:57.001021Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.09076"},"observation_digest":"sha256:bb405affb7698ba46a03ca7ff1f96714a83fbb99feb5b7848150589c9327c4ea","observation_id":"eff6429b-4930-413c-b119-94d6da010edd","resolution":{"observed_at":"2026-07-03T00:07:27.947025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-07-15T10:53:37.186361Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09076","last_updated":"2026-07-14T12:46:55Z","snapshot_observed_at":"2026-07-17T23:19:03.633221Z","submitted_at":"2026-06-08T06:20:12Z","title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-15T10:53:37.186361Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.09076"},"observation_digest":"sha256:8e1564b0099d7744eb5673df1986e2ab070292fe845eca88a3241d15ef0f82e4","observation_id":"b4562b7f-ec49-4b61-aa2b-eedd15c64ef6","resolution":{"observed_at":"2026-07-15T10:53:37.186361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.10620","last_updated":"2026-06-09T09:17:55Z","snapshot_observed_at":"2026-08-02T16:01:56.626147Z","submitted_at":"2026-06-09T09:17:55Z","title":"Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T13:34:25.079037Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.10620"},"observation_digest":"sha256:49929a21972962b4fe4cb0ef4efb0e86701430ccbe3b75032ed1c826a25fe7df","observation_id":"890f8b57-61be-47be-b68a-9f0b8abd0265","resolution":{"observed_at":"2026-07-03T04:57:38.065459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.10894","last_updated":"2026-06-09T14:05:48Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T14:05:48Z","title":"The 1st PortraitCraft Challenge: A CVPR 2026 Workshop Competition on Portrait Composition Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T13:36:15.259428Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.10894"},"observation_digest":"sha256:6f4706bf65ca1566088f2b3de34a6fc26ed9dbb1d3e7dd8adc6c7462c070ba43","observation_id":"a2cd6be4-646e-488c-8f30-afb48953ef69","resolution":{"observed_at":"2026-07-03T04:47:38.642928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.22699/citation-record","integrity":"/paper/2511.22699/integrity","json":"/paper/2511.22699/citation-record.json","paper":"/paper/2511.22699"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:30.475102Z","title":"Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.475102Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c422723d19af4792b616cb2a37be9290b5064679798d3398ae0446da26ec9086","observation_id":"28fae302-c7f4-43ae-a7e9-4fbb34c873d5","resolution":{"observed_at":"2026-08-03T19:47:30.475102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T19:47:30.562252Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.562252Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:3aa06e1c0e58ae68cf6122dd1e6b3fd9e39f555d7298abc3621b52c78cff47b6","observation_id":"cde753cb-7cd0-4565-b9ec-cfa708e46925","resolution":{"observed_at":"2026-08-03T19:47:30.562252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:30.646391Z","title":"Imagen 3.arXiv preprint arXiv:2408.07009, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.646391Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:8074fc0cbf0b22a10ae7b4f769ef4f05c217b5d742245c4ed4f649c9d6596746","observation_id":"5de9258b-3273-4120-a708-48d4d271cd6b","resolution":{"observed_at":"2026-08-03T19:47:30.646391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:30.700289Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.700289Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:11abfeaa72c0712b9327a952959eb26c155ba4c2208235982e2d694ee3bcd8b4","observation_id":"3f74fa1a-f1c6-4c0c-ab2d-0aee17c7ba9f","resolution":{"observed_at":"2026-08-03T19:47:30.700289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:30.729213Z","title":"Instructpix2pix: Learning to follow im- age editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.729213Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:eaaec565c73fa3329ecafb9de51974d21eba9809fa2f8d4163dad84f011445cb","observation_id":"05e2d8b6-848d-4e48-bb2d-afeba793fc31","resolution":{"observed_at":"2026-08-03T19:47:30.729213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:30.809386Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.809386Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c641595a591de94b8ac7101bb5e76fc00e2c630b49fa973c76c76a724f3bd34d","observation_id":"441b816e-9fc6-4508-9df1-b6cc05f13de3","resolution":{"observed_at":"2026-08-03T19:47:30.809386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:30.849396Z","title":"Hidream-i1: An open-source high-efficient image generative foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.849396Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:e3fea449a9a304e7bceaee5c13cf97570ebb40fb564b568c1dec7c8f04d42af4","observation_id":"e87f4a65-4f4d-42fc-8eb7-0e0436d52bb8","resolution":{"observed_at":"2026-08-03T19:47:30.849396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-08-03T19:47:30.877338Z","title":"Hunyuanimage 3.0 technical report.arXiv preprint arXiv:2509.23951, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.877338Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:94aaf9a289aac5c93a24bf8a0cf31121a73a29fc25bbb219eb09847d8d032b9f","observation_id":"45847ee5-85b5-46d0-a19c-43a7daade548","resolution":{"observed_at":"2026-08-03T19:47:30.877338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07977","last_updated":"2025-06-26T15:47:09Z","snapshot_observed_at":"2026-08-03T22:18:20.423791Z","submitted_at":"2025-06-09T17:50:21Z","title":"OneIG-Bench: Omni-dimensional Nuanced Evaluation for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07977","snapshot_observed_at":"2026-08-03T19:47:30.934626Z","title":"Oneig-bench: Omni-dimensional nuanced evaluation for image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.934626Z"},"links":{"cited_paper":"/paper/2506.07977","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:219d140132f6c3eabba504d45189dc2d306d411a8e6bb929c17cfaeefcc8bb10","observation_id":"245f5d62-2469-4ceb-8d6f-5b2ee348c88f","resolution":{"observed_at":"2026-08-03T19:47:30.934626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:30.990759Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:30.990759Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:da9fedb35805e0d3699f69db4f6e16e2f2cc210dcb4c52876eb3f8ae892febae","observation_id":"5f576ab7-7a74-42e1-8cf8-69bfd11d612f","resolution":{"observed_at":"2026-08-03T19:47:30.990759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-03T19:47:31.024621Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.024621Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:5e67f12695ada0bf58c8f915ae3ef1ac7da23543a44aaa942e689268433f5920","observation_id":"29386781-04fa-4eef-8e9a-82c97c78ff74","resolution":{"observed_at":"2026-08-03T19:47:31.024621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.057684Z","title":"Pixart-𝜎: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.057684Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:ba1080e3aada84e8be34bffe6b7f3c0b22a260b1cb1f486cfefe91b7d2fcacc8","observation_id":"3e54ed50-4cc9-4c0d-b555-97c2e576da47","resolution":{"observed_at":"2026-08-03T19:47:31.057684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.091651Z","title":"Pixart-𝛼: Fast training of diffusion transformer for photo- realistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.091651Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:80fb5e2a04938ece88dda2b96f5f97aa8006cf3c247e8864a50cbab5a6146fcc","observation_id":"ba09161e-606e-4c5a-b74b-49f3b23ef8b6","resolution":{"observed_at":"2026-08-03T19:47:31.091651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-03T19:47:31.126783Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.126783Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:af6db73b1fe8df1f443a847c5d2b0664d4278a4b4b0bcc4b95e43aa0c3ac6415","observation_id":"f8562c6d-748d-455c-983f-683e9c065ecb","resolution":{"observed_at":"2026-08-03T19:47:31.126783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T19:47:31.160663Z","title":"Emerging properties in unified multimodal pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.160663Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:10bbde7e3cf3ac67eecf64459e4d3af879858207881111a3f394ab648cf2fbd6","observation_id":"373e2210-19fc-4629-b3b0-f8710f8983a8","resolution":{"observed_at":"2026-08-03T19:47:31.160663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.198772Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.198772Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:7bf6a4dbd8cbcbcdea066ec5b137783a085041ec91940d25808081eb7029b8c2","observation_id":"126de000-b4a2-4adb-ad18-ba6e62d6b30f","resolution":{"observed_at":"2026-08-03T19:47:31.198772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.258509Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes.arXiv preprint arXiv:2503.23461, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.258509Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c6f38740f7a585d4193b9f69d4658bcf95c3d0ed424311c2dce377a51f6c7bd7","observation_id":"6e659890-00c2-4f33-a20c-2198ba661e01","resolution":{"observed_at":"2026-08-03T19:47:31.258509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.312423Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.312423Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:37acdbbaafd2b48d41843444277fe00e8be8a1b3d8ccd18db8139d6cf4a3a63e","observation_id":"53875729-1899-4cd1-90d6-e6f71402d439","resolution":{"observed_at":"2026-08-03T19:47:31.312423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09680","snapshot_observed_at":"2026-08-03T19:47:31.327318Z","title":"Flux-reason-6m and prism-bench: A million-scale text-to- image reasoning dataset and comprehensive benchmark.arXiv preprint arXiv:2509.09680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.327318Z"},"links":{"cited_paper":"/paper/2509.09680","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:aba704fb018a3301dbd8bb38c5761feacc1e00a89cb4c3c7e88c820070729e76","observation_id":"6b6f9400-4ee2-466a-9de1-97b015cb413c","resolution":{"observed_at":"2026-08-03T19:47:31.327318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-03T19:47:31.331517Z","title":"Lumina- t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.331517Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1c9ed634e69bff1a6ecc74405cc5e716f2186e31b1d6c899c04c2a5f7d557348","observation_id":"0af520a0-f9d2-4d3e-adfc-e940073ddea5","resolution":{"observed_at":"2026-08-03T19:47:31.331517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-03T19:47:31.335779Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.335779Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:88ad194cb2fb4e4875f9a0de525d70aabcd5a325b492578e3d9199c82a669fa9","observation_id":"261c5bf2-d0d4-42ee-ac7a-bfbfcf415f0e","resolution":{"observed_at":"2026-08-03T19:47:31.335779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22058","last_updated":"2025-07-29T17:59:04Z","snapshot_observed_at":"2026-08-03T01:06:06.514446Z","submitted_at":"2025-07-29T17:59:04Z","title":"X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22058","snapshot_observed_at":"2026-08-03T19:47:31.339897Z","title":"X-omni: Reinforcement learning makes discrete autoregressive image generative models great again.arXiv preprint arXiv:2507.22058, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.339897Z"},"links":{"cited_paper":"/paper/2507.22058","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:763d45210f40a341d106beda0956d0d7dd3afef3438f12845caa8073e168683c","observation_id":"cfd7ea82-2d80-4696-9395-a33b2ee4b16c","resolution":{"observed_at":"2026-08-03T19:47:31.339897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.343751Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132– 52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.343751Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c29dfb13db952f5c1d6a145c3d84b0fc8a09f68dc985d877b4d446169564514c","observation_id":"680d4670-3c35-4ffc-ba01-a85f0445ecbd","resolution":{"observed_at":"2026-08-03T19:47:31.343751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.347436Z","title":"Dynamic few-shot visual learning without forgetting","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.347436Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:9bd40760d9b817ecf3e0e3c06aa8225829bb1c95d4cb35ce9b296589396eee64","observation_id":"17f4bde7-669c-4abb-b77a-2825ae4b551b","resolution":{"observed_at":"2026-08-03T19:47:31.347436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.362336Z","title":"Gemini 2.5 flash & 2.5 flash image model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.362336Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:0d093fd591989937d7f9685dcd7831888408fe6958783c4ead57809cfe72bc6b","observation_id":"c26176ae-26c0-477f-b2e7-8a1b698acdcb","resolution":{"observed_at":"2026-08-03T19:47:31.362336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.413630Z","title":"Imagen 4 model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.413630Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:ca1c61b83ca2705dddfe32a187f5823b6bda7880913e9590aec0a1f7c21da694","observation_id":"6d1afd41-2448-41c7-a0df-bede08690930","resolution":{"observed_at":"2026-08-03T19:47:31.413630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.567733Z","title":"Nano banana pro","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.567733Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:36cc069ff204e316b70b9e8fc2a5e7d0b67eaf10437bc1020659ffe88c4a2042","observation_id":"2b28f84b-170d-4a92-9565-b3b7a9771eb1","resolution":{"observed_at":"2026-08-03T19:47:31.567733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.722054Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.722054Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c4b22cd2e24aa5d8024d5b4de69c7d120a7f869de8805252a3864a2bee075664","observation_id":"d860859d-0ede-4f11-a591-f323e7dc2c55","resolution":{"observed_at":"2026-08-03T19:47:31.722054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:31.797853Z","title":"Classifier-free diffusion guidance.Advances in Neural Information Processing Systems Workshops (NeurIPS Workshops), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.797853Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:2393dd6bd7f4b325b5b541ff6f5b12acaeae472089ad072cc6c3342fff842db8","observation_id":"36508c3d-f09f-4e79-a116-2b97fa94d97c","resolution":{"observed_at":"2026-08-03T19:47:31.797853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-03T19:47:31.943799Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:31.943799Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:13a0a06c8cf6d311ebf5b79eb790ee27dfd1e9a286d897948cd59676f1925f64","observation_id":"247dc9e9-a06c-46c1-9fbd-754140edaeff","resolution":{"observed_at":"2026-08-03T19:47:31.943799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13649","last_updated":"2026-07-03T19:09:38Z","snapshot_observed_at":"2026-08-03T21:47:18.352895Z","submitted_at":"2025-11-17T17:59:54Z","title":"Distribution Matching Distillation Meets Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.13649","snapshot_observed_at":"2026-08-03T19:47:32.038741Z","title":"Distribution matching distillation meets reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.038741Z"},"links":{"cited_paper":"/paper/2511.13649","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:38851e0409859f6a7cd237bdfa16c4c37d63acb8a02dac74915e5cf004ecda50","observation_id":"6bb10234-dd0d-4a45-b7b6-9b94bdb865e0","resolution":{"observed_at":"2026-08-03T19:47:32.038741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.129517Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.129517Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:3906a7efe559298f741ee80cea7431b831140d9ba16b950a00fc2b9484369a70","observation_id":"d6789c7b-cc47-400e-abb4-3762a195fc9c","resolution":{"observed_at":"2026-08-03T19:47:32.129517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.243783Z","title":"Kolors 2.0.https://app.klingai.com/cn/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.243783Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:9b4d6c665e54f37a89319abd8fc7432c8c28a021660fa25f7a891ad6a329eebc","observation_id":"3822905b-a2fb-455a-bf28-33e0d8a27e68","resolution":{"observed_at":"2026-08-03T19:47:32.243783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.330782Z","title":"Flux.https://github.com/black-forest-labs/flux, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.330782Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:12f1d63aca9aa35092884decdf10dac882ed45c01a727efed0d466545d9f89ab","observation_id":"86b1d17d-62e2-48b1-aa7a-25a3f2fb1522","resolution":{"observed_at":"2026-08-03T19:47:32.330782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.382835Z","title":"FLUX.2: State-of-the-Art Visual Intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.382835Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:818b29b772b65970a706787a7521a6178b094a8eb920e7654d8977820e432ff3","observation_id":"8dd85b46-19dc-4cd6-978d-41d6d0daa65f","resolution":{"observed_at":"2026-08-03T19:47:32.382835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15742","last_updated":"2025-06-24T05:31:03Z","snapshot_observed_at":"2026-07-06T21:44:22.901650Z","submitted_at":"2025-06-17T20:18:23Z","title":"FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15742","snapshot_observed_at":"2026-08-03T19:47:32.488207Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.488207Z"},"links":{"cited_paper":"/paper/2506.15742","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:87050ef6a2d2fb70abdd2b3f32cba9bc4cdc2615b99a09c47367710e7f3bdffd","observation_id":"8757f701-eafa-4306-b768-20a719972bba","resolution":{"observed_at":"2026-08-03T19:47:32.488207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.631497Z","title":"Gpu server rental pricing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.631497Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:f098dc4ee830862924200402e4163cfa30f03eb49bfa9a8d34301028ab141898","observation_id":"06d3c611-4751-4bb0-a00d-c84263c49369","resolution":{"observed_at":"2026-08-03T19:47:32.631497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-03T19:47:32.718177Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.718177Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:8c49358c993140efae74581181efbf442424fccbbe89fd95334a7f1de58239ee","observation_id":"e406c874-4fcf-416f-a346-fe3c80f85494","resolution":{"observed_at":"2026-08-03T19:47:32.718177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.746065Z","title":"Ragdiffusion: Faithful cloth generation via external knowledge assimilation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.746065Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:0ce456e5684633648f7e00229dd5d8dbfdf196aa3005dbe1e623ad40bed6ccad","observation_id":"9562f21d-da7d-45f2-8a5f-e8bad6940781","resolution":{"observed_at":"2026-08-03T19:47:32.746065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T19:47:32.749977Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.749977Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:4226694f87daaaf919f3b05fdd2a638ce3f84c79c82539a58b6d36f8040664dd","observation_id":"31537b14-4724-42bc-9266-d28b5e4755c2","resolution":{"observed_at":"2026-08-03T19:47:32.749977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.754194Z","title":"Visualcloze: A universal image generation framework via visual in-context learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.754194Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:972f70da92e61a56a9f26ff7ddbc94a6c486dfd85a10218d84e78882ed88f098","observation_id":"32545311-bce1-4a11-846e-f03ab50aa75c","resolution":{"observed_at":"2026-08-03T19:47:32.754194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16888","last_updated":"2025-11-04T13:15:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-19T15:38:06Z","title":"Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.16888","snapshot_observed_at":"2026-08-03T19:47:32.758069Z","title":"Uniworld-v2: Reinforce image editing with diffusion negative-aware finetuning and mllm implicit feedback.arXiv preprint arXiv:2510.16888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.758069Z"},"links":{"cited_paper":"/paper/2510.16888","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:58121c5c25de9e515b3e51e0dee906df5ca09289ded21b838f2cdb53d7eb41da","observation_id":"ad822751-6882-4b7c-86f5-4f244de43800","resolution":{"observed_at":"2026-08-03T19:47:32.758069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-08-03T19:47:32.762169Z","title":"Uniworld: High-resolution semantic encoders for unified visual understanding and generation.arXiv preprint arXiv:2506.03147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.762169Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:6a12a880f3b13f5f6941138932139710af8d4725b4cb0c793af986cc4060f02e","observation_id":"52956ea3-9be0-4a8d-b1d4-e64d0ac1a586","resolution":{"observed_at":"2026-08-03T19:47:32.762169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T19:47:32.766217Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.766217Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:5b29d26d3b19e21cbf0bb8ecd1f1144e12fd4f44755024a3cb3f34e7135cb7cc","observation_id":"dd5b2ed7-9bf0-49a2-989d-8f9df31cceb9","resolution":{"observed_at":"2026-08-03T19:47:32.766217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.770481Z","title":"Decoupled dmd: Cfg augmentation as the spear, distribu- tion matching as the shield.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.770481Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:63cc92c643889acccb4065a343392e32503e8520dc0b636e0894ea9bd95bc7aa","observation_id":"de4402de-2521-403c-ade7-51d505165ab5","resolution":{"observed_at":"2026-08-03T19:47:32.770481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-03T19:47:32.774192Z","title":"Flow-grpo: Training flow matching models via online rl.arXiv preprint arXiv:2505.05470, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.774192Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:6fcc81ffa3d85a6383aeece55ca2f5240975e7889ef6b7a29b09bc8b017f0b77","observation_id":"8df3ea5e-949a-4a5d-b433-07aee08b746c","resolution":{"observed_at":"2026-08-03T19:47:32.774192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-03T19:47:32.778169Z","title":"Step1x-edit: A practical framework for general image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.778169Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:8bb25a05dce965289822e38aa17369693c821c34f61f22105af229392929e1d8","observation_id":"06e0ce66-b787-4070-8781-989d799cca07","resolution":{"observed_at":"2026-08-03T19:47:32.778169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-03T19:47:32.782064Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.782064Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:3ff32362eaecaa1b912b3e2871fb17fb557b39dd81858b34e24c4670fcc88697","observation_id":"43f98f48-9d2c-4168-837b-19f2d91210be","resolution":{"observed_at":"2026-08-03T19:47:32.782064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-07-06T21:06:50.056353Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-08-03T19:47:32.786122Z","title":"Omnicaptioner: One captioner to rule them all.arXiv preprint arXiv:2504.07089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.786122Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:645fe40dd65743c00804143727275b84f124fb1f590bf1b8e5b7332d3752861a","observation_id":"c21bfeb1-2a69-48f2-8e4d-de3b6d031cfa","resolution":{"observed_at":"2026-08-03T19:47:32.786122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.789992Z","title":"Cosine normalization: Using cosine similarity instead of dot product in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.789992Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:fb7f5abed0bbc4c222cbdba967180ff5dd2a3c1d7d54ccd1bcc3e759b2768b2a","observation_id":"bb5e7e7b-9b35-40bb-a5c1-b13a311833ac","resolution":{"observed_at":"2026-08-03T19:47:32.789992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-07-06T19:49:17.129421Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-03T19:47:32.793928Z","title":"Janusflow: Harmonizing autoregression and rectified flow for unified multimodal understanding and generation.arXiv preprint arXiv:2411.07975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.793928Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:127351c5bc91fbc86df118875e0f29c468bc35bbe562e4a3f763f54fdb025fc2","observation_id":"af18e0f6-a6c1-4d71-b93a-a757630e669e","resolution":{"observed_at":"2026-08-03T19:47:32.793928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.797901Z","title":"Midjourney v7.https://www.midjourney.com/home, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.797901Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c26ad67d6e844f43f6a1daadbf0cc4629a9a48e1f8219834f6f292d3db08cc36","observation_id":"1112a812-c971-43fb-9035-4022c6ef2a02","resolution":{"observed_at":"2026-08-03T19:47:32.797901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.801626Z","title":"Enhancing few-shot image classification with cosine transformer.IEEE Access, 11:79659–79672, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.801626Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1a37bce27440cb5c7f381b7dea9f62cf035c72fd6097ca1851f9280a0ab9d8c3","observation_id":"b21d78b7-2663-4049-86cc-3971a91ca126","resolution":{"observed_at":"2026-08-03T19:47:32.801626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.805453Z","title":"Cagra: Highly parallel graph construction and approximate nearest neighbor search for gpus","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.805453Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:b6296e64226ce7c5a229de71bdda4542760f5cd0ec5ec0f60d8b86254b2ae7b4","observation_id":"402a0527-8c22-46cc-8e70-2bedd5770fe9","resolution":{"observed_at":"2026-08-03T19:47:32.805453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.808944Z","title":"Gpt-image-1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.808944Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1484f18e91f9286f192f0979deadaa5ab50ee365fbee06f603d085aba22f4d37","observation_id":"4d93624c-7506-4252-b846-08656cca8f73","resolution":{"observed_at":"2026-08-03T19:47:32.808944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.812444Z","title":"The pagerank citation ranking: Bringing order to the web","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.812444Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:d65ee3c9460712d679dd033b95aa73ce992d30c02ca8fd500a1edf427bc6ab24","observation_id":"f05a983a-cde9-48d8-a1e4-6b712b5bb37e","resolution":{"observed_at":"2026-08-03T19:47:32.812444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-03T19:47:32.816279Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.816279Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1b4953486610be1c9952f34ba65971ecf1002ab2a208e4e7841cc9133e2e9e29","observation_id":"80639104-f252-4422-b3fc-54545848c8c7","resolution":{"observed_at":"2026-08-03T19:47:32.816279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-05T11:15:36.366240Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-03T19:47:32.820285Z","title":"Lumina-image 2.0: A unified and efficient image generative framework.arXiv preprint arXiv:2503.21758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.820285Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1cf73d717657cda9e7ef695f7d4416014c2766f2d3d2912bcc8c16f3402732e4","observation_id":"083082b4-0ea8-4d8a-b712-96b7160d0bd5","resolution":{"observed_at":"2026-08-03T19:47:32.820285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.823876Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.823876Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:8253e3989b30a2e45021b8c029b68deb0e719608d5789290b95ed0b8a955cc26","observation_id":"9badaaa4-7339-4a94-9e1b-475e03d93446","resolution":{"observed_at":"2026-08-03T19:47:32.823876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.827296Z","title":"cuGraph - RAPIDS Graph Analytics Library","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.827296Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:92e2f55ab158640416aaf3f2af178d9529f8cc6ac0c29edfea1bf59de637359b","observation_id":"add8b61f-7163-4506-9a3e-a5cf06f6eeb6","resolution":{"observed_at":"2026-08-03T19:47:32.827296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.830910Z","title":"Recraft v3.https://www.recraft.ai/docs/recraft-models/recraft-V3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.830910Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:49afc566da20369184f1ecc87c3db4ee6d0577d92a42165f72a8915160f85401","observation_id":"0fd77d68-dfdb-47b6-8f9d-b4bc66c38e4d","resolution":{"observed_at":"2026-08-03T19:47:32.830910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.834387Z","title":"The probabilistic relevance framework: Bm25 and beyond.Foundations and Trends® in Information Retrieval, 3(4):333–389, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.834387Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:2092509c69d914a53cb839b3f279aa9d5ba546a57ae54394a4b34b9a94397872","observation_id":"7c9581a8-9a96-42f2-9379-6db1f75516cb","resolution":{"observed_at":"2026-08-03T19:47:32.834387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.838076Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.838076Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:df068c620748ef8e1f4190b341cecdf1c98cc9c20a39286f448623e6917855cb","observation_id":"de6e366d-b1cb-4d6d-b8e0-6bbf2d0ca9d4","resolution":{"observed_at":"2026-08-03T19:47:32.838076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-08-03T19:47:32.841640Z","title":"Seedream 4.0: Toward next-generation multimodal image generation.arXiv preprint arXiv:2509.20427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.841640Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1810a5017a7331c8d374a23c67e6ac3e534a2b26ff04984ad7b48ded640ebb7c","observation_id":"7fd5d0e7-076e-4197-8209-27b54b88993e","resolution":{"observed_at":"2026-08-03T19:47:32.841640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.845771Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision.Advances in Neural Information Processing Systems, 37:68658–68685, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.845771Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:a484c87dffe51c113ce3d071282b9ddae4633c3b2bb578cbd414c5b609a067ad","observation_id":"001f9e5e-79db-4125-bd69-62f8a157e1ba","resolution":{"observed_at":"2026-08-03T19:47:32.845771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.849321Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.849321Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:b34873819860c9e0aaa50262b39c2ee26c14f3f14f1081e57a75e01a992c80fb","observation_id":"6cbba010-adce-477b-94fd-5ab51a938109","resolution":{"observed_at":"2026-08-03T19:47:32.849321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.852837Z","title":"Flux.1 krea [dev].https://github.com/krea-ai/flux-krea, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.852837Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:0a9560b28bfc8e855547be7c143f4e2e48d0b8a44a4e99980ec2ce30f5c3624d","observation_id":"bf6655a5-17b8-4c07-85e5-ba6c4dff28ca","resolution":{"observed_at":"2026-08-03T19:47:32.852837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.856326Z","title":"From louvain to leiden: guaranteeing well-connected communities.Scientific reports, 9(1):1–12, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.856326Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c030960af6e7f7ee3df76c30138d3c773c6037930497d60b2060d2409f835914","observation_id":"b3f2e89b-804a-4105-81dc-a7ec64ad74c0","resolution":{"observed_at":"2026-08-03T19:47:32.856326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-03T19:47:32.859900Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.859900Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:f1711f058c375d17862e5a915e7530292788f8e7c0988204c937d359c356a4da","observation_id":"8547a68f-3bc8-436a-b350-d3b1ebfe4763","resolution":{"observed_at":"2026-08-03T19:47:32.859900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.863821Z","title":"Anytext: Multilingual visual text generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.863821Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:61d21bc1bb0261a732cb6d2a19bcd24071dcc5f9c155e2d721d60d63084801e9","observation_id":"9d7a79c0-80d7-4f36-a560-e97452fa4c77","resolution":{"observed_at":"2026-08-03T19:47:32.863821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15613","last_updated":"2024-06-28T09:22:38Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T14:58:51Z","title":"Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15613","snapshot_observed_at":"2026-08-03T19:47:32.867409Z","title":"Automatic data curation for self-supervised learning: A clustering-based approach.arXiv preprint arXiv:2405.15613, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.867409Z"},"links":{"cited_paper":"/paper/2405.15613","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c4bfc7806ea87f3f9880e7e440a0b4c129b661b59ace7ea9773c473d6fd2694a","observation_id":"2c059e89-b1c9-4c53-9b29-e88f08179e47","resolution":{"observed_at":"2026-08-03T19:47:32.867409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-03T19:47:32.871256Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.871256Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:e5546acf4627efaf1504c5dc3049f0253fe473f7f4e99706b48ec17faeff7f25","observation_id":"ae2eea76-621f-4287-94a7-8e76b1acd82e","resolution":{"observed_at":"2026-08-03T19:47:32.871256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.875546Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.875546Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1f162752a05b81023bf5dc8dd2f264ad03ff8cd99642780a19dea4bea0c1e61d","observation_id":"6fb69a08-9e45-47f3-a5e9-b4272ca191fb","resolution":{"observed_at":"2026-08-03T19:47:32.875546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02161","last_updated":"2026-07-12T08:53:18Z","snapshot_observed_at":"2026-08-03T11:32:22.984587Z","submitted_at":"2025-06-02T18:44:07Z","title":"TIIF-Bench: How Does Your T2I Model Follow Your Instructions?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02161","snapshot_observed_at":"2026-08-03T19:47:32.879231Z","title":"Tiif-bench: How does your t2i model follow your instructions?arXiv preprint arXiv:2506.02161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.879231Z"},"links":{"cited_paper":"/paper/2506.02161","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:3fb81a38d6332b88ac2d4fa05ab8bc0ee9c07975461f388946f7de68741f983e","observation_id":"c225f343-de65-4a46-a361-411e08e52309","resolution":{"observed_at":"2026-08-03T19:47:32.879231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.882907Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.882907Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:29b33076fb8a65e04b26eebdfac2f90240050853b5f9dc98e33c1c9f14663d04","observation_id":"04c73a54-6442-49b1-b6ad-8f40308d6c62","resolution":{"observed_at":"2026-08-03T19:47:32.882907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-03T19:47:32.886603Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.886603Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:3d86fef549974906d8a2765fbc842b6a9ff61df1b12fcb974ded34584d406c11","observation_id":"f6cbc9a7-7c97-4211-9433-48b1576430ea","resolution":{"observed_at":"2026-08-03T19:47:32.886603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.890313Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.890313Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:e0b96c4bc30ff1ca26c9cffa123252847af012382c92d89b66bd4517a6cdbcb7","observation_id":"591e6a73-4ffb-41ff-97be-97f818aa624b","resolution":{"observed_at":"2026-08-03T19:47:32.890313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-08-03T19:47:32.893816Z","title":"Omnigen2: Exploration to advanced multimodal generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.893816Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:bf81c4cac417c205ed4cf52e4bb2fd7dc0856bf25c53800c305108e8f04ffef6","observation_id":"51eaf0c8-952c-4956-a7cf-6ffc95dbe6bf","resolution":{"observed_at":"2026-08-03T19:47:32.893816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08619","last_updated":"2025-03-11T16:58:02Z","snapshot_observed_at":"2026-08-01T14:58:14.866237Z","submitted_at":"2025-03-11T16:58:02Z","title":"LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08619","snapshot_observed_at":"2026-08-03T19:47:32.897508Z","title":"Lightgen: Efficient image generation through knowledge distillation and direct preference optimization.arXiv preprint arXiv:2503.08619, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.897508Z"},"links":{"cited_paper":"/paper/2503.08619","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:620700fd79b714b54b9d2fbcc15ef8be4a134167bfd790a02a1c997a1a775161","observation_id":"ea22e517-559e-489c-a0c5-3dc9a51399a4","resolution":{"observed_at":"2026-08-03T19:47:32.897508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.901206Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.901206Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:cb7939832064eb83cbf257a5d66b593afeb70bd3f8007d241ab4741f035d238b","observation_id":"e5a2cb71-57c7-450b-94f0-6568e6b5f5e6","resolution":{"observed_at":"2026-08-03T19:47:32.901206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.905000Z","title":"Sana 1.5: Efficient scaling of training-time and inference- time compute in linear diffusion transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.905000Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:06b5fcdcca0dd7e0c99103af475e8fb4da0bde9ca3c0982fd87f12592b345a49","observation_id":"34af0cec-fee1-41fa-bc57-d9178a7b71b2","resolution":{"observed_at":"2026-08-03T19:47:32.905000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.908697Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.908697Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:4138652b0ed3cfd2ee01df2c952f2687e9e54dc3502e5de3908ad3060a7e1ba0","observation_id":"414f53da-d353-4115-8a61-2d07dd8fdfba","resolution":{"observed_at":"2026-08-03T19:47:32.908697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-08-03T19:47:32.912339Z","title":"Show-o2: Improved native unified multimodal models.arXiv preprint arXiv:2506.15564, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.912339Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:622769a5301f818f8c96ffb3ef1a006e38c2bd16a00ca6d2f40edf05b8932009","observation_id":"5b6c705a-04c7-4a30-b649-78ad33a04a3b","resolution":{"observed_at":"2026-08-03T19:47:32.912339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-03T02:30:08.318253Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-08-03T19:47:32.916121Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation.arXiv preprint arXiv:2412.21059, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.916121Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:9b6aa2e72b8ad0775a5348a440464464dabba6a197ffd6af8c69b32af2b53bc5","observation_id":"407fb0a1-7253-40a0-8e5b-c93341c6631c","resolution":{"observed_at":"2026-08-03T19:47:32.916121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T19:47:32.919923Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.919923Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:4a3c7461984f712ef380578bc447afe5113bf6a12542d281f9ecb2df353b541f","observation_id":"51cdbaa3-842d-4ff5-9420-88e348106128","resolution":{"observed_at":"2026-08-03T19:47:32.919923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-02T21:42:25.156081Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-03T19:47:32.923852Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.923852Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c8a6beea31ebcc4952955c151fa6f44cd25018d4f64ae0c43defaffe55ac5e37","observation_id":"9313398e-7389-40e6-9162-02bc5618da1d","resolution":{"observed_at":"2026-08-03T19:47:32.923852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-08-03T19:47:32.927991Z","title":"Imgedit: A unified image editing dataset and benchmark.arXiv preprint arXiv:2505.20275, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.927991Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:2a08f4a8828723b3eb1aee6aa1f1de951e2473973564d4e5d5dd20a524e08e03","observation_id":"b95ce2d4-deaf-43d9-a338-bffeab7b07e9","resolution":{"observed_at":"2026-08-03T19:47:32.927991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.931947Z","title":"Improved distribution matching distillation for fast image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.931947Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:7c6004c9df2fa9de67e4b7bef05fbfbec45b312081391cf35577c894af860fda","observation_id":"2f78b4cf-82b7-4a6b-9b14-2ebe4c44aa91","resolution":{"observed_at":"2026-08-03T19:47:32.931947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.936030Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.936030Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:9197fb7a5ae7b3a89291008195dc9e642ba7d6680ab2d698148828e69ff353f6","observation_id":"19d8feed-c4f9-443c-ac5e-2e95158b2cf6","resolution":{"observed_at":"2026-08-03T19:47:32.936030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.939949Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.939949Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:1b70d276f86ca6ccef41353f2dc46e3f49502f1fbd0b840ea4f564ae8bfb5a8b","observation_id":"89dffe26-4af2-4f31-9c22-7e00364e6146","resolution":{"observed_at":"2026-08-03T19:47:32.939949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.943774Z","title":"Root mean square layer normalization.Advances in Neural Informa- tion Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.943774Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:cd09405ecada485de42c6e6986d142e55f371595879b6a290435f53979ed718b","observation_id":"daf94073-59ef-4700-97cb-aef9c5aa98e9","resolution":{"observed_at":"2026-08-03T19:47:32.943774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.947772Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.947772Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:8255088456f3d39dac219f42a3510a5a5a074d9bccd222f7868dc2dadc5a5d81","observation_id":"2f39c923-2d12-4713-ba8e-37fb47a77507","resolution":{"observed_at":"2026-08-03T19:47:32.947772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-08-03T19:47:32.951504Z","title":"Waver: Wave your way to lifelike video generation.arXiv preprint arXiv:2508.15761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.951504Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:c92bf51045fb4d9cccde6fd0dbba3ac97af2709887526d619c72976af62342d9","observation_id":"724d8e93-be20-455a-9c1d-538edb4c1b6a","resolution":{"observed_at":"2026-08-03T19:47:32.951504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-03T19:47:32.955470Z","title":"In-context edit: Enabling instructional image editing with in-context generation in large scale diffusion transformer.arXiv preprint arXiv:2504.20690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.955470Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:8bedd656885202013c79f4693c8529fb5e013df13c59d2c43eab249d3486da8b","observation_id":"d577266e-387f-46a8-8ce8-25dad117d4df","resolution":{"observed_at":"2026-08-03T19:47:32.955470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.959458Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale.Advances in Neural Information Processing Systems, 37:3058–3093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.959458Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:9b8442ce7f69e868dfbb0c444ab2f981855244e0d95e2bc0c6d01ce712b0287e","observation_id":"d8c04b0f-276f-44b8-818f-4219b120d5f2","resolution":{"observed_at":"2026-08-03T19:47:32.959458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-03T19:47:32.963177Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.963177Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:5096cb327bff73a14d942bb1541e98e9515ec9ec10ae8f6a50a9245131690a23","observation_id":"e5b84ebc-1b0e-4bc5-bdc0-b8b55e55a319","resolution":{"observed_at":"2026-08-03T19:47:32.963177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05121","last_updated":"2024-03-08T07:32:50Z","snapshot_observed_at":"2026-07-06T17:41:27.341898Z","submitted_at":"2024-03-08T07:32:50Z","title":"CogView3: Finer and Faster Text-to-Image Generation via Relay Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05121","snapshot_observed_at":"2026-08-03T19:47:32.968338Z","title":"Cogview3: Finer and faster text-to-image generation via relay diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.968338Z"},"links":{"cited_paper":"/paper/2403.05121","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:4763b895365cb732be49b859db37e72005ab65db79e03dcacdcc9a8612f0d242","observation_id":"5cc1cd5d-82f7-4f75-8817-df4ba1599eb1","resolution":{"observed_at":"2026-08-03T19:47:32.968338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05131","last_updated":"2025-01-09T10:34:00Z","snapshot_observed_at":"2026-08-06T02:14:02.110378Z","submitted_at":"2025-01-09T10:34:00Z","title":"3DIS-FLUX: simple and efficient multi-instance generation with DiT rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05131","snapshot_observed_at":"2026-08-03T19:47:32.977475Z","title":"3dis-flux: simple and efficient multi-instance generation with dit rendering.arXiv preprint arXiv:2501.05131, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.977475Z"},"links":{"cited_paper":"/paper/2501.05131","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:648f1c56bedbf55aebb654c52910556e71663f1c11fd0ca1f80ba8e87fa8e0d5","observation_id":"7f3e05e9-da72-47ae-a9d2-eae80e7dac7b","resolution":{"observed_at":"2026-08-03T19:47:32.977475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.982043Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.Advances in Neural Information Processing Systems (NeurIPS), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.982043Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:a3ee4640a4d148150ee2048c12d13c40fea3d9156976c7ad3e0834b943ae1a2d","observation_id":"a9d8bf48-453a-46bb-adc0-368c4766b394","resolution":{"observed_at":"2026-08-03T19:47:32.982043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T19:47:32.986689Z","title":"Turbo”字样，胸口白色小字清晰的写着“MAI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.986689Z"},"links":{"citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:e3208b86453a765845a9f1a2818723b77b93f398b426b0da5b11ab33b99288f8","observation_id":"6a802147-c552-40de-9f64-5ad920717acd","resolution":{"observed_at":"2026-08-03T19:47:32.986689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 100 inbound Pith citation observations for arXiv:2511.22699."}