{"as_of":"2026-08-06T21:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39a335c593543212e723333969587e92a09b56b2ad9d1ee4e92db7ec50eb0315","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T05:15:22.907880Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T18:33:52.933672Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-20T18:38:52.917903Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"cited_work":{"arxiv_id":"2604.18168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18168","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","venue":"cs.CV","work_id":"fd1fc553-d07c-43af-8a13-39264481c38b","year":2026},"citing_paper":{"arxiv_id":"2605.15803","last_updated":"2026-05-15T09:56:40Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:56:40Z","title":"Embedding-perturbed Exploration Preference Optimization for Flow Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-20T18:33:52.933672Z"},"links":{"cited_paper":"/paper/2604.18168","citing_paper":"/paper/2605.15803"},"observation_digest":"sha256:e1aa08b36674d81c4d7413d9a8d9444a76afe0482cf4435bc28f588000b53620","observation_id":"48f3f1e4-b893-4df5-ad80-f151fc77bf54","resolution":{"observed_at":"2026-05-20T18:38:52.919696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.18168/citation-record","integrity":"/paper/2604.18168/integrity","json":"/paper/2604.18168/citation-record.json","paper":"/paper/2604.18168"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffu- sion probabilistic models.Advances in neural information processing systems, 33:6840–6851","venue":null,"work_id":"ad9b560b-2685-4f12-885e-e3e4cc9fdc8e","year":2020},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:edbc6184f5fb2298352a08e41da0163c8e7957e89e56109753845de657011e39","observation_id":"3f069ea7-8e75-419e-a549-12188780915a","resolution":{"observed_at":"2026-05-21T21:44:23.730117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:c5080829e3ede134892f14ae9c1caa1ae27a70ca19b748604eced662537982b2","observation_id":"4dbd93fb-70cc-4a87-a478-f15fd048e270","resolution":{"observed_at":"2026-05-10T09:28:39.625775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow matching for generative modeling","venue":null,"work_id":"4a792064-5449-4cce-9526-23f9809f9f14","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:cdb74c40c2e31013256989e459120eb5943b488b6dcae17a1fd60eb07186c51f","observation_id":"84666e2e-9a9a-416c-a63c-deca3cafdb49","resolution":{"observed_at":"2026-05-21T21:44:23.732245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flowtransformersforhigh-resolutionimagesynthesis.InForty- first international conference on machine learning","venue":null,"work_id":"df085606-47f9-4598-98a9-278d31caa49d","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:23ca8d93aa1638607059e43d7dba766aeb1623628d5d0eb9ec692f68b0fc946c","observation_id":"1cddfd30-dd49-4775-a2a2-c12d6db12cd0","resolution":{"observed_at":"2026-05-21T21:44:23.725387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Consistency models","venue":null,"work_id":"43eaa0ea-4c29-4808-93de-f45cbdf48b30","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:ec9371831fea1644e1b9a13a0abd3a82d1c0c7a39533930f5075d3cf5f0d4874","observation_id":"c4274da3-2d76-428b-81e7-0c8d734bd983","resolution":{"observed_at":"2026-05-21T21:44:23.755134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06807","last_updated":"2024-11-19T14:31:02Z","snapshot_observed_at":"2026-08-03T11:30:00.885783Z","submitted_at":"2024-03-11T15:26:34Z","title":"Multistep Consistency Models","version":3},"cited_work":{"arxiv_id":"2403.06807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.06807","snapshot_observed_at":"2026-07-04T17:29:59.509159Z","title":"Multistep Consistency Models, November 2024","venue":null,"work_id":"d75545e0-a6f8-42ad-87e0-f3503e354e25","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2403.06807","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:3bb38d3f7708226cc45bfbe2cd7b9c56b5e8bd8c4e53885567eaa20049174421","observation_id":"24eaa755-7c05-4d82-ba2f-06434762e7f7","resolution":{"observed_at":"2026-05-10T09:28:39.551210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14603","last_updated":"2025-06-17T15:06:07Z","snapshot_observed_at":"2026-07-06T21:43:40.740750Z","submitted_at":"2025-06-17T15:06:07Z","title":"Align Your Flow: Scaling Continuous-Time Flow Map Distillation","version":1},"cited_work":{"arxiv_id":"2506.14603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14603","snapshot_observed_at":"2026-07-04T19:50:11.438511Z","title":"Align your flow: Scaling continuous- time flow map distillation","venue":null,"work_id":"d608f2d9-214b-40f9-a6a5-c480d26ebdb1","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2506.14603","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:c0093e6eb31afa0894686ff48035b846dd3451b8415aeac846fb2e259a259edd","observation_id":"9f57c5a8-4651-4b9d-951c-ce1580a72fed","resolution":{"observed_at":"2026-05-10T09:33:41.601618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07507","last_updated":"2025-06-03T00:03:07Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:41:26Z","title":"Flow map matching with stochastic interpolants: A mathematical framework for consistency models","version":2},"cited_work":{"arxiv_id":"2406.07507","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07507","snapshot_observed_at":"2026-07-04T17:09:58.778148Z","title":"Boffi, Michael S","venue":null,"work_id":"3b39f5ec-7294-49ef-ac0e-d95360c0f177","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2406.07507","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:b7922b1ebe2a95f0e18e86c8041847526bc95097fe31a11f9dd4023d2c91955a","observation_id":"7e20a4bd-f721-42c0-a456-4ee2efadd77e","resolution":{"observed_at":"2026-05-10T09:33:41.639906Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-07-06T21:26:30.087184Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":"2505.13447","doi":"10.48550/arxiv.2505.13447","metadata_source":"pith","pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mean Flows for One-step Generative Modeling","venue":"cs.LG","work_id":"07a52ad5-0f82-4095-9a66-559b09fea1ae","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:91499f07838689bbd464474e4027bfc09e4831e47b12275a13c9a380784af4c3","observation_id":"ad82b1cf-94e0-4ffb-ad8b-3a6c5ee9c73a","resolution":{"observed_at":"2026-05-11T14:29:30.500037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20771","doi":"10.48550/arxiv.2510.20771","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zhang, A","venue":"ArXiv.org","work_id":"35a29981-f3bd-45d1-a04b-c8b55c9138bc","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:bf005078a1f262dc184b1ccbe75ce7e2a95f9c88dc32bf30c9af2a29d57881d5","observation_id":"6f52eed5-9cb1-4842-b34f-587929729f21","resolution":{"observed_at":"2026-05-10T09:33:41.636415Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16884","last_updated":"2025-07-22T16:26:58Z","snapshot_observed_at":"2026-08-06T16:54:35.498677Z","submitted_at":"2025-07-22T16:26:58Z","title":"SplitMeanFlow: Interval Splitting Consistency in Few-Step Generative Modeling","version":1},"cited_work":{"arxiv_id":"2507.16884","doi":"10.48550/arxiv.2507.16884","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16884","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2507.16884 (2025)","venue":"ArXiv.org","work_id":"962b780e-64c7-4220-8b48-cbc7fc1b12d4","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2507.16884","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:ebe0753157f57691a728dbfe982aaee4fcdf1faa8da78f57f56a48db1fe62181","observation_id":"9e595388-e436-4c85-9af0-a437fa6a15d4","resolution":{"observed_at":"2026-05-10T09:28:39.588855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:59:58.126859Z","title":"Decoupled meanflow: Turning flow models into flow maps for acceler- ated sampling","venue":null,"work_id":"9c822e6d-3795-46c2-b0fc-1727b6ef7b4c","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:1efb5becae7283a7924df1d912aa6a1ccf067368a48740b7c4be9b6a455dc373","observation_id":"17af12ea-0515-4483-8499-01b4a9404d26","resolution":{"observed_at":"2026-05-10T09:28:39.591490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"62b10d18-bdc4-4fd6-952d-7eca36b97a96","year":2009},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:5731ccadba61f44cf23482e6201fe2983ae4776be57e1edb5175348f1817cddc","observation_id":"1e62e046-6323-4fb5-b462-afe71a51de37","resolution":{"observed_at":"2026-05-21T21:44:23.720593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2410.10629","doi":"10.48550/arxiv.2410.10629","metadata_source":"pith","pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","venue":"cs.CV","work_id":"c53bf282-3c74-4c37-a7bd-6531aee212b8","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:e1213faa7750ce915a8810a280a51dfa702a2f7e6309afa349b165a37913354d","observation_id":"e6b7663d-ebe9-40fd-8242-62a962224a52","resolution":{"observed_at":"2026-05-15T00:56:50.121098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning trans- ferable visual models from natural language supervision","venue":null,"work_id":"8d97b8af-71a4-4822-99f9-1c71a4673d55","year":null},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:a04c43ab98ccfdbdc176741e47e6ef0f4a01ed2448f28a6ddf34e72f9cdeb799","observation_id":"a93b0b49-62d6-4197-9e08-242ae8bc0634","resolution":{"observed_at":"2026-05-21T21:44:23.720304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67","venue":null,"work_id":"0b41db60-a3f8-4005-97ae-8440a9f93e37","year":2020},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:4421a10c96f6f8a4408e79e8fe9d9383f7b4c9be24e5a065f67d9ca6f986e0bc","observation_id":"925e388f-5715-4952-9da6-db60f64a966b","resolution":{"observed_at":"2026-05-21T21:44:23.704110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:f14a0fb62facaf0b96efdab3215f658c4d79d6683c615dfd3dc19b440edff9cd","observation_id":"06fd4b26-6939-450e-9e7d-10cc1e1e34c1","resolution":{"observed_at":"2026-05-10T14:09:09.439499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:0736dfcc99d8508fc7ebf245f2cd27177daa8a89ec79687f437196338cc8e0d6","observation_id":"9f3d9ad2-e725-4af6-8c6f-89c817520d60","resolution":{"observed_at":"2026-05-10T12:11:16.746994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09641","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T23:26:22.548759Z","title":"8 Sana-sprint: One-step diffusion with continuous-time consis- tency distillation","venue":null,"work_id":"4d0fc865-637e-474b-8b69-40ac8fe22eaf","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:4a994d044ea416e704750a9ebd0abaedc0118873c423d29aaadeff84277dbeee","observation_id":"b7087298-efb4-45ea-a3e3-146de5a712e2","resolution":{"observed_at":"2026-05-10T09:28:39.567279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11081","last_updated":"2025-03-01T09:52:49Z","snapshot_observed_at":"2026-07-06T19:33:30.263638Z","submitted_at":"2024-10-14T20:43:25Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","version":2},"cited_work":{"arxiv_id":"2410.11081","doi":"10.48550/arxiv.2410.11081","metadata_source":"pith","pith_arxiv_id":"2410.11081","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","venue":"cs.LG","work_id":"1151c0b6-2be7-436c-ab83-843d92dea769","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2410.11081","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:f07847e59574caef222bbc30ce16282bd9da44ba491848921061823a34246b13","observation_id":"731fe970-5be0-4ab0-94e3-72c68ccf09b2","resolution":{"observed_at":"2026-05-13T10:26:23.772771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:52.637926+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:52.637926+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08431","last_updated":"2026-05-06T15:49:52Z","snapshot_observed_at":"2026-08-06T18:36:14.975364Z","submitted_at":"2025-10-09T16:45:30Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","version":3},"cited_work":{"arxiv_id":"2510.08431","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08431","snapshot_observed_at":"2026-07-11T01:07:44.823334Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","venue":"cs.CV","work_id":"c4d59581-ef40-441f-937a-e325bff802be","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2510.08431","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:00f1a46eba43e37d4194d04cfeb8cee0f4ed3871cd2f70b52bd3ff3df9aba60b","observation_id":"9a1f6ecc-891f-4aa5-a9e4-3389e29e495a","resolution":{"observed_at":"2026-05-10T09:28:39.639528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14548","last_updated":"2024-10-10T21:59:49Z","snapshot_observed_at":"2026-08-05T03:20:53.668810Z","submitted_at":"2024-06-20T17:56:02Z","title":"Consistency Models Made Easy","version":2},"cited_work":{"arxiv_id":"2406.14548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14548","snapshot_observed_at":"2026-07-02T16:07:08.224804Z","title":"Gonzalez, M.; Fernandez Pinto, N.; Tran, T.; Hajri, H.; Mas- moudi, N.; et al","venue":null,"work_id":"8a18f8f0-423e-4b12-8c96-c574c60954cf","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2406.14548","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:116a201f229e9bc46d4fd4797a92de2150b5e94e4233f69d2326d0559820dc25","observation_id":"4d3247bb-44c9-4e2b-a96b-409d69860435","resolution":{"observed_at":"2026-05-10T09:33:41.662547Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14189","last_updated":"2023-10-22T05:33:38Z","snapshot_observed_at":"2026-08-03T16:40:35.231838Z","submitted_at":"2023-10-22T05:33:38Z","title":"Improved Techniques for Training Consistency Models","version":1},"cited_work":{"arxiv_id":"2310.14189","doi":"10.48550/arxiv.2310.14189","metadata_source":"pith","pith_arxiv_id":"2310.14189","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Techniques for Training Consistency Models","venue":"cs.LG","work_id":"f730a570-4b0e-4910-87bb-ed1ec909fbc6","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2310.14189","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:0c7f8e2f490808bb718675dc29ec7ea0830f6116e68591c9995d2108f985b667","observation_id":"5b328d3b-7d01-40e1-9061-6387feb5f2f2","resolution":{"observed_at":"2026-05-21T05:04:10.684842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12586","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:44:19.591719Z","title":"Advancing end- to-end pixel space generative modeling via self-supervised pre-training","venue":null,"work_id":"4f90755f-f431-4408-8d8f-53fbe51ca8fb","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:142419c0679370af9254ddd80aab75b67abd1cb9ddbde0055bf01a89e086b042","observation_id":"005ca170-0da8-418e-a4cf-2ed10216f322","resolution":{"observed_at":"2026-05-10T09:28:39.612762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":"2510.11690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-07-10T18:47:31.703880Z","title":"Diffusion Transformers with Representation Autoencoders","venue":"cs.CV","work_id":"c1a2d4de-4439-4005-8c56-e0124e4ed5fa","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:179d2d2b1e292e8482d844045bc202d6e20169206c843a7f4c6442f7d31ef42d","observation_id":"86826d24-af32-40d4-88f5-d78d49c3f718","resolution":{"observed_at":"2026-05-11T22:34:18.071377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:a9c8416f9cb38adcb415631f5614348694168c5c452e590c74ee7336850c1269","observation_id":"57afe4cc-3a5d-4048-883f-4800c8f2cdf1","resolution":{"observed_at":"2026-05-12T15:09:37.504223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.398527Z","title":"Latent diffusion model without variational autoencoder","venue":null,"work_id":"ab5fd0eb-3300-410d-a690-19e04b2a7770","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:83398a6a24af4fe100674baac354a4285a1c1819a11120d71f1635f7c252adba","observation_id":"2ecd1cf9-7c91-493c-901f-faa7fd1f330f","resolution":{"observed_at":"2026-05-10T09:28:39.548609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representation entanglement for generation: Training diffusion transformers is much easier than you think","venue":null,"work_id":"fb90a8f3-ff18-4413-b6f0-4c7b0e086d2c","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:f57eb7f221c00d3ad851025e441b48370b3a2163fef82212a3c92e8c84efdd2f","observation_id":"9379771f-a636-438e-9704-b97d8decaeb4","resolution":{"observed_at":"2026-05-21T21:44:23.715591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InICCV","venue":null,"work_id":"1653c0bb-7bdf-410b-b262-4c7212263bbd","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:9da348561c09dbb22b7aeb71a2a682d930adfb93d64b9c2082671b05833ba7c3","observation_id":"c9434ea0-c1c9-489f-a857-17cbdcd8881d","resolution":{"observed_at":"2026-05-21T21:44:23.699410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-04T22:36:03.033298Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":"2509.07295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.07295","snapshot_observed_at":"2026-07-02T08:16:48.433525Z","title":"\"Your output must be a single JSON object.\\n\\n","venue":"cs.CV","work_id":"49fe4943-80e8-4f4e-b253-05cf57244f19","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2509.07295","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:34e318d1c3cea962e8cddc6b6ea8b604832f2e213425e3bce92d1712d8919e7b","observation_id":"18624687-ba25-4118-8323-2cfbc76445ae","resolution":{"observed_at":"2026-06-26T02:15:36.738364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sana 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer","venue":null,"work_id":"3a99773a-1da9-4ea8-af53-550e9e4cd878","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:40d84c363c9e5d7467d5e22667bee833ed5707cec107f2d6591ef6fa29082249","observation_id":"279719c3-82a0-4c51-9335-39830488559e","resolution":{"observed_at":"2026-05-21T21:44:23.709567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"31f5be2c-af85-4662-8b84-b3763ab57406","year":null},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:0dc26b390b5c7405c761602836becd8c298d0709d066b6bee81e90daf18a2612","observation_id":"47aa68e4-9830-48f4-8b0f-9a521601fa38","resolution":{"observed_at":"2026-05-21T21:44:23.712492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.715460Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"292e4202-5927-473f-b73e-1d6883498f14","year":null},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:17c7d79854acdfce2bfb735b47cee344be3f6adf9f82999f8d8d9cbb33975de7","observation_id":"0a5a0c6d-5950-4ef3-8a27-04a4b904802d","resolution":{"observed_at":"2026-05-21T21:44:23.718203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.12880","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:44:19.533879Z","title":"S2-guidance: Stochastic self guidance for training-free enhancement of diffusion models","venue":null,"work_id":"23671066-7c01-4a16-8fe6-794f4e803fb7","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:fa6896f3d5605301576cb6e7c4291bd0607e75a4a69f5695134fa1d8f5700f96","observation_id":"7b5bd5ae-0276-43cb-ab47-0d9e54fd6a31","resolution":{"observed_at":"2026-05-10T09:33:41.659344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming preference mode collapse via directional decoupling alignment in diffusion reinforcement learning","venue":null,"work_id":"c462cdab-caaf-45b3-be60-4cf23a7dbcca","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:8347237ff83d5a082ac581aaa25eadab66aa74d0f16871bfaae5cb69eb4f2ede","observation_id":"907c7825-2665-4e8a-8525-c595ff44a7b9","resolution":{"observed_at":"2026-05-10T09:28:39.634001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:ad52a69dc05fa2fe29d9a05e93b3e1a8b0938977f291ba88da590f2285355d41","observation_id":"b9562984-82e3-4676-9a48-12165c14b8b5","resolution":{"observed_at":"2026-05-10T09:33:41.642802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:fc808421c8d641d2ecfe00c3ab7c6da18441a7c7b2446dd3d76a9c4767a24f7c","observation_id":"9ec2f277-279c-4a71-8972-e8a26a78daae","resolution":{"observed_at":"2026-05-10T09:28:39.620625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":"2403.08295","doi":"10.48550/arxiv.2403.08295","metadata_source":"pith","pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma: Open Models Based on Gemini Research and Technology","venue":"cs.CL","work_id":"a9ea2870-df28-40b8-a9e0-a7e9a116f793","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:67cbf9c620dea5205a526992e74826d4f2988c88d3b602f188ca4260a30102d4","observation_id":"d7f0a1c9-04c7-4d72-a98e-7ad5651a712f","resolution":{"observed_at":"2026-05-10T15:54:09.189864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:b5ad26ca86d88a911afbfff3f0af31a3f422a83b51f1367c358276bc680ae051","observation_id":"a9db719e-fcfe-49bd-baa4-863eb986598f","resolution":{"observed_at":"2026-05-10T09:28:39.617811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis withlatentdiffusionmodels","venue":null,"work_id":"d6188f5e-b886-433e-8642-52106f07db71","year":2022},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:abde1c4222577a0032fab0dfecea21cf1f83b429bfacc5e685e55a6ed1d2114a","observation_id":"d6fe364b-5a3c-4b71-9499-4cff217e2ffc","resolution":{"observed_at":"2026-05-21T21:44:23.727838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:f92b14bca4a55c1efcf8ea0ad07f0ecf4eaf53d1bb780ced2fec08dc038788c8","observation_id":"b0e129c9-4d86-4b9a-8437-5b2c6eca2117","resolution":{"observed_at":"2026-05-10T15:22:03.751402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixart-𝛼: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":"a519c2aa-a8b6-487a-b22e-87b94c96acb6","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:618068d0bf81e17f3acc20b21aeb5c33faff7751b68037765d7530f46716a997","observation_id":"7700f5a4-e79f-493e-89ba-dee488f2652b","resolution":{"observed_at":"2026-05-21T21:44:23.737243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-07-06T17:13:50.706719Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":"2401.05252","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-07-01T22:26:17.406080Z","title":"Pixart-{\\delta}: Fast and controllable image generation with latent consistency models","venue":null,"work_id":"84330e8f-f6a0-4504-80e7-b8f8f3a25587","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:248248dd688e0b3b6d610d9fdd1947966966dee13847e6b1a0ed7caeefb08ea8","observation_id":"70510194-090f-412e-a1e4-b72b7d4fe14e","resolution":{"observed_at":"2026-05-10T09:28:39.623281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixart-𝜎: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":"c09761a0-8153-41d0-bdf4-01b562d0d9ae","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:105dbf039f04201b2ba1434252e5682d201d0b821ec17bbc3794fbf468f97230","observation_id":"4be4a9e5-2ab3-4348-b20b-f962c88e7451","resolution":{"observed_at":"2026-05-21T21:44:23.696510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"49deee45-2d03-469c-b84e-385a5b8a9599","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:5b667603ae922b827462c59c18224a98841cfdfe308ea974acb94aacaba93725","observation_id":"8f4cafac-6826-4145-b41e-161e1732a5a6","resolution":{"observed_at":"2026-05-21T21:44:23.706886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.03329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.566556Z","title":"Flux-text: A simple and advanced diffusion transformer baseline for scene text editing.arXiv preprint arXiv:2505.03329","venue":null,"work_id":"1bf6b24b-cdb9-4b2d-b872-9613d9085131","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:95d3f31ae4cdad670b2949d66c37f1ad16499d69af442f976af476c0c9e35e8b","observation_id":"6e216859-95ac-48c4-a414-5aefe50849b0","resolution":{"observed_at":"2026-05-10T09:33:41.605722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nano banana","venue":null,"work_id":"9e427153-9011-4f87-b5a7-920a4a91d8ff","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:1b665de331eeb65177debd4dde9cbf0bee12c410e5cf5daf1eb71e2bdd0d345b","observation_id":"63ba8b72-ade2-480c-b0a9-bfc0a78dd088","resolution":{"observed_at":"2026-05-21T21:44:23.680937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:164829ed68b58517befe7c64436791be0b1c3ab24312bb116f6ce7a5a0ac0fcc","observation_id":"126a2e29-ad8a-48f0-b1d4-c23345e402aa","resolution":{"observed_at":"2026-05-10T14:29:07.137498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.23951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-07-04T16:59:57.981208Z","title":"HunyuanImage 3.0 Technical Report","venue":"cs.CV","work_id":"36511e33-8360-43dd-9407-dddf867c1d7c","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:552009e7ce80e7b03cea6b966730e37000e4ea6eaf3c288f7bd3df7a99de5d44","observation_id":"ce4cba4c-d39b-4163-9ddb-75a2738fb6e5","resolution":{"observed_at":"2026-05-16T02:02:32.945705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-07-06T19:16:23.103921Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:6efdd1645f570f92992899abfbb9b237d9685e0a540f244a4969560f5c10167b","observation_id":"6cdca740-2263-4059-b665-c36a3b372e93","resolution":{"observed_at":"2026-05-10T09:28:39.561935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T16:51:14.299739Z","title":"Blip3o-next: Next frontier of native image generation","venue":null,"work_id":"b51bf787-a19b-47bb-9114-1a1a29263297","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:efd7634cbd3ece14125bab29bdfe434c69cdd3660ea1e60c7ac28d6a7eb03687","observation_id":"e982e22b-dde6-42c6-a6b4-63ffc68ace9d","resolution":{"observed_at":"2026-05-10T09:28:39.607020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":"2310.04378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-07-08T10:54:49.201621Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","venue":"cs.CV","work_id":"53b1d836-7feb-402c-97c7-87b9bc51196f","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:6ae0200f20fe17f85bf6f575bae59956d9471fc15f9a112ad9948dd14cd80164","observation_id":"928552b2-61f6-4326-8b44-9b687fad2b42","resolution":{"observed_at":"2026-05-13T04:15:55.027720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02398","last_updated":"2024-07-02T16:15:37Z","snapshot_observed_at":"2026-08-02T20:27:48.466035Z","submitted_at":"2024-07-02T16:15:37Z","title":"Consistency Flow Matching: Defining Straight Flows with Velocity Consistency","version":1},"cited_work":{"arxiv_id":"2407.02398","doi":"10.48550/arxiv.2407.02398","metadata_source":"pith","pith_arxiv_id":"2407.02398","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Consistency flow matching: Defining straight flows with velocity consistency","venue":"cs.CV","work_id":"88f9c5fa-dd27-420b-b012-3849fb16c89f","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2407.02398","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:329e2f109ff1027cacd9eb28cc1ad863428eab397714a94e7a117179aa45d9a1","observation_id":"bb3cf0db-bcb1-4d7f-81f0-e83f2a3e504c","resolution":{"observed_at":"2026-05-10T09:28:39.583244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-06T05:46:13.034506Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"cited_work":{"arxiv_id":"2509.04394","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04394","snapshot_observed_at":"2026-07-04T09:09:42.674557Z","title":"Transition models: Rethinking the generative learning objective","venue":null,"work_id":"51ea0365-c065-430c-93d3-7bba9adcd951","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2509.04394","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:30ecee16201542aec5e67050c0912980645b92a7265f4433aa0ba089917a0b4e","observation_id":"5780362e-d0f8-4a4c-9ee6-4fd357f51749","resolution":{"observed_at":"2026-05-10T09:28:39.594127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"ca23606f-d325-41aa-828a-50ac7f31bdad","year":2014},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:dc5455887dd198a9d98659ad79470d9fd40838aefba78159be3f1ba3ea89db51","observation_id":"13a56e94-eb59-4ce1-a164-21801ea2336d","resolution":{"observed_at":"2026-05-21T21:44:23.702133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Saco loss: Sample-wise affinity consistency for vision-language pre-training","venue":null,"work_id":"946e609b-ebe4-4c20-896d-260cdea4c8ab","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:d48e14740af97dc775116c748aba1063f9c41280e9fed5650cf7845cd53efcfe","observation_id":"e6ec3b3e-d11f-4e28-b7c5-891f75cd5523","resolution":{"observed_at":"2026-05-21T21:44:23.734872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":"2508.10104","doi":"10.1055/a-2487-1252","metadata_source":"pith","pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv3","venue":"cs.CV","work_id":"c8b07deb-8fe7-4e18-9620-f3569d3529ce","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:a6cf1662bd3e3309f643bded250932f186345d161751dccc4cfe994aa12ca7ee","observation_id":"a0232557-c79b-42fc-b4c8-b829612a6ede","resolution":{"observed_at":"2026-05-10T09:28:39.628421Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:d438b38a96f360dc62b39b6bdaae9f4af1ba536a7470fd2f20a2dbca5bd5f572","observation_id":"00aac801-13ad-4aec-ad65-958dad157038","resolution":{"observed_at":"2026-05-11T19:43:03.755490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:594ee0158b5f3b09fd7477542a7b3a688fff06f684ca59bbde24a64d03047da6","observation_id":"b390162c-fe32-420d-9480-e024d708fc4c","resolution":{"observed_at":"2026-05-10T09:28:39.609965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-07-06T21:45:57.248156Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"cited_work":{"arxiv_id":"2506.18095","doi":"10.48550/arxiv.2506.18095","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18095","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharegpt-4o-image: Aligning multimodal models with gpt-4o-level image generation","venue":"arXiv (Cornell University)","work_id":"089b1c33-975f-4482-9c6f-590a1181c2dd","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2506.18095","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:67238273b32788883964f3aad932e09d06a7b0e117d2b10db3d2627981737c66","observation_id":"09230663-92aa-4ccf-a58c-26893973f84b","resolution":{"observed_at":"2026-05-10T09:28:39.596721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"cited_work":{"arxiv_id":"2508.09987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09987","snapshot_observed_at":"2026-07-04T21:10:09.706550Z","title":"Echo-4o: Harnessing the power of gpt- 4o synthetic images for improved image generation","venue":null,"work_id":"03495384-0569-439e-a1d4-067ad2d077a1","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2508.09987","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:b82c96c56fb71d157146ea39fba10a8c3662f9fc930559658e029d64be0e75b8","observation_id":"3d432ef3-d8fb-47df-b223-a5d3b74ead1e","resolution":{"observed_at":"2026-05-10T09:28:39.636695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geneval: An object-focused framework for evaluating text-to- imagealignment.AdvancesinNeuralInformationProcessing Systems, 36:52132–52152","venue":null,"work_id":"a1b7804c-56a0-41cb-84d3-a8153c23847b","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:ff234f33933e6f66329a8715978bd6efc9c6805604b257281c414545cdfcc433","observation_id":"e65cb7a1-7749-40a6-9ab3-322a91769353","resolution":{"observed_at":"2026-05-21T21:44:23.686655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":"2306.09341","doi":"10.48550/arxiv.2306.09341","metadata_source":"pith","pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","venue":"cs.CV","work_id":"40702548-f094-4c67-a5db-a62f426f852e","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:42279bbcf283a93c19c2a50cd06a9d5a653c15b90d586c656ad3c65e6cd0a6a1","observation_id":"434df2f4-984e-46fd-8521-074b35dcca44","resolution":{"observed_at":"2026-05-11T08:30:48.951760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":"9c6d380e-2f47-430b-93bd-8ea938a727cf","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:6143bc59e9886f81cc5a4e5c4d0de01cc5e2fa8b14015edc85498d14bde84259","observation_id":"1eb8ff30-d822-4b2b-9755-93090830d1da","resolution":{"observed_at":"2026-05-21T21:44:23.677327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-05T11:15:36.366240Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":"2503.21758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-07-03T17:18:43.730046Z","title":"Lumina-image 2.0: A unified and efficient image generative framework","venue":null,"work_id":"4336fecf-1790-4c0a-ad5d-b2bde933d2b6","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:8ce84f472f1d0d4a036aae35e0840f85dd81c6c342e3df136fd0aa5a32f1f3d7","observation_id":"2a99ff9d-d136-4719-b385-a0e61630601d","resolution":{"observed_at":"2026-05-10T09:28:39.604186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-07-30T00:45:52.058972Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":"2505.22705","doi":"10.48550/arxiv.2505.22705","metadata_source":"pith","pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","venue":"cs.CV","work_id":"68d4c0f7-3dfd-438d-a823-6a93fd0a835d","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:b9bcc617294ef65859f6fa25b93e970a481db5725471eb74c95f267e93a134ad","observation_id":"8d27b40e-ee67-4959-bf6b-d2e7504946e1","resolution":{"observed_at":"2026-05-16T17:13:39.137651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2504.11346","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-07-04T07:29:38.429370Z","title":"Seedream 3.0 Technical Report","venue":"cs.CV","work_id":"013e56d0-7f47-4d0e-bbca-e9540fc0e0cc","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:708b7c8f1a3d92c1261d79cb759c9632ec9cab34e6ec9466989687a4f4b06d23","observation_id":"c0ffe458-cd3f-4b7b-8de6-d3db4160dcbe","resolution":{"observed_at":"2026-05-13T07:55:38.865721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-image-1","venue":null,"work_id":"9c70c7d1-f8e9-4e04-a211-77dbbd6cc5c4","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:278740e1beaf1ca7bd9e2f12ebf1ef4ed3e3a1f80aee7876399598d156c78730","observation_id":"98e17ba2-832a-433d-90f4-01c9902bf7cf","resolution":{"observed_at":"2026-05-21T21:44:23.674569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:08e1e8b9a279051a8bd8dc4e4d331461a790378400607730355686bac7fe9fc7","observation_id":"6d0ff3b8-ab01-43ce-a8d0-b03f0767452c","resolution":{"observed_at":"2026-05-14T22:49:23.311693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23661","last_updated":"2025-06-02T13:04:26Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:09:44Z","title":"OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2505.23661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23661","snapshot_observed_at":"2026-07-04T16:39:58.237442Z","title":"Openuni: A simple baseline for unified multimodal understanding and generation.arXiv preprint arXiv:2505.23661, 2025b","venue":null,"work_id":"74eca3ff-bbe5-492f-ab35-b10bd41e7b5a","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2505.23661","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:24f57f68ab5e0dfd0511324c428bcc16a33a9f0de2820303ad4ef48b29cfc8dd","observation_id":"c96aa05d-13c8-4ef0-88af-bcbcf5319edf","resolution":{"observed_at":"2026-05-10T09:28:39.580506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18898","last_updated":"2025-06-23T17:59:14Z","snapshot_observed_at":"2026-07-06T21:46:30.250293Z","submitted_at":"2025-06-23T17:59:14Z","title":"Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations","version":1},"cited_work":{"arxiv_id":"2506.18898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18898","snapshot_observed_at":"2026-07-04T10:09:44.750475Z","title":"Vision as a dialect: Unifying visual understanding and generation via text-aligned representations.arXiv preprint arXiv:2506.18898","venue":null,"work_id":"eeaabcd0-b12e-4324-88d6-d54239671f08","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2506.18898","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:eea8eb89d4cc115a3302ad0a069d78c0e063ee38809c4576cfe67ff72ad0e5a3","observation_id":"3f09bd54-8d22-4e48-9d5f-b6c7e89f3d47","resolution":{"observed_at":"2026-05-10T09:28:39.564612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08098","last_updated":"2025-08-14T17:38:47Z","snapshot_observed_at":"2026-08-06T16:04:08.524640Z","submitted_at":"2025-08-11T15:37:22Z","title":"TBAC-UniImage: Unified Understanding and Generation by Ladder-Side Diffusion Tuning","version":2},"cited_work":{"arxiv_id":"2508.08098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08098","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2508.08098, 2025","venue":null,"work_id":"c28a98ed-9d3a-4c48-a78f-440cd6432d2a","year":2025},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2508.08098","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:58126ffa3d4501297977008847b07f3ae2abc4b37322e290f9f592d24937607f","observation_id":"b0403c62-fbe1-4434-ad2a-a777f90716fa","resolution":{"observed_at":"2026-05-10T09:28:39.569797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13929","last_updated":"2024-03-02T09:09:32Z","snapshot_observed_at":"2026-07-31T02:56:13.600400Z","submitted_at":"2024-02-21T16:51:05Z","title":"SDXL-Lightning: Progressive Adversarial Diffusion Distillation","version":3},"cited_work":{"arxiv_id":"2402.13929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.13929","snapshot_observed_at":"2026-07-04T13:09:51.155182Z","title":"SDXL-Lightning: Progressive Adversarial Diffusion Distillation","venue":"cs.CV","work_id":"6f58ba2c-1c9d-47c8-bc8b-c6ae6636971d","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2402.13929","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:7acb7d3137a1d7f60a599e837a5d4004f4e1196bca57a60ee3031e14a1e28966","observation_id":"ef46f3d8-b6e0-4506-8923-8125b0f47ab7","resolution":{"observed_at":"2026-05-17T05:08:49.084339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyper-sd: Trajectory segmented consistency model for efficient image synthesis","venue":null,"work_id":"d85e66fb-911b-497d-b94c-135aeefd6222","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:1081a67f1c1cb2513693739bc4e8096b11ed3554924a15076465c28aedcfea01","observation_id":"f4495ff5-71c5-4c97-867b-8d6acdbdbb2e","resolution":{"observed_at":"2026-05-21T21:44:23.722845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved distribution matching distillation for fast image synthesis","venue":null,"work_id":"c12d2f68-1f6f-450e-a3bb-1849bb9e93dc","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:6800434b717fcfa87f5161baedb32525ac6c7b95e480060edbe077ee9f7ac2f0","observation_id":"f025159d-474c-47ea-94fd-77bce48e82ac","resolution":{"observed_at":"2026-05-21T21:44:23.684809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.Advances in Neural Information Processing Systems, 37:131278–131315","venue":null,"work_id":"622e6c9c-2163-41cc-a059-e88f149a5dcd","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:fc4ff7b329da701e64a817829411559830a3c006a5f15a469f2cec1cd7f006e9","observation_id":"c076c545-6e37-47bf-adaa-3921a74077b5","resolution":{"observed_at":"2026-05-21T21:44:23.749725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2402.17245","doi":"10.48550/arxiv.2402.17245","metadata_source":"pith","pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","venue":"cs.CV","work_id":"53c64fda-8566-434d-bc10-2fdfbc6a55ad","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:87c2d20fe04ede985d1b80100d76fb61d921d3429d17588ce2b38ff0e43ed53a","observation_id":"8b50e645-0356-47d0-8008-17bc23d6465a","resolution":{"observed_at":"2026-05-15T16:40:06.446550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hunyuan- dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":"784e73ec-8326-470a-a15b-a70ad37e1219","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:56cc08b3441319ba4656d7526e30b1022e17c00424b9d87cde43df75cecfc3b0","observation_id":"ce416278-a20e-4dcf-9845-66106728773b","resolution":{"observed_at":"2026-05-21T21:44:23.752388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DALL·E 3","venue":null,"work_id":"4af99a36-dbf4-48bf-9c5d-d78acf5b2356","year":2023},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:d5ad81e4237b108da4cedec56a5753b8dd55d8132c3dd2082a4b133df8112afb","observation_id":"cbec2dbf-7924-4b89-8e6f-4e0e08778e87","resolution":{"observed_at":"2026-05-21T21:44:23.701263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast high- resolution image synthesis with latent adversarial diffusion distillation","venue":null,"work_id":"e5184e50-6b21-467e-ad54-761b89dc62c8","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:234550f011c2dce3dfb5aa8807964cbae5846362a43a68ecfdb2612e7eeb943b","observation_id":"341d00f8-d39e-41db-bde1-86461a66d5fa","resolution":{"observed_at":"2026-05-21T21:44:23.747289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text Conditions 𝑡−𝑟𝑢(𝑧,𝑟,𝑡)𝑢(𝑧,𝑟,𝑡)𝑣 𝑡−𝑟𝑢(𝑧,𝑟,𝑡)𝑣𝑢(𝑧,𝑟,𝑡) Figure 7","venue":null,"work_id":"1cca16a0-b48a-4351-bbc1-72bdb4e88dec","year":null},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:8296848e0ac2d71138556e79aba1ce66259621e5ac22a5adebe5a808191f2fd4","observation_id":"9620d42e-0206-4e69-8043-fa0282e5285b","resolution":{"observed_at":"2026-05-21T21:44:23.722527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We chose OpenUni because it shares the SANA- 1.5 diffusion backbone, but uses a InternVL3–based text encoder","venue":null,"work_id":"def0d861-7b36-4266-9a02-8042a80f3981","year":null},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:55ea19ceedf5dc73eef8c3903471801a4650bd075d556886ff19d9f34de9f782","observation_id":"0d375dbb-8fc1-4b4a-bc37-ddcace2b52e7","resolution":{"observed_at":"2026-05-21T21:44:23.712717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When generating images from the same prompt and timing diffusion sampling only, BLIP3o-NEXT on H200 takes 1.24 s with 30 steps, while ours takes 0.22/0.12/0.08 s (4/2/1 steps)","venue":null,"work_id":"3447f2fb-9a74-4f39-b05c-f744c46a243d","year":null},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:e76e45578bf41e88312e73011e4863234f1a4e73337c18e6cf92d4a151790c84","observation_id":"294b7956-d89b-4bac-a097-25d02377dd9c","resolution":{"observed_at":"2026-05-21T21:44:23.739780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Which result best matches the prompt?","venue":null,"work_id":"bc314601-db3c-441f-b86a-57d868fca012","year":null},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:5477d83cabd85093d70714ce7e0aed5dc9ce9be095a936c4b22e3acfd82535a5","observation_id":"42b38891-4185-4ebb-ae84-1bf28f468edc","resolution":{"observed_at":"2026-05-21T21:44:23.742049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DPG-Bench evaluation.Generatinghigh-fidelityimages from complex and detail-rich textual prompts in a limited number of denoising iterations is a highly challenging task","venue":null,"work_id":"d6ec646e-6795-4cbf-98b8-5c7a098e809a","year":null},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:071fcd03be98a212261650c6907ece023273ab822f24d0b6a46c99fd25f05da8","observation_id":"f49fa23d-6c3e-4654-bef9-6cd23e3c56a7","resolution":{"observed_at":"2026-05-21T21:44:23.744879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T17:07:08.698328Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":1,"verified_exact":47,"verified_fuzzy":32},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 1 inbound Pith citation observation for arXiv:2604.18168."}