{"as_of":"2026-08-07T01:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:773ff3b581e514ab492354d2e8371e02411aebf754eb7db73f30a52772d74a22","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:28:03.229878Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2405.14430","last_updated":"2025-12-03T10:59:23Z","snapshot_observed_at":"2026-08-04T10:57:26.733885Z","submitted_at":"2024-05-23T11:00:07Z","title":"PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T01:17:11.261301Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2405.14430"},"observation_digest":"sha256:f757b5da68de2b454dceff4fd7e3798b9aad55fc01d111d6085e163ae91e2a42","observation_id":"c1bf6e93-ff1f-4a8c-ac56-7194297bd8e7","resolution":{"observed_at":"2026-05-24T01:18:42.436471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:1287c496ea1be7c6f99312d9e1f41ede4239acc129dcb2b3f790cdb36db190c0","observation_id":"fd326b99-339d-41ef-9657-0f1857e97335","resolution":{"observed_at":"2026-05-11T10:56:07.071520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-12T15:09:36.982610Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2410.06940"},"observation_digest":"sha256:c9c0319e16ea4b832a152b3b86ba3c5111ef834426229de19f3bd283df9be1f7","observation_id":"8728af1f-2f07-4c39-bdda-51192b67a42b","resolution":{"observed_at":"2026-05-12T15:09:37.106792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:50.009149Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2410.10629"},"observation_digest":"sha256:ebb72b44ac1ae1ed39efb89056d624e971558374ed375c2562c0804c8317dccd","observation_id":"1dd59143-9730-4ee8-84a2-cc731d0854b8","resolution":{"observed_at":"2026-05-15T00:56:50.061833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:a3e49e518b8ce75dc6cd242db5845d7ca2cf984f294f18f26e06e2817f85ec52","observation_id":"5efd29ea-e9f0-4d9b-bbb7-c04c01814d08","resolution":{"observed_at":"2026-05-23T08:42:45.242218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T11:45:17.473970Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2501.09732"},"observation_digest":"sha256:23497f3d69e1fb15bd408de62b40cc3357c67970e036d4f65bcc37629d3c015d","observation_id":"5f7af95b-3c7a-4a80-8bbe-962ac750425f","resolution":{"observed_at":"2026-05-20T11:45:17.556019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:97be5859d2f009032138a6b6ef2a01ceb626f52040b69894368b6c92bf025b34","observation_id":"3a998c9d-486f-477f-9ba3-fe809f89580b","resolution":{"observed_at":"2026-05-11T08:14:53.079659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:d492130436d49ac70bd43a8d2a3b03ba8b1d19b9bc6f36b16e5cd2ab480b5123","observation_id":"b4466de2-93a3-412d-bd41-62fb0e516af2","resolution":{"observed_at":"2026-05-17T07:24:04.781066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T23:28:03.229878Z","title":"PixArt-Sigma : Weak-to-strong training of diffusion transformer for 4K text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-06T23:20:59.622434Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:03.229878Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:53cffb5c107d48b96127eb55e2d9492a56c3b40fca544585449366f355632fcf","observation_id":"85473dbf-336f-4058-a13a-706dc983d539","resolution":{"observed_at":"2026-08-06T23:28:03.229878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T20:26:37.842944Z","title":"Pixart-\\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02713","last_updated":"2025-07-04T14:45:23Z","snapshot_observed_at":"2026-08-06T20:20:14.510003Z","submitted_at":"2025-07-03T15:27:28Z","title":"UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:37.842944Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.02713"},"observation_digest":"sha256:75ef87e874095c6faadf974fee2d48895d37a8851d663dcfe607a63a8639cab3","observation_id":"1c6e5d5b-eb49-4408-9bf2-6a90c31c6534","resolution":{"observed_at":"2026-08-06T20:26:37.842944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T19:50:20.126209Z","title":"Chung, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05300","last_updated":"2025-07-07T01:18:40Z","snapshot_observed_at":"2026-08-06T19:42:02.441384Z","submitted_at":"2025-07-07T01:18:40Z","title":"Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.126209Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.05300"},"observation_digest":"sha256:fe2df56c7f3c764c067e3dd333f3358d6decc3d2d646384f3ea5ed337fafe134","observation_id":"7a5cdab3-5c44-4c2d-857f-bdbbecbb83dc","resolution":{"observed_at":"2026-08-06T19:50:20.126209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T17:54:45.724628Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11554","last_updated":"2025-08-03T03:07:39Z","snapshot_observed_at":"2026-08-06T17:42:45.335185Z","submitted_at":"2025-07-14T02:59:28Z","title":"Inversion-DPO: Precise and Efficient Post-Training for Diffusion Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:54:45.724628Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.11554"},"observation_digest":"sha256:76b00c285820173f8c4d4eac802b83f8e3e0bf5b7afd2b957a3195ea96e7f4cd","observation_id":"674c6596-15e6-40f1-8fcf-43b62960a7f5","resolution":{"observed_at":"2026-08-06T17:54:45.724628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T16:42:11.259659Z","title":"Pixart-\\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation.arXiv preprint arXiv:2403.04692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12933","last_updated":"2025-07-17T09:15:29Z","snapshot_observed_at":"2026-08-06T16:32:03.141705Z","submitted_at":"2025-07-17T09:15:29Z","title":"DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:11.259659Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.12933"},"observation_digest":"sha256:2c86a0ce3e291492a272614d62a19db6942f0ea2c5780a7d9bce09092009d7d0","observation_id":"ae74d6d3-7395-4556-ac5d-55236b283dec","resolution":{"observed_at":"2026-08-06T16:42:11.259659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-06T12:37:05.366376Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21690","last_updated":"2025-07-29T11:13:03Z","snapshot_observed_at":"2026-08-06T16:48:37.571408Z","submitted_at":"2025-07-29T11:13:03Z","title":"APT: Improving Diffusion Models for High Resolution Image Generation with Adaptive Path Tracing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:37:05.366376Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2507.21690"},"observation_digest":"sha256:9454c7713ce80cd8f03cd208a37deafd63e4d9d6949cdbdb83864f9e5607f787","observation_id":"faab2c4a-7a9a-433d-91d0-b5731022b0c1","resolution":{"observed_at":"2026-08-06T12:37:05.366376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-03T10:56:11.852224Z","title":"Pixart-σ: Weak-to-strong training of dif- fusion transformer for 4k text-to-image generation.arXiv preprint arXiv:2403.04692, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08303","last_updated":"2026-07-06T07:20:34Z","snapshot_observed_at":"2026-08-05T14:11:41.034201Z","submitted_at":"2026-01-13T07:46:46Z","title":"SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T10:56:11.852224Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2601.08303"},"observation_digest":"sha256:e068f98dc4f2cb62a35775523f81b1544902f8408599a8f59e2c698e14aaa3fa","observation_id":"f5421e55-af37-428a-8e1a-7ea89fc9132b","resolution":{"observed_at":"2026-08-03T10:56:11.852224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2603.07119","last_updated":"2026-05-04T15:27:59Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T09:11:10Z","title":"TIQA: Human-Aligned Perceptual Text Quality Assessment in Generated Images","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T14:32:59.720416Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2603.07119"},"observation_digest":"sha256:2024a6b16d998c8690f9fe23669b9d78d4a9eee46c6c27c896012435b6983f0a","observation_id":"e9eb2faf-cc5d-45fc-91b7-2bba5ead58f8","resolution":{"observed_at":"2026-05-15T14:35:55.881028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2603.21002","last_updated":"2026-05-18T13:08:31Z","snapshot_observed_at":"2026-07-06T22:50:01.539214Z","submitted_at":"2025-11-25T18:54:45Z","title":"SURF: Signature-Retained Fast Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T18:11:39.642701Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2603.21002"},"observation_digest":"sha256:7317df19d84c5947cecb43b3042a6219564deda6e81e213794a16211e973e3e8","observation_id":"68bd0e14-cad3-4529-935b-429b68459ca0","resolution":{"observed_at":"2026-05-21T18:14:17.450007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2604.07427","last_updated":"2026-04-08T17:35:36Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T17:35:36Z","title":"Personalizing Text-to-Image Generation to Individual Taste","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:07:31.236729Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2604.07427"},"observation_digest":"sha256:be92acc036b27fb0cf5f26973f1b4cd1e86b639b0a8ce6eb6bc5ec548ce561a1","observation_id":"47178d1a-d3e3-41b4-a887-bac27138d552","resolution":{"observed_at":"2026-05-11T05:26:02.359239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2604.07879","last_updated":"2026-04-09T06:49:43Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T06:49:43Z","title":"FlowGuard: Towards Lightweight In-Generation Safety Detection for Diffusion Models via Linear Latent Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:03:35.420451Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2604.07879"},"observation_digest":"sha256:24ca063751af381ded9c80a1d196e19b5be0c4167332caa86eda9d6ff28e8220","observation_id":"384fa532-d39a-4972-b90f-006eee372352","resolution":{"observed_at":"2026-05-11T07:41:00.462920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2604.11934","last_updated":"2026-04-13T18:22:50Z","snapshot_observed_at":"2026-07-06T23:00:12.978356Z","submitted_at":"2026-04-13T18:22:50Z","title":"BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:33:15.025940Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2604.11934"},"observation_digest":"sha256:7a3bdab78211a7680e1582b7ca4fc31097964c538edcd5f1962e8bba1ea7ee7d","observation_id":"3da6f15e-deb5-4bd2-9cde-70ed7e28b979","resolution":{"observed_at":"2026-05-11T10:21:00.664118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2604.26348","last_updated":"2026-04-29T07:00:00Z","snapshot_observed_at":"2026-08-02T10:12:35.563336Z","submitted_at":"2026-04-29T07:00:00Z","title":"ACPO: Anchor-Constrained Perceptual Optimization for Diffusion Models with No-Reference Quality Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T14:05:05.560294Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2604.26348"},"observation_digest":"sha256:e55190ff1733baedac24dd695f95a3c1a37c12c98a0afb3bf5bd8a2ef67fc561","observation_id":"d4d838cf-c640-47a3-a5dd-b30f6936948c","resolution":{"observed_at":"2026-05-09T03:04:47.616327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.04609","last_updated":"2026-05-06T07:56:16Z","snapshot_observed_at":"2026-08-03T01:43:19.583154Z","submitted_at":"2026-05-06T07:56:16Z","title":"Advancing Aesthetic Image Generation via Composition Transfer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T18:23:12.827094Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.04609"},"observation_digest":"sha256:76f872c7ed3b17ae2cd1409a291b1d574831e42dc218b7de4f8452142ffbce84","observation_id":"c2f42710-215e-44fc-85df-39fb931310a2","resolution":{"observed_at":"2026-05-09T06:30:44.333026Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.15684","last_updated":"2026-05-15T07:13:27Z","snapshot_observed_at":"2026-08-02T22:46:51.504070Z","submitted_at":"2026-05-15T07:13:27Z","title":"ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-20T20:00:27.987481Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.15684"},"observation_digest":"sha256:bee47bfde7ea59a9d6e51042947a55ea5fc05a0d0afec1f5da1c5706ecb93ffa","observation_id":"baf9c3aa-7f7d-4542-b5ac-c3f9f62bc7a7","resolution":{"observed_at":"2026-05-20T20:03:43.842993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.21272","last_updated":"2026-05-20T15:04:56Z","snapshot_observed_at":"2026-08-02T13:53:05.548583Z","submitted_at":"2026-05-20T15:04:56Z","title":"MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T05:21:18.369534Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.21272"},"observation_digest":"sha256:98560450cc5e7c94b2303095076be6dbb311d1de792eda0cf7a7a7b7f860f9a6","observation_id":"5dfc211d-86f5-47fd-abdc-2723cb4a028d","resolution":{"observed_at":"2026-05-21T05:23:58.469175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.22015","last_updated":"2026-05-21T05:23:21Z","snapshot_observed_at":"2026-08-02T06:54:38.654414Z","submitted_at":"2026-05-21T05:23:21Z","title":"ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:21:16.861996Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.22015"},"observation_digest":"sha256:d1fef34cc464df668862770e5783a0fc82ea7ffde31d76dc22ee7b73dd5f8cd3","observation_id":"10e89b33-dd90-4ceb-b175-44480b64073b","resolution":{"observed_at":"2026-05-22T07:24:43.433506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2605.25798","last_updated":"2026-05-25T12:48:17Z","snapshot_observed_at":"2026-08-03T18:16:15.377656Z","submitted_at":"2026-05-25T12:48:17Z","title":"DiSC: Resolution-Scalable Acceleration of Diffusion Models by Exploiting Sparsity and Cached Token Reuse with Hash-based Distribution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T19:33:05.248105Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2605.25798"},"observation_digest":"sha256:b89ed6041bea3d4540d80e2f652aae9fe0cac5bf63c4dcb2fe2bf01ff6cbaa23","observation_id":"8d5bd4ae-0825-4893-890a-711a59f87a9b","resolution":{"observed_at":"2026-06-29T19:33:53.900908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2606.02090","last_updated":"2026-06-02T15:33:35Z","snapshot_observed_at":"2026-08-06T12:48:41.308922Z","submitted_at":"2026-06-01T11:18:11Z","title":"FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:40.039365Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2606.02090"},"observation_digest":"sha256:8ad3c85441a188ebe3a0897ebce968443cc159bfa631b74e8c74c23ff9df2828","observation_id":"0b450218-c9b7-4c4c-bd1f-ffc49161699b","resolution":{"observed_at":"2026-07-01T22:26:17.436674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2606.18554","last_updated":"2026-06-17T00:08:35Z","snapshot_observed_at":"2026-08-06T14:23:49.960091Z","submitted_at":"2026-06-17T00:08:35Z","title":"Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T21:32:27.296146Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2606.18554"},"observation_digest":"sha256:f0b9199e54606fffa680d8353a07b6c41023e8fff12ae441c843d1fc5e8f1315","observation_id":"d9c33576-307d-4a8c-8c2e-59afbd9c511a","resolution":{"observed_at":"2026-07-03T23:59:07.406676Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2403.04692","doi":"10.48550/arxiv.2403.04692","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"5dc0cfb7-2014-4631-be70-f632bf6ca9ec","year":2024},"citing_paper":{"arxiv_id":"2606.32020","last_updated":"2026-06-30T17:51:26Z","snapshot_observed_at":"2026-08-03T10:16:58.559510Z","submitted_at":"2026-06-30T17:51:26Z","title":"Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:48.896721Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2606.32020"},"observation_digest":"sha256:5e91b174eef03c4dc3f060f61b0df16af806799495522fa969b258911cbb382c","observation_id":"361c2a0a-68aa-4f4f-84c3-eef4ceb1430c","resolution":{"observed_at":"2026-07-01T10:25:41.126840Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-07-14T16:28:17.428855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09753","last_updated":"2026-07-04T13:24:14Z","snapshot_observed_at":"2026-07-16T23:18:00.569503Z","submitted_at":"2026-07-04T13:24:14Z","title":"Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T16:28:17.428855Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2607.09753"},"observation_digest":"sha256:6c9bf5fc35bb86c8fd05faf26f461580c4c670efaa54baacdd64d0626f6b965e","observation_id":"950cf92b-89e3-43d0-9d20-41e1c08ae5cd","resolution":{"observed_at":"2026-07-14T16:28:17.428855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-01T17:30:31.211432Z","title":"arXiv preprint arXiv:2403.04692 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17634","last_updated":"2026-07-20T07:40:56Z","snapshot_observed_at":"2026-08-01T17:30:12.616355Z","submitted_at":"2026-07-20T07:40:56Z","title":"MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T17:30:31.211432Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2607.17634"},"observation_digest":"sha256:14496798f1c7b43caad01921d0dc24abeb072aa5a01ea13b3abb1e3d6310b50e","observation_id":"9a6d307a-9be5-43f5-9ede-8532edf70965","resolution":{"observed_at":"2026-08-01T17:30:31.211432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-01T08:52:47.034867Z","title":"2403.04692 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22745","last_updated":"2026-07-23T06:56:49Z","snapshot_observed_at":"2026-08-03T08:25:31.170674Z","submitted_at":"2026-07-23T06:56:49Z","title":"AI-generated Images Challenge Visual Trust in High-risk Scenarios","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T08:52:47.034867Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2607.22745"},"observation_digest":"sha256:7af3c542bda56c7575d63e3f29c21d21fd2107c4b873f3b2cf5c3b9b3e0b28e3","observation_id":"4b1322ca-60f7-43af-95db-debf5566edb5","resolution":{"observed_at":"2026-08-01T08:52:47.034867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.04692/citation-record","integrity":"/paper/2403.04692/integrity","json":"/paper/2403.04692/citation-record.json","paper":"/paper/2403.04692"},"outbound":[],"paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:41:10.677334Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2403.04692."}