{"as_of":"2026-08-06T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19894b75c21946d3564f921eac979c9d06b07e5edace011d047e633d90fb9f62","coverage":[{"denominator":154,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T20:38:52.749119Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":140,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:43:37.986629Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:43.956642Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2310.19512"},"observation_digest":"sha256:770ff501ab42c06fe1e15030e79ae46d6074f9edc4fbcb4d31635c1c5e819b21","observation_id":"301d929a-8d94-4a41-9b87-94711272d13a","resolution":{"observed_at":"2026-05-14T21:40:44.020027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T16:40:06.277285Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2402.17245"},"observation_digest":"sha256:b5f7f35b7af108a14951ad53dd39d410ceae99e3ad05625bc12f7d38b0956e1d","observation_id":"63c8eb6e-2708-4822-8ec2-75b480504819","resolution":{"observed_at":"2026-05-15T16:40:06.308504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T19:43:03.310237Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2403.05135"},"observation_digest":"sha256:1124b68ae7bf79c8486e3e69d69b5fb7ddedf97d1c9ad6cb80d355e39961dd5c","observation_id":"dd6b88b6-4b67-4535-8634-8e5afe1d8b78","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:2c54d0d81233adbaf5d5b27343e70a6e9f301a07bee67e7f8571e3b5fd6f3781","observation_id":"a27eb339-2fbc-4d77-85af-ce5188773c41","resolution":{"observed_at":"2026-05-15T22:48:36.064695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2405.14430","last_updated":"2025-12-03T10:59:23Z","snapshot_observed_at":"2026-08-04T10:57:26.733885Z","submitted_at":"2024-05-23T11:00:07Z","title":"PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T01:17:11.261301Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2405.14430"},"observation_digest":"sha256:effcc673c5f47e950788c141af54d6df36c299586e5d84500a23652bd7b75480","observation_id":"b8f7941d-b0b0-4335-b376-f9e8f7009459","resolution":{"observed_at":"2026-05-24T01:18:42.441870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:22.224924Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2408.06072"},"observation_digest":"sha256:b828799df29e5de2058d458ee2c5addc9c826af68e0f86c636acf6094cfe6e68","observation_id":"bdb47c83-f29f-4e91-b7ee-a204d9af36f3","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:40de30a52e7044af054c19476c4a09b40f0aebbda7e411274b7d0fbc323dcddb","observation_id":"c018ce20-9e91-47b9-beff-5ff610a1fcf8","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:844f7c951fd86d1f782cc9d2c87993f7fc688372ca2db0fb3b1627619364f2e9","observation_id":"535b825a-dfe5-4fc2-8098-48bf1d333881","resolution":{"observed_at":"2026-05-15T22:09:16.407748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T12:01:51.366667Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.20404"},"observation_digest":"sha256:eaea8c186870c5949452e0265e33361d06771c1228e042fa45ca754e0165a8be","observation_id":"24bfcb7c-ee30-4b07-9eaf-87b8f6a84d19","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T10:36:12.058970Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2501.00103"},"observation_digest":"sha256:4d04662542bb7e58a6c5256044d22b64f1ef28880256e8199906b22a7adda99a","observation_id":"40e08ea3-7199-4117-99cf-28126e6bc934","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:8c77642a9fc4a59c4c15e09b8dc310877b1ac872cb78b575d03c6179871273f4","observation_id":"2f4943a7-d837-4677-8307-227ef95da2c5","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:2045b50ba772a073f1ad305cd1e487c28935cde0d6c3922dff375bc04ed9894d","observation_id":"a122dd90-5703-4f45-8bdd-e3911295351b","resolution":{"observed_at":"2026-05-19T08:02:23.592279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2503.02537","last_updated":"2026-04-09T09:03:54Z","snapshot_observed_at":"2026-08-02T05:25:26.152686Z","submitted_at":"2025-03-04T12:03:26Z","title":"RectifiedHR: Enable Efficient High-Resolution Synthesis via Energy Rectification","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T01:33:49.962427Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2503.02537"},"observation_digest":"sha256:40eb78df850ebdf641ed93b3defbe65677759d30068ce65b0fcb26955793257c","observation_id":"a8f70ab6-1b48-4689-b1c6-ec49df8604e3","resolution":{"observed_at":"2026-05-23T01:35:19.430489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T00:53:53.855965Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2503.07598"},"observation_digest":"sha256:a5ed7f33feeecaca37acff988d4e795ffc925c46fed2eb8c2f1c29b87c509a67","observation_id":"1bb5c2c2-83f6-4fec-a2f1-dd6896074c89","resolution":{"observed_at":"2026-05-16T00:53:54.120853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:75f22563688995e0db8cdfe2eb371316fd9f212efc2f78c27bab252a5807eb82","observation_id":"cbc04683-96d0-4b69-9266-50248a0b9303","resolution":{"observed_at":"2026-05-22T23:07:14.553838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2503.22171","last_updated":"2026-04-17T04:53:40Z","snapshot_observed_at":"2026-08-06T10:42:36.270805Z","submitted_at":"2025-03-28T06:18:15Z","title":"An Empirical Study of Validating Synthetic Data for Text-Based Person Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T22:59:36.542774Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2503.22171"},"observation_digest":"sha256:1880afda2164b033f4819bcff4bb3d64bfe2ff1f125c7be3e3f1f13317de4e15","observation_id":"a430feab-c2bb-4fd4-b803-118876e5efb5","resolution":{"observed_at":"2026-05-22T23:02:13.638804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:3ebe1aa9eaa728ad0819476c48d8e9f6e528b1ab02291cb5bb72150cc978f4d2","observation_id":"f67680ab-02fe-4daf-ba02-c5b3232d1a13","resolution":{"observed_at":"2026-05-22T17:51:54.376553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:175220f43b3572a5b8f83a876e798abad9ccb67867f0926a5fb4a5ee992cfd8f","observation_id":"2b4efeb3-3710-472b-bcca-355e780d0970","resolution":{"observed_at":"2026-05-22T17:51:54.617932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T16:07:53.054355Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2504.20690"},"observation_digest":"sha256:dcb6548990897b5230e766fa314a1f09f5e8001b030cf50b221db2e5f07a7598","observation_id":"aeafd9b0-343a-45c5-a576-64e684a847ad","resolution":{"observed_at":"2026-05-16T16:07:53.182484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:a533cf4db33ac01f9054b022a87ba9e775cee5d2bcb7fa4eb764639067ebc524","observation_id":"faf2fd28-95ed-40f6-8a79-e015f12bfb58","resolution":{"observed_at":"2026-05-17T07:24:04.775904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T20:31:15.700943Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2505.13211"},"observation_digest":"sha256:fbf3e249d2094f930d3f9dc4a361735d50e7b618c934b8624e31752d1d7250dc","observation_id":"6e35f018-2761-4a75-b4e9-2cfc59cd917e","resolution":{"observed_at":"2026-05-13T20:31:15.757258Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T17:34:26.951644Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.03147"},"observation_digest":"sha256:fa57f9d2e7d7a892c1f56a7148e42ec9dc26cb8fcae633432392d13d20a823d1","observation_id":"5d8f2739-d40a-4939-8338-d5fa511b86d7","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:7a17702de218b5b6012f53401b3d48e8372216bcea658984815b18a130764be4","observation_id":"363f5538-7668-43b2-a53a-bfa597dc22ba","resolution":{"observed_at":"2026-05-19T07:52:10.913871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2506.19840","last_updated":"2026-04-16T20:25:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-24T17:58:04Z","title":"GenHSI: Controllable Generation of Human-Scene Interaction Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T07:25:41.219753Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.19840"},"observation_digest":"sha256:ae0bba3b8c587b5622d37a1d1f2a88387ffcd2d89369d7ae62ac863f0941306d","observation_id":"d34ff940-edb5-4b82-ba0b-7606b5f9523b","resolution":{"observed_at":"2026-05-19T07:27:09.031158Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T20:43:37.986629Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01953","last_updated":"2025-07-02T17:58:20Z","snapshot_observed_at":"2026-08-06T20:37:16.244300Z","submitted_at":"2025-07-02T17:58:20Z","title":"FreeMorph: Tuning-Free Generalized Image Morphing with Diffusion Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:37.986629Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.01953"},"observation_digest":"sha256:e9b813acb485f181e1159b31119cdc797dea50c1f048de6bbf1dcb8c27e3c9d1","observation_id":"9640f4f6-e3d5-413a-85da-69c413809cde","resolution":{"observed_at":"2026-08-06T20:43:37.986629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T19:45:52.383239Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-06T19:39:31.849674Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.383239Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:0d2d9ed678f81355d3a0cfd8ab7a02b08d579aaeed349932cde6e4faa031692a","observation_id":"1c97579e-5679-49a4-bffb-f94465bededd","resolution":{"observed_at":"2026-08-06T19:45:52.383239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T17:47:51.123031Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-06T17:37:17.850345Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:51.123031Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:c2caaf112ef16879d5509572fa917c04718027b328dda7e4be0b5150ca069c6d","observation_id":"a0393b45-96bd-4029-b95a-7c94ffa108bf","resolution":{"observed_at":"2026-08-06T17:47:51.123031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T15:42:23.657607Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15249","last_updated":"2025-07-21T05:15:45Z","snapshot_observed_at":"2026-08-06T15:34:11.082185Z","submitted_at":"2025-07-21T05:15:45Z","title":"FreeCus: Free Lunch Subject-driven Customization in Diffusion Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:23.657607Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.15249"},"observation_digest":"sha256:0a134e9199965bc8aaf08280ffad5d043530e37f483140f59c13fd5b86474c4a","observation_id":"8d5773ea-59f0-474d-91c5-ac3660498073","resolution":{"observed_at":"2026-08-06T15:42:23.657607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2507.15753","last_updated":"2026-04-24T13:01:43Z","snapshot_observed_at":"2026-08-05T13:24:42.047640Z","submitted_at":"2025-07-21T16:09:26Z","title":"Algebraic Language Models for Inverse Design of Metamaterials via Diffusion Transformers","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T04:18:32.034089Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.15753"},"observation_digest":"sha256:be31f3cf2aa3463cfa18183a4c785ba66038111b695c1ee15d8921af72687e7b","observation_id":"c92992ba-87d7-49b9-ab93-f3d0de01fea2","resolution":{"observed_at":"2026-05-19T04:22:02.809960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T14:45:53.196801Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17853","last_updated":"2026-06-21T15:14:16Z","snapshot_observed_at":"2026-08-06T14:36:33.723541Z","submitted_at":"2025-07-23T18:20:46Z","title":"Detail++: Training-Free Detail Enhancer for T2I Diffusion Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:53.196801Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.17853"},"observation_digest":"sha256:bd83943dfae63ebc1da0cfe87f81683c69b4012475e1471b70a7cf1d62ef71bd","observation_id":"27ef2ffd-371a-4fa9-b3da-fa1e901ab624","resolution":{"observed_at":"2026-08-06T14:45:53.196801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T05:59:15.463874Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01008","last_updated":"2025-08-01T18:19:51Z","snapshot_observed_at":"2026-08-06T05:59:14.014286Z","submitted_at":"2025-08-01T18:19:51Z","title":"ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:59:15.463874Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.01008"},"observation_digest":"sha256:9ee1df6dda9beea6d60b04f26df910451c3d9464fe5f1c38e8cf4864d929a957","observation_id":"7a802e98-d67a-45ec-9e3b-86fedc30fa33","resolution":{"observed_at":"2026-08-06T05:59:15.463874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T04:44:56.402484Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03032","last_updated":"2025-08-05T03:18:04Z","snapshot_observed_at":"2026-08-06T04:44:54.183188Z","submitted_at":"2025-08-05T03:18:04Z","title":"A Summer Meridional Subsurface Temperature Dipole Mode in the South China Sea","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:44:56.402484Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.03032"},"observation_digest":"sha256:9d2a62dff63b63e8e8f9920aa22e8bbbeaef0f996bc403bdd20025ea5c25c46b","observation_id":"15599bd4-42ed-40da-8d8b-2703df7cd6c1","resolution":{"observed_at":"2026-08-06T04:44:56.402484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T04:23:04.802017Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03789","last_updated":"2025-08-22T08:53:37Z","snapshot_observed_at":"2026-08-06T04:22:44.373906Z","submitted_at":"2025-08-05T17:17:13Z","title":"HPSv3: Towards Wide-Spectrum Human Preference Score","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:23:04.802017Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.03789"},"observation_digest":"sha256:6f23e3239e9d5feba87a6f7a2c0dc8c45c65aafd22f2ca169051a8f882e22f6d","observation_id":"0a2fddd8-8fd2-4960-8c26-1da23dacd150","resolution":{"observed_at":"2026-08-06T04:23:04.802017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T22:02:50.021807Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07647","last_updated":"2025-08-11T05:57:59Z","snapshot_observed_at":"2026-08-05T22:02:45.629357Z","submitted_at":"2025-08-11T05:57:59Z","title":"LaRender: Training-Free Occlusion Control in Image Generation via Latent Rendering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:02:50.021807Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.07647"},"observation_digest":"sha256:6a79a852b507eba9fdee4c73c39f38fd0d865ebaee02fb1a5fdcb0627e2b4b76","observation_id":"e6e7afeb-8d4a-4b90-8e7b-267e811a8a38","resolution":{"observed_at":"2026-08-05T22:02:50.021807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T20:49:49.072336Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09858","last_updated":"2025-08-13T14:50:19Z","snapshot_observed_at":"2026-08-05T20:49:47.618789Z","submitted_at":"2025-08-13T14:50:19Z","title":"HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:49.072336Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.09858"},"observation_digest":"sha256:5758628fd2840aa21ef117361054bac8363b9f3b482bf55eac2aa4015bc45a06","observation_id":"1902dab6-6dbf-4b9d-9466-929d0c831488","resolution":{"observed_at":"2026-08-05T20:49:49.072336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T20:44:10.965681Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:10.965681Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:e815061d20abf30e37cce2b8e3f95d80555a0fcb54e1c19dd1cb332a594e1a9c","observation_id":"0a9f6bb9-d2f5-455e-8ebc-1323b3f2d242","resolution":{"observed_at":"2026-08-05T20:44:10.965681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T20:30:36.664588Z","title":"T.; Luo, P.; Lu, H.; and Li, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10424","last_updated":"2025-08-14T07:54:44Z","snapshot_observed_at":"2026-08-05T20:30:27.344231Z","submitted_at":"2025-08-14T07:54:44Z","title":"NanoControl: A Lightweight Framework for Precise and Efficient Control in Diffusion Transformer","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:30:36.664588Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.10424"},"observation_digest":"sha256:405f7f40d154309c34f70f1008f764ec365f1a75f4b2d8c0ff1be89ca2fbaf0c","observation_id":"2704d7b8-86dc-4299-a3b2-e839d8fde45f","resolution":{"observed_at":"2026-08-05T20:30:36.664588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T18:37:17.980610Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14441","last_updated":"2025-08-20T05:53:05Z","snapshot_observed_at":"2026-08-05T18:37:15.366913Z","submitted_at":"2025-08-20T05:53:05Z","title":"FBI: Learning Dexterous In-hand Manipulation with Dynamic Visuotactile Shortcut Policy","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T18:37:17.980610Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.14441"},"observation_digest":"sha256:775759cdea1a45f79a858bedf38a62daa81875d1071547a36d2dc5e7b816d3e0","observation_id":"90dafdd2-98dc-4e6e-9255-8fdc904214f2","resolution":{"observed_at":"2026-08-05T18:37:17.980610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T17:31:13.009858Z","title":"arXiv preprint arXiv:2310.00426","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16211","last_updated":"2025-08-22T08:34:03Z","snapshot_observed_at":"2026-08-05T17:31:12.432392Z","submitted_at":"2025-08-22T08:34:03Z","title":"Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:31:13.009858Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2508.16211"},"observation_digest":"sha256:cc4903a3e01e5543b2bdf540958b3a71f6cdcca227cf788f8d24c51b970b1cfc","observation_id":"a114b720-4bdf-4469-b1ab-c5eb94a14c41","resolution":{"observed_at":"2026-08-05T17:31:13.009858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T10:38:06.418266Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03903","last_updated":"2025-09-04T05:53:58Z","snapshot_observed_at":"2026-08-05T10:38:03.743918Z","submitted_at":"2025-09-04T05:53:58Z","title":"A Generative Foundation Model for Chest Radiography","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:06.418266Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.03903"},"observation_digest":"sha256:cdda419160105b20d77222f82cb799c9f13b919957218288353c4d407065db78","observation_id":"528ed183-a9cd-4cb7-b301-46510f26a8ed","resolution":{"observed_at":"2026-08-05T10:38:06.418266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T10:19:54.309215Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-06T05:46:13.034506Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:19:54.309215Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.04394"},"observation_digest":"sha256:c8b276b27b00adecad08e489179388451881f15faa873b82d2bbd991675a790c","observation_id":"5059c983-5575-44ce-996f-375a5c3101c1","resolution":{"observed_at":"2026-08-05T10:19:54.309215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2509.06984","last_updated":"2026-05-18T12:48:12Z","snapshot_observed_at":"2026-08-02T14:39:32.506651Z","submitted_at":"2025-09-01T10:40:13Z","title":"FediLoRA: Practical Federated Fine-Tuning of Foundation Models Under Missing-Modality Constraints","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-21T21:58:12.430340Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.06984"},"observation_digest":"sha256:b80176bd84c912a14eebe2834f16030eafe4e2142975b21e09c8d1392a1f6e38","observation_id":"b1019603-8c5d-4a35-9d06-2dcb73a2ee71","resolution":{"observed_at":"2026-05-21T22:00:41.448943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T20:08:56.030031Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08826","last_updated":"2025-09-10T17:59:31Z","snapshot_observed_at":"2026-08-04T20:08:51.890283Z","submitted_at":"2025-09-10T17:59:31Z","title":"RewardDance: Reward Scaling in Visual Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:08:56.030031Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.08826"},"observation_digest":"sha256:c2990a77e407d50a92f3eb78efb96aca03e24dd3cf09086177f4f92c520f7f42","observation_id":"0f4bcd2d-bb19-4f13-b4b8-18379f110cfc","resolution":{"observed_at":"2026-08-04T20:08:56.030031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T18:58:10.888699Z","title":"arXiv:2310.00426","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-06T08:13:00.424968Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.888699Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:92746e27ef743b20c7dd2587c05f7d2ea7a6c2cda1168f0b77a14d332f08eb4d","observation_id":"26b0d4e0-4b54-4a25-8570-7882cd0b2820","resolution":{"observed_at":"2026-08-04T18:58:10.888699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T18:48:03.608245Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09680","last_updated":"2025-09-11T17:59:59Z","snapshot_observed_at":"2026-08-04T18:48:02.197558Z","submitted_at":"2025-09-11T17:59:59Z","title":"FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:03.608245Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.09680"},"observation_digest":"sha256:696e19429a50f681bc6ce916434c2ed8b113c0e68d7ff5789e343559c3503349","observation_id":"d52c7b55-7cc0-4e1a-b710-fc45ed3298d6","resolution":{"observed_at":"2026-08-04T18:48:03.608245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T16:07:02.015340Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.16518","last_updated":"2026-06-04T19:42:40Z","snapshot_observed_at":"2026-08-04T16:06:57.570070Z","submitted_at":"2025-09-20T03:48:32Z","title":"FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:02.015340Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2509.16518"},"observation_digest":"sha256:7d727b5ab3f2c32b116d950196b8b9f9bef0547f7bebfdd451f9484390f3ea11","observation_id":"c2ae3072-209b-4300-836c-24d5d77469e0","resolution":{"observed_at":"2026-08-04T16:07:02.015340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2510.01186","last_updated":"2026-04-14T16:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T17:59:56Z","title":"ASTRA: Let Arbitrary Subjects Transform in Video Editing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T10:13:10.141426Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2510.01186"},"observation_digest":"sha256:70ed2655289a20806a9aadc19f93f87759a6039b8c329cddf9b5255e1e51f4f2","observation_id":"d3fba73f-2f0f-4462-8f90-a34c2b672507","resolution":{"observed_at":"2026-05-18T10:16:14.300904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T12:37:32.990859Z","title":"Pixart- : Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03434","last_updated":"2026-07-31T16:40:13Z","snapshot_observed_at":"2026-08-05T23:14:15.176223Z","submitted_at":"2025-10-03T18:53:12Z","title":"Paris: A Decentralized Trained Open-Weight Diffusion Model","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:32.990859Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2510.03434"},"observation_digest":"sha256:57db5c5a00ec3c82e3d73ebac95b5dcf1985cdfd49d820172573df56ce45f202","observation_id":"3266fca7-6121-459c-9ea9-bd02715c1019","resolution":{"observed_at":"2026-08-04T12:37:32.990859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T09:20:06.351589Z","title":"Pixart-α: Fast training of diffusion transformer for photore- alistic text-to-image synthesis.arXiv preprint arXiv:2310.00426,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.16325","last_updated":"2026-07-01T00:44:38Z","snapshot_observed_at":"2026-08-04T09:20:05.440581Z","submitted_at":"2025-10-18T03:15:26Z","title":"UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T09:20:06.351589Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2510.16325"},"observation_digest":"sha256:bc72d1ffaf06c890ed15c0119e5ec59f0c58b01326ee3bd0e175469db3010724","observation_id":"ef53952c-9f71-4539-a38c-60627b0dc3be","resolution":{"observed_at":"2026-08-04T09:20:06.351589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2511.03913","last_updated":"2026-04-10T12:20:25Z","snapshot_observed_at":"2026-07-06T22:35:02.737645Z","submitted_at":"2025-11-05T23:31:54Z","title":"Evolutionary Optimization Trumps Adam Optimization on Embedding Space Exploration","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T00:28:09.302276Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2511.03913"},"observation_digest":"sha256:c71d2a4c1d07faf81246265d105e11d60c687e5653f8c512c5c4c7d609d9a13e","observation_id":"14d38e04-afc8-47fe-8b1b-32935bfca540","resolution":{"observed_at":"2026-05-18T00:30:33.028861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T06:47:03.411590Z","title":"Pixart: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-06T21:19:52.567521Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:03.411590Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:5a83e76d156fd567c2cc0cdbde1934e5844cf8ca1015a9ad33b03865d132fb24","observation_id":"c0df67fd-3efc-4aad-b2af-120ea6c208c9","resolution":{"observed_at":"2026-08-04T06:47:03.411590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2512.01030","last_updated":"2026-05-18T02:06:07Z","snapshot_observed_at":"2026-07-06T22:37:21.536027Z","submitted_at":"2025-11-30T18:57:25Z","title":"Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T18:21:15.831853Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2512.01030"},"observation_digest":"sha256:6d77b6acc953305e753d3c13442adc1253cd8721ba92d89d02117c7ef171cb1d","observation_id":"484f9d5f-8911-4713-8e74-a0c3d890184c","resolution":{"observed_at":"2026-05-21T18:24:18.269617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-03T16:43:20.875326Z","title":"Pixart-α: Fast training of diffu- sion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.12425","last_updated":"2026-05-25T12:13:04Z","snapshot_observed_at":"2026-08-04T22:13:51.531102Z","submitted_at":"2025-12-13T18:39:23Z","title":"Boosting Monocular Metric Depth Estimation via Bokeh Rendering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:20.875326Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2512.12425"},"observation_digest":"sha256:8109a43464c8daba6ec65abaa2441111f866187d5383abb58a682fb9c417b40e","observation_id":"9e75b3e9-1a31-4428-a735-3734ca68c94a","resolution":{"observed_at":"2026-08-03T16:43:20.875326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2512.22437","last_updated":"2026-04-10T13:28:12Z","snapshot_observed_at":"2026-07-06T22:40:07.339525Z","submitted_at":"2025-12-27T02:18:36Z","title":"EmoCtrl: Controllable Emotional Image Content Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T19:35:52.111730Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2512.22437"},"observation_digest":"sha256:7b5789dc61f4135cdcf0d5f041beda10d02318cae543a514d30b5ed6275745e9","observation_id":"0961b1b0-3b9c-4235-a97e-eabcb2096e15","resolution":{"observed_at":"2026-05-16T19:38:20.757838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2512.23421","last_updated":"2026-04-17T11:51:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-29T12:32:27Z","title":"DriveLaW:Unifying Planning and Video Generation in a Latent Driving World","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T19:34:39.518649Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2512.23421"},"observation_digest":"sha256:7a2d0125b2f9fba4772bdfba6300225fe71c6470a99ffbb5683959f9be2ff7dd","observation_id":"60aec55c-61cf-4e86-bdbe-cba3db6d46c1","resolution":{"observed_at":"2026-05-16T19:38:21.135667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-03T13:04:36.371293Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.00664","last_updated":"2026-05-30T08:41:30Z","snapshot_observed_at":"2026-08-05T17:56:34.094236Z","submitted_at":"2026-01-02T11:58:48Z","title":"Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:04:36.371293Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2601.00664"},"observation_digest":"sha256:38e4bfe8519282be85e851c4e858f1a0b3512b2df12da27ea93781acfeccd211","observation_id":"ce365602-40ba-42a2-914f-a578e6b8f1b1","resolution":{"observed_at":"2026-08-03T13:04:36.371293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-03T10:55:14.376845Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.08379","last_updated":"2026-06-09T06:35:29Z","snapshot_observed_at":"2026-08-03T10:55:06.287259Z","submitted_at":"2026-01-13T09:42:57Z","title":"MMD Guidance: Training-Free Distribution Adaptation for Diffusion Models via Maximum Mean Discrepancy Guidance","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T10:55:14.376845Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2601.08379"},"observation_digest":"sha256:596489f6e282eb58fc0d9b8b2757906f59c880b01561ccd554080a7219134a82","observation_id":"c5c2b64b-3e2b-4671-9ac0-b470efe56b3e","resolution":{"observed_at":"2026-08-03T10:55:14.376845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T13:00:22.875471Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:67fab41ed98b8102f0145ec5dea3cbba8a56a9f4c78f1c1608e893d8fd2eb25f","observation_id":"93f4885e-ca9d-461d-9460-1fa94c82d17f","resolution":{"observed_at":"2026-05-21T13:04:10.573402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-03T03:50:45.241076Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:50:45.241076Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:402335adf26b212657bd0e071720ce36d14c958be3852ed0094f42041b552333","observation_id":"4af4b611-6ce8-4d49-a031-481ed163eca4","resolution":{"observed_at":"2026-08-03T03:50:45.241076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2602.13357","last_updated":"2026-08-05T03:37:20Z","snapshot_observed_at":"2026-08-06T21:02:40.607778Z","submitted_at":"2026-02-13T08:11:54Z","title":"AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T22:55:15.572867Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2602.13357"},"observation_digest":"sha256:74c26a6e2d46860c2d27c6bdd517dd1970f0bf8e71f28fccbdd3d73ab288246a","observation_id":"94305886-f476-4b30-a3ec-f57eb41ce290","resolution":{"observed_at":"2026-05-15T22:56:50.220217Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2603.00918","last_updated":"2026-05-10T14:01:21Z","snapshot_observed_at":"2026-07-06T22:47:24.369805Z","submitted_at":"2026-03-01T04:39:09Z","title":"Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T18:40:18.940889Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2603.00918"},"observation_digest":"sha256:52d0ff08b7dc30e9f4f41eebe6242aacce7932ce52abf3a622acda2dadf5c092","observation_id":"3d833edb-2d70-4a8a-bdab-cae5f32da1f2","resolution":{"observed_at":"2026-05-15T18:41:28.737058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-02T19:29:27.986219Z","title":"arXiv preprint arXiv:2310.00426 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.02172","last_updated":"2026-06-26T20:23:59Z","snapshot_observed_at":"2026-08-03T20:24:48.093594Z","submitted_at":"2026-03-02T18:42:15Z","title":"TerraDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T19:29:27.986219Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2603.02172"},"observation_digest":"sha256:19723be88b706b9ac667f9e8afb28fbdd38aa646d110bb01424c3529bb92c1d1","observation_id":"e68f28f0-72f5-4e06-8303-94e910aaf7c5","resolution":{"observed_at":"2026-08-02T19:29:27.986219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-07-15T14:03:19.278198Z","title":"Pixart-𝛼: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06741","last_updated":"2026-07-31T17:10:16Z","snapshot_observed_at":"2026-08-06T21:10:13.854077Z","submitted_at":"2026-03-06T08:43:43Z","title":"Heterogeneous Decentralized Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-15T14:03:19.278198Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2603.06741"},"observation_digest":"sha256:bc5a596e58c8f0a5844503d80ad966ebb105a9db7569d8f6b9e2d4c8493a6c4e","observation_id":"5a4acb9f-8933-420b-8761-dab5b4ae16aa","resolution":{"observed_at":"2026-07-15T14:03:19.278198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-04T05:55:55.238174Z","title":"Pixart-𝛼: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.06741","last_updated":"2026-07-31T17:10:16Z","snapshot_observed_at":"2026-08-06T21:10:13.854077Z","submitted_at":"2026-03-06T08:43:43Z","title":"Heterogeneous Decentralized Diffusion Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T05:55:55.238174Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2603.06741"},"observation_digest":"sha256:317fe81e563cfba30321bc85c74d81649a07251125a6a052e581a98cbbf75bfc","observation_id":"ba39eafe-3e9d-446c-b312-b9b8e6e7c6c0","resolution":{"observed_at":"2026-08-04T05:55:55.238174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2603.07119","last_updated":"2026-05-04T15:27:59Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T09:11:10Z","title":"TIQA: Human-Aligned Perceptual Text Quality Assessment in Generated Images","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T14:32:59.720416Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2603.07119"},"observation_digest":"sha256:dabb5940421d30dd58d94eb55b176d03cb646f15301c70a716b1ce51568d716b","observation_id":"ca678abe-6c5e-46ea-b74b-0b6232e8f7d0","resolution":{"observed_at":"2026-05-15T14:35:55.863778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-07-13T23:13:52.470831Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.17390","last_updated":"2026-07-08T08:37:32Z","snapshot_observed_at":"2026-08-06T06:41:36.061071Z","submitted_at":"2026-03-18T06:14:00Z","title":"FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T23:13:52.470831Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2603.17390"},"observation_digest":"sha256:d400c8eff377ae5e803e6ba1489c2a407966aab147216d7428209ecc48a241c1","observation_id":"4c2f9c77-086d-4a0b-b7f3-dc49290d378c","resolution":{"observed_at":"2026-07-13T23:13:52.470831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-07-13T20:31:07.902275Z","title":"arXiv preprint arXiv:2310.00426 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22025","last_updated":"2026-06-27T01:25:31Z","snapshot_observed_at":"2026-08-02T05:11:13.037192Z","submitted_at":"2026-03-23T14:31:24Z","title":"Superbunched random fiber laser","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T20:31:07.902275Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2603.22025"},"observation_digest":"sha256:d0e6b59d8c50ad5a285b5109f3e2798466fd95f3b9e58d7c892873a7896b0236","observation_id":"a54d657f-f085-429c-8439-36316e8f68b9","resolution":{"observed_at":"2026-07-13T20:31:07.902275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.02355","last_updated":"2026-03-12T12:49:26Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-03-12T12:49:26Z","title":"From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-15T12:50:13.764159Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.02355"},"observation_digest":"sha256:1379bfd73eeca7a2cac97d604b5c4b9c46d45cf7830d176220706bcd1a4ef2a4","observation_id":"55ac820d-e0c6-4cb9-b4f5-dea0e2c158ad","resolution":{"observed_at":"2026-05-15T12:50:37.085883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-07-13T12:34:28.755596Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03674","last_updated":"2026-04-04T10:16:18Z","snapshot_observed_at":"2026-08-06T17:48:37.654091Z","submitted_at":"2026-04-04T10:16:18Z","title":"DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T12:34:28.755596Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.03674"},"observation_digest":"sha256:8d813ac3b6f465b212574e25bd11bfe936600a41196772d76fd0a4397be03821","observation_id":"c755195b-f18e-438f-98b5-137a224f7a8f","resolution":{"observed_at":"2026-07-13T12:34:28.755596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.09073","last_updated":"2026-04-10T07:56:38Z","snapshot_observed_at":"2026-07-06T22:58:04.106299Z","submitted_at":"2026-04-10T07:56:38Z","title":"DRIFT: Harnessing Inherent Fault Tolerance for Efficient and Reliable Diffusion Model Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:49.089468Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.09073"},"observation_digest":"sha256:dd14b142b476d1b1602d082b4ec95199dbbb71916fdda262e45009902873a97f","observation_id":"c83685e6-8c79-4540-a906-41cd410f137e","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.09861","last_updated":"2026-04-10T19:43:06Z","snapshot_observed_at":"2026-08-02T11:28:37.898266Z","submitted_at":"2026-04-10T19:43:06Z","title":"Evolutionary Token-Level Prompt Optimization for Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:00.723170Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.09861"},"observation_digest":"sha256:d567c191618c8c9f6b1f7eda182fded2c148ae3252e4ef596fb774069c4ca819","observation_id":"d2c03e8d-47ee-4957-9bd5-2d05fe6429fc","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.11934","last_updated":"2026-04-13T18:22:50Z","snapshot_observed_at":"2026-07-06T23:00:12.978356Z","submitted_at":"2026-04-13T18:22:50Z","title":"BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:33:15.025940Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.11934"},"observation_digest":"sha256:d2ec81e0887a88baa2ddbe81bab8e18a8a153584904bb56861577dbd5a3d10c3","observation_id":"3ee57da8-bf7e-44d9-8892-2fe57bd09ea5","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:41:23.057949Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:0f811a76cd252d88d9d209d6955ba8a91ad7eb894bb15621e4c2ad36b471378f","observation_id":"a0f26548-f006-415b-9ae7-b14aacb5d3d6","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-07-12T21:00:35.123495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T21:00:35.123495Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:08d6b4a6f927794a43cb69b49176d30a06b7de5318f3058aba43b4038c2032eb","observation_id":"5a38b2ef-ae5d-4404-b16f-cb12768060bc","resolution":{"observed_at":"2026-07-12T21:00:35.123495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.15857","last_updated":"2026-04-17T09:05:40Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T09:05:40Z","title":"AHS: Adaptive Head Synthesis via Synthetic Data Augmentations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:36.768883Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.15857"},"observation_digest":"sha256:ac22ba75579635c48e31159b83a8d61d77752f5e4a6aef6db06aa1403f88f9b8","observation_id":"bf858b10-8e69-4813-b55b-b1cd1668541e","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.17211","last_updated":"2026-04-19T02:43:00Z","snapshot_observed_at":"2026-08-03T14:44:01.659679Z","submitted_at":"2026-04-19T02:43:00Z","title":"EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T07:13:14.016037Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.17211"},"observation_digest":"sha256:2fb2b5cf87f2a8118a9835adad879e2f346addec3d3fd6a4f9c08c13d0912f6d","observation_id":"92f7ecfa-3c63-415c-b588-e079afccc86c","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.21036","last_updated":"2026-04-22T19:30:35Z","snapshot_observed_at":"2026-08-02T19:59:38.936997Z","submitted_at":"2026-04-22T19:30:35Z","title":"Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T23:48:37.948835Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.21036"},"observation_digest":"sha256:52309e41eb0b15db5cdd85deb363af1330243f0b5223ace474a6ccb9074ae242","observation_id":"33c54d52-7ac3-4d4d-b75c-5582f0f29f9e","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.24346","last_updated":"2026-04-27T11:39:18Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:39:18Z","title":"SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:44:35.423054Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.24346"},"observation_digest":"sha256:7e4e12502828af4ea45e03eb9162e92120e0600970be7ce7ac3e36648f8dde71","observation_id":"a6f70c8a-22f2-4fec-a9dc-ff66c16d4eb4","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.24351","last_updated":"2026-04-27T11:44:45Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:44:45Z","title":"Diffusion Templates: A Unified Plugin Framework for Controllable Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T04:24:53.023047Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.24351"},"observation_digest":"sha256:e2138f7578d80f1bdeef3f91862918523fd7fd695ee909592b791e34d2f94b57","observation_id":"d63572c5-efba-483e-b241-c31283aac9d2","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.25299","last_updated":"2026-04-28T07:09:18Z","snapshot_observed_at":"2026-07-06T23:11:11.827339Z","submitted_at":"2026-04-28T07:09:18Z","title":"The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T17:16:00.988125Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.25299"},"observation_digest":"sha256:bf1995abae60afc3fd45bfa983c94d754e94886d845ef839e18fb841a4bb1378","observation_id":"8da3410b-0d36-4310-a864-35dfc67092dc","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.26341","last_updated":"2026-04-29T06:46:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T06:46:59Z","title":"SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T13:45:53.346402Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.26341"},"observation_digest":"sha256:5c04d309b612450e91ab375d361e8846544311519c457129865a71cd3caa896e","observation_id":"fa4dbfa2-b7c1-4e18-8796-c9148de20751","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:32c32c8d62502a32bd76e7391e56c35096cfa0e3e2ec675b4e92dadf67a9f7ca","observation_id":"bb38d082-794c-46ee-bc0d-5122b5a3ed07","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:f4458fdf89fa892eba49a448e10aa26c19be7a79566b8974f16013c9ded1b493","observation_id":"40abff50-8a7d-472f-953b-72faf4bf5f37","resolution":{"observed_at":"2026-05-21T09:14:06.030233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.00273","last_updated":"2026-06-08T16:33:25Z","snapshot_observed_at":"2026-08-02T14:38:38.045362Z","submitted_at":"2026-04-30T22:18:33Z","title":"When Do Diffusion Models learn to Generate Multiple Objects?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T08:07:10.345273Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.00273"},"observation_digest":"sha256:734910c2343616f401f058f1570a50da86c21c1151443627a5f56f7a6afd19f6","observation_id":"b8b22434-d16b-4090-9643-572d14c202c4","resolution":{"observed_at":"2026-07-01T08:15:32.073008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.06070","last_updated":"2026-05-07T11:56:26Z","snapshot_observed_at":"2026-08-02T22:55:59.306670Z","submitted_at":"2026-05-07T11:56:26Z","title":"Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T14:16:55.945455Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.06070"},"observation_digest":"sha256:1f09d826cb4b7b004f46e7d265639804f024eb199487d0566b68ab65fa20ff0b","observation_id":"dc56eb4a-9228-4224-9c1e-971487087908","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.10019","last_updated":"2026-05-11T05:44:18Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T05:44:18Z","title":"The two clocks and the innovation window: When and how generative models learn rules","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T03:15:45.257213Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.10019"},"observation_digest":"sha256:f47e61bea0823c2933fda860151a2b6bd15fa5223ddd7346835645148f190166","observation_id":"8618f3a6-4700-4b18-b40a-c83708e7a669","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.10127","last_updated":"2026-05-13T05:54:11Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:40:03Z","title":"Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T03:56:43.640874Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.10127"},"observation_digest":"sha256:81153a046feba9cdc3dad95ffaef61cf4b8707ed8c29e1309088314f4d18cc2f","observation_id":"e3c3324a-7ff9-4609-bc57-068e8075149c","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.10127","last_updated":"2026-05-13T05:54:11Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:40:03Z","title":"Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T21:56:10.499014Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.10127"},"observation_digest":"sha256:725637058c5a7cc9124dfdbe5744c17da46aca2d56f2ca3e5b3beeef533502d2","observation_id":"85af0f9a-2663-461c-9397-381156ed02ba","resolution":{"observed_at":"2026-05-14T21:58:03.367081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.10180","last_updated":"2026-05-11T08:31:57Z","snapshot_observed_at":"2026-08-01T15:31:49.304094Z","submitted_at":"2026-05-11T08:31:57Z","title":"What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:35:39.370969Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.10180"},"observation_digest":"sha256:a84a51cf58e6cb4d486663d0df3435322d9f3d83e99c12d409b30f8d317f47da","observation_id":"7e601976-439d-42e7-886d-e5e3c2571dca","resolution":{"observed_at":"2026-05-12T20:38:53.511834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.12011","last_updated":"2026-05-12T12:00:48Z","snapshot_observed_at":"2026-08-02T23:56:46.052228Z","submitted_at":"2026-05-12T12:00:48Z","title":"CaloArt: Large-Patch x-Prediction Diffusion Transformers for High-Granularity Calorimeter Shower Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T04:40:25.725622Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.12011"},"observation_digest":"sha256:634f959e00b296515e98cef7f481ee846b1e753e15539750142e2d7cb404bb4f","observation_id":"2fd02118-7748-4fb3-acb9-43321e8736ab","resolution":{"observed_at":"2026-05-13T04:42:15.820000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.12013","last_updated":"2026-05-12T12:01:35Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T12:01:35Z","title":"L2P: Unlocking Latent Potential for Pixel Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T07:12:28.181595Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.12013"},"observation_digest":"sha256:680f0c11e7a5c51de4e44a2f24306540c958b66df7e6f20687b840cad329c523","observation_id":"04cf1cc8-cf24-4d2d-80e2-ad778de878c6","resolution":{"observed_at":"2026-05-13T07:17:29.679013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-08-03T01:41:22.691646Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:39.114660Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:d2b9b630fb6f8b6d5d61278e6ae15776ac89b4cbec53de472e3bdc36fa90e64f","observation_id":"ea46d88f-21d1-4b02-be81-98bd377cbfbd","resolution":{"observed_at":"2026-05-13T06:07:22.952148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.12271","last_updated":"2026-05-26T13:34:33Z","snapshot_observed_at":"2026-08-03T01:41:22.691646Z","submitted_at":"2026-05-12T15:35:34Z","title":"Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T22:18:55.933311Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.12271"},"observation_digest":"sha256:4bf75c0961cd8e3e1e9e062f51627aa69ab1dccc6851bed5075e00b295ab0767","observation_id":"976438e6-5f3e-4571-b215-73b27d26f3fc","resolution":{"observed_at":"2026-07-01T14:05:46.562530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.12967","last_updated":"2026-05-13T04:01:10Z","snapshot_observed_at":"2026-08-02T17:48:26.431725Z","submitted_at":"2026-05-13T04:01:10Z","title":"ImageAttributionBench: How Far Are We from Generalizable Attribution?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:38:41.659261Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.12967"},"observation_digest":"sha256:e3420241cd340d42fdefa3fbf0041b490d4ba31c484415d119f6ede308f17343","observation_id":"e3193a3f-98e8-40b1-943e-ef5114221629","resolution":{"observed_at":"2026-05-14T19:39:23.956550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.13448","last_updated":"2026-05-13T12:42:58Z","snapshot_observed_at":"2026-08-03T00:45:41.054613Z","submitted_at":"2026-05-13T12:42:58Z","title":"On the Limits of Latent Reuse in Diffusion Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-14T18:38:49.566101Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.13448"},"observation_digest":"sha256:633b9fba84e537279c0569ff6b09dfdf33b29527550a0803e104797104f7c3d4","observation_id":"e415dc12-4b2d-4f82-96a6-6218dcc6461b","resolution":{"observed_at":"2026-05-14T18:39:22.000324Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.14191","last_updated":"2026-05-13T23:13:29Z","snapshot_observed_at":"2026-08-01T23:13:44.447855Z","submitted_at":"2026-05-13T23:13:29Z","title":"CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T04:47:32.476614Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.14191"},"observation_digest":"sha256:2d40602bf41e602c3903e1e4878e9e317c7f272eba5a5bc545b81b745afc2fe2","observation_id":"ee712373-ad4e-4aa8-a3ac-49d4951928e4","resolution":{"observed_at":"2026-05-15T04:49:44.394983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.15682","last_updated":"2026-05-15T07:08:01Z","snapshot_observed_at":"2026-07-06T23:26:56.013191Z","submitted_at":"2026-05-15T07:08:01Z","title":"DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T20:07:26.432000Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.15682"},"observation_digest":"sha256:bf2ae813a1551a0dcd2774335149ef5d7a4a6dec8d69202cdedaaf8382635ae7","observation_id":"b5fee53a-d444-4cbe-ae07-ba647c8db15f","resolution":{"observed_at":"2026-05-20T20:08:59.172946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.15908","last_updated":"2026-05-15T12:45:17Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T12:45:17Z","title":"RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T19:01:52.883915Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.15908"},"observation_digest":"sha256:c351967b18f046b1a3272d4d4076d9f92d23d13a5049a356c15efa5c35c970db","observation_id":"2d1423ac-ddae-49a1-b2b2-a8f7c437f744","resolution":{"observed_at":"2026-05-20T19:03:39.591226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.16603","last_updated":"2026-05-15T20:06:02Z","snapshot_observed_at":"2026-08-05T16:09:41.396728Z","submitted_at":"2026-05-15T20:06:02Z","title":"Controlla: Learning Controllability via Graph-Constrained Latent Geometry","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T18:39:09.515957Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.16603"},"observation_digest":"sha256:d9378719b1a7d39a281d20b2c7ad9b1336a40a37f8594bed4fd1b48b59f1a6a8","observation_id":"7fffde73-02b8-4abe-a8d5-03f9e2cbbd21","resolution":{"observed_at":"2026-05-20T18:43:38.908188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2605.16732","last_updated":"2026-05-16T00:52:00Z","snapshot_observed_at":"2026-07-31T16:38:42.574868Z","submitted_at":"2026-05-16T00:52:00Z","title":"DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T21:48:35.203469Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2605.16732"},"observation_digest":"sha256:a19cfcbefc60398778d87cd714012c11bca5b9eabee4a98ec68b59b4aa87034a","observation_id":"9be60fee-89ee-4913-995e-1e6b07bfd7a1","resolution":{"observed_at":"2026-05-19T21:52:48.377600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.00426/citation-record","integrity":"/paper/2310.00426/integrity","json":"/paper/2310.00426/citation-record.json","paper":"/paper/2310.00426"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ediffi: Text-to-image diffusion models with an ensemble of expert denoisers","venue":null,"work_id":"7b3f0ec5-8cde-4746-91c4-b2f525378054","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:22a11b1bbfd30c4c1b715b25f2d8a2a968d4f6e65406ae8b23c639e20301913f","observation_id":"4482aebb-d86c-4bb0-8e4b-544135b1f8f6","resolution":{"observed_at":"2026-05-12T20:38:53.497118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":"dc5742de-b306-4fe7-8565-d4c06c76ff88","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:0cea6f54b3a96b998cfe7f84e087824c9411ea8a2eeee9207a5bce8c48384488","observation_id":"07e6c455-efc7-447b-bc09-e7ecc57cc433","resolution":{"observed_at":"2026-05-12T20:38:53.503500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A study on the evaluation of generative models","venue":null,"work_id":"b610c3c1-fa7b-48fd-a654-b3733895def6","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:6c9740d8ce178b7c2317987162437d686fd4c90f4514dbbeba905832f5e0790e","observation_id":"72ba8db4-e012-4ac4-8646-c9ed3d4574f1","resolution":{"observed_at":"2026-05-12T20:38:53.506717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"9e8de266-8b5e-4baa-a192-25c6902a2f71","year":2020},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:3306a9b919c1fa12c3527d78e510cb01aea728f5606a1f481c81076b672cfa7f","observation_id":"0e9b78ed-cac5-4576-99a7-cc2ea0308fe2","resolution":{"observed_at":"2026-05-12T20:38:53.510407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepfloyd","venue":null,"work_id":"f4edd0e8-a0a5-48c2-a2cf-c04e92826000","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:e3397087b2f0bfa7c3fc04b9b72741ac3d0713ddcf2c48c73535b5f6a1c0b661","observation_id":"f7125189-6ef5-47c0-87b2-574e4eac2527","resolution":{"observed_at":"2026-05-12T20:38:52.870644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T20:44:09.312766Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"8851b143-ce72-43a9-88ae-cb55a1069e36","year":2009},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:7a8ef5fbd65303fd34b0c62a7a0375c7629fea202359427b823c83e058788b6f","observation_id":"fe021278-3ac0-4485-804c-8d6a10ba5c88","resolution":{"observed_at":"2026-05-12T20:38:52.877642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"4b7dcc0e-5a58-4125-9097-4a8ab6d90e2e","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:2ce294386f61da9e71001454f92adb015a8ef485c649c01c19924221d8d6281b","observation_id":"daf0b63f-9036-404c-b0f7-a31be108750d","resolution":{"observed_at":"2026-05-12T20:38:52.883538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"bb286ecf-b010-4344-99cd-8e430af6ee7e","year":2020},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:5a1c070f7650395e23d311000d0db899899a774e2c97fec15b1e11d73aa298a1","observation_id":"f08578eb-e7c0-4da1-a4a4-4cd1d152499c","resolution":{"observed_at":"2026-05-12T20:38:52.889408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"1f7ceb20-25bb-471b-a4a1-a6d261650c9d","year":2020},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:d23312f65bf940a64149cd871f12cb99b0eaf319d76c5c7e620bd2d60cdfb966","observation_id":"8c52de0b-0bf9-4dc7-9337-3f11a9453637","resolution":{"observed_at":"2026-05-12T20:38:52.894627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ernie-vilg 2.0: Improving text-to-image diffusion model with knowledge-enhanced mixture-of-denoising-experts","venue":null,"work_id":"ec828a32-1f2f-45d5-b551-f3e1ce27075e","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:aed412bb1bbe6e0c2746d520557a32ff398d75decf3279157b9e453a85417350","observation_id":"8f70611c-a185-44c2-a850-7e85769b5132","resolution":{"observed_at":"2026-05-12T20:38:52.900386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metabev: Solving sensor failures for 3d detection and map segmentation","venue":null,"work_id":"5f225e8d-24f3-43cf-a621-79e6f4fa7f26","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:ec7bd93aec6c9ce947ee510a6b3ffbd8718717a808021fcb25d2e0cd2e62ae56","observation_id":"2d560979-de43-467f-a30c-5ff1e4933aa1","resolution":{"observed_at":"2026-05-12T20:38:52.906082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"918e2586-a73b-42fb-980a-0ce4751a3735","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:c5ce27381026d2c7d724f93353d1e4fcca1cba7c2f6f9b16292dce1597981f2e","observation_id":"2b35c947-f8aa-4d4b-9cb1-bee6de5ec77e","resolution":{"observed_at":"2026-05-12T20:38:52.910720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative adversarial nets","venue":null,"work_id":"cb734972-af6c-4487-ab39-39454191f467","year":2014},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:23e6b0c3e656c0cb75b0987e92a975688bd81128ac1f5ef945690333dee259e7","observation_id":"84e726dc-a8d9-4725-9f84-c0e94ab19eae","resolution":{"observed_at":"2026-05-12T20:38:52.914705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer in transformer","venue":null,"work_id":"dbba01de-857e-4934-9cf3-880edb3fd668","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:d89718fa118c8a271c5bbf765310feffeacf02d237f41f3d242f2690ae93f128","observation_id":"c61d18ed-8c00-4fab-8bf9-18bc092f343a","resolution":{"observed_at":"2026-05-12T20:38:52.918243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"907826aa-8f2a-4475-baec-4808245bb1f2","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:b515263b27fbc447541540123b731bb045f95a3e1f6d896a1aef6e34b1f76fda","observation_id":"d3c71219-b468-43dc-9563-faa55ed28747","resolution":{"observed_at":"2026-05-12T20:38:52.922414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"a96f2ef8-ad26-43f5-852d-7172e299b0ed","year":2017},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:a6cc381978416df670fefdf405eb7e1912646fd54e0936d9a0137b6f249777fe","observation_id":"e42e348e-535e-4b5d-9121-8a77efe74791","resolution":{"observed_at":"2026-05-12T20:38:52.926886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:03:56.530125Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"7e1a9898-ae5b-47d7-90c0-4938d3cd4cde","year":2020},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:7818ad48aae9c09d0e0a6af4e7b1a357c382faed8448ee92b821ae59262938d6","observation_id":"c757223d-4b5f-4d9f-a791-e1c4c06d90be","resolution":{"observed_at":"2026-05-12T20:38:52.931058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"0af14e2b-0e6c-432c-8dc3-894056975c32","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:953a46e94a652a3eb8919e8a0b1902f25af40def4dc4bc01247c9dce7410bdf3","observation_id":"6b7894cd-4b83-4e9b-9a3d-b5b0889f06a7","resolution":{"observed_at":"2026-05-12T20:38:52.934133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"27854aab-f75a-4588-b50e-65db61ffc166","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:f97f09d5285bc9b9eda768af8d9c5838c6e63a34038da03540e3126739dd58bf","observation_id":"2ffb6caa-a45f-40ff-8299-9d884c9e9ecb","resolution":{"observed_at":"2026-05-12T20:38:52.937533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up gans for text-to-image synthesis","venue":null,"work_id":"9113fd09-8971-4141-bedb-29e73151d012","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:89019da0d58d441f9fd0e69a1ba5dbd6323eff9792612b411d131d3b48b218f8","observation_id":"6aad4289-557d-43cc-8958-67b56f6d3209","resolution":{"observed_at":"2026-05-12T20:38:52.940660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusionclip: Text-guided diffusion models for robust image manipulation","venue":null,"work_id":"19879ed2-0a12-404f-a73e-11d24cf8f4b1","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:656530c87b600b628a668ee858cfb6b471c2797c6c403628d842af18a8cacc16","observation_id":"0ca0a31e-0605-4076-8e33-97a3e1208c3d","resolution":{"observed_at":"2026-05-12T20:38:52.944157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auto-encoding variational bayes","venue":null,"work_id":"40cf2d10-84f3-41f7-8bf8-9967cf3265c0","year":2013},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:35ead232101bc7e7a4745f8c07d493a24d550cb1b404b37a9d02d7b07fa2d104","observation_id":"e83d0710-6b37-4206-911a-fae33c8a4e31","resolution":{"observed_at":"2026-05-12T20:38:52.947684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything","venue":null,"work_id":"61d6ab8b-815c-430a-b7fc-3fc391a1fd74","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:f734743b4d5da78dab7eab458ab26a18db34780e50394ea8c9ee64d2208d5c54","observation_id":"aa4db450-8ecc-4bf8-993d-db58e1428121","resolution":{"observed_at":"2026-05-12T20:38:52.951076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"c197beae-5e41-4aba-b97a-f5342254d5c7","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:f999a0a79e159f1206594b96ba48e9c8e4386464038743f537a7e9b51010dadc","observation_id":"fe6e2d44-9dc9-4c00-ba9b-8bb9f01e2ed3","resolution":{"observed_at":"2026-05-12T20:38:52.954757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"cc48872d-4f16-4f14-9a72-b56af8b92048","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:ab0c2f97cfafeff9fa81db85982f25240f5cda974a792bf66268096f07f5c2fd","observation_id":"1395e1f1-b6c9-4383-ab29-e1904f2e20b2","resolution":{"observed_at":"2026-05-12T20:38:52.959132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panoptic segformer: Delving deeper into panoptic segmentation with transformers","venue":null,"work_id":"35d74d90-3391-4398-84e6-2f50b9336403","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:6d2487c4644cf5d7e830d5908fde002e3578342cf3f9b7c9588840caac81996e","observation_id":"23f2a5d4-630c-4837-ab58-e2fa37df4fdd","resolution":{"observed_at":"2026-05-12T20:38:52.964446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"a8a9a6bf-fd4b-4a2a-8d6a-74c42484d0ac","year":2014},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:a01c47e5620f8fe9e43da7e823e5677e95bc5de2d2c153808ff261967a762188","observation_id":"47fafbe0-bf00-40bf-ba73-a5de9b72a04b","resolution":{"observed_at":"2026-05-12T20:38:52.967833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"2b532480-25de-428a-bcc2-1fd83229345f","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:962003f5a068e9b02d25872e6894459b48fad8af22b9ee4baa241209f702dae4","observation_id":"dcc93902-ca5f-4f5b-8725-69b0fd9f3a03","resolution":{"observed_at":"2026-05-12T20:38:52.970798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"b1a5ea54-e1ea-4718-9eda-d6b7d984dfbe","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:24e2b3179ec0b43c755cb3894435c10dfbd3972946ea1eecb865934e576a126a","observation_id":"ced374d7-6a40-462c-9d71-b21d2496a7a7","resolution":{"observed_at":"2026-05-12T20:38:52.974199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video swin transformer","venue":null,"work_id":"f432cbaf-95d8-4a25-bd1f-b4f190012d7d","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:859e02ee030b38be0fa659f9644bbdf6268739ff9f76e891999f78b61d991702","observation_id":"168a6be1-09d7-46be-b52d-3723f6f9fb63","resolution":{"observed_at":"2026-05-12T20:38:52.978030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"746bfcfc-755f-4c79-81ce-de4b6f41c82a","year":2017},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:50a5c52948534ab65a50439a37bc8b7baa998409839551990103044913952765","observation_id":"a1b03bae-4b29-495e-ae99-e97e9ff7de8d","resolution":{"observed_at":"2026-05-12T20:38:52.981914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":"adbb4bfa-bb6a-4316-8b1b-08334f35a1f2","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:bfc18b69a18a578075659a6f2c79b1c77d30fdcedd8732b75ada0bdfad8851da","observation_id":"18412270-43ca-44cf-998e-1792bd7c4a3f","resolution":{"observed_at":"2026-05-12T20:38:52.985726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpu selling","venue":null,"work_id":"2e07f063-d0b0-4666-9b47-64e9571b47a7","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:3af26733be73baae619647fd8bb7fcceb33e442c365b1b9ca708491a9b2438f0","observation_id":"c8b0e488-58c5-45a7-a7e3-c7454b75aea7","resolution":{"observed_at":"2026-05-12T20:38:52.989440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Midjourney","venue":null,"work_id":"c59ca4b0-85d6-4142-ba76-91530c92c56b","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:5bb987cfde6ed302bd904c0ef846ef73a302f697cb36acf08d1067c35a1a6746","observation_id":"3266293a-d254-41b8-a8fd-027c91872e98","resolution":{"observed_at":"2026-05-12T20:38:52.992991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":"f39805f4-dd8f-496d-a56e-ca33202f594b","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:39ef86ca3560745f8a8d660517e21f7ed97d771be3abf00b650640427766c0d6","observation_id":"ac4b74b4-4f77-418b-87aa-83eb2634556d","resolution":{"observed_at":"2026-05-12T20:38:52.996934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"eaf36cb6-ab10-4e7d-a2af-ce7350d27d7e","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:1f1cff02b99732f716bcd044fadfff0168bcb324f9a3d68476b226cfc3a3286b","observation_id":"0b3d4ca7-aae5-47d9-9501-c9e6b1144ab4","resolution":{"observed_at":"2026-05-12T20:38:53.001588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nltk","venue":null,"work_id":"e25da738-95ff-4d5b-ae42-38f2145b4994","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:b27df364fb75a61946ebada92cbfd93e5debd9b707edf301c2479b58c6045b57","observation_id":"d96f5ca4-be4c-4eab-9a05-50fab3602596","resolution":{"observed_at":"2026-05-12T20:38:53.005812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Getting immediate speedups with a100 and tf32","venue":null,"work_id":"f6e0270b-0b9d-4bd3-9ee9-039571d788d4","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:03f4d8e2b1e30631b83e29acbd42775a30a94ea4bf77b865b4815d2950d2f894","observation_id":"cfbcef77-4c09-438a-bfd2-2d8331807651","resolution":{"observed_at":"2026-05-12T20:38:53.010612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dalle-2","venue":null,"work_id":"041e6fa3-7e6e-4a11-9944-f3b46c693191","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:a2d37280ea2e1a7a3683348abe9750d14f1722c39e104c160eb5c7a6344c7e02","observation_id":"12a3bcfb-0315-43de-aee9-f7395a58f11a","resolution":{"observed_at":"2026-05-12T20:38:53.014634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":"aaec4b66-8f7d-4a14-b281-6281b71cb454","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:826f5f1046bbbbc9564e0e23d8d4143a79b56948599c389442155c43f1c32292","observation_id":"af17eeae-0f56-43ff-a131-b9d87090ca09","resolution":{"observed_at":"2026-05-12T20:38:53.019350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"8d38d418-891b-4677-8c42-8119261f034c","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:dfd0ae6fc2660d05bd4514f632092c0a3101395327a1259409f462e19079fc3e","observation_id":"42a727b1-1930-47f2-9e01-35a7d32c3b17","resolution":{"observed_at":"2026-05-12T20:38:53.024074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:01.036320Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"b0ae75e0-8e63-4a82-a889-6637cc42d57e","year":2018},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:86497db33c1c9d2c5799f6f78253b5bd0b6e8a4bedfec4bb2f6cff894fa6f4ce","observation_id":"799ea71b-8010-43b3-aa38-5b98ce823471","resolution":{"observed_at":"2026-05-12T20:38:53.028766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"ef50f0b3-48a5-4c13-87fc-3e49a5867586","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:7d7f1292d202f211999ec31e84fc0c7de7b84cc7424eb8e47166336111c06288","observation_id":"6e975255-8904-400b-b237-21a533d990f7","resolution":{"observed_at":"2026-05-12T20:38:53.032679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Barron, and Ben Mildenhall","venue":null,"work_id":"9aa3a779-77f9-437e-8ee2-2c62412612f8","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:973333389e019efa6ed4bec0eaa0992b6e4748adcfcc70a5a353cd65bb3a3048","observation_id":"8aa7f316-4b4d-44b2-9233-1defde07a8f4","resolution":{"observed_at":"2026-05-12T20:38:53.036143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"bd93559b-51d8-482c-83ca-e6749a64c1d1","year":2018},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:b27850c1b6c23111c6390ff4f73f5fea318c4f43da88272185f9e29dc9f616e6","observation_id":"6e8c469a-c606-493c-8679-62acf974e27a","resolution":{"observed_at":"2026-05-12T20:38:53.039506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"586d4dff-1898-41af-96a9-f2a60a64d04c","year":2019},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:ba4fb91037df0295db3d5ebaa7396314b34df37a38fc38694e8c1e84aa470e07","observation_id":"243f02cd-a62f-47c2-83fe-aa1e7f5d7c91","resolution":{"observed_at":"2026-05-12T20:38:53.042738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variational inference with normalizing flows","venue":null,"work_id":"09fa2d8d-3c53-4900-b15e-b98a69dcb659","year":2015},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:6758dfc7d49a5548678fc7ffd45cf1286872b65fa9f45cec498958978d846ce1","observation_id":"a138f9c1-64ba-4ef1-9f3b-51623a224bf9","resolution":{"observed_at":"2026-05-12T20:38:53.046900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"c893d08b-dfec-403b-b2a0-be5a8fda721c","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:b6c80b01c41724bd97f4554cb124089b557eeb27c28c88f30f3ce3f8caa583ad","observation_id":"f8e6bc37-c10b-4059-8f2b-04b8e02ce8d6","resolution":{"observed_at":"2026-05-12T20:38:53.050978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"3a5b1bac-4c3a-4972-ad70-e0c3027a2bdf","year":2015},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:a1924abc0484c4235d4d9edf99156d02375a5d01186401eef30f7dedcbb06ef3","observation_id":"ac1c81f3-7bd6-4ec4-8b70-a6fce5cfc2fe","resolution":{"observed_at":"2026-05-12T20:38:53.055217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"1e15eb84-791c-41a1-a0ce-c66c809cf0ef","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:f58351e12c250ee2b17035263862cff8cccf2f9e12f5d49ee461eb3b0eb1b6f7","observation_id":"e64b53f1-a8c8-433b-a4f0-3e1b61c244b2","resolution":{"observed_at":"2026-05-12T20:38:53.059311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"ace5af9a-a79e-4a15-addc-a7b084779cda","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:6e04aa88804bdb0197b0d2594e2ea345b4cc52277945dd9927a780297fe4b465","observation_id":"d650de01-a1aa-47d0-9e71-ce8e8b9977a5","resolution":{"observed_at":"2026-05-12T20:38:53.063288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":"e56d7e6e-519e-4310-9363-e9efda2e1c8f","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:e046aed95b919bf589312bb752479b450f050d833f3ca98351cdbde6bcaeb913","observation_id":"34dc9229-04f8-465b-af08-61c91ab967cc","resolution":{"observed_at":"2026-05-12T20:38:53.067624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"c6c19a67-9cee-4251-bf17-c6de765420b7","year":2015},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:8d22b57925664146b9b9cb78e7aff20c2d0ee6ee1d9b01b56614288617026923","observation_id":"705a06d4-7b36-49c1-83b5-6f9b1c460532","resolution":{"observed_at":"2026-05-12T20:38:53.071527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"292ea857-8069-4ae0-aef3-6edd301a2863","year":2019},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:8f165bfe5be0aa735a32d2aafca768eefceb2d9698bc178220346b1cf73c4368","observation_id":"609a33b5-8ab3-4123-b998-d99c6e998713","resolution":{"observed_at":"2026-05-12T20:38:53.075004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":"caf05a37-efba-49dc-aab2-afba98d890e2","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:4a2ff2f17ddf7e24b041d7e48f810dafd3c4b77028af5d76a14fb7e0a19f29af","observation_id":"6eb177e2-1eb0-4e16-8ef7-6a104684a874","resolution":{"observed_at":"2026-05-12T20:38:53.079783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segmenter: Transformer for semantic segmentation","venue":null,"work_id":"d5dbb63a-3181-4427-a5f1-36bbe889f465","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:ae5423c4aba13063512fe879dda16f8dc69ab3cfae4efbc443c25dce44c0e0c1","observation_id":"e9969750-b238-48e4-961a-fcad8e0e100b","resolution":{"observed_at":"2026-05-12T20:38:53.105752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transtrack: Multiple object tracking with transformer","venue":null,"work_id":"c9be5b75-6b88-4ad3-b351-34ee23b7ea41","year":2020},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:3146c83093a18b0dd5912af185286411e140d80e4082eb21e229cdb717762c39","observation_id":"17395460-5d6c-4747-b55d-064af3713f99","resolution":{"observed_at":"2026-05-12T20:38:53.110742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"8cbaa1ac-6f9a-404a-9ef1-63fdfc7f4856","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:e8e243437f552080bd843f66c4f3391fa11fb41941b8286ae526d426d607ae9a","observation_id":"b45f3cb9-7516-4fe3-aac1-6ce40087a5e9","resolution":{"observed_at":"2026-05-12T20:38:53.115543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"908440d0-9a2f-4a54-a942-a0e0ca9a2cbe","year":2017},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:04f0d192e0d685556576e3e7c9f2801db6dad5dab306f41822aaee511ea8c5f4","observation_id":"c3ead0d1-71f1-4339-b3a2-3cdc8d6b3ecc","resolution":{"observed_at":"2026-05-12T20:38:53.120249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":"6ee6b906-9c1c-45a5-9f67-5af12a0d76b4","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:c9ea16cebe57ae02fc285c2eaf4984d59f31eb0be3df89e30bcfa9d7bed38fea","observation_id":"aa5e9118-a95b-4469-a20c-b83af9bec80a","resolution":{"observed_at":"2026-05-12T20:38:53.124481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"e13c4564-0318-4527-bdca-da484d511f3d","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:97daa313f815c255136692b96586617ea5bb13b7bd9e7905f2689209375a9f70","observation_id":"dde8b18e-693e-40cc-98e4-61a47f7e9e7a","resolution":{"observed_at":"2026-05-12T20:38:53.129011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers","venue":null,"work_id":"fec0dd4b-d576-43fc-879a-b9f3f1d5c205","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:7176d2135c2b565b749b4876a7569474fd7830c1349c1a4a1e2281ee2165840d","observation_id":"0bb0ed68-6d5c-4b00-a194-c92cbfbee9e3","resolution":{"observed_at":"2026-05-12T20:38:53.133919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Difffit: Unlocking transferability of large diffusion models via simple parameter-efficient fine-tuning","venue":null,"work_id":"54b5631f-d4b3-46db-83f1-8462ad154170","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:b0312223e1d1dc57cc97068989a89f14ae14e3837016bf266962de393e58485c","observation_id":"7b887f22-33b2-4d38-9b44-365e2b6435b1","resolution":{"observed_at":"2026-05-12T20:38:53.138375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holistically-nested edge detection","venue":null,"work_id":"56a8229f-4458-45e8-986f-bfd9af45117a","year":2015},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:8836f55fa01aa875b9fdd1cd2b560a315c0abcf771e958a919d8a6a0adc0630a","observation_id":"dbe6d169-ae34-468b-8791-ce033c4b0d00","resolution":{"observed_at":"2026-05-12T20:38:53.142468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raphael: Text-to-image generation via large mixture of diffusion paths","venue":null,"work_id":"7da2812e-3060-400e-9e41-d8e184a302f7","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:a4ec9e79ba3d321524b2e1b0dbc5ffea6e5c1796f003bf9fdde9aecbc8e57460","observation_id":"fe50890b-0808-487b-87dc-f098c9e2a822","resolution":{"observed_at":"2026-05-12T20:38:53.146482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet","venue":null,"work_id":"f3f7ea04-b50a-41c5-8d9d-3f77117d86ed","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:be8d5b0b8b295fb052f4de16c29a12ba2ab57c92eb17ac5843ba7e2b5d4363d0","observation_id":"55b9cb73-5551-4cbf-a060-5388b0c7b6b9","resolution":{"observed_at":"2026-05-12T20:38:53.151062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"cac4468c-8b91-4f79-8584-8ab2df5caf36","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:f8924c7eaed7e6a0792d17af421dcd79a0643d71ab437ec9b1cd34927dd0c8d6","observation_id":"a8fb24cd-5476-4256-9593-f2c316a25903","resolution":{"observed_at":"2026-05-12T20:38:53.155768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point transformer","venue":null,"work_id":"7822c9ea-d404-4051-832e-73e13702785f","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:1ae3faff9517cf58afdc63477e24a2865e5f8e23c9808067f28970daf527b714","observation_id":"b833bcf7-b666-4986-b095-0c58d979284c","resolution":{"observed_at":"2026-05-12T20:38:53.159042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast training of diffusion models with masked transformers","venue":null,"work_id":"aa234085-4582-4b6e-992a-f888603664b6","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:996dd7ee2b412226acbcd7d68cd000c3ec5a5483102101a4eebe53ddcdbb6dcf","observation_id":"ac116d0c-237d-4a57-825e-d1cb999cf6c3","resolution":{"observed_at":"2026-05-12T20:38:53.162726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers","venue":null,"work_id":"105819be-6133-47e7-9b02-1da5230f585c","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:dbaa9f30842f4e42680553a2b94d5533e8aabbebc2d9a704e1f761e39eebf479","observation_id":"b59868bc-86ac-4937-84ce-8fd861a45ce7","resolution":{"observed_at":"2026-05-12T20:38:53.166019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepvit: Towards deeper vision transformer","venue":null,"work_id":"c84f4f31-8ed1-46e5-aafc-31e443d34549","year":2021},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:5734464483f8cb54246222d138ec1462db3f1997856a272761d92e5a0af90873","observation_id":"1544443a-3a85-43c1-867c-b52d72bbecbf","resolution":{"observed_at":"2026-05-12T20:38:53.169658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the robustness in vision transformers","venue":null,"work_id":"459bcdc9-125e-4d8d-8fee-f50f92e7379d","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:bc54198b1f7a2c256adc640d0c8951858d79c36b1418444003a3a60e51a65a5f","observation_id":"44ccec44-960b-42ad-8721-3580e84596d8","resolution":{"observed_at":"2026-05-12T20:38:53.173876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Getting Immediate Speedups with A100 and TF32","venue":null,"work_id":"1ed9aba4-49e7-4330-9399-6bffbcdbf7ff","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:14ec6d1ee04bdc88bf9290d52e33e2856d1e5f9b34644359d610b3dead66a08e","observation_id":"45cc76d6-7349-45c4-8441-ba09e381f503","resolution":{"observed_at":"2026-05-12T20:38:53.177666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPU selling","venue":null,"work_id":"c83143ba-b261-4278-93ad-2fba243254ee","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:bd86a96ec1f11a3b6affc46e6c5b9300f540d3f105e47da9ff5a59841cd3969e","observation_id":"ded67b08-6810-4879-a348-114ef46c49c9","resolution":{"observed_at":"2026-05-12T20:38:53.181133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6c3cb475-07b2-4d82-ac58-02c66f507605","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:4a2f2455f9f03611daa65805c6a833b57d912fc53506622fc92c770fcd511e15","observation_id":"6b4265d8-f58d-4f82-b637-9d55eeedbe7f","resolution":{"observed_at":"2026-05-12T20:38:53.184598Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Midjourney","venue":null,"work_id":"2e9f4301-c94f-43c5-bafd-5d475bd5868f","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:9a41812311795d8b8338be499ec27c5b60f255ceb383d4c8472d14c634f34686","observation_id":"12fa10bf-f31b-45c0-a66f-a909f5747427","resolution":{"observed_at":"2026-05-12T20:38:53.187945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepFloyd","venue":null,"work_id":"df165c98-74e2-4b29-9e5d-1ab161f51204","year":2023},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:e9a39deb2aee9323ecfac298d5928d2a7f969cd214d3305508ef65924a97c5f2","observation_id":"2217c9ee-a642-4da8-bd81-6cd01872e26a","resolution":{"observed_at":"2026-05-12T20:38:53.192344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"e09cbd22-ced4-437d-be7e-46e2c15e1da2","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:a5834ecc2b97b3fe571cb4d8bf3a697c4edd4c0720073e8837cc8d27db7bd900","observation_id":"f1e8b88c-24bf-4fbb-b757-f2fe19732f41","resolution":{"observed_at":"2026-05-12T20:38:53.196590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11565","last_updated":"2023-03-17T17:28:04Z","snapshot_observed_at":"2026-08-06T21:10:44.877323Z","submitted_at":"2022-12-22T09:43:36Z","title":"Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2212.11565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.11565","snapshot_observed_at":"2026-07-02T12:16:56.715496Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"71927ab4-2a47-4921-8939-c0fe6715790b","year":2022},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"cited_paper":"/paper/2212.11565","citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:54922db1f6556b2ab940e8f6dea5b13862fe25c9fbe68d18f2b70544e4e38cc5","observation_id":"f8d86f92-1bef-444b-acd0-7f7ea73c1cc6","resolution":{"observed_at":"2026-05-12T20:38:52.844051Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Mildenhall, Ben , title =","venue":null,"work_id":"147132ab-c295-4fe8-b01e-a922a9751884","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:1ad8c9416ae06dd645afabd0668190808049518c06d47424242c3bc5ed683b99","observation_id":"c6d4044d-3078-4bd4-8251-ee782333d3a4","resolution":{"observed_at":"2026-05-12T20:38:53.200726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7f10425f-691a-4a3f-a36e-866cf77ed18f","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:a6349cad7052f074687084604ea7e7cdcd6641205000fc44f7cb2451e544d22a","observation_id":"0eca0f7c-4288-4848-8b5e-c6a9591b578e","resolution":{"observed_at":"2026-05-12T20:38:53.204892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:10.038710Z","title":null,"venue":null,"work_id":"b4894d61-39c6-485e-961a-1ff90a35f8b6","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:c4115c9447eaf53ad5e2f0f74986e202dcd495c60d9a76c2d70dd10cadf4dfb7","observation_id":"8a874d4d-7757-4732-8fa1-9c7d51ce9807","resolution":{"observed_at":"2026-05-12T20:38:53.209128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:10.023698Z","title":null,"venue":null,"work_id":"4f8e6ef5-c869-4da4-a9c8-c7e492a8b312","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:99e044edab0d4029159933e0c3f019a7e027c0a79dda584453d5fe2d0a776f32","observation_id":"44093391-dc26-4187-9d2c-dbd0894d178f","resolution":{"observed_at":"2026-05-12T20:38:53.213891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:09.975453Z","title":null,"venue":null,"work_id":"a78a341c-406b-438d-8d99-2b9e45ebc410","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:8bec69b9319bd6d3186def969d59a418753f98dada5edb0c9f7757c777ca4abc","observation_id":"e73efa12-db91-4cae-874f-3b1299dcd81c","resolution":{"observed_at":"2026-05-12T20:38:53.218252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:22:51.631228Z","title":null,"venue":null,"work_id":"0252e629-d722-48b9-9aca-3f913056cd6a","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:98a991ad9cf460930cfa1f12c46a057b0419610a97460386395483a182db38c8","observation_id":"119a0b33-1325-44cb-aa32-1ed8990e0ce1","resolution":{"observed_at":"2026-05-12T20:38:53.222518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0cdb2e7-3bb6-46e8-b9c2-c65c376defbd","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:2a5cea16d6ff2c10bcad7dd9bb57a4df25dc4cb3af7b87f11e952654f06ea2f2","observation_id":"adace538-8300-4f94-96af-5baaa2751edd","resolution":{"observed_at":"2026-05-12T20:38:53.226834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"01469d7d-9e5d-414d-821c-1e35f5ead5d5","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:0a13290dc19aa793db65eaaeba5210fce408f74b19dd0a44da6971e6b715e9ef","observation_id":"3e8ac78e-dc80-4ccc-8efd-718e6b5f3647","resolution":{"observed_at":"2026-05-12T20:38:53.230902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ac83d7d5-5330-4414-8ced-ec4b6f19d259","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:a1f0cf99eeb3fd5f169a20952ab155eae7a636e7bd88e6d70a810af1b1ee0b07","observation_id":"7af18003-f0a6-43fb-a915-bd5ea37d40d7","resolution":{"observed_at":"2026-05-12T20:38:53.234528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"61918db8-4781-422e-a8ec-3477b305958c","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:934556a372ac8ae79bff1d7f68cd1bcab40cd7d9da48818583bb72790fef3c7f","observation_id":"ed1bcea6-6aac-4d4d-b699-9bc052034a2b","resolution":{"observed_at":"2026-05-12T20:38:53.238557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"84998fa4-5710-45ca-84ee-ed714706cdd8","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:fcfe457c13aa746a5d3f1951e0c63cd87ac668424b193a1b19ed2b90a1862f2d","observation_id":"86545a1c-86aa-4c57-bbac-e1b7618a8d82","resolution":{"observed_at":"2026-05-12T20:38:53.242035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08234980-37dd-48de-93de-8936cc7f3f71","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:830b1a6585dd7dc1b432875fd84196ce9427e0c743c0234bebe08f01cba9d2f2","observation_id":"138cc53a-1ef0-4509-ae11-7b1efcaf67d3","resolution":{"observed_at":"2026-05-12T20:38:53.245791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JMLR , year=","venue":null,"work_id":"1752b1ff-e638-4c28-8366-d896a8f81e6e","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:beeb93aee95feab46ee37aa7385fbdd3d8cbc34bd4190210af4e7df556f8568f","observation_id":"2361e3ba-824d-4a0d-bb21-cabd53a877aa","resolution":{"observed_at":"2026-05-12T20:38:53.249489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f2264e0d-ba35-4bfc-9460-07e565ff05e5","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:05491227fc79b2e9d0aacd41e14850fe9ccb59016d513e1c693d43c21b470c13","observation_id":"968f8d49-fd3c-4034-8b96-0858b9ec6883","resolution":{"observed_at":"2026-05-12T20:38:53.254142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cde0c291-9ce1-41f8-9d62-ca4b9a2b23d0","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:87492669461f980687de656046ceb4f1481bd77ce88f586aa40dfae828368e77","observation_id":"522db86a-33e9-4dec-8afd-5fca1fcbac7e","resolution":{"observed_at":"2026-05-12T20:38:53.258097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"933999ab-9af4-4e73-b895-c15124894e44","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:bcc76d45f3ad1b74068417c17f1e26b346b49fac6e1217237c6775681d57e91d","observation_id":"acd22407-dcf0-48bf-8b95-20fed76b07c1","resolution":{"observed_at":"2026-05-12T20:38:53.262593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8db40748-6f8d-45ac-859e-525b5b312f83","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:758f4aee110cae4b34a1ce6edf418b15bdeebb5d34578ac27ea494746d0f6e72","observation_id":"9b4242ab-c932-42d0-8f7d-327422e68db9","resolution":{"observed_at":"2026-05-12T20:38:53.266244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a60ffbc-fdd2-40f9-8bef-8824bed0f4a0","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:69576ecdb08473d5372a5dd7efb815c2e36086c74f64db2d7fd50cdbc95be601","observation_id":"4096d68c-2def-4c51-aa35-e935e4884a85","resolution":{"observed_at":"2026-05-12T20:38:53.269957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:09.912507Z","title":null,"venue":null,"work_id":"c9763656-e7e2-4997-bbf0-b66b1bf27374","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:2000e3087efa30ebe23bec04bc85ca20efd09864814b428ac973dc2757e79c7f","observation_id":"5c7cfc55-0d00-412e-be9c-d278f073b48d","resolution":{"observed_at":"2026-05-12T20:38:53.274011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07d9d631-c941-4074-8dc9-ab0f656f2615","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:2e6961a47ef58341da0e137de96d2845043a37ca0da3440d573a0ed4acf4a007","observation_id":"1847acaf-eacd-483d-ace6-ae0f0b787f08","resolution":{"observed_at":"2026-05-12T20:38:53.279212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"207d0dbb-e0f7-4389-bc9f-ac2a474bff50","year":null},"citing_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-12T20:38:52.749119Z"},"links":{"citing_paper":"/paper/2310.00426"},"observation_digest":"sha256:f7808167ba8f5df0b66877648e0b397034d8769f4ed2b2f9e69d6866b148fc14","observation_id":"7d290973-28dd-4774-9eb3-aecf88730d1d","resolution":{"observed_at":"2026-05-12T20:38:53.283558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":19,"verified_exact":0,"verified_fuzzy":79},"total_outbound_references":154},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 154 outbound references and 100 inbound Pith citation observations for arXiv:2310.00426."}