{"as_of":"2026-08-12T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:740f92fd9b4d1e28d3815d1639da27aa2804a7d5219a2e04d60b9a0bf7dd3e9d","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:11:00.639240Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:30:31.258053Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12391","snapshot_observed_at":"2026-08-03T20:30:31.258053Z","title":"Efficient scaling of diffusion transformers for text-to-image generation.arXiv preprint arXiv:2412.12391, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19778","last_updated":"2026-06-30T01:28:09Z","snapshot_observed_at":"2026-08-07T03:18:48.553937Z","submitted_at":"2025-11-24T23:10:15Z","title":"Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T20:30:31.258053Z"},"links":{"cited_paper":"/paper/2412.12391","citing_paper":"/paper/2511.19778"},"observation_digest":"sha256:428f8254842543bf4298fa4c18f06e4e4faa9bde74244f8f339945a85e498195","observation_id":"e89e2380-e22a-43ab-8d62-db81ad126e7e","resolution":{"observed_at":"2026-08-03T20:30:31.258053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12391","snapshot_observed_at":"2026-08-01T10:59:49.288561Z","title":"Efficient scaling of diffusion transformers for text-to-image generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20048","last_updated":"2026-07-22T11:42:42Z","snapshot_observed_at":"2026-08-05T09:15:47.648858Z","submitted_at":"2026-07-22T11:42:42Z","title":"Importance-Aware OBS Pruning for Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:59:49.288561Z"},"links":{"cited_paper":"/paper/2412.12391","citing_paper":"/paper/2607.20048"},"observation_digest":"sha256:f4d3856e4143fa7894e2b56fd40189910e017e3661b1a5f11c549c7087cd7090","observation_id":"52761174-4d24-43fc-a1f9-7293d6313353","resolution":{"observed_at":"2026-08-01T10:59:49.288561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12391/citation-record","integrity":"/paper/2412.12391/integrity","json":"/paper/2412.12391/citation-record.json","paper":"/paper/2412.12391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:01.001218Z","title":"[Online; accessed 4-March-2024]","venue":null,"work_id":"fc0f4bfa-3dee-480b-a51f-c2e8d3418d40","year":2024},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.535053Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:fea4e269db1dba17c9f74ee3f8083b57b03467bc1ca581900b79bff40ff0e776","observation_id":"6eb7e9bf-7027-4ae4-9872-dd1ec108ed8a","resolution":{"observed_at":"2026-08-11T14:11:01.006837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-11T14:11:00.540025Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.540025Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:fcad4b5364683e5f3b20adf5439ce3cf9ee4b066123ac100f7b268cac55c2d3b","observation_id":"65abf0c2-4b3b-4339-b2be-ae7f0ca877a8","resolution":{"observed_at":"2026-08-11T14:11:00.540025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T14:11:00.556269Z","title":"URL https://doi.org/10.5281/zenodo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.556269Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:a202059efffe6ea53f1a25a9d566ef41f4073feca3c1241c74418fcf57c91675","observation_id":"bb0157df-e0aa-498e-9542-d9fb1d151351","resolution":{"observed_at":"2026-08-11T14:11:00.556269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T14:11:00.561565Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.561565Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:09856b0854e5a864290d36671c84336cbe918418e1e1bacf2f17bd4661f404e5","observation_id":"df311dd2-2ef2-449c-9626-236fec9ce460","resolution":{"observed_at":"2026-08-11T14:11:00.561565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-11T14:11:00.567171Z","title":"Manmatha, Ashwin Swaminathan, Zhuowen Tu, Stefano Ermon, and Stefano Soatto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.567171Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:66bddf1de691427418c1203dec81a077927e2ddb2e5f10c55bb6e7b4a512a05e","observation_id":"cb023b8d-cfb7-4994-8ec8-83b8fd4eff4d","resolution":{"observed_at":"2026-08-11T14:11:00.567171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T14:11:00.572731Z","title":"Sdxl: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.572731Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:62f2e284af3eaef037f09fd9ed0812defb74de1d4c8031b15feb2a0f740cab16","observation_id":"3028d1b1-2011-410d-8a7c-5f5fa92057f3","resolution":{"observed_at":"2026-08-11T14:11:00.572731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T14:11:00.577563Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.577563Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:57080bd8adbc14e723c1ee34e6f18bf503f74128c7be773e2e9b00c208e6f2d7","observation_id":"09efea52-30c3-46c0-9fc2-2064026aefee","resolution":{"observed_at":"2026-08-11T14:11:00.577563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.983598Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"12a7ac14-4e1a-4de5-ac18-4d2263c647fc","year":2015},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.583441Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:5de13ecc100ccbac4a63e282b722a508de47e3ccba18a77f62b4a153857982ca","observation_id":"14bd2e94-787a-4f10-8185-6e0c67911dc0","resolution":{"observed_at":"2026-08-11T14:11:00.989413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-12T04:22:15.303374Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-11T14:11:00.598263Z","title":"wikipedia.org/w/index.php?title=Mean_squared_error&oldid=1207422018","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.598263Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:0a85bb9ff07a8882ec8dd3a19e0ee90c6bac01d86bc82e32bdedcb72a02c8656","observation_id":"7df0b84d-929d-409a-8743-63c36ea9c0a2","resolution":{"observed_at":"2026-08-11T14:11:00.598263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-11T00:30:13.593181Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-11T14:11:00.604152Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.604152Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:2cc3184aba3ea361d71374138dc5afc545fda806a90495c9d5e85dd9680832f3","observation_id":"710f86f6-d71a-4824-8142-9e6a882a290c","resolution":{"observed_at":"2026-08-11T14:11:00.604152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T14:11:00.609126Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.609126Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:48d25e5c4ee8bab6e2f9fb134e990b9964ddca52df1d19609899be230d60c794","observation_id":"df250891-c198-42ef-8cf7-c91b44fff2f3","resolution":{"observed_at":"2026-08-11T14:11:00.609126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-11T14:11:00.614058Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.614058Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:36e818e24dd81516d2fcdcc7a0a83a17d253e45fc2fe9cd2eaf856d0a60c5b22","observation_id":"3a17937c-00ab-4842-8bb1-8e8b85577898","resolution":{"observed_at":"2026-08-11T14:11:00.614058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-06T11:25:48.819238Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-11T14:11:00.618880Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.618880Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:e2ac6a94735b5249630691b7b249047166f01365cfcb3e08a25a6984208a8b5b","observation_id":"699907c1-0d15-4c46-a919-6f33a9bda6c4","resolution":{"observed_at":"2026-08-11T14:11:00.618880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.966968Z","title":"LensArt consists of 250 million image-text pairs, carefully selected from an initial pool of 1 billion noisy web image-text pairs","venue":null,"work_id":"99fb981b-cf73-4f4c-9731-9c17b98c7a17","year":2023},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.624731Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:9ed138f1cff1efd38a248df8db21e9da5c544d5b0149593b5a0d08442578f033","observation_id":"da66e0fe-1c08-4771-96c4-71e9a005ca97","resolution":{"observed_at":"2026-08-11T14:11:00.972905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.951156Z","title":"B.1 B ENCHMARKS We outline the evaluation benchmarks used to assess the performance of our image inpainting and canny edge conditioning models","venue":null,"work_id":"10103df1-f644-4443-9158-7e34bab053d2","year":2000},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.630046Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:89a57629790c1a59d1b3df6cbd7bcb46bb7d80fc15bd327b44e9f290af7a9c13","observation_id":"5ba47946-b5f7-4d59-a311-a52ff46defe1","resolution":{"observed_at":"2026-08-11T14:11:00.956046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.935042Z","title":null,"venue":null,"work_id":"be45e03f-a8ae-4eb5-b8b0-2102f78d2a34","year":2024},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.634831Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:2fad19c3ff31bd58ff7eacd43174f2cefd1a5d743f7f400f727efed35bb342b2","observation_id":"0b2474e7-bbe9-4e35-b4b1-4e433df4a3e6","resolution":{"observed_at":"2026-08-11T14:11:00.939986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:11:00.917019Z","title":"In addition to TIFA and ImageReward, we also provide the FID score, which measures the fidelity or similarity of the generated images to the groundtruth images","venue":null,"work_id":"1a7da54c-6b3b-48a6-b0ef-c57974070d26","year":2014},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.639240Z"},"links":{"citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:0af639c35acfe1e7206bbab9baaab3ac24dc31e525f6bfaef62bfdd08d2ac201","observation_id":"d2d2f455-3e5b-43d7-beaa-68fe9dad98db","resolution":{"observed_at":"2026-08-11T14:11:00.924216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T14:11:00.593507Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.593507Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:010c697ad2fa1a377cfaa8b62daaae36ea32290a692f954a9a9c7fd5656f6fbc","observation_id":"001bea12-8fd3-4ba3-bce3-ce49bc74b0c7","resolution":{"observed_at":"2026-08-11T14:11:00.593507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-08-11T04:49:14.950904Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-08-11T14:11:00.550971Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.550971Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:1b32eb08fba5fd00a2ee4d19e36dfd4cc0b75202f213ba65a21b3b554304ca1b","observation_id":"30cca4b0-6871-4574-a296-a74f49fb3437","resolution":{"observed_at":"2026-08-11T14:11:00.550971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T14:11:00.588431Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.588431Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:45bbf4f7e616b86b92554359d268d49e003c08a2bedf05f1808e2fb61149b549","observation_id":"99a30b2d-0b47-440f-911c-a8e9c81fdd8d","resolution":{"observed_at":"2026-08-11T14:11:00.588431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T14:11:00.545632Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.545632Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:f81b7b3c1feff69838a4c67fd1e0608fa12c4914dcf0c6790cc5b36f7c59bf26","observation_id":"e79e9040-d0fe-4f84-88b8-78fb9ef02d14","resolution":{"observed_at":"2026-08-11T14:11:00.545632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10972","last_updated":"2023-05-21T07:07:55Z","snapshot_observed_at":"2026-08-08T02:32:31.177380Z","submitted_at":"2023-01-26T07:37:22Z","title":"On the Importance of Noise Scheduling for Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10972","snapshot_observed_at":"2026-08-11T14:11:00.529321Z","title":"1 Junsong Chen, Chongjian Ge, Enze Xie, Yue Wu, Lewei Yao, Xiaozhe Ren, Zhongdao Wang, Ping Luo, Huchuan Lu, and Zhenguo Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:11:00.529321Z"},"links":{"cited_paper":"/paper/2301.10972","citing_paper":"/paper/2412.12391"},"observation_digest":"sha256:f143c6fba282c6f88fa4be51b6d47b7e00b98298ba0012802f64274135f1d5b2","observation_id":"d23cdeee-dccc-42e5-91c7-345a749c17a9","resolution":{"observed_at":"2026-08-11T14:11:00.529321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12391","last_updated":"2024-12-16T22:59:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T19:23:53.976388Z","submitted_at":"2024-12-16T22:59:26Z","title":"Efficient Scaling of Diffusion Transformers for Text-to-Image Generation"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 2 inbound Pith citation observations for arXiv:2412.12391."}