Pith. sign in

Paper Citation Record · LEDGER

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation

As of 12 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 2 inbound Pith citation observations for arXiv:2412.12391.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.12391 v1

Coverage vector

measured 22 of 22 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T14:11:00.639240Z

measured 24 of 24 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T20:30:31.258053Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

22 of 22 outbound references displayed

  • verified exact0
  • verified fuzzy5
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6eb7e9bf-7027-4ae4-9872-dd1ec108ed8a · outbound

This paper cites [Online; accessed 4-March-2024].

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation [Online; accessed 4-March-2024]

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:11:01.006837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T14:11:00.535053Z digest=sha256:fea4e269db1dba17c9f74ee3f8083b57b03467bc1ca581900b79bff40ff0e776

Observation 65abf0c2-4b3b-4339-b2be-ae7f0ca877a8 · outbound

This paper cites Scaling Rectified Flow Transformers for High-Resolution Image Synthesis.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Scaling Rectified Flow Transformers for High-Resolution Image Synthesis

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.540025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.540025Z digest=sha256:fcad4b5364683e5f3b20adf5439ce3cf9ee4b066123ac100f7b268cac55c2d3b

Observation bb0157df-e0aa-498e-9542-d9fb1d151351 · outbound

This paper cites Mistral 7B.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Mistral 7B

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.556269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.556269Z digest=sha256:a202059efffe6ea53f1a25a9d566ef41f4073feca3c1241c74418fcf57c91675

Observation df311dd2-2ef2-449c-9626-236fec9ce460 · outbound

This paper cites Scaling Laws for Neural Language Models.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Scaling Laws for Neural Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.561565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.561565Z digest=sha256:09856b0854e5a864290d36671c84336cbe918418e1e1bacf2f17bd4661f404e5

Observation cb023b8d-cfb7-4994-8ec8-83b8fd4eff4d · outbound

This paper cites Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.567171Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.567171Z digest=sha256:66bddf1de691427418c1203dec81a077927e2ddb2e5f10c55bb6e7b4a512a05e

Observation 3028d1b1-2011-410d-8a7c-5f5fa92057f3 · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.572731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.572731Z digest=sha256:62f2e284af3eaef037f09fd9ed0812defb74de1d4c8031b15feb2a0f740cab16

Observation 09efea52-30c3-46c0-9fc2-2064026aefee · outbound

This paper cites Hierarchical Text-Conditional Image Generation with CLIP Latents.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Hierarchical Text-Conditional Image Generation with CLIP Latents

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.577563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.577563Z digest=sha256:57080bd8adbc14e723c1ee34e6f18bf503f74128c7be773e2e9b00c208e6f2d7

Observation 14bd2e94-787a-4f10-8185-6e0c67911dc0 · outbound

This paper cites U-net: Convolutional networks for biomedical image segmentation.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation U-net: Convolutional networks for biomedical image segmentation

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:11:00.989413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T14:11:00.583441Z digest=sha256:5de13ecc100ccbac4a63e282b722a508de47e3ccba18a77f62b4a153857982ca

Observation 7df0b84d-929d-409a-8743-63c36ea9c0a2 · outbound

This paper cites GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.598263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.598263Z digest=sha256:0a85bb9ff07a8882ec8dd3a19e0ee90c6bac01d86bc82e32bdedcb72a02c8656

Observation 710f86f6-d71a-4824-8142-9e6a882a290c · outbound

This paper cites Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.604152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.604152Z digest=sha256:2cc3184aba3ea361d71374138dc5afc545fda806a90495c9d5e85dd9680832f3

Observation df250891-c198-42ef-8cf7-c91b44fff2f3 · outbound

This paper cites IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.609126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.609126Z digest=sha256:48d25e5c4ee8bab6e2f9fb134e990b9964ddca52df1d19609899be230d60c794

Observation 3a17937c-00ab-4842-8bb1-8e8b85577898 · outbound

This paper cites PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.614058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.614058Z digest=sha256:36e818e24dd81516d2fcdcc7a0a83a17d253e45fc2fe9cd2eaf856d0a60c5b22

Observation 699907c1-0d15-4c46-a919-6f33a9bda6c4 · outbound

This paper cites Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.618880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.618880Z digest=sha256:e2ac6a94735b5249630691b7b249047166f01365cfcb3e08a25a6984208a8b5b

Observation da66e0fe-1c08-4771-96c4-71e9a005ca97 · outbound

This paper cites LensArt consists of 250 million image-text pairs, carefully selected from an initial pool of 1 billion noisy web image-text pairs.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation LensArt consists of 250 million image-text pairs, carefully selected from an initial pool of 1 billion noisy web image-text pairs

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:11:00.972905Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T14:11:00.624731Z digest=sha256:9ed138f1cff1efd38a248df8db21e9da5c544d5b0149593b5a0d08442578f033

Observation 5ba47946-b5f7-4d59-a311-a52ff46defe1 · outbound

This paper cites B.1 B ENCHMARKS We outline the evaluation benchmarks used to assess the performance of our image inpainting and canny edge conditioning models.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation B.1 B ENCHMARKS We outline the evaluation benchmarks used to assess the performance of our image inpainting and canny edge conditioning models

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:11:00.956046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T14:11:00.630046Z digest=sha256:89a57629790c1a59d1b3df6cbd7bcb46bb7d80fc15bd327b44e9f290af7a9c13

Observation 0b2474e7-bbe9-4e35-b4b1-4e433df4a3e6 · outbound

This paper cites an unresolved cited work.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:11:00.939986Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T14:11:00.634831Z digest=sha256:2fad19c3ff31bd58ff7eacd43174f2cefd1a5d743f7f400f727efed35bb342b2

Observation d2d2f455-3e5b-43d7-beaa-68fe9dad98db · outbound

This paper cites In addition to TIFA and ImageReward, we also provide the FID score, which measures the fidelity or similarity of the generated images to the groundtruth images.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation In addition to TIFA and ImageReward, we also provide the FID score, which measures the fidelity or similarity of the generated images to the groundtruth images

Reference 2014

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:11:00.924216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T14:11:00.639240Z digest=sha256:0af639c35acfe1e7206bbab9baaab3ac24dc31e525f6bfaef62bfdd08d2ac201

Observation 001bea12-8fd3-4ba3-bce3-ce49bc74b0c7 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation LLaMA: Open and Efficient Foundation Language Models

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.593507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.593507Z digest=sha256:010c697ad2fa1a377cfaa8b62daaae36ea32290a692f954a9a9c7fd5656f6fbc

Observation 30cca4b0-6871-4574-a296-a74f49fb3437 · outbound

This paper cites TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.550971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.550971Z digest=sha256:1b32eb08fba5fd00a2ee4d19e36dfd4cc0b75202f213ba65a21b3b554304ca1b

Observation 99a30b2d-0b47-440f-911c-a8e9c81fdd8d · outbound

This paper cites Denoising Diffusion Implicit Models.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation Denoising Diffusion Implicit Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.588431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.588431Z digest=sha256:45bbf4f7e616b86b92554359d268d49e003c08a2bedf05f1808e2fb61149b549

Observation e79e9040-d0fe-4f84-88b8-78fb9ef02d14 · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation LoRA: Low-Rank Adaptation of Large Language Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.545632Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.545632Z digest=sha256:f81b7b3c1feff69838a4c67fd1e0608fa12c4914dcf0c6790cc5b36f7c59bf26

Observation d23cdeee-dccc-42e5-91c7-345a749c17a9 · outbound

This paper cites On the Importance of Noise Scheduling for Diffusion Models.

Efficient Scaling of Diffusion Transformers for Text-to-Image Generation On the Importance of Noise Scheduling for Diffusion Models

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-11T14:11:00.529321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:11:00.529321Z digest=sha256:f143c6fba282c6f88fa4be51b6d47b7e00b98298ba0012802f64274135f1d5b2

Pith citing papers

Observation e89e2380-e22a-43ab-8d62-db81ad126e7e · inbound

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer cites this paper.

Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer Efficient Scaling of Diffusion Transformers for Text-to-Image Generation

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-03T20:30:31.258053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T20:30:31.258053Z digest=sha256:428f8254842543bf4298fa4c18f06e4e4faa9bde74244f8f339945a85e498195

Observation 52761174-4d24-43fc-a1f9-7293d6313353 · inbound

Importance-Aware OBS Pruning for Diffusion Models cites this paper.

Importance-Aware OBS Pruning for Diffusion Models Efficient Scaling of Diffusion Transformers for Text-to-Image Generation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-01T10:59:49.288561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:59:49.288561Z digest=sha256:f4d3856e4143fa7894e2b56fd40189910e017e3661b1a5f11c549c7087cd7090