Pith. sign in

Paper Citation Record · LEDGER

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation

As of 6 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2602.06886.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2602.06886 v5

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T03:50:47.434926Z

measured 24 of 24 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

24 of 24 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved22
  • parse uncertain0
  • malformed identifier2
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 61207d22-6a08-47c7-beb3-4a670fc9c49a · outbound

This paper cites Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.140207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.140207Z digest=sha256:88eac16d0a35a38db0c9f042d3bddb1f6c74c06e1c358d3f88f79b254b9a1ff3

Observation 4af4b611-6ce8-4d49-a031-481ed163eca4 · outbound

This paper cites PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.241076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.241076Z digest=sha256:402335adf26b212657bd0e071720ce36d14c958be3852ed0094f42041b552333

Observation c465b187-478f-4047-b6f4-665b93268e0e · outbound

This paper cites BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.324738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.324738Z digest=sha256:e4a72d42969ace3e6f9fad61d5fc80027081b9f4d8823d5ac0a9c63a2521c4fc

Observation b30d7a25-386e-4117-8c44-0142af571fe1 · outbound

This paper cites Classifier-Free Diffusion Guidance.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Classifier-Free Diffusion Guidance

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.406955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.406955Z digest=sha256:a1bb0cd0a674a4b10c623aef580c79a6499b3fc0d1020bec858f8f8f02828641

Observation ef49485a-c6c6-4505-9ee1-985504817105 · outbound

This paper cites These Prompt Reinjection settings are chosen based on the best-performing combinations identified in our ablation stud- ies.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation These Prompt Reinjection settings are chosen based on the best-performing combinations identified in our ablation stud- ies

Reference 8

Resolution
malformed identifier
no resolver link, observed 2026-08-03T03:50:47.209248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:47.209248Z digest=sha256:87adfd517374b0626f392dce1391eaa267eaae6974cfaabe06d179b06b0b25c3

Observation 85d1aed7-3d63-4c12-ab53-ed1e5f83d174 · outbound

This paper cites Latte: Latent Diffusion Transformer for Video Generation.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Latte: Latent Diffusion Transformer for Video Generation

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.759009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.759009Z digest=sha256:cda50f921214e68c05b82e7a9249c3358761708da24ea6dc5106b4470373f8f7

Observation 07672c85-0219-44fc-a3f9-7d0b30e5acda · outbound

This paper cites GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.861332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.861332Z digest=sha256:621b4718d8e5b6ae82ec6a20ebae03064cc7e7823486fa8949751734de8888f4

Observation 87f96f3d-37df-4345-9ae2-056844db962b · outbound

This paper cites SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.972063Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.972063Z digest=sha256:da51f51f18d6033af9568ecc312b14a6db87566f674a3b7763602527948f41fb

Observation c6b843f2-2a15-4dfd-8971-32b736baa733 · outbound

This paper cites Denoising Diffusion Implicit Models.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Denoising Diffusion Implicit Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:46.127262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:46.127262Z digest=sha256:99ece2f48aaa7d9b22935033593be45c1b9f244bba5a4e00dae888dc5177a00e

Observation 0e0ecd26-3c0f-475a-bb09-b07fa5eecaf3 · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Wan: Open and Advanced Large-Scale Video Generative Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:46.244612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:46.244612Z digest=sha256:ab178ac95a215af586b9a164ac07cc99da5917f8da567a5495f9827062ffde7c

Observation cd2da8e1-e90b-4b6f-840d-04681d943322 · outbound

This paper cites FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image Editing.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image Editing

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:46.360371Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:46.360371Z digest=sha256:1a68cfc934daa43eeb0329b24b2647678e87257344ee747f33a10953f01933aa

Observation 802d2e37-b182-422b-9536-7d3ddfce2ecc · outbound

This paper cites Qwen-Image Technical Report.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Qwen-Image Technical Report

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:46.437884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:46.437884Z digest=sha256:3576832c954e4d6e403dfb713e91479e7e28e65f7242a3e8da77d41c17e0ee86

Observation 2267f655-40b9-413e-ba18-ddf0684089e0 · outbound

This paper cites Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:46.551257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:46.551257Z digest=sha256:7e46762191602a4734b1dd26cddce239b693a19440b012819ea4095bea7123b5

Observation e7cd895d-04b1-4852-872d-2dfdbcc19770 · outbound

This paper cites SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:46.708056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:46.708056Z digest=sha256:363a6dc723fd21847c1a14fd3ab98162f5ad6007708bf6b7e3ae4f001af2bbe5

Observation 4b0d842f-3bb5-43bd-b628-7734f017fe59 · outbound

This paper cites Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:46.874348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:46.874348Z digest=sha256:f9382d1f204a57822aa06e4ceccec1509aadaf6c634d28cd602c846cb93ee8d7

Observation 44f08017-9a0e-4aa1-964f-852df110be70 · outbound

This paper cites Fast Training of Diffusion Models with Masked Transformers.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Fast Training of Diffusion Models with Masked Transformers

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:47.050868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:47.050868Z digest=sha256:1be34c4ebad5d91562ed94660413aef908bd91d56769f3598ef14ef6abc7b1e4

Observation a137796f-de77-420b-af96-6cc3b956bcf9 · outbound

This paper cites an unresolved cited work.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:47.319081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:47.319081Z digest=sha256:caabd0e17fc752b4a9f172cf4378706554f62605a09691e449226e8098a0d383

Observation 4e2bc90d-6625-489e-9e76-e6b09a446371 · outbound

This paper cites Unlike our training-free Prompt Reinjec- tion, TACA requires LoRA fine-tuning of the model.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Unlike our training-free Prompt Reinjec- tion, TACA requires LoRA fine-tuning of the model

Reference 24

Resolution
malformed identifier
no resolver link, observed 2026-08-03T03:50:47.434926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:47.434926Z digest=sha256:b5b63dd5ebb644b537b5c15db8bd2eeb2bb27499ad000b896133b49dd71ca46b

Observation f7ca069d-3743-4e45-a8e3-3a0f96c54a5b · outbound

This paper cites We fix lori=1, Ltgt={l|l > lori}, and w=0.025, and vary the prompt set used to collect text-token pairs for computing the orthogonal mapping.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation We fix lori=1, Ltgt={l|l > lori}, and w=0.025, and vary the prompt set used to collect text-token pairs for computing the orthogonal mapping

Reference 1024

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:47.131010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:47.131010Z digest=sha256:085fcd127faf216bd25c64e37b7a97e0ebb3f81fcd1efa7558f96ba71c3fd2bc

Observation b45ccc8f-b5a9-4358-8d0b-8fe2a88c3205 · outbound

This paper cites Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers

Reference 2014

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.713158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.713158Z digest=sha256:2640955e9e0f252c3c583848a4fc393219497d4bcd6a6e79b1434cbb41998c9d

Observation a793ebab-2c41-46d2-a3d3-1fa2b9f2d3b9 · outbound

This paper cites ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.491098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.491098Z digest=sha256:8faf5d1a3dd761b6dcaecfeb94de823273710d4d65884e96f5881764a249103f

Observation a82a82ae-cb7e-4cba-a558-1ec636851bbb · outbound

This paper cites Training Diffusion Models with Reinforcement Learning.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation Training Diffusion Models with Reinforcement Learning

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.046193Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.046193Z digest=sha256:89d9aa3b7af74acb479859b9023f297c80fdf16bf5f0267482cdf00f520944cf

Observation cb1ba7c0-5ec4-4cdc-8fbc-057a32fd6f27 · outbound

This paper cites TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.652959Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.652959Z digest=sha256:646cd7b3ebf9d68ec173bef868467e68de8722dc76ed94a10725ea6c9cc34d90

Observation b3615aaa-0fa3-47d1-9cf3-e65fd594d11c · outbound

This paper cites The Platonic Representation Hypothesis.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation The Platonic Representation Hypothesis

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.572290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.572290Z digest=sha256:d9238576e215dde985115e6752cdf1fa9736473a71fc641f1974544211318d72

Pith citing papers

No inbound Pith citation observations are available.