Pith. sign in

Paper Citation Record · LEDGER

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 3 inbound Pith citation observations for arXiv:2601.02211.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2601.02211 v2

Coverage vector

measured 53 of 53 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T12:39:59.330475Z

measured 56 of 56 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T03:50:45.652959Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T16:07:08.965746Z

Reference resolution

53 of 53 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved53
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1acbafad-d7d0-44d0-86d2-01cf0551a5af · outbound

This paper cites Countgd: Multi-modal open-world counting.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Countgd: Multi-modal open-world counting

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:53.576640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:53.576640Z digest=sha256:8415f8ece7d5096e392f78e36c1731e414ae7f41396a05e00627d3346431410a

Observation bf5cfc98-badc-4486-a651-145405c13c89 · outbound

This paper cites Stable flow: Vital layers for training-free image editing.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Stable flow: Vital layers for training-free image editing

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:53.664753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:53.664753Z digest=sha256:1c1c5d41d7a0933bbbb4a66192ee12ba87230d162cdb220907e8b70cf9bdc255

Observation 31b10555-9829-4064-b7a9-667ffd37b0dc · outbound

This paper cites Qwen2.5-VL Technical Report.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Qwen2.5-VL Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:53.776475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:53.776475Z digest=sha256:1db8c2eb919d0f451cee27e728bb15a499b7fe6bbcb39940344eed4e75aad1ee

Observation df594be9-da2c-47fd-a711-fe65842fd27d · outbound

This paper cites Imagen 3.arXiv preprint arXiv:2408.07009, 2024.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Imagen 3.arXiv preprint arXiv:2408.07009, 2024

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:53.870600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:53.870600Z digest=sha256:7c5464e932ffcb96385e09cf915f213d96b45c77f5a427b0c4d78021d4526b17

Observation 98087cb2-d25d-4ef9-ad56-5da8a66a4665 · outbound

This paper cites All are worth words: A vit backbone for diffusion models.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers All are worth words: A vit backbone for diffusion models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:53.937224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:53.937224Z digest=sha256:70a92c7353a95ac7fa069a9ba3a2c2d63c49dbcb8f91e82e2baa9a3a6682121c

Observation 7bfe2fc2-c3c2-43ad-b2b6-7f7f16666086 · outbound

This paper cites Masactrl: Tuning-free mu- 9 tual self-attention control for consistent image synthesis and editing.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Masactrl: Tuning-free mu- 9 tual self-attention control for consistent image synthesis and editing

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.009761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.009761Z digest=sha256:6d3663d00083da9899a13ca06675fbf1b74becb76fb6c5c3276102df92cbdd74

Observation 6580c660-7bbc-4b7a-889b-42aecfbbba6c · outbound

This paper cites Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.104334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.104334Z digest=sha256:ad84907947bf1666c1cbc7479f1b840119ea023788e1bb1d01810d16f6c536ea

Observation 44e29ded-6dc0-494a-8a6b-16eb8fc7c0b7 · outbound

This paper cites Diffusion models beat gans on image synthesis.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Diffusion models beat gans on image synthesis

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.211751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.211751Z digest=sha256:feebe83a79d7ce9ab5746d24ace019ccee1559783bf7563a443455f261a1ce27

Observation 33bd5ffc-84ae-444b-ba8a-da1eb66851e3 · outbound

This paper cites Scaling recti- fied flow transformers for high-resolution image synthesis.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Scaling recti- fied flow transformers for high-resolution image synthesis

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.349697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.349697Z digest=sha256:f047a366ef3f3100772740cb12f459901dbd8b82e3d89dd41a824c6ec29e3689

Observation 4f04187f-5873-46e9-bf57-3e09f4fd306d · outbound

This paper cites Seedream 3.0 Technical Report.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Seedream 3.0 Technical Report

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.420041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.420041Z digest=sha256:95327370a93ae1c7fcaedacf9076fb64d400a416584d69ed682118ba725319f5

Observation e71270c5-7abd-41ac-bf7b-0de65280f75a · outbound

This paper cites Geneval: An object-focused framework for evaluating text- to-image alignment.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Geneval: An object-focused framework for evaluating text- to-image alignment

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.551791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.551791Z digest=sha256:5d4120a14f0ae89559b081f2d7de7873d2f8f0b97461c63d2c552e7a34b19ba4

Observation 01fc6551-66d3-4ebe-9067-d5a27f20c564 · outbound

This paper cites Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.656909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.656909Z digest=sha256:22157db2cc49083dddc894deee6e11923d0c3edf9be19fe3599f2770c28a647a

Observation 51d3f7af-ab58-4b1d-98af-23948b2d3f2a · outbound

This paper cites Prompt-to-Prompt Image Editing with Cross Attention Control.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Prompt-to-Prompt Image Editing with Cross Attention Control

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.760486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.760486Z digest=sha256:17b9dd22b8310ab1afbae7559a83b8623faea150eff1990b7fed446096fd3b2e

Observation 468c6688-74ad-47c3-af8b-39fbc9b9ad5d · outbound

This paper cites Classifier-Free Diffusion Guidance.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Classifier-Free Diffusion Guidance

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.832563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.832563Z digest=sha256:f5a470a7269c14b42b247296f558d991d10e831922bfca7a13691fb18bc5137a

Observation a499af7b-d295-4d50-81ef-5a13d4ca6916 · outbound

This paper cites Denoising dif- fusion probabilistic models.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Denoising dif- fusion probabilistic models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:54.921783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:54.921783Z digest=sha256:5774db8de6977d8749f24fcb9ea768cae76dfd1edda9e0da4c48b0e48cd1427d

Observation 0a0dc0d1-5a93-484d-8991-6d7cc8bba12d · outbound

This paper cites T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation.IEEE Transactions on Pattern Analysis and Ma- chine Intelligence, 2025.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation.IEEE Transactions on Pattern Analysis and Ma- chine Intelligence, 2025

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.017997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.017997Z digest=sha256:56815f1b3eee9e4d7df22e0b197d4eaa48ecc923734a24622aef848403e8a802

Observation 5bbaecdb-570c-4a02-add0-10e33e9d3224 · outbound

This paper cites an unresolved cited work.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.148813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.148813Z digest=sha256:8c9634830bbe9d9593680267ed4e859c720569e3b7b4a1f1d4477716dbeae6b1

Observation caba5c44-c215-4525-95ee-5dcf5f2a0fab · outbound

This paper cites Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.224838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.224838Z digest=sha256:942a4d76c316ec3e7e354987fae72cf546c888bf082f53d65605ba42d4a10379

Observation 7f75b3b1-1986-4cec-9437-b15d04ed03f3 · outbound

This paper cites Flow matching for generative modeling.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Flow matching for generative modeling

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.361101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.361101Z digest=sha256:8d03c900f3083518ba9489e4be172d85db3e705afbfe519839bc1738a4f31536

Observation ffe1fea6-b322-4bed-ac8f-36b493bc5c8a · outbound

This paper cites Towards understanding cross and self-attention in stable diffusion for text-guided image editing.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Towards understanding cross and self-attention in stable diffusion for text-guided image editing

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.507999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.507999Z digest=sha256:0677879dd20dae9e0801ec2a2f606e90b613990e888a5e1dba461c92498d3fcf

Observation 68dbbf78-7163-49de-b3a1-be990f2c9c61 · outbound

This paper cites Timestep embedding tells: It’s time to cache for video diffusion model.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Timestep embedding tells: It’s time to cache for video diffusion model

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.615413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.615413Z digest=sha256:68fecbc414e023eccaec88c1eaa2d5237c3ba0c3da5e67b49620a2dc9c5008fe

Observation ae64b6fb-a21a-42ba-8929-f53e8ee588b3 · outbound

This paper cites Flow straight and fast: Learning to generate and transfer data with rectified flow.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Flow straight and fast: Learning to generate and transfer data with rectified flow

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.737178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.737178Z digest=sha256:01a59895c50107f3d32b0ef467c3fbd1d8bb04275e0c28ddb529f57b887aed2b

Observation 67b54e65-822f-41bd-b9e3-5fe551ddcaf1 · outbound

This paper cites Dpm-solver: A fast ode solver for dif- fusion probabilistic model sampling in around 10 steps.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Dpm-solver: A fast ode solver for dif- fusion probabilistic model sampling in around 10 steps

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.804374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.804374Z digest=sha256:e77ed12d042bf50d0d63baec58acff75bc4acaef0d2b3322f4d6c018e402a606

Observation 22acf449-4dcb-4b89-883f-88e59253f854 · outbound

This paper cites Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:55.861674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:55.861674Z digest=sha256:c1851f0cd0cdb1586174c8959d7cce2f36ab78188409d2fb2924b2c7e1fd98f4

Observation fda6821e-32f3-49b4-b843-8c2684adee44 · outbound

This paper cites Re- thinking cross-modal interaction in multimodal diffusion transformers.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Re- thinking cross-modal interaction in multimodal diffusion transformers

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.002759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.002759Z digest=sha256:02d030f0df70f75d67808bfd40dedeca27b524d2fc1829b922ef3a63709679c3

Observation 3a9024af-1680-47c0-a149-3eed5e376324 · outbound

This paper cites Latte: Latent Diffusion Transformer for Video Generation.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Latte: Latent Diffusion Transformer for Video Generation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.101693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.101693Z digest=sha256:b43a48812ba2f2608c665b3749b283fef4e3f2f3c496286c605b168fe9995d5f

Observation 483dffff-0608-43d2-a226-17c1ff7f515d · outbound

This paper cites Video generation models as world simulators.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Video generation models as world simulators

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.203738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.203738Z digest=sha256:ce46909fd55a6ebe41f2adad7bbd062ad685269854bc2f3e3781e5ba4bbb4193

Observation 2dec7a44-6ec2-4a1d-b77c-73114fafccb8 · outbound

This paper cites DINOv2: Learning robust visual features without supervision.Transactions on Machine Learning Research,.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers DINOv2: Learning robust visual features without supervision.Transactions on Machine Learning Research,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.490511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.490511Z digest=sha256:8f599ae567ec6e35be07324168408628638583a739f16b26cc3d5f8af1992149

Observation 5bea0785-31fe-437c-a12a-8b60f53c56aa · outbound

This paper cites Scalable diffusion models with transformers.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Scalable diffusion models with transformers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.597819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.597819Z digest=sha256:28c9e13a8c245628b4bd0bcfce4ca7011b9bec5a65393cf986ff29d8ad3601fe

Observation c5dc1917-4917-4ec7-b264-26e79e43e1b1 · outbound

This paper cites Learn- ing transferable visual models from natural language super- vision.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Learn- ing transferable visual models from natural language super- vision

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.709259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.709259Z digest=sha256:1344c97a76af0a5f89d3b9357bf31c72abafcc73ecc264fe198251199c182cb7

Observation 35ecbd6d-7a7b-4e7e-b616-2615a0c751f6 · outbound

This paper cites High-resolution image synthesis with latent diffusion models.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers High-resolution image synthesis with latent diffusion models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.830069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.830069Z digest=sha256:e007f6fbbd13022997fea39aca4812900c294a7799224b168e5bd343c8281942

Observation 5db906c9-2034-453d-a023-bff27804ba38 · outbound

This paper cites Laion aesthetics.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Laion aesthetics

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.898012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.898012Z digest=sha256:b677a1ad139c224e7b8e471370b1e6c1bedb2741ca0d335196d36804073cdee6

Observation 35cbfcbb-ebb8-4de8-838b-d35e04709cd8 · outbound

This paper cites Exploring multimodal diffusion transform- ers for enhanced prompt-based image editing.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Exploring multimodal diffusion transform- ers for enhanced prompt-based image editing

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.996285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.996285Z digest=sha256:2bcece0ea2ad0866b5d9be74f97758661fe57648cbd5aafb2f2fc7314351f0dc

Observation e910398a-4711-4bfa-8d54-ab7d05014a3f · outbound

This paper cites Freeu: Free lunch in diffusion u-net.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Freeu: Free lunch in diffusion u-net

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:57.119450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:57.119450Z digest=sha256:15300bbad489a93b68ce7c4c531042bd42605442578880d33354caf5b5cc5ff3

Observation f3d00d7b-43cd-4cb2-a8e6-dc8689b4765d · outbound

This paper cites Denois- ing diffusion implicit models.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Denois- ing diffusion implicit models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:57.285486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:57.285486Z digest=sha256:b8c88dd6983250d0c3d5ba7c5f0cc2ebc27230b77dddf47682561dc9feffa761

Observation 783579df-e02e-4bd6-b34f-61d11f1f1327 · outbound

This paper cites Consistency models.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Consistency models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:57.392976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:57.392976Z digest=sha256:3a96a86f491f3676a5053f0e4a32cf9c6e91c78fb4e4215397805c69eacff638

Observation a739707a-5e72-4285-ba41-2ab6605fd67d · outbound

This paper cites Stable diffusion 3.5.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Stable diffusion 3.5

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:57.487487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:57.487487Z digest=sha256:f20b908824dfa967e86479a099d39b9d322bf6ee1f57b4e625f9c20c731bfe2d

Observation 7c0f15bf-3ead-45b1-93ab-7f44e558ac02 · outbound

This paper cites OminiControl: Minimal and Universal Control for Diffusion Transformer.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers OminiControl: Minimal and Universal Control for Diffusion Transformer

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:57.635461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:57.635461Z digest=sha256:9788efcfbdd6e5ee0d3ec29d7cb88e0999591b5daef79a4efb76f52a28750ebe

Observation 4ca6bce0-b200-4195-bbd4-9f705fe5b897 · outbound

This paper cites Hunyuanvideo: A sys- tematic framework for large video generative models, 2024.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Hunyuanvideo: A sys- tematic framework for large video generative models, 2024

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:57.785330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:57.785330Z digest=sha256:ec7e457d0e15543db710477eba707e119396687bc85ebed2cc08e35fb2b6b67d

Observation 3b53c935-42b2-4c9f-b0a7-62b56133ecce · outbound

This paper cites Hunyuanimage-2.1: An efficient diffusion model for high-resolution (2k) text-to- image generation, 2025.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Hunyuanimage-2.1: An efficient diffusion model for high-resolution (2k) text-to- image generation, 2025

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:57.942452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:57.942452Z digest=sha256:460d1e9d54f51ae1a55ee31d3d797a0a7e20fffad1e1101dd54b4f2b7b86d294

Observation 1a9a88b3-9352-4759-abb6-930e227ffce2 · outbound

This paper cites Attention is all you need.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Attention is all you need

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:58.052690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:58.052690Z digest=sha256:c4fe547eed81f1eb138a606f7bbd3d62d96578281d2382d4d5ffa55700945a3a

Observation 59737f79-45ed-430c-9b0d-ad8aff6542b3 · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Wan: Open and Advanced Large-Scale Video Generative Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:58.179263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:58.179263Z digest=sha256:474328a6e6e00832d289e1ed915f166c37280e81835d54381fd298efab43e0c4

Observation 1572279b-ff26-4a4b-bb28-7bf03d1c2f24 · outbound

This paper cites Freeflux: Understanding and exploiting layer-specific roles in rope-based mmdit for versatile image editing.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Freeflux: Understanding and exploiting layer-specific roles in rope-based mmdit for versatile image editing

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:58.294053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:58.294053Z digest=sha256:99d0f83a177a151dad88f1bd57a818340a96ae4e4976d964345b2cb7810cc7ec

Observation 6415ef91-6f46-4a58-8c9d-2f011aab16a1 · outbound

This paper cites A uni- fied framework for u-net design and analysis.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers A uni- fied framework for u-net design and analysis

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:58.397490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:58.397490Z digest=sha256:403c91ef05ccfde04f8b6f6e1a49c937955daa2e39b2ff47ad0c968207351ead

Observation 327a4d58-e3ec-4920-a17e-96b3642f4a71 · outbound

This paper cites Qwen-Image Technical Report.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Qwen-Image Technical Report

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:58.518630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:58.518630Z digest=sha256:6c11bb91900dc543eb10d9028a295a9788070c105711630554e553f6c90d6542

Observation 7ec50b5c-b186-465f-b332-d45cd87c0e70 · outbound

This paper cites Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:58.628033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:58.628033Z digest=sha256:a371e2537a52c62268f3b8d63b37508283dca637a232b548c702ba93160a8e6f

Observation 611b0c85-4da9-41a9-a245-4c4b37db281b · outbound

This paper cites Instanceassemble: Layout-aware image generation via in- stance assembling attention.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Instanceassemble: Layout-aware image generation via in- stance assembling attention

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:58.771778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:58.771778Z digest=sha256:85a96405783cf81d9e10b0efb75c49fc8151a19d572315b05d4187d5aad3562b

Observation b538b1eb-af94-4eb5-8a32-ede0895fb125 · outbound

This paper cites Imagereward: learning and evaluating human preferences for text-to-image generation.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Imagereward: learning and evaluating human preferences for text-to-image generation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:58.898539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:58.898539Z digest=sha256:b4d9bc71a76aaf848779b3a82263147166e461670e68dc5a385a8c6490dd06e6

Observation 24595342-8f84-46d5-ace6-aeb7b3aa6def · outbound

This paper cites Cogvideox: Text-to-video dif- fusion models with an expert transformer.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Cogvideox: Text-to-video dif- fusion models with an expert transformer

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:59.002790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:59.002790Z digest=sha256:da5617bb90c14a66010ed9295dbbe7eafd36e61c53fc2bbbc7677c375ab9ee36

Observation 994c3947-e3d5-48cd-8969-5104ca38c0ab · outbound

This paper cites Towards understanding the working mechanism of text-to-image dif- fusion model.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Towards understanding the working mechanism of text-to-image dif- fusion model

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:59.139622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:59.139622Z digest=sha256:944e5bfe391ead4aa81621032f09ffcf2430b3c087c041dd401e7bc618ce806b

Observation 8ee9f82a-8b81-4d8f-bb65-6fc7d147b935 · outbound

This paper cites Adding conditional control to text-to-image diffusion models.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Adding conditional control to text-to-image diffusion models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:59.218588Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:59.218588Z digest=sha256:177e638fdd15ef9ccb9fefe77a90caae1bd8ca4ac169cbd5f706eef5f4c0d32c

Observation ed1bbda6-819d-449a-bd41-43dab2455bd9 · outbound

This paper cites Exploring Position Encoding in Diffusion U-Net for Training-free High-resolution Image Generation.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Exploring Position Encoding in Diffusion U-Net for Training-free High-resolution Image Generation

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:59.330475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:59.330475Z digest=sha256:251b9a6b7cda064d906e6fb94c8e269753b33f82e05119ec64f962d8d505e73d

Observation fad3956d-e6d8-40d6-ba84-cac84187b02d · outbound

This paper cites an unresolved cited work.

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Unresolved cited work

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T12:39:56.330898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:39:56.330898Z digest=sha256:e2032fe44b09c1b8f122346558ddce0ae5e8c189cf97e2b4617ef6748a4ba509

Pith citing papers

Observation 6a617b15-aa7d-4b04-892d-0c90d7ab9c50 · inbound

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation cites this paper.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:11.480124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-21T13:00:22.875471Z digest=sha256:27ed3493cf20a7de9e45d64d38dea499a946d1b20885266265435c69b5aa8e29

Observation cb1ba7c0-5ec4-4cdc-8fbc-057a32fd6f27 · inbound

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation cites this paper.

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T03:50:45.652959Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:50:45.652959Z digest=sha256:646cd7b3ebf9d68ec173bef868467e68de8722dc76ed94a10725ea6c9cc34d90

Observation 7ed7b4e8-95a8-4511-bfe7-ef482499fa00 · inbound

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation cites this paper.

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:11.480124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-27T22:59:39.440344Z digest=sha256:33cfc4bf128b5ec83705982dc899b7dd1da3c55424d6da7f8c2dab46acec46a8