Pith. sign in

Paper Citation Record · LEDGER

Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2401.11708.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2401.11708 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 14 of 14 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 14 of 14 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T11:38:56.249658Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-29T13:23:28.257830Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 5f5cdb6a-875b-468f-8208-44001f9fbd15 · inbound

ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment cites this paper.

ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 58

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T19:43:03.480198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-11T19:43:03.310237Z digest=sha256:e5c101d1eec4c23a46eb21e460e001066ce70023db6a4a81d7a2c2c8d69dc40c

Observation d2c356f3-c195-426d-8230-ba8200344824 · inbound

Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding cites this paper.

Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-05-16T14:58:37.473771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-16T14:58:37.383749Z digest=sha256:dec47375399d5ac027a1f31dd5bc91bdd7ea2f458fb26e81df36bfb03ac71735

Observation d01e336e-499e-4ebe-9ab8-1faeee6f2db4 · inbound

Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models cites this paper.

Image Regeneration: Evaluating Text-to-Image Model via Generating Identical Image with Multimodal Large Language Models Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-12T20:41:19.290640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:41:19.290640Z digest=sha256:9cb3285eaad6ab2a53d5d5e0b599ce4da61256ea5bef9d72713d1f49444251f9

Observation c7a4ae6b-1162-475b-97a1-3215af1bbe90 · inbound

MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models cites this paper.

MoTrans: Customized Motion Transfer with Text-driven Video Diffusion Models Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-12T04:31:13.568607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:31:13.568607Z digest=sha256:de471977ade9d0b28431ca8f785b899bdab952ede3890760eb5176f2d38520cf

Observation d18b211b-9d12-46c5-9a1e-15169c08dc39 · inbound

GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration cites this paper.

GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-11T21:28:21.219961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:28:21.219961Z digest=sha256:4cd6cf0c80ac675ff34bc24731d93cf79dcdfa7b4f21df0ee8f383f0bc925b2a

Observation 2d42e04f-a0b0-41d2-adb3-fabe87a9bd6c · inbound

DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation cites this paper.

DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-16T11:38:56.249658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:38:56.249658Z digest=sha256:6fbe0ca7f8f3b766290518cc8df74eca4bb66902c9419cd3941018fc5a687662

Observation d2dc2bf1-886b-4bd2-a3e3-16813d97853e · inbound

Step1X-Edit: A Practical Framework for General Image Editing cites this paper.

Step1X-Edit: A Practical Framework for General Image Editing Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 62

Resolution
verified exact
arxiv_id, observed 2026-05-11T14:36:41.851013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-11T14:36:41.467429Z digest=sha256:f5c4d13229ef45890c57b8a9983cc21ef5379d7dfaa00921b2b8d2014a94e156

Observation b3b398bc-8821-45dd-bc29-fee3c6833b06 · inbound

Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion cites this paper.

Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T14:06:52.960237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:06:52.960237Z digest=sha256:97569affb2b5927d2d8006893a433ce53e36c11490da8cccdf7e72baccab12e1

Observation 71ba07ae-22b9-49a5-809f-62d0ccf92dca · inbound

Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization cites this paper.

Rhetorical Text-to-Image Generation via Two-layer Diffusion Policy Optimization Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-07T13:04:55.387035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T13:04:55.387035Z digest=sha256:69068aa4e5e98c740ab2b5aad7c1f85de177dae6a2ba133bffe31252d247fff5

Observation bc27c992-506a-44c4-8192-8bdb4f0a89db · inbound

Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers cites this paper.

Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T05:25:43.989620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:25:43.989620Z digest=sha256:aede0e4dc5e889ff9bfaae54b92f0fd32753d403e9420145e552a5c458543170

Observation ff379478-dc49-45a9-9c2d-0c34e5ca44a1 · inbound

Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models cites this paper.

Why Settle for Mid: A Probabilistic Viewpoint to Spatial Relationship Alignment in Text-to-image Models Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-06T21:48:56.923723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T21:48:56.923723Z digest=sha256:def8c5325f3c8a0d47ef985a5195f9d74d4d6e4a6115a97d6cd90a7dd385a89e

Observation 276680a2-f601-4dcf-bb86-2f6e84230380 · inbound

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization cites this paper.

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:23:28.259292Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-29T13:15:24.299457Z digest=sha256:41fef62b66db21a08963c8b516b8bf50c6ce782d41c6474ade4450e217faab77

Observation fc73f304-751b-4432-b8c0-7f4ee8713757 · inbound

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation cites this paper.

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 232

Resolution
unresolved
no resolver link, observed 2026-08-02T06:23:50.288678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T06:23:50.288678Z digest=sha256:c4e477c2c6a554c1bfcd81cea05f972a68fd401b0b387fed97e24b668908c1af

Observation 529408f0-8e0a-4e04-84c2-4757a6f8e4cd · inbound

TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward cites this paper.

TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-02T13:55:32.972530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T13:55:32.972530Z digest=sha256:02ad6ef73baac9d8a402f01223f683c4f938393b0598a3470d13f3a71f11a17d