{"as_of":"2026-08-17T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c35de92b4e9aa3dfaacda9d0bfa8f4d9df7edd9826cdb56966938b3cfcfa569","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:21:22.544386Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T20:44:20.190064Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T20:52:37.899434Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"cited_work":{"arxiv_id":"2505.10046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10046","snapshot_observed_at":"2026-06-28T20:52:37.899434Z","title":"Exploring the deep fusion of large language models and diffusion transformers for text-to-image synthesis","venue":null,"work_id":"afa2aa8d-bb78-4c08-b329-04a3ece7b9a6","year":2025},"citing_paper":{"arxiv_id":"2604.25289","last_updated":"2026-04-28T06:53:57Z","snapshot_observed_at":"2026-08-11T01:55:05.851383Z","submitted_at":"2026-04-28T06:53:57Z","title":"Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T16:52:29.681159Z"},"links":{"cited_paper":"/paper/2505.10046","citing_paper":"/paper/2604.25289"},"observation_digest":"sha256:2f53c474bcbe2da4b3163531e0279833fa1656621cb1b9c48bcb23445e3f287f","observation_id":"20536b70-f7f7-486f-aba4-ca14b5b728e9","resolution":{"observed_at":"2026-05-11T23:31:15.483764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"cited_work":{"arxiv_id":"2505.10046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10046","snapshot_observed_at":"2026-06-28T20:52:37.899434Z","title":"Exploring the deep fusion of large language models and diffusion transformers for text-to-image synthesis","venue":null,"work_id":"afa2aa8d-bb78-4c08-b329-04a3ece7b9a6","year":2025},"citing_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-14T05:36:12.019199Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T20:44:20.190064Z"},"links":{"cited_paper":"/paper/2505.10046","citing_paper":"/paper/2605.31530"},"observation_digest":"sha256:d96f05bf49bf913d2cf3f3f86a97823c40bd05d49d4cdeeee22a957c2426a54f","observation_id":"1453aca1-62fc-4390-8b98-9d0544cdf4a0","resolution":{"observed_at":"2026-06-28T20:52:37.900963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10046/citation-record","integrity":"/paper/2505.10046/integrity","json":"/paper/2505.10046/citation-record.json","paper":"/paper/2505.10046"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:22.301918Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.301918Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:f61bf3cde0bc1a73e501a0b755a36070c63f54618bedc97499108bbb2e82fabf","observation_id":"84166abf-e733-4b08-8131-92ecb78713f0","resolution":{"observed_at":"2026-08-15T21:21:22.301918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.406786Z","title":"Improving image generation with bet- ter captions.https://cdn","venue":null,"work_id":"ed6a2246-f658-463a-a994-af1c7da8c36c","year":null},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.307045Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:17e3939374d659de219e102279cfddcdfb05a0c0a878daffb2d63ed338677574","observation_id":"38107a9c-d4ce-48ae-80e2-1ac0682d6741","resolution":{"observed_at":"2026-08-15T21:21:23.411407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-15T21:21:22.312956Z","title":"Paligemma: A versatile 3b vlm for trans- fer.arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.312956Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:d52f0b87f18dcd143e3860a53f83d1110a356b73a73a0cc6c3cd7211cd3f3ec8","observation_id":"099dd9c6-6957-48f1-8e80-d41b57328739","resolution":{"observed_at":"2026-08-15T21:21:22.312956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.390925Z","title":"Conceptual 12M: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"70d95644-a136-464e-826f-6eaae02de93e","year":null},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.317960Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:f2b4483424379a8087c5c3ece3fd9852f29f8fa16b8191a570ba1d20b34005f9","observation_id":"6924cf41-b96d-4d04-b941-de9e9bf73817","resolution":{"observed_at":"2026-08-15T21:21:23.395722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:22.322726Z","title":"Pixart-σ: Weak-to-strong training of diffu- sion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.322726Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:1145852a588df4c4399f2548ce3a4da1148b7b5b31f94517bb188ba6415ac9e9","observation_id":"1d980851-702e-4225-8b0b-a89b2b9e4e75","resolution":{"observed_at":"2026-08-15T21:21:22.322726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:22.327511Z","title":"Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.327511Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:922b047eb857bc6786e20b5b1b53b5fe89364df414da414fa3f0e04c4968dc35","observation_id":"e5d32a4a-2b8f-4010-8297-357af72623d9","resolution":{"observed_at":"2026-08-15T21:21:22.327511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.354296Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":"8d62fa45-43b6-48ae-8dfa-418d60bc7371","year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.332279Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:1901c7a601c94a9a9135417aa97aeccdb69f2bbbe28713473dc8d646c0ed010a","observation_id":"7d1e53b3-7ec3-4164-a779-abcef857e1f3","resolution":{"observed_at":"2026-08-15T21:21:23.360640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:22.337102Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.337102Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:49d3ae41a632f35922914edeb7a6115d35faf230b8165d7ce82344347436e4a2","observation_id":"18600dbf-4d7b-4c32-9c3e-50e178a4a01c","resolution":{"observed_at":"2026-08-15T21:21:22.337102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.323121Z","title":"conceptual-captions-cc12m- llavanext.https://huggingface.co/datasets/ CaptionEmporium / conceptual - captions - cc12m-llavanext, 2024","venue":null,"work_id":"ae420c29-f015-4070-8cef-a96f2f5d6df0","year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.342342Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:0b1e536637f9c8c35f6363a80b6fdab6c213678101a0448d7e7b63f22afcd66b","observation_id":"ea9feaa5-d32c-4a32-97ab-86555854e8b1","resolution":{"observed_at":"2026-08-15T21:21:23.329413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.305485Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"a04df7f8-c062-4a48-a062-0a1fadcc1d8f","year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.347166Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:bfb873a7b0613a89597bebbd138b4d43ef1cf2996d24012283006a5009479fba","observation_id":"a2d01e66-b909-4997-8f7d-94bdd26dd061","resolution":{"observed_at":"2026-08-15T21:21:23.310435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-16T13:53:57.994391Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-15T21:21:22.351916Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers.arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.351916Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:4185878a8b142bfe1922e6ae944f2d3e6584f66186ce6b496519d921eb737c04","observation_id":"5d519a93-288e-437c-85e1-b0880a5f1302","resolution":{"observed_at":"2026-08-15T21:21:22.351916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-08-16T14:51:16.293174Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-15T21:21:22.357600Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment.arXiv:2310.11513, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.357600Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:3a8fe9743e064819ec5eca30d9186f1543e7ec5496d5c9c87df4830f43297e61","observation_id":"1c1b25db-b937-4edf-a7e1-d762c5b8e6bb","resolution":{"observed_at":"2026-08-15T21:21:22.357600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:21:22.362449Z","title":"The llama 3 herd of models.arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.362449Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:77735341eca67c378de26e9fa954dece5784834482832d1e53de1b1ceb959a95","observation_id":"87813c34-a662-4e5e-935a-201f7f17690f","resolution":{"observed_at":"2026-08-15T21:21:22.362449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.288760Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"a4feb026-29ad-443a-b9c9-c6b695b57fb2","year":2017},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.366760Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:3c6833b3f844459c7d8e8d34e9f9ec95ae7ed5a7e131a842b01e0ebe51bd0f08","observation_id":"9daa17b9-ba47-4df7-8437-507b94b4de11","resolution":{"observed_at":"2026-08-15T21:21:23.293896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-15T21:21:22.370956Z","title":"Ella: Equip diffusion models with llm for en- hanced semantic alignment.arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.370956Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:6404d0b86fb9f0cb434604361e515bf444b097085bb40c5a14212e4c3c00fea6","observation_id":"cba3a9ee-932d-4840-977a-abba7820078c","resolution":{"observed_at":"2026-08-15T21:21:22.370956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.271469Z","title":"Segment any- thing","venue":null,"work_id":"3ec71bab-bba9-4739-88f8-cdd68ea7ff51","year":2023},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.375713Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:6414e4313d9b724a6382d68ae422c440e37ac5d5c92feec3863390606fda38ef","observation_id":"e4628444-0840-4eb3-8b39-5cfed74b87b6","resolution":{"observed_at":"2026-08-15T21:21:23.276634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.254314Z","title":"Announcing black forest labs.https: / / blackforestlabs","venue":null,"work_id":"cac89cbc-f6df-4b0b-bfab-c9c62092ab30","year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.379767Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:9eb9e4e01a3e6d76e66afc95c6d388945fd5863e96fe67103c11c3cc21599f28","observation_id":"d5f0aabc-8081-4ed7-8bc5-be63e2764acb","resolution":{"observed_at":"2026-08-15T21:21:23.259190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-08-16T13:11:20.195602Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-15T21:21:22.384379Z","title":"Playground v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.384379Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:8fb304dfc22068df5d9f919d2fbc576ccdadaf91d4a77335290266d7f6c275f5","observation_id":"ed48c7a0-a327-49ce-ad36-75df7b37c629","resolution":{"observed_at":"2026-08-15T21:21:22.384379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-16T15:30:49.729694Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-08-15T21:21:22.389546Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.389546Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:18eeec115dcc5c3bc7aa68964a3786d68abcc2d39c2de8e82717de9f7142c6b6","observation_id":"9b08194e-ee6d-4bc4-b43b-b3e109e38284","resolution":{"observed_at":"2026-08-15T21:21:22.389546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-08-14T02:18:08.215462Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-08-15T21:21:22.394751Z","title":"Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models.arXiv:2411.04996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.394751Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:1dcd01e813d7fefa3447eff525c43d47f971fd94db3558f2742f98cb2eae73b7","observation_id":"0bef1506-ddd8-453f-ae31-edce49ed054c","resolution":{"observed_at":"2026-08-15T21:21:22.394751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-16T13:18:02.646429Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-15T21:21:22.400326Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.400326Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:a2329027576e47542a22f776c7d0d93c2c1a4a23f55304bdfe71b8899bd4db0c","observation_id":"d548729c-5054-4608-bfba-5b440b84d94b","resolution":{"observed_at":"2026-08-15T21:21:22.400326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00737","last_updated":"2024-08-27T08:33:31Z","snapshot_observed_at":"2026-08-16T13:38:22.914699Z","submitted_at":"2024-06-30T15:50:32Z","title":"LLM4GEN: Leveraging Semantic Representation of LLMs for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00737","snapshot_observed_at":"2026-08-15T21:21:22.405865Z","title":"Llm4gen: Leveraging semantic representation of llms for text-to-image generation.arXiv:2407.00737, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.405865Z"},"links":{"cited_paper":"/paper/2407.00737","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:2a011402bbfe247adc8f45f848ab2f05b716b7e1e8d8eac69abb1323552f410f","observation_id":"e9d11945-1a16-4623-beba-1900f437cd1b","resolution":{"observed_at":"2026-08-15T21:21:22.405865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-15T21:21:22.410575Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.410575Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:b262ce845b2383e1dca53da9b488bcb36d3f4d309f859f77539923ca36dbc640","observation_id":"9a13fcdd-d4c0-417e-abf1-64ce1ff25263","resolution":{"observed_at":"2026-08-15T21:21:22.410575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:22.415252Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.415252Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:629d64cd4ac7c89649687ea3df5acb8fe19b5c7d9f6b4b2d6a717e586f436940","observation_id":"67fc0407-e9f6-4173-a7b4-8f0d5506609f","resolution":{"observed_at":"2026-08-15T21:21:22.415252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11831","last_updated":"2024-12-05T04:06:09Z","snapshot_observed_at":"2026-08-16T13:42:07.744224Z","submitted_at":"2024-06-17T17:59:43Z","title":"Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11831","snapshot_observed_at":"2026-08-15T21:21:22.419884Z","title":"Exploring the role of large language models in prompt encoding for diffusion models.arXiv:2406.11831,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.419884Z"},"links":{"cited_paper":"/paper/2406.11831","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:d96e56d5c4c94aa379263ab505e9d26c5ba85b3f96e315e535127264c9866833","observation_id":"a07767c5-ac48-40b4-a783-d8c948b9a28e","resolution":{"observed_at":"2026-08-15T21:21:22.419884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-16T13:00:44.601845Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-15T21:21:22.425364Z","title":"Janusflow: Harmonizing autore- gression and rectified flow for unified multimodal under- standing and generation.arXiv:2411.07975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.425364Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:11768c43c3ffb48cbd480c03302850cc674573695577fd0623d0c83ff2389de7","observation_id":"a79a9207-d8ca-48fc-9664-19cfb0e9705f","resolution":{"observed_at":"2026-08-15T21:21:22.425364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-15T21:21:22.430243Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.430243Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:a308370d731998bcfe868b43ac7040ec10d85b083b2f08a0eeaf2f18441aead4","observation_id":"13c44ca0-43f1-49fb-a9ff-afb09bda4419","resolution":{"observed_at":"2026-08-15T21:21:22.430243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.226500Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":"c7c11dff-10e0-4bf6-acdd-c316460a96e0","year":null},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.434395Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:5c582e59e221509f1a15a0c91768f20d57cf84d10ba30c77ece32050a55fc3cf","observation_id":"74ab8f56-896d-436d-b5a8-245951ea52ae","resolution":{"observed_at":"2026-08-15T21:21:23.231608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.212092Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"135541a4-a64e-46e9-b05c-c6777eae8008","year":2023},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.438510Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:82564a27eb89a9a8f18525e58b3c4c596189303ceaf901c3d641d57d548b946e","observation_id":"12de4571-f47f-4484-a08e-f83f1b68a468","resolution":{"observed_at":"2026-08-15T21:21:23.216837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-15T21:21:22.442388Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.442388Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:c75d20d2c38a2900836ecfe15382aa8687d7ffcbecb2503670c511b7da04d319","observation_id":"41e8791c-670a-47a2-a30a-b81753ade952","resolution":{"observed_at":"2026-08-15T21:21:22.442388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.195622Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"8a729aab-49e6-4643-aaf0-a669f14f5542","year":2021},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.447075Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:0a230cd3b0d2976e5c08ff6b5a14c66195a4b8e3e062c40647076bfb06ada853","observation_id":"aaae57d3-25d5-4324-9ede-01b31b3f3f7f","resolution":{"observed_at":"2026-08-15T21:21:23.200891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.180512Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"ef3bd606-bed4-4f00-9c8d-7df088119555","year":2020},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.451755Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:639966e0038634fc9a7172a29f0a17a48f446303c83aedd727d33bab6c5c414f","observation_id":"fdd8e30c-961c-4114-8a27-3cbf787658ba","resolution":{"observed_at":"2026-08-15T21:21:23.185200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-15T21:21:22.456347Z","title":"Hierarchical text-conditional image gener- ation with clip latents.arXiv:2204.06125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.456347Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:5dea5896a7af1cd1c2dc2d81a38c3dd88e2da5aa9439305845fb42f96e93b314","observation_id":"1c29957c-fcc7-458d-97c1-17ac02b26bdf","resolution":{"observed_at":"2026-08-15T21:21:22.456347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-15T21:21:22.461406Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.461406Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:2431ef5fc8df6ddd661b540f7860998ac8616db4aa093b5775726f6e7844391f","observation_id":"766d0d3c-8087-4f3b-a042-c97d9b6bed46","resolution":{"observed_at":"2026-08-15T21:21:22.461406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.165058Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"fe74a45f-b906-42d3-9bcb-4b14ee125830","year":2022},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.466130Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:9112a3a14dcee11a34423406ac87b5ff71d32ef56b412e8172f19890be247005","observation_id":"c6d5c7ef-ac60-426d-a695-ce10885587f4","resolution":{"observed_at":"2026-08-15T21:21:23.170014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:22.471083Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.471083Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:3b25efb16b04c758130fb7a0a5137e37578dec82bd9f136c6f75b497b0a08814","observation_id":"fce47d88-2f5d-4a7a-a3f7-620ede3bba3a","resolution":{"observed_at":"2026-08-15T21:21:22.471083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15811","last_updated":"2024-07-22T17:23:28Z","snapshot_observed_at":"2026-08-16T13:32:03.952838Z","submitted_at":"2024-07-22T17:23:28Z","title":"Stretching Each Dollar: Diffusion Training from Scratch on a Micro-Budget","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15811","snapshot_observed_at":"2026-08-15T21:21:22.475887Z","title":"Stretching each dol- lar: Diffusion training from scratch on a micro-budget","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.475887Z"},"links":{"cited_paper":"/paper/2407.15811","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:438e80131fc960689a1b32b8049bc3cfc684efddd7d1ddae9a2606f58c78af67","observation_id":"770ff9e0-87c8-4cb8-9e05-40f25708c8ea","resolution":{"observed_at":"2026-08-15T21:21:22.475887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-17T03:15:27.866249Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-15T21:21:22.481319Z","title":"Lmfusion: Adapting pretrained language models for multimodal gener- ation.arXiv:2412.15188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.481319Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:28d58f9e619b83dcdd7d769072323b7f0cdab877930b5314406c63f1988a18c5","observation_id":"04671a1f-5f16-4c92-8f25-e16a2ac660be","resolution":{"observed_at":"2026-08-15T21:21:22.481319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-14T18:24:15.384302Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-15T21:21:22.487821Z","title":"Layer by layer: Uncovering hidden representations in language mod- els.arXiv:2502.02013, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.487821Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:219f76279ba8c806b76fa80a49f6ea4988d067ab5c7e1e59e8232cff564b8ec5","observation_id":"32912298-69e7-4213-9abf-079c51bc419b","resolution":{"observed_at":"2026-08-15T21:21:22.487821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.140792Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 2024","venue":null,"work_id":"1fd0f7c4-ee46-4527-a19c-591d7cbd2a04","year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.492712Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:780d4e0c1a0d193833d4ae286f21bdd3cc0f38b502d54cc1bc48c77251cc6227","observation_id":"0726554d-c66b-4672-a230-a6fb5c664a3c","resolution":{"observed_at":"2026-08-15T21:21:23.145142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.124967Z","title":"Journeydb: A benchmark for generative im- age understanding","venue":null,"work_id":"e6b06ed3-5874-4657-9499-bfcf6457e206","year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.496996Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:d800d5eb3780929da91a28966671d6faa7e90a096e49ca8723398c148d41daf7","observation_id":"4e2894ff-197f-47f8-84d4-4fca02de2027","resolution":{"observed_at":"2026-08-15T21:21:23.130660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:22.501812Z","title":"Is noise conditioning necessary for denoising genera- tive models?arXiv:2502.13129, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.501812Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:d9609852b415449deeff58aa53c1f864056b8e34f2caeb669c006d960922b84c","observation_id":"3b2636fd-e03b-4e50-8807-cb94f2c15be9","resolution":{"observed_at":"2026-08-15T21:21:22.501812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:22.506037Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.506037Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:e5d196a8aacbe39bba30a052fd605fea930404ff547f7b2a6288c20f5b9acd6a","observation_id":"7ab2af98-7c52-410b-9a57-5542dc66eef5","resolution":{"observed_at":"2026-08-15T21:21:22.506037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15688","last_updated":"2024-01-30T13:05:13Z","snapshot_observed_at":"2026-08-16T14:23:53.297113Z","submitted_at":"2024-01-28T16:18:39Z","title":"Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15688","snapshot_observed_at":"2026-08-15T21:21:22.509934Z","title":"Divide and conquer: Language mod- els can plan and self-correct for compositional text-to-image generation.arXiv:2401.15688, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.509934Z"},"links":{"cited_paper":"/paper/2401.15688","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:db89ead8369e1a90b24894f9a9f97a587986741a32d8e8d2d76607c94ede658e","observation_id":"45c80d04-10c2-482d-b653-eea19c028557","resolution":{"observed_at":"2026-08-15T21:21:22.509934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.097875Z","title":"Self-correcting llm-controlled diffusion models","venue":null,"work_id":"a8c6ba78-2f09-457a-af2d-630175bb4c24","year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.514397Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:f8e8f1aa25d32332a68308f256bc1bb9f4d071fc1ee42e1319ead528a3a82e64","observation_id":"4f92cb59-87ca-4751-bb31-ecba7051fa41","resolution":{"observed_at":"2026-08-15T21:21:23.102824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-16T13:17:46.268142Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-15T21:21:22.519750Z","title":"Omnigen: Unified image genera- tion.arXiv:2409.11340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.519750Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:86447c0be5e3d5f4623ec61a15641b8bc84d58347d6e9f415c6ef192ec3a1c0c","observation_id":"349b1ff8-2fd8-4e95-b63e-8894acf49083","resolution":{"observed_at":"2026-08-15T21:21:22.519750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-08-16T01:17:28.297637Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-15T21:21:22.524502Z","title":"Sana: Ef- ficient high-resolution image synthesis with linear diffusion transformers.arXiv:2410.10629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.524502Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:d249430af19f8193299a6c47e9a35a611ac8be55809eeca29678cc4b937cc687","observation_id":"1d3a0de2-db54-4969-b304-7f068e3226fa","resolution":{"observed_at":"2026-08-15T21:21:22.524502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-13T17:55:42.231540Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-15T21:21:22.529564Z","title":"Sana 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.529564Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:15444308a851e6f7c2d98a9cc917e8a860416e4915f802ee3c85696807d30eea","observation_id":"ccb77f9a-1191-4d2b-b06b-5e21026ca24c","resolution":{"observed_at":"2026-08-15T21:21:22.529564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:21:23.080104Z","title":"Mastering text-to-image diffu- sion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":"6ffa247f-08fd-41cb-ace0-acf1ee002e33","year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.534197Z"},"links":{"citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:21abcf41e209e7f403ea97077699ba9099e84341c2aa58caa788bd15a45419c1","observation_id":"9ccefb93-3e28-44bd-934f-c88b21e75d7b","resolution":{"observed_at":"2026-08-15T21:21:23.086820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-15T21:21:22.538806Z","title":"Transfusion: Pre- dict the next token and diffuse images with one multi-modal model.arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.538806Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:223c2f1fbbf9a49de172615d4a1651a4fe35f8b1585abb5d4c15f8ba60e5af6f","observation_id":"24a5858c-0b98-4d62-94c8-41a92f6c5dd5","resolution":{"observed_at":"2026-08-15T21:21:22.538806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-16T13:45:47.270039Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-15T21:21:22.544386Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.arXiv:2406.18583, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:21:22.544386Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2505.10046"},"observation_digest":"sha256:7b33e8e5dc0e7ce85f1fd512bce172ea3b660c8f412b881a45e9ea09a241d97a","observation_id":"7c23bef9-2e55-45cc-88e1-922db9ce5157","resolution":{"observed_at":"2026-08-15T21:21:22.544386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.10046","last_updated":"2025-05-15T07:43:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T10:46:43.017879Z","submitted_at":"2025-05-15T07:43:23Z","title":"Exploring the Deep Fusion of Large Language Models and Diffusion Transformers for Text-to-Image Synthesis"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2505.10046."}