{"as_of":"2026-08-10T00:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ae0b0545dbd1490b101e866c1e86f7ec18bed63bcf91b05a7ad5a8c22f0470b","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:39:59.330475Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:50:45.652959Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:07:08.965746Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2601.02211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.02211","snapshot_observed_at":"2026-07-07T03:18:11.480124Z","title":"arXiv preprint arXiv:2601.02211 , year=","venue":null,"work_id":"9d53ebd9-9057-4814-a30e-6a91dc7628a7","year":null},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T13:00:22.875471Z"},"links":{"cited_paper":"/paper/2601.02211","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:27ed3493cf20a7de9e45d64d38dea499a946d1b20885266265435c69b5aa8e29","observation_id":"6a617b15-aa7d-4b04-892d-0c90d7ab9c50","resolution":{"observed_at":"2026-07-07T03:18:11.480124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02211","snapshot_observed_at":"2026-08-03T03:50:45.652959Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06886","last_updated":"2026-07-31T08:35:56Z","snapshot_observed_at":"2026-08-05T23:10:18.924353Z","submitted_at":"2026-02-06T17:19:53Z","title":"Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:50:45.652959Z"},"links":{"cited_paper":"/paper/2601.02211","citing_paper":"/paper/2602.06886"},"observation_digest":"sha256:646cd7b3ebf9d68ec173bef868467e68de8722dc76ed94a10725ea6c9cc34d90","observation_id":"cb1ba7c0-5ec4-4cdc-8fbc-057a32fd6f27","resolution":{"observed_at":"2026-08-03T03:50:45.652959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2601.02211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.02211","snapshot_observed_at":"2026-07-07T03:18:11.480124Z","title":"arXiv preprint arXiv:2601.02211 , year=","venue":null,"work_id":"9d53ebd9-9057-4814-a30e-6a91dc7628a7","year":null},"citing_paper":{"arxiv_id":"2606.06813","last_updated":"2026-06-05T01:27:44Z","snapshot_observed_at":"2026-08-06T01:41:43.591563Z","submitted_at":"2026-06-05T01:27:44Z","title":"Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T22:59:39.440344Z"},"links":{"cited_paper":"/paper/2601.02211","citing_paper":"/paper/2606.06813"},"observation_digest":"sha256:33cfc4bf128b5ec83705982dc899b7dd1da3c55424d6da7f8c2dab46acec46a8","observation_id":"7ed7b4e8-95a8-4511-bfe7-ef482499fa00","resolution":{"observed_at":"2026-07-07T03:18:11.480124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.02211/citation-record","integrity":"/paper/2601.02211/integrity","json":"/paper/2601.02211/citation-record.json","paper":"/paper/2601.02211"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:53.576640Z","title":"Countgd: Multi-modal open-world counting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:53.576640Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:8415f8ece7d5096e392f78e36c1731e414ae7f41396a05e00627d3346431410a","observation_id":"1acbafad-d7d0-44d0-86d2-01cf0551a5af","resolution":{"observed_at":"2026-08-03T12:39:53.576640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:53.664753Z","title":"Stable flow: Vital layers for training-free image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:53.664753Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:1c1c5d41d7a0933bbbb4a66192ee12ba87230d162cdb220907e8b70cf9bdc255","observation_id":"bf5cfc98-badc-4486-a651-145405c13c89","resolution":{"observed_at":"2026-08-03T12:39:53.664753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T12:39:53.776475Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:53.776475Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:1db8c2eb919d0f451cee27e728bb15a499b7fe6bbcb39940344eed4e75aad1ee","observation_id":"31b10555-9829-4064-b7a9-667ffd37b0dc","resolution":{"observed_at":"2026-08-03T12:39:53.776475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:53.870600Z","title":"Imagen 3.arXiv preprint arXiv:2408.07009, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:53.870600Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:7c5464e932ffcb96385e09cf915f213d96b45c77f5a427b0c4d78021d4526b17","observation_id":"df594be9-da2c-47fd-a711-fe65842fd27d","resolution":{"observed_at":"2026-08-03T12:39:53.870600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:53.937224Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:53.937224Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:70a92c7353a95ac7fa069a9ba3a2c2d63c49dbcb8f91e82e2baa9a3a6682121c","observation_id":"98087cb2-d25d-4ef9-ad56-5da8a66a4665","resolution":{"observed_at":"2026-08-03T12:39:53.937224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:54.009761Z","title":"Masactrl: Tuning-free mu- 9 tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.009761Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:6d3663d00083da9899a13ca06675fbf1b74becb76fb6c5c3276102df92cbdd74","observation_id":"7bfe2fc2-c3c2-43ad-b2b6-7f7f16666086","resolution":{"observed_at":"2026-08-03T12:39:54.009761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:54.104334Z","title":"Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.104334Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:ad84907947bf1666c1cbc7479f1b840119ea023788e1bb1d01810d16f6c536ea","observation_id":"6580c660-7bbc-4b7a-889b-42aecfbbba6c","resolution":{"observed_at":"2026-08-03T12:39:54.104334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:54.211751Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.211751Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:feebe83a79d7ce9ab5746d24ace019ccee1559783bf7563a443455f261a1ce27","observation_id":"44e29ded-6dc0-494a-8a6b-16eb8fc7c0b7","resolution":{"observed_at":"2026-08-03T12:39:54.211751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:54.349697Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.349697Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:f047a366ef3f3100772740cb12f459901dbd8b82e3d89dd41a824c6ec29e3689","observation_id":"33bd5ffc-84ae-444b-ba8a-da1eb66851e3","resolution":{"observed_at":"2026-08-03T12:39:54.349697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-08-03T12:39:54.420041Z","title":"Seedream 3.0 technical report.arXiv preprint arXiv:2504.11346, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.420041Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:95327370a93ae1c7fcaedacf9076fb64d400a416584d69ed682118ba725319f5","observation_id":"4f04187f-5873-46e9-bf57-3e09f4fd306d","resolution":{"observed_at":"2026-08-03T12:39:54.420041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:54.551791Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.551791Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:5d4120a14f0ae89559b081f2d7de7873d2f8f0b97461c63d2c552e7a34b19ba4","observation_id":"e71270c5-7abd-41ac-bf7b-0de65280f75a","resolution":{"observed_at":"2026-08-03T12:39:54.551791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07703","snapshot_observed_at":"2026-08-03T12:39:54.656909Z","title":"Seedream 2.0: A native chinese-english bilin- gual image generation foundation model.arXiv preprint arXiv:2503.07703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.656909Z"},"links":{"cited_paper":"/paper/2503.07703","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:22157db2cc49083dddc894deee6e11923d0c3edf9be19fe3599f2770c28a647a","observation_id":"01fc6551-66d3-4ebe-9067-d5a27f20c564","resolution":{"observed_at":"2026-08-03T12:39:54.656909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-03T12:39:54.760486Z","title":"Prompt-to-prompt im- age editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.760486Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:17b9dd22b8310ab1afbae7559a83b8623faea150eff1990b7fed446096fd3b2e","observation_id":"51d3f7af-ab58-4b1d-98af-23948b2d3f2a","resolution":{"observed_at":"2026-08-03T12:39:54.760486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-03T12:39:54.832563Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.832563Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:f5a470a7269c14b42b247296f558d991d10e831922bfca7a13691fb18bc5137a","observation_id":"468c6688-74ad-47c3-af8b-39fbc9b9ad5d","resolution":{"observed_at":"2026-08-03T12:39:54.832563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:54.921783Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:54.921783Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:5774db8de6977d8749f24fcb9ea768cae76dfd1edda9e0da4c48b0e48cd1427d","observation_id":"a499af7b-d295-4d50-81ef-5a13d4ca6916","resolution":{"observed_at":"2026-08-03T12:39:54.921783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:55.017997Z","title":"T2i-compbench++: An enhanced and comprehensive benchmark for compositional text-to-image generation.IEEE Transactions on Pattern Analysis and Ma- chine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.017997Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:56815f1b3eee9e4d7df22e0b197d4eaa48ecc923734a24622aef848403e8a802","observation_id":"0a0dc0d1-5a93-484d-8991-6d7cc8bba12d","resolution":{"observed_at":"2026-08-03T12:39:55.017997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:55.148813Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.148813Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:8c9634830bbe9d9593680267ed4e859c720569e3b7b4a1f1d4477716dbeae6b1","observation_id":"5bbaecdb-570c-4a02-add0-10e33e9d3224","resolution":{"observed_at":"2026-08-03T12:39:55.148813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-03T12:39:55.224838Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chi- nese understanding.arXiv preprint arXiv:2405.08748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.224838Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:942a4d76c316ec3e7e354987fae72cf546c888bf082f53d65605ba42d4a10379","observation_id":"caba5c44-c215-4525-95ee-5dcf5f2a0fab","resolution":{"observed_at":"2026-08-03T12:39:55.224838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:55.361101Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.361101Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:8d03c900f3083518ba9489e4be172d85db3e705afbfe519839bc1738a4f31536","observation_id":"7f75b3b1-1986-4cec-9437-b15d04ed03f3","resolution":{"observed_at":"2026-08-03T12:39:55.361101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:55.507999Z","title":"Towards understanding cross and self-attention in stable diffusion for text-guided image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.507999Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:0677879dd20dae9e0801ec2a2f606e90b613990e888a5e1dba461c92498d3fcf","observation_id":"ffe1fea6-b322-4bed-ac8f-36b493bc5c8a","resolution":{"observed_at":"2026-08-03T12:39:55.507999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:55.615413Z","title":"Timestep embedding tells: It’s time to cache for video diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.615413Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:68fecbc414e023eccaec88c1eaa2d5237c3ba0c3da5e67b49620a2dc9c5008fe","observation_id":"68dbbf78-7163-49de-b3a1-be990f2c9c61","resolution":{"observed_at":"2026-08-03T12:39:55.615413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:55.737178Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.737178Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:01a59895c50107f3d32b0ef467c3fbd1d8bb04275e0c28ddb529f57b887aed2b","observation_id":"ae64b6fb-a21a-42ba-8929-f53e8ee588b3","resolution":{"observed_at":"2026-08-03T12:39:55.737178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:55.804374Z","title":"Dpm-solver: A fast ode solver for dif- fusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.804374Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:e77ed12d042bf50d0d63baec58acff75bc4acaef0d2b3322f4d6c018e402a606","observation_id":"67b54e65-822f-41bd-b9e3-5fe551ddcaf1","resolution":{"observed_at":"2026-08-03T12:39:55.804374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-03T12:39:55.861674Z","title":"Latent consistency models: Synthesizing high- resolution images with few-step inference.arXiv preprint arXiv:2310.04378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:55.861674Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:c1851f0cd0cdb1586174c8959d7cce2f36ab78188409d2fb2924b2c7e1fd98f4","observation_id":"22acf449-4dcb-4b89-883f-88e59253f854","resolution":{"observed_at":"2026-08-03T12:39:55.861674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.002759Z","title":"Re- thinking cross-modal interaction in multimodal diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.002759Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:02d030f0df70f75d67808bfd40dedeca27b524d2fc1829b922ef3a63709679c3","observation_id":"fda6821e-32f3-49b4-b843-8c2684adee44","resolution":{"observed_at":"2026-08-03T12:39:56.002759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-03T12:39:56.101693Z","title":"Latte: Latent diffusion transformer for video generation.arXiv preprint arXiv:2401.03048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.101693Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:b43a48812ba2f2608c665b3749b283fef4e3f2f3c496286c605b168fe9995d5f","observation_id":"3a9024af-1680-47c0-a149-3eed5e376324","resolution":{"observed_at":"2026-08-03T12:39:56.101693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.203738Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.203738Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:ce46909fd55a6ebe41f2adad7bbd062ad685269854bc2f3e3781e5ba4bbb4193","observation_id":"483dffff-0608-43d2-a226-17c1ff7f515d","resolution":{"observed_at":"2026-08-03T12:39:56.203738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.490511Z","title":"DINOv2: Learning robust visual features without supervision.Transactions on Machine Learning Research,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.490511Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:8f599ae567ec6e35be07324168408628638583a739f16b26cc3d5f8af1992149","observation_id":"2dec7a44-6ec2-4a1d-b77c-73114fafccb8","resolution":{"observed_at":"2026-08-03T12:39:56.490511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.597819Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.597819Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:28c9e13a8c245628b4bd0bcfce4ca7011b9bec5a65393cf986ff29d8ad3601fe","observation_id":"5bea0785-31fe-437c-a12a-8b60f53c56aa","resolution":{"observed_at":"2026-08-03T12:39:56.597819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.709259Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.709259Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:1344c97a76af0a5f89d3b9357bf31c72abafcc73ecc264fe198251199c182cb7","observation_id":"c5dc1917-4917-4ec7-b264-26e79e43e1b1","resolution":{"observed_at":"2026-08-03T12:39:56.709259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.830069Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.830069Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:e007f6fbbd13022997fea39aca4812900c294a7799224b168e5bd343c8281942","observation_id":"35ecbd6d-7a7b-4e7e-b616-2615a0c751f6","resolution":{"observed_at":"2026-08-03T12:39:56.830069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.898012Z","title":"Laion aesthetics","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.898012Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:b677a1ad139c224e7b8e471370b1e6c1bedb2741ca0d335196d36804073cdee6","observation_id":"5db906c9-2034-453d-a023-bff27804ba38","resolution":{"observed_at":"2026-08-03T12:39:56.898012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.996285Z","title":"Exploring multimodal diffusion transform- ers for enhanced prompt-based image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.996285Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:2bcece0ea2ad0866b5d9be74f97758661fe57648cbd5aafb2f2fc7314351f0dc","observation_id":"35cbfcbb-ebb8-4de8-838b-d35e04709cd8","resolution":{"observed_at":"2026-08-03T12:39:56.996285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:57.119450Z","title":"Freeu: Free lunch in diffusion u-net","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:57.119450Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:15300bbad489a93b68ce7c4c531042bd42605442578880d33354caf5b5cc5ff3","observation_id":"e910398a-4711-4bfa-8d54-ab7d05014a3f","resolution":{"observed_at":"2026-08-03T12:39:57.119450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:57.285486Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:57.285486Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:b8c88dd6983250d0c3d5ba7c5f0cc2ebc27230b77dddf47682561dc9feffa761","observation_id":"f3d00d7b-43cd-4cb2-a8e6-dc8689b4765d","resolution":{"observed_at":"2026-08-03T12:39:57.285486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:57.392976Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:57.392976Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:3a96a86f491f3676a5053f0e4a32cf9c6e91c78fb4e4215397805c69eacff638","observation_id":"783579df-e02e-4bd6-b34f-61d11f1f1327","resolution":{"observed_at":"2026-08-03T12:39:57.392976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:57.487487Z","title":"Stable diffusion 3.5","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:57.487487Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:f20b908824dfa967e86479a099d39b9d322bf6ee1f57b4e625f9c20c731bfe2d","observation_id":"a739707a-5e72-4285-ba41-2ab6605fd67d","resolution":{"observed_at":"2026-08-03T12:39:57.487487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15098","last_updated":"2025-07-07T17:33:23Z","snapshot_observed_at":"2026-08-09T00:44:58.573039Z","submitted_at":"2024-11-22T17:55:15Z","title":"OminiControl: Minimal and Universal Control for Diffusion Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15098","snapshot_observed_at":"2026-08-03T12:39:57.635461Z","title":"Ominicontrol: Minimal and uni- versal control for diffusion transformer.arXiv preprint arXiv:2411.15098, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:57.635461Z"},"links":{"cited_paper":"/paper/2411.15098","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:9788efcfbdd6e5ee0d3ec29d7cb88e0999591b5daef79a4efb76f52a28750ebe","observation_id":"7c0f15bf-3ead-45b1-93ab-7f44e558ac02","resolution":{"observed_at":"2026-08-03T12:39:57.635461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:57.785330Z","title":"Hunyuanvideo: A sys- tematic framework for large video generative models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:57.785330Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:ec7e457d0e15543db710477eba707e119396687bc85ebed2cc08e35fb2b6b67d","observation_id":"4ca6bce0-b200-4195-bbd4-9f705fe5b897","resolution":{"observed_at":"2026-08-03T12:39:57.785330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:57.942452Z","title":"Hunyuanimage-2.1: An efficient diffusion model for high-resolution (2k) text-to- image generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:57.942452Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:460d1e9d54f51ae1a55ee31d3d797a0a7e20fffad1e1101dd54b4f2b7b86d294","observation_id":"3b53c935-42b2-4c9f-b0a7-62b56133ecce","resolution":{"observed_at":"2026-08-03T12:39:57.942452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:58.052690Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:58.052690Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:c4fe547eed81f1eb138a606f7bbd3d62d96578281d2382d4d5ffa55700945a3a","observation_id":"1a9a88b3-9352-4759-abb6-930e227ffce2","resolution":{"observed_at":"2026-08-03T12:39:58.052690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T12:39:58.179263Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:58.179263Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:474328a6e6e00832d289e1ed915f166c37280e81835d54381fd298efab43e0c4","observation_id":"59737f79-45ed-430c-9b0d-ad8aff6542b3","resolution":{"observed_at":"2026-08-03T12:39:58.179263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:58.294053Z","title":"Freeflux: Understanding and exploiting layer-specific roles in rope-based mmdit for versatile image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:58.294053Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:99d0f83a177a151dad88f1bd57a818340a96ae4e4976d964345b2cb7810cc7ec","observation_id":"1572279b-ff26-4a4b-bb28-7bf03d1c2f24","resolution":{"observed_at":"2026-08-03T12:39:58.294053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:58.397490Z","title":"A uni- fied framework for u-net design and analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:58.397490Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:403c91ef05ccfde04f8b6f6e1a49c937955daa2e39b2ff47ad0c968207351ead","observation_id":"6415ef91-6f46-4a58-8c9d-2f011aab16a1","resolution":{"observed_at":"2026-08-03T12:39:58.397490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-03T12:39:58.518630Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:58.518630Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:6c11bb91900dc543eb10d9028a295a9788070c105711630554e553f6c90d6542","observation_id":"327a4d58-e3ec-4920-a17e-96b3642f4a71","resolution":{"observed_at":"2026-08-03T12:39:58.518630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-03T12:39:58.628033Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:58.628033Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:a371e2537a52c62268f3b8d63b37508283dca637a232b548c702ba93160a8e6f","observation_id":"7ec50b5c-b186-465f-b332-d45cd87c0e70","resolution":{"observed_at":"2026-08-03T12:39:58.628033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:58.771778Z","title":"Instanceassemble: Layout-aware image generation via in- stance assembling attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:58.771778Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:85a96405783cf81d9e10b0efb75c49fc8151a19d572315b05d4187d5aad3562b","observation_id":"611b0c85-4da9-41a9-a245-4c4b37db281b","resolution":{"observed_at":"2026-08-03T12:39:58.771778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:58.898539Z","title":"Imagereward: learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:58.898539Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:b4d9bc71a76aaf848779b3a82263147166e461670e68dc5a385a8c6490dd06e6","observation_id":"b538b1eb-af94-4eb5-8a32-ede0895fb125","resolution":{"observed_at":"2026-08-03T12:39:58.898539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:59.002790Z","title":"Cogvideox: Text-to-video dif- fusion models with an expert transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:59.002790Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:da5617bb90c14a66010ed9295dbbe7eafd36e61c53fc2bbbc7677c375ab9ee36","observation_id":"24595342-8f84-46d5-ace6-aeb7b3aa6def","resolution":{"observed_at":"2026-08-03T12:39:59.002790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:59.139622Z","title":"Towards understanding the working mechanism of text-to-image dif- fusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:59.139622Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:944e5bfe391ead4aa81621032f09ffcf2430b3c087c041dd401e7bc618ce806b","observation_id":"994c3947-e3d5-48cd-8969-5104ca38c0ab","resolution":{"observed_at":"2026-08-03T12:39:59.139622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:59.218588Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:59.218588Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:177e638fdd15ef9ccb9fefe77a90caae1bd8ca4ac169cbd5f706eef5f4c0d32c","observation_id":"8ee9f82a-8b81-4d8f-bb65-6fc7d147b935","resolution":{"observed_at":"2026-08-03T12:39:59.218588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09830","last_updated":"2025-03-12T20:51:17Z","snapshot_observed_at":"2026-08-07T17:08:57.228635Z","submitted_at":"2025-03-12T20:51:17Z","title":"Exploring Position Encoding in Diffusion U-Net for Training-free High-resolution Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09830","snapshot_observed_at":"2026-08-03T12:39:59.330475Z","title":"Exploring position encoding in diffusion u-net for training-free high-resolution image generation.arXiv preprint arXiv:2503.09830, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:59.330475Z"},"links":{"cited_paper":"/paper/2503.09830","citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:251b9a6b7cda064d906e6fb94c8e269753b33f82e05119ec64f962d8d505e73d","observation_id":"ed1bbda6-819d-449a-bd41-43dab2455bd9","resolution":{"observed_at":"2026-08-03T12:39:59.330475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:39:56.330898Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T12:39:56.330898Z"},"links":{"citing_paper":"/paper/2601.02211"},"observation_digest":"sha256:e2032fe44b09c1b8f122346558ddce0ae5e8c189cf97e2b4617ef6748a4ba509","observation_id":"fad3956d-e6d8-40d6-ba84-cac84187b02d","resolution":{"observed_at":"2026-08-03T12:39:56.330898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.02211","last_updated":"2026-07-06T03:26:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T22:25:47.271922Z","submitted_at":"2026-01-05T15:32:53Z","title":"TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 3 inbound Pith citation observations for arXiv:2601.02211."}