{"as_of":"2026-08-23T04:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8bfffba2c8ac404c43e96de5d1c2f2f4a13e3718954400011a2c8601c8e0aadd","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:55:33.337018Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21606/citation-record","integrity":"/paper/2607.21606/integrity","json":"/paper/2607.21606/citation-record.json","paper":"/paper/2607.21606"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:29.936261Z","title":"Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:29.936261Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:91a0f6f9caaf71cadeec961e26e6ecde7ef0e4c72bf21064bb72336297319513","observation_id":"c2b4b5ad-6b60-4aa7-9907-7de1806461f1","resolution":{"observed_at":"2026-08-02T13:55:29.936261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14687","last_updated":"2024-05-20T04:23:45Z","snapshot_observed_at":"2026-08-14T03:13:28.801183Z","submitted_at":"2022-09-29T11:12:27Z","title":"Diffusion Posterior Sampling for General Noisy Inverse Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14687","snapshot_observed_at":"2026-08-02T13:55:30.021743Z","title":"T., Klasky, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.021743Z"},"links":{"cited_paper":"/paper/2209.14687","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:ab975d3e6b7d105e37b6f42ecd2cefc1f6aac5980829f393b460177ca5a8e18f","observation_id":"9f287d4f-a905-4ee8-a2b3-9a27e95c98f7","resolution":{"observed_at":"2026-08-02T13:55:30.021743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08070","last_updated":"2024-09-12T04:39:16Z","snapshot_observed_at":"2026-08-16T13:43:49.389556Z","submitted_at":"2024-06-12T10:40:10Z","title":"CFG++: Manifold-constrained Classifier Free Guidance for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08070","snapshot_observed_at":"2026-08-02T13:55:30.123200Z","title":"Y., Nam, H., and Ye, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.123200Z"},"links":{"cited_paper":"/paper/2406.08070","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:edd8738b3d0d18aa3efc8c0651464f1c03353fffd4166e9234cc62aa8caa18d9","observation_id":"2979a611-d133-40fa-8d7c-b62fe06ae6ba","resolution":{"observed_at":"2026-08-02T13:55:30.123200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:30.190355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.190355Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:d8b43447a7c61f99698a06ecf461bf67fdfe74d23963f77d7009ee0a30c6fef4","observation_id":"7412f951-4378-4706-a0ea-76bab6d87363","resolution":{"observed_at":"2026-08-02T13:55:30.190355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11552","last_updated":"2024-09-14T18:55:50Z","snapshot_observed_at":"2026-08-19T19:09:25.649922Z","submitted_at":"2023-02-22T18:48:46Z","title":"Reduce, Reuse, Recycle: Compositional Generation with Energy-Based Diffusion Models and MCMC","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11552","snapshot_observed_at":"2026-08-02T13:55:30.284275Z","title":"B., Dieleman, S., Fergus, R., Sohl-Dickstein, J., Doucet, A., and Grathwohl, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.284275Z"},"links":{"cited_paper":"/paper/2302.11552","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:7b9a1d9bf02a73febd4635f0c4ef5e8f1a5a3644e07a819f52be4fb97d28a103","observation_id":"5bd776df-94a8-4991-b9c1-1abeee0f207f","resolution":{"observed_at":"2026-08-02T13:55:30.284275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:30.417761Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.417761Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:2168e398ac6c677d41fea5e0e7ef44689010bad8b5d90dc06dca4e5c715d9410","observation_id":"b6ab270e-d86e-4031-b1cc-78b4bad73333","resolution":{"observed_at":"2026-08-02T13:55:30.417761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-18T16:04:10.548936Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-02T13:55:30.481624Z","title":"E., and Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.481624Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:a7c4fa379be60523a2d7fec4e7b9c2ef56cc30feea9d4c22f77b9eb86e4dc1e4","observation_id":"339b0c4a-a215-44da-a5ab-bdcf8ee4323e","resolution":{"observed_at":"2026-08-02T13:55:30.481624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16424","last_updated":"2023-11-28T02:08:06Z","snapshot_observed_at":"2026-08-16T14:39:49.196088Z","submitted_at":"2023-11-28T02:08:06Z","title":"Manifold Preserving Guided Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16424","snapshot_observed_at":"2026-08-02T13:55:30.552955Z","title":"Z., Salakhutdinov, R., and Ermon, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.552955Z"},"links":{"cited_paper":"/paper/2311.16424","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:a9f5c4a4d057abecfe143118d7bdb75a4fba34404f46a296498882fba3d9a3d2","observation_id":"036885d6-8b9c-408c-a8b4-a103044f82a7","resolution":{"observed_at":"2026-08-02T13:55:30.552955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:30.649504Z","title":"and Salimans, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.649504Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:7771234807861e9d38223da7f7bea6f128aacc8f88546540ef9a60c19dc150e3","observation_id":"4105144f-5d48-4182-b84d-d0c6b23b6643","resolution":{"observed_at":"2026-08-02T13:55:30.649504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-02T13:55:30.729432Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.729432Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:e27f2b30b426c3df9caae827b2f6272bbaa2ee5ae35bc83af5b796351872ef2a","observation_id":"7456b5fc-1917-426d-807a-c98e4e2207a8","resolution":{"observed_at":"2026-08-02T13:55:30.729432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-02T13:55:30.811752Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.811752Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:80ef66c6e2d362a6bf1b5fb249e509acd039705f37ef0ffaf9f7b23a830e0d42","observation_id":"c8b5510c-8502-4c92-9bd0-0e8703b682d3","resolution":{"observed_at":"2026-08-02T13:55:30.811752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:30.893955Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.893955Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:9634527b3c65bf901e0d84a597f563828a8ff23fd76d2dc9a16e4796428bfabf","observation_id":"eb88aded-0d48-458d-bef1-6c181c2189b5","resolution":{"observed_at":"2026-08-02T13:55:30.893955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:30.959951Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:30.959951Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:6e4148a5e2cb33534cdf6ee5601cfc576fe89274b25737bcee2e6454b04d1e37","observation_id":"98408988-4d20-4971-aa4e-e067e7084289","resolution":{"observed_at":"2026-08-02T13:55:30.959951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05591","last_updated":"2025-03-04T04:21:35Z","snapshot_observed_at":"2026-08-16T13:11:42.448989Z","submitted_at":"2024-10-08T01:06:01Z","title":"TweedieMix: Improving Multi-Concept Fusion for Diffusion-based Image/Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05591","snapshot_observed_at":"2026-08-02T13:55:31.049059Z","title":"and Ye, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.049059Z"},"links":{"cited_paper":"/paper/2410.05591","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:fbb4e143f2402ccb1fe597088566a6c13e6f022d98e53509307f753226437313","observation_id":"d0360256-b92b-4ea7-8333-31567abe476a","resolution":{"observed_at":"2026-08-02T13:55:31.049059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:31.148462Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.148462Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:b8fa170082ee808b6b9b504671794a8b0e6457e7f8c5048a828a4dbe9e3d98df","observation_id":"c396b231-b4ec-4256-bd32-fae97a203e84","resolution":{"observed_at":"2026-08-02T13:55:31.148462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:31.203745Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.203745Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:094bf3a66abb0dd70b06333b0aa3c063ff8d1a756a4d087feda213022c741a94","observation_id":"bae5263d-8588-4be9-b511-38af21e11104","resolution":{"observed_at":"2026-08-02T13:55:31.203745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:31.265659Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.265659Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:b752bbf8849974eb00da51fc20144ab042af8a65074b5436a5d5b6813670bfae","observation_id":"57e24fcd-4abf-4949-8191-1b75bdc8dfda","resolution":{"observed_at":"2026-08-02T13:55:31.265659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08453","last_updated":"2023-03-20T10:52:26Z","snapshot_observed_at":"2026-08-13T05:43:28.614772Z","submitted_at":"2023-02-16T17:56:08Z","title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08453","snapshot_observed_at":"2026-08-02T13:55:31.376390Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.376390Z"},"links":{"cited_paper":"/paper/2302.08453","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:a4c0fd6bb0952f32a6bc8c25b20cac0193ea92ba95e9a5e12ed7c27eb2fc3b73","observation_id":"d596a2f1-6707-4b49-bb74-cf1eec6d0200","resolution":{"observed_at":"2026-08-02T13:55:31.376390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T13:55:31.487451Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.487451Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:5ed299cf9b5dfa6b1dd4010aaf51711e60d7b6734018718d2b8ba060dfbff144","observation_id":"00a5032a-4539-4eb1-b466-0106f5fb59d2","resolution":{"observed_at":"2026-08-02T13:55:31.487451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:31.572076Z","title":"Rare-to-frequent: Unlocking compositional generation power of diffusion models on rare concepts with llm guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.572076Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:48b23aec2c5ed3a1a61eeae8efa62d0ab866a35d66cc98a0387806218cb99632","observation_id":"5db8cace-0748-477d-8155-4dab917c7d44","resolution":{"observed_at":"2026-08-02T13:55:31.572076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:31.654587Z","title":"Grounded text-to-image synthesis with attention refocusing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.654587Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:1f21fd8d27b97953af960935be6bbf8fee969c990d0e84b86d8149c964ef1864","observation_id":"a616b9c9-31ca-4a56-ad79-fb83f0dfe24c","resolution":{"observed_at":"2026-08-02T13:55:31.654587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-02T13:55:31.747100Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.747100Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:bd4f2e42a88d0e4ffa572dd9c6dc5a0ea4d5e3108cdc696df8e9a2a97bee7a4a","observation_id":"7d4c1015-6f7a-4014-b449-799a7c4d10d1","resolution":{"observed_at":"2026-08-02T13:55:31.747100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:31.809190Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.809190Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:f520af48afb5801e196dfa9a9a8dd097a88d17994216ddf2eec13c7c8501e147","observation_id":"6f39579f-d6b4-409d-9f9a-9f15114dd086","resolution":{"observed_at":"2026-08-02T13:55:31.809190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05095","last_updated":"2023-08-12T05:36:42Z","snapshot_observed_at":"2026-08-16T15:09:35.376687Z","submitted_at":"2023-08-09T17:45:04Z","title":"LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05095","snapshot_observed_at":"2026-08-02T13:55:31.858324Z","title":"Layoutllm-t2i: Eliciting layout guidance from llm for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.858324Z"},"links":{"cited_paper":"/paper/2308.05095","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:c6de49f531ceece5ac439003e49cb496c125a5ed9b522a1d35add029822be1c9","observation_id":"8a0f0a49-6216-4732-b88d-7abe2ed87f93","resolution":{"observed_at":"2026-08-02T13:55:31.858324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:31.932336Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:31.932336Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:fac84737cdcf4e294e3950c864d55e47155c98183451b6b3fee3f8aca4bda059","observation_id":"bfac7711-7279-41e8-b10b-b187f69ca188","resolution":{"observed_at":"2026-08-02T13:55:31.932336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:32.043260Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.043260Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:c3bc24bd90edc20dbcacf660c1ef130f32abae4bb23d60fac5caf3e95ce8f78d","observation_id":"9ab857fe-3125-4b26-9327-4eeaf6736596","resolution":{"observed_at":"2026-08-02T13:55:32.043260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:32.129115Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.129115Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:65283b9796f5683deedd444db2d74aef100f818b3c2125aada9d648e0c7212a8","observation_id":"fbb5c8c2-abfe-4fb9-bf80-3cc5a089fbe2","resolution":{"observed_at":"2026-08-02T13:55:32.129115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:32.211529Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.211529Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:d05703a2ec544831518732094c3ce150f87d4425a8643cf4cad49a082f4cbcdc","observation_id":"4b0d1d83-b378-418a-beef-a0c2ec8a7554","resolution":{"observed_at":"2026-08-02T13:55:32.211529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:32.300163Z","title":"K., Karagol Ayan, B., Mahdavi, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.300163Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:b1cb79605494cc4914a03c2e9a307092291487054f91803a979c08910ea6300e","observation_id":"ad3fea7b-38a5-4931-9e14-5f826118dfc7","resolution":{"observed_at":"2026-08-02T13:55:32.300163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:32.375905Z","title":"The superposition of diffusion models using the it\\^o density estimator","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.375905Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:fd7b9402aeecb7bb239af95ee8f42d0992a6ec300d73bda0ee0ea4f62ad0c001","observation_id":"b68c27de-0e4c-4a11-b062-8aef3057f1f7","resolution":{"observed_at":"2026-08-02T13:55:32.375905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:32.464453Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.464453Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:400bb85842ef9209976f425acde9cd11a59c3c6e9f9e60e0e61916b419f3e252","observation_id":"e52a023c-1646-4766-89cd-f770552390f7","resolution":{"observed_at":"2026-08-02T13:55:32.464453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03290","last_updated":"2024-02-05T18:49:17Z","snapshot_observed_at":"2026-08-20T12:02:18.908954Z","submitted_at":"2024-02-05T18:49:17Z","title":"InstanceDiffusion: Instance-level Control for Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03290","snapshot_observed_at":"2026-08-02T13:55:32.546518Z","title":"S., Girdhar, R., Misra, I., and Darrell, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.546518Z"},"links":{"cited_paper":"/paper/2402.03290","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:faff133f45a6062544d302a1eaf6cbf953b8e0a8686a9b8ea3c61abce972d203","observation_id":"3ef68fb8-c65d-4e9e-92bb-87ba1f6a2f4c","resolution":{"observed_at":"2026-08-02T13:55:32.546518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:32.628801Z","title":"Information theoretical analysis of multivariate correlation","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.628801Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:8fdb31e711d1c7c7ead779f7840dd80b5042bec8928fb0979140201855191dee","observation_id":"bfe0acbe-f516-4e73-a3db-7e402737700c","resolution":{"observed_at":"2026-08-02T13:55:32.628801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10816","last_updated":"2023-08-21T13:07:10Z","snapshot_observed_at":"2026-08-22T06:10:38.475713Z","submitted_at":"2023-07-20T12:25:06Z","title":"BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10816","snapshot_observed_at":"2026-08-02T13:55:32.710981Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.710981Z"},"links":{"cited_paper":"/paper/2307.10816","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:4371d5ed580108c927e8303637ee91f05ddb1476ddea596845078b3b852b33d1","observation_id":"c59816ba-a2f3-492c-9554-ad302c81b323","resolution":{"observed_at":"2026-08-02T13:55:32.710981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:32.821374Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.821374Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:2dc1c810c277011701c6cfa902562a73e5492981cd29a42924ca3eadd75d22ec","observation_id":"f42177c4-f285-4e3c-816a-03eee77691bc","resolution":{"observed_at":"2026-08-02T13:55:32.821374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11708","last_updated":"2024-05-05T04:50:54Z","snapshot_observed_at":"2026-08-16T14:25:42.389620Z","submitted_at":"2024-01-22T06:16:29Z","title":"Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11708","snapshot_observed_at":"2026-08-02T13:55:32.972530Z","title":"Mastering text-to-image diffusion: Recaptioning, planning, and generating with multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:32.972530Z"},"links":{"cited_paper":"/paper/2401.11708","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:02ad6ef73baac9d8a402f01223f683c4f938393b0598a3470d13f3a71f11a17d","observation_id":"529408f0-8e0a-4e04-84c2-4757a6f8e4cd","resolution":{"observed_at":"2026-08-02T13:55:32.972530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05760","last_updated":"2025-02-27T12:13:38Z","snapshot_observed_at":"2026-08-16T13:11:37.860959Z","submitted_at":"2024-10-08T07:33:49Z","title":"Training-free Diffusion Model Alignment with Sampling Demons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05760","snapshot_observed_at":"2026-08-02T13:55:33.085974Z","title":"Training-free diffusion model alignment with sampling demons, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:33.085974Z"},"links":{"cited_paper":"/paper/2410.05760","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:556651b72a4cb809306779f189c72d917295f107e797a0dd868874324435af81","observation_id":"4ef1021b-7a48-49c8-8209-c180e7cb5b46","resolution":{"observed_at":"2026-08-02T13:55:33.085974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T13:55:33.200608Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:33.200608Z"},"links":{"citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:7261fbe53e884bdf5b7eba702f67c14f8e640fb88e6151b1cc2f6a9502b10c34","observation_id":"2cdcfd25-9460-4da8-9461-daaa95fa14f5","resolution":{"observed_at":"2026-08-02T13:55:33.200608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12342","last_updated":"2024-03-26T04:17:42Z","snapshot_observed_at":"2026-08-16T14:41:37.862775Z","submitted_at":"2023-11-21T04:28:12Z","title":"LoCo: Locally Constrained Training-Free Layout-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12342","snapshot_observed_at":"2026-08-02T13:55:33.337018Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T13:55:33.337018Z"},"links":{"cited_paper":"/paper/2311.12342","citing_paper":"/paper/2607.21606"},"observation_digest":"sha256:2bd173f2cfe715e7ec851f450e83bfdfae478900adf8404946278bb100fa844d","observation_id":"c671c404-a663-4b31-bfd1-efcbe1494694","resolution":{"observed_at":"2026-08-02T13:55:33.337018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21606","last_updated":"2026-05-16T16:56:52Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T16:14:49.559969Z","submitted_at":"2026-05-16T16:56:52Z","title":"TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2607.21606."}