{"as_of":"2026-08-13T05:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37783af537d3e54f50e27d4b5d36be8f037a1457aa94848505cc395aba33f069","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:08:54.669287Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:45:53.297589Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:58:37.263440Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15236","snapshot_observed_at":"2026-08-06T14:45:53.297589Z","title":"Text embed- ding is not all you need: Attention control for text-to-image semantic alignment with text self-attention maps.arXiv preprint arXiv:2411.15236, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17853","last_updated":"2026-06-21T15:14:16Z","snapshot_observed_at":"2026-08-07T20:37:21.945333Z","submitted_at":"2025-07-23T18:20:46Z","title":"Detail++: Training-Free Detail Enhancer for T2I Diffusion Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:53.297589Z"},"links":{"cited_paper":"/paper/2411.15236","citing_paper":"/paper/2507.17853"},"observation_digest":"sha256:2342b047738881928568e1f96da2175ee9fe1d7452f920faee5a8d01a838e0c3","observation_id":"fdbcc39c-bc22-4799-9ead-0a82d02e5fc4","resolution":{"observed_at":"2026-08-06T14:45:53.297589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"cited_work":{"arxiv_id":"2411.15236","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15236","snapshot_observed_at":"2026-07-03T15:58:37.263440Z","title":"Text embedding is not all you need: Attention control for text-to-image semantic alignment with text self-attention maps.arXiv preprint arXiv:2411.15236, 2024","venue":null,"work_id":"ec1f285c-568b-43e6-abe5-83e1587735bd","year":2024},"citing_paper":{"arxiv_id":"2607.02220","last_updated":"2026-07-02T14:26:47Z","snapshot_observed_at":"2026-08-01T18:29:16.831004Z","submitted_at":"2026-07-02T14:26:47Z","title":"DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-03T15:56:38.037304Z"},"links":{"cited_paper":"/paper/2411.15236","citing_paper":"/paper/2607.02220"},"observation_digest":"sha256:3de708b79382b7e367bb2b07167f038825cee842f482b94c7e66034d472b7d31","observation_id":"46a62a12-f3ce-40f9-a558-0886d5c4ec17","resolution":{"observed_at":"2026-07-03T15:58:37.265067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15236/citation-record","integrity":"/paper/2411.15236/integrity","json":"/paper/2411.15236/citation-record.json","paper":"/paper/2411.15236"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.535602Z","title":"A-star: Test-time attention segregation and retention for text-to-image synthesis","venue":null,"work_id":"f4baae85-d734-41b8-a5f4-7d485832a873","year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.220813Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:c08e45ff551f401bf6db0f9e31df45c6275adb90747a111c281f6dae059fc44d","observation_id":"860654df-32b1-470a-a7be-77ce9b923569","resolution":{"observed_at":"2026-08-12T15:08:56.587696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18893","last_updated":"2024-06-28T03:22:33Z","snapshot_observed_at":"2026-08-13T04:11:13.333683Z","submitted_at":"2024-06-27T05:08:46Z","title":"AlignIT: Enhancing Prompt Alignment in Customization of Text-to-Image Models","version":2},"cited_work":{"arxiv_id":"2406.18893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.18893","snapshot_observed_at":"2026-08-12T15:08:55.604066Z","title":"AlignIT: Enhancing Prompt Alignment in Customization of Text-to-Image Models","venue":"cs.CV","work_id":"b47e248f-bac3-4df5-85d3-b911c5e7d027","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.416975Z"},"links":{"cited_paper":"/paper/2406.18893","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:93f35be0ad976ae0937994cba71a79b4b8ad8e8ca28ef2277a0741d1dca55ad8","observation_id":"00464a84-ec3f-481f-9cba-3fb45053ed2d","resolution":{"observed_at":"2026-08-12T15:08:55.655150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.496433Z","title":"Attend-and-excite: Attention-based se- mantic guidance for text-to-image diffusion models","venue":null,"work_id":"b9301711-6655-4f29-a9e4-c18bf630a240","year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.538102Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:f3b32f7bd99abefd7d79ee491bcb8afda8fb5bebeab640cd5a4c890b830b7a40","observation_id":"f3a26ef5-c45c-459a-a889-f967ed3a35fd","resolution":{"observed_at":"2026-08-12T15:08:56.510085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-12T15:08:53.586669Z","title":"Pixart- α: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.586669Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:91ca7e8780f17d8d9a544cd59b49753f7224f3a0c7db20a58b1ae88419387aaf","observation_id":"86b56c1a-ed34-4e6f-a549-f9508e3e5072","resolution":{"observed_at":"2026-08-12T15:08:53.586669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04692","last_updated":"2024-03-17T16:59:25Z","snapshot_observed_at":"2026-08-13T00:59:54.489440Z","submitted_at":"2024-03-07T17:41:37Z","title":"PixArt-\\Sigma: Weak-to-Strong Training of Diffusion Transformer for 4K Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04692","snapshot_observed_at":"2026-08-12T15:08:53.596085Z","title":"Pixart- \\sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.596085Z"},"links":{"cited_paper":"/paper/2403.04692","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:261dbfec23a13966612d54ccb179220fa2990f126e5fa6e3e5b573f3e7e12fa3","observation_id":"c1746190-6bc2-4565-81e2-59ffb069b285","resolution":{"observed_at":"2026-08-12T15:08:53.596085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.415172Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to- image generation models","venue":null,"work_id":"245cb0b9-193f-41db-9c9d-ae5a3da5fd9f","year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.629726Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:c19de340cf1f9c0d6b6d0bb0ca5eb2c6e2f4c6cac61996b0a982c8490d9b8151","observation_id":"338f1936-24c5-4ed3-94a4-fa7ee20f7b0b","resolution":{"observed_at":"2026-08-12T15:08:56.459247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:53.675405Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.675405Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:2231656dcdb940f2b054e8967d2efc53c231ce1a10ecb56241780d4a8bdd4bf0","observation_id":"a614f833-0c21-4618-8e76-d663731cda2e","resolution":{"observed_at":"2026-08-12T15:08:53.675405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-10T14:28:11.482404Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-12T15:08:53.683502Z","title":"Training-free structured diffusion guidance for compositional text-to-image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.683502Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:3a4b1eec2d9c55f164a98dacca8f259ced5c46cdf1a2b68446de706d6429268c","observation_id":"38e3d833-4cdc-45bd-8fd6-117feeac26d1","resolution":{"observed_at":"2026-08-12T15:08:53.683502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-12T15:08:53.730797Z","title":"When attention sink emerges in language models: An empirical view","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.730797Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:85bc603e06fcadaa206d59c1121d25fadb35eee8ee90b289d538a3d4fbb66c2f","observation_id":"735bb36e-7c43-4f19-bb83-85f56785282f","resolution":{"observed_at":"2026-08-12T15:08:53.730797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-12T15:08:53.768421Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.768421Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:9bceffa87455690c7d389fa93d126d234cdf4e3a45089dd86fb01b8761fd9ecf","observation_id":"9f994c93-3122-47c8-bd26-2ca7ec81dc13","resolution":{"observed_at":"2026-08-12T15:08:53.768421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.327690Z","title":"spacy 2: Natural lan- guage understanding with bloom embeddings, convolutional neural networks and incremental parsing","venue":null,"work_id":"0ea20c21-5c70-45ab-ae29-2b58ba8a5815","year":2017},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.783216Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:0b6c41640ed80e888f5b1b08b6664f0f4f288bad87ae76077be810c587dd35b5","observation_id":"e0a854e5-19ca-4449-8159-8bf6b8d2fed6","resolution":{"observed_at":"2026-08-12T15:08:56.362672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-12T15:08:53.821243Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.821243Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:a171cf28329d9f28b391046222b5a95f58b3deef90c8b43fc72fd1c43e6a8d18","observation_id":"ce474741-af47-465b-bc87-cbc72ca61bd7","resolution":{"observed_at":"2026-08-12T15:08:53.821243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.253929Z","title":"Tifa: Accu- rate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"7642cbce-2a8c-476e-8d16-e0255c9cf882","year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.842397Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:57b92f83af8cd9a1d101bc0c4df3d3034fa3dc26bbe8b622196e18d6a68e0592","observation_id":"7ffb49e3-94ef-49ad-a930-5195b5240431","resolution":{"observed_at":"2026-08-12T15:08:56.288975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05268","last_updated":"2024-11-30T11:55:19Z","snapshot_observed_at":"2026-08-13T00:35:14.954754Z","submitted_at":"2024-04-08T07:59:04Z","title":"MC$^2$: Multi-concept Guidance for Customized Multi-concept Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05268","snapshot_observed_at":"2026-08-12T15:08:53.854867Z","title":"Mc2: Multi-concept guidance for customized multi-concept generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.854867Z"},"links":{"cited_paper":"/paper/2404.05268","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:a6ce3a6ffb1c87d81df2b3f879d5d04a762bdefbca2e27cfd949e1372a8b456d","observation_id":"4139fcd9-6cf9-4359-9bca-762418452722","resolution":{"observed_at":"2026-08-12T15:08:53.854867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:53.879934Z","title":"Dense text-to-image generation with attention modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.879934Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:fe18ee16b31c5633fb1a79b69e56cb697d54ecf881578d578df7b952ef33c6ce","observation_id":"166d9dcb-4ec2-453d-b425-f61bd04fea16","resolution":{"observed_at":"2026-08-12T15:08:53.879934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-12T15:08:53.954810Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.954810Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:83106f3a38850a04a8fd812c9c9928f7daefb599f7fe1dd0ed213c4b184c2388","observation_id":"9be8d80a-c345-45a0-a1d6-eb7b3402a058","resolution":{"observed_at":"2026-08-12T15:08:53.954810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:53.982683Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.982683Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:22eba6bc65957605039814dddf9bfd99b94337bd68deb146ecf911252438b94c","observation_id":"978e7c52-b3e2-417e-9378-8a35852e42b8","resolution":{"observed_at":"2026-08-12T15:08:53.982683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:53.993512Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:53.993512Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:df64b1183fbcb738156f230ad8f851f9b7ad0f9c6a3e1f3f5a9fb2e902562095","observation_id":"cd0d00d4-ea19-4ec4-9c31-f439499692a8","resolution":{"observed_at":"2026-08-12T15:08:53.993512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17804","last_updated":"2024-03-26T15:42:01Z","snapshot_observed_at":"2026-08-13T00:44:36.119295Z","submitted_at":"2024-03-26T15:42:01Z","title":"Improving Text-to-Image Consistency via Automatic Prompt Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17804","snapshot_observed_at":"2026-08-12T15:08:54.008711Z","title":"Improving text- to-image consistency via automatic prompt optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.008711Z"},"links":{"cited_paper":"/paper/2403.17804","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:8def05ec6e10819c3be295640fd34271532cc868e47c5def83c8d98e870292a3","observation_id":"37b1587b-5b1e-4954-a3ad-5feb3b425a7a","resolution":{"observed_at":"2026-08-12T15:08:54.008711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20972","last_updated":"2025-03-24T12:16:17Z","snapshot_observed_at":"2026-08-12T22:13:53.382996Z","submitted_at":"2024-10-28T12:43:48Z","title":"Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!","version":2},"cited_work":{"arxiv_id":"2410.20972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.20972","snapshot_observed_at":"2026-08-12T15:08:55.172958Z","title":"Attention Overlap Is Responsible for The Entity Missing Problem in Text-to-image Diffusion Models!","venue":"cs.CV","work_id":"76e40adb-04a0-46a2-8c46-32b846d8f8c0","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.067179Z"},"links":{"cited_paper":"/paper/2410.20972","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:3de44ca41962340f4b150918decf341bcf7a7c789f48ecb254bd148ae37be890","observation_id":"c62ebd91-f847-4e46-a36a-22593e22af9e","resolution":{"observed_at":"2026-08-12T15:08:55.214378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:56.064481Z","title":"Conform: Contrast is all you need for high- fidelity text-to-image diffusion models","venue":null,"work_id":"657d5524-fef2-4aed-a24d-467c96f13469","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.125524Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:8a1f9aa8563bc5c912381f103a254989383acf641314267bf2be25389a3679f8","observation_id":"22456177-2924-4e5a-80e3-d21454ed916a","resolution":{"observed_at":"2026-08-12T15:08:56.127872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.970832Z","title":"Openai gpt-3 api [gpt-3.5-turbo], 2024","venue":null,"work_id":"b1dca9a9-a310-419b-bebf-7b54f40ac116","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.138455Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:b1e0e6d0828e7cbf76099600cd0e86b35da67997ef8de70207f4e9f9ed766ed3","observation_id":"70120ce3-9e5c-4932-97f2-7d689dec5a89","resolution":{"observed_at":"2026-08-12T15:08:56.003417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-12T15:08:54.150477Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.150477Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:0c9c9c781bf4b91265313a8600b6baa00ce4c2ea35a53712f293bccfb28d6931","observation_id":"1b51419f-9f9c-4f71-bb8d-f1216a926d55","resolution":{"observed_at":"2026-08-12T15:08:54.150477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14041","last_updated":"2024-07-27T14:22:56Z","snapshot_observed_at":"2026-08-12T23:18:58.374622Z","submitted_at":"2024-07-19T05:36:22Z","title":"Not All Noises Are Created Equally:Diffusion Noise Selection and Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14041","snapshot_observed_at":"2026-08-12T15:08:54.173401Z","title":"Not all noises are created equally: Diffusion noise selection and optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.173401Z"},"links":{"cited_paper":"/paper/2407.14041","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:8faf18e273f74397ebc2f529d174e87bda33909450aa338965f1b28eaa7e8c96","observation_id":"f7c116de-be8d-4031-88e7-7e733ee9434a","resolution":{"observed_at":"2026-08-12T15:08:54.173401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:54.188458Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.188458Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:0e54480667df9e7be7a7d669ebfaa06eb16f068e44c0bff0d56a1eaba0387bf6","observation_id":"1ade333e-63e3-43c6-9714-1cd9299d83c7","resolution":{"observed_at":"2026-08-12T15:08:54.188458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:54.235980Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.235980Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:3856415a10204d899750ae47fc820208196a810b1579ffe093b5e3d089da8eca","observation_id":"d350a184-03ee-4255-a4d6-34504c349c54","resolution":{"observed_at":"2026-08-12T15:08:54.235980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T15:08:54.256485Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.256485Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:3b99c9ae5ac8a736846bb9d13b050aab86c943b235b067126f3aeafe8e4f40e3","observation_id":"0b906bca-8342-4e94-a1ca-9173e430b137","resolution":{"observed_at":"2026-08-12T15:08:54.256485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.859059Z","title":"Linguistic bind- ing in diffusion models: Enhancing attribute correspondence through attention map alignment","venue":null,"work_id":"9da9eeb5-13bd-44b0-84bf-723e4456e11c","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.270378Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:a9fced32f7e1bd2068fbbf5aa111c862f40b9213e4833f4e50afa5f89fdb90b6","observation_id":"11e5687e-4de8-4665-8bde-81fe11a06ab5","resolution":{"observed_at":"2026-08-12T15:08:55.870591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:54.331546Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.331546Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:ec252989fb17f07894349f734a6d22008eaabb90e0c70a1887bdf939628dee08","observation_id":"b3976570-40f6-4017-8709-f07fdd194195","resolution":{"observed_at":"2026-08-12T15:08:54.331546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.781382Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"a10901d4-bb2c-4b08-b920-cd43f4acff2b","year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.376477Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:ca168f8edfcfda062a56bc03de5632f8dd088d151da0d17578b7e8fafd956073","observation_id":"e67aa0c6-9e1a-4956-a64a-a3190cd26d30","resolution":{"observed_at":"2026-08-12T15:08:55.791771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.750268Z","title":"Rethinking the spatial inconsistency in classifier- free diffusion guidance","venue":null,"work_id":"44492ef6-f84c-4c2f-9150-2a6ca9a3bb87","year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.386550Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:4c3a20a166e9df883c60b31082db753bc93427b5774d2e81f0396b4658d4e44e","observation_id":"bfd31bc5-6cb1-49fd-be3d-344a8282fc4d","resolution":{"observed_at":"2026-08-12T15:08:55.762366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-12T15:08:54.393582Z","title":"Massive activations in large language models.arXiv preprint arXiv:2402.17762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.393582Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:2494aaa308bd84c06a371538847fb5d4b19c456d7188e58c7e50cb486ee41f51","observation_id":"fd48f046-aa25-41ac-bf2b-ac475226fc33","resolution":{"observed_at":"2026-08-12T15:08:54.393582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:54.448164Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.448164Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:76a5f574c925caaed01c53fca3bd6e547cb8a636757bb0152ca53fc7986625d2","observation_id":"f95914e2-e112-4fba-9254-4cc7a3ab33f7","resolution":{"observed_at":"2026-08-12T15:08:54.448164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03626","last_updated":"2024-06-23T23:50:59Z","snapshot_observed_at":"2026-08-13T05:08:36.070418Z","submitted_at":"2023-12-06T17:13:15Z","title":"TokenCompose: Text-to-Image Diffusion with Token-level Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03626","snapshot_observed_at":"2026-08-12T15:08:54.481001Z","title":"Tokencompose: Grounding diffusion with token-level supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.481001Z"},"links":{"cited_paper":"/paper/2312.03626","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:8e654ec2cd6838e5abd79d1ea37bb0cc6f13229c56580c0f0dd6aa331eb896a7","observation_id":"61e611f5-978f-42c8-af57-4d3effba7709","resolution":{"observed_at":"2026-08-12T15:08:54.481001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-12T15:08:54.493758Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.493758Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:f2ae8fb342573fb37fc1ab6dd40213d6225f4878b5d11df886fd832b4ff105dd","observation_id":"7ea65f26-5a4c-4102-a902-2ab30b770d93","resolution":{"observed_at":"2026-08-12T15:08:54.493758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:08:55.680030Z","title":"Dynamic prompt learning: Addressing cross- attention leakage for text-based image editing","venue":null,"work_id":"64aa1010-c2ff-4a8b-8d4e-7c0c763e5acc","year":null},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.508264Z"},"links":{"citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:38c30ec8b2a997a129582fcea5f5a0cbeb4dfd39deed69d23a1b2b494c21143e","observation_id":"68feadc4-3997-4a2a-89c4-757edabb1c2d","resolution":{"observed_at":"2026-08-12T15:08:55.688429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15330","last_updated":"2024-10-27T04:44:41Z","snapshot_observed_at":"2026-08-12T23:59:02.601724Z","submitted_at":"2024-05-24T08:12:41Z","title":"Towards Understanding the Working Mechanism of Text-to-Image Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15330","snapshot_observed_at":"2026-08-12T15:08:54.570225Z","title":"Towards understanding the working mechanism of text-to-image dif- fusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.570225Z"},"links":{"cited_paper":"/paper/2405.15330","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:18ff6ad6e94f7f6fc599a8673a53ac9809b1e15d046a3ef76ae276b42a00146a","observation_id":"f24ac3fb-769c-4092-b47d-a0ea293bd3a1","resolution":{"observed_at":"2026-08-12T15:08:54.570225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01154","last_updated":"2024-04-01T14:59:13Z","snapshot_observed_at":"2026-08-13T00:40:04.705890Z","submitted_at":"2024-04-01T14:59:13Z","title":"Uncovering the Text Embedding in Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01154","snapshot_observed_at":"2026-08-12T15:08:54.605688Z","title":"Uncovering the text embedding in text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.605688Z"},"links":{"cited_paper":"/paper/2404.01154","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:f24fcfc82bc639a43f7796f8c3dfda864f48e314d5fcee6cdadf36c44b9884c6","observation_id":"5a92f757-1784-42dd-8ef2-10fe272ceac7","resolution":{"observed_at":"2026-08-12T15:08:54.605688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-12T15:08:54.617831Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.617831Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:effd594fb72f0f34dc61d9ba566b17a9151bb92ee73e08539c5089da93f687f3","observation_id":"988c4283-3a19-43a4-aa41-6e97888d8372","resolution":{"observed_at":"2026-08-12T15:08:54.617831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-10T14:28:08.728516Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-12T15:08:54.627473Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.627473Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:d2d803cb1e544c66414cec9d01ee86e94b418a131f66de3ed36ebaa5725684c1","observation_id":"1c5deeee-8208-4051-8fa1-6835cb49f8d4","resolution":{"observed_at":"2026-08-12T15:08:54.627473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06381","last_updated":"2024-03-11T02:18:27Z","snapshot_observed_at":"2026-08-13T00:58:00.883131Z","submitted_at":"2024-03-11T02:18:27Z","title":"Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06381","snapshot_observed_at":"2026-08-12T15:08:54.669287Z","title":"is there a green backpack?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:08:54.669287Z"},"links":{"cited_paper":"/paper/2403.06381","citing_paper":"/paper/2411.15236"},"observation_digest":"sha256:aab69efc1c37e76bfe207fd1ee722d5a327507821ccb783606059ff8e72f3573","observation_id":"2d139588-cb0e-453b-8fe0-eca0c44a2ca8","resolution":{"observed_at":"2026-08-12T15:08:54.669287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.15236","last_updated":"2024-11-21T23:37:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:01:56.180949Z","submitted_at":"2024-11-21T23:37:03Z","title":"Text Embedding is Not All You Need: Attention Control for Text-to-Image Semantic Alignment with Text Self-Attention Maps"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2411.15236."}