{"as_of":"2026-08-09T08:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5a3c495519aa1deee9794179f9ca58d901b8ac4f83376af5d8ba8d88a5b563e","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:01:52.609484Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:13:10.574530Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:38:29.278949Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"cited_work":{"arxiv_id":"2507.22076","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22076","snapshot_observed_at":"2026-07-03T14:38:29.278949Z","title":"Test-time prompt refinement for text-to-image models.ArXiv, abs/2507.22076","venue":null,"work_id":"fd50823e-de83-49d8-bfb7-0ac2b6ee0055","year":2025},"citing_paper":{"arxiv_id":"2604.09861","last_updated":"2026-04-10T19:43:06Z","snapshot_observed_at":"2026-08-02T11:28:37.898266Z","submitted_at":"2026-04-10T19:43:06Z","title":"Evolutionary Token-Level Prompt Optimization for Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:00.723170Z"},"links":{"cited_paper":"/paper/2507.22076","citing_paper":"/paper/2604.09861"},"observation_digest":"sha256:a64aa4dfb4b1677c026b725fb283313172066e4bbb74f1211a703f3e25b1b73a","observation_id":"5af3e4d7-3f17-45fc-acab-134cacffe0e0","resolution":{"observed_at":"2026-05-11T07:40:57.856590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"cited_work":{"arxiv_id":"2507.22076","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22076","snapshot_observed_at":"2026-07-03T14:38:29.278949Z","title":"Test-time prompt refinement for text-to-image models.ArXiv, abs/2507.22076","venue":null,"work_id":"fd50823e-de83-49d8-bfb7-0ac2b6ee0055","year":2025},"citing_paper":{"arxiv_id":"2606.13303","last_updated":"2026-07-31T12:46:43Z","snapshot_observed_at":"2026-08-06T09:21:13.456472Z","submitted_at":"2026-06-11T12:58:48Z","title":"DuET: Dual Expert Trajectories for Diffusion Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T06:58:39.254427Z"},"links":{"cited_paper":"/paper/2507.22076","citing_paper":"/paper/2606.13303"},"observation_digest":"sha256:47e964661d46ab04ec64a2afb3af978ff0434e04035c5f5957bebeb4f15c15c0","observation_id":"5a7d0d4a-ab9d-4063-99a1-367dc1aa8057","resolution":{"observed_at":"2026-07-03T14:38:29.280305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22076","snapshot_observed_at":"2026-08-03T02:13:10.574530Z","title":"Test-time prompt refinement for text-to-image models.arXiv preprint arXiv:2507.22076,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13303","last_updated":"2026-07-31T12:46:43Z","snapshot_observed_at":"2026-08-06T09:21:13.456472Z","submitted_at":"2026-06-11T12:58:48Z","title":"DuET: Dual Expert Trajectories for Diffusion Image Editing","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T02:13:10.574530Z"},"links":{"cited_paper":"/paper/2507.22076","citing_paper":"/paper/2606.13303"},"observation_digest":"sha256:958f95d43e7f8517ca163927dc87668e1f2965ad57b8101edad2d198b4dfa2d5","observation_id":"ee1caf41-9d5b-4243-9317-9ad86911a2f3","resolution":{"observed_at":"2026-08-03T02:13:10.574530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22076/citation-record","integrity":"/paper/2507.22076/integrity","json":"/paper/2507.22076/citation-record.json","paper":"/paper/2507.22076"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.176538Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.176538Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:9c62e77655f43417fd861e8a716e22039275b0811bd35c65b44c003073e1111f","observation_id":"43569dd6-df28-472c-b09b-7dd3ef991d24","resolution":{"observed_at":"2026-08-06T15:01:52.176538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.716626Z","title":"Blended latent diffusion","venue":null,"work_id":"e2e4c7f5-d19c-4d3d-bcb2-41e83ab22261","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.182180Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:ca5fd4fcd72e30d2e74a284de1a5d289a9fd92a4ec6f85b10186a31a9a4a77f6","observation_id":"d086ba3e-d8bd-4d9a-b8bc-3c593c135bf0","resolution":{"observed_at":"2026-08-06T15:01:53.721694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T15:01:52.186385Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.186385Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:aa1946bc39c727e18fdeb99b28ec3c96458538a69f931f481ded875cbfddf204","observation_id":"2e92cf0d-7eeb-4d4c-9d31-50ebba10271f","resolution":{"observed_at":"2026-08-06T15:01:52.186385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.692667Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":"28a6742e-1672-4bf5-94da-b3c7e2b217c6","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.191212Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:27aa1486d5750b8ac10dfbca87d5e83f21fa83ea2f8dfc53c73fd055d4cc78a1","observation_id":"7f4b6d50-f2df-4c29-b53a-be447b2216c3","resolution":{"observed_at":"2026-08-06T15:01:53.700213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.674693Z","title":"Improving image generation with better captions","venue":null,"work_id":"0e2b6edc-3aa2-476b-9a6f-5806db7c3319","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.195527Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:60034fdb613ab40a105ae09569f3330ec8f2a971fc3b0c3cd80aa60a33797457","observation_id":"9c19095c-5274-4f7e-8dbd-ea1d0be6be35","resolution":{"observed_at":"2026-08-06T15:01:53.679210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.658145Z","title":"Training-free layout control with cross-attention guidance","venue":null,"work_id":"3c5d39e9-8797-4d2b-af77-ddddf9256cbe","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.199854Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:cf33d2c58c9455103b9b7f0b432d08afc3674373df3f603d798e50758db58e05","observation_id":"f1065118-1e2e-437d-8dbc-4419629261b4","resolution":{"observed_at":"2026-08-06T15:01:53.663088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.639729Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"1ff85f45-4a05-4fcb-9de1-a6d228b38095","year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.204947Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:dd1c3e646c6ae6d0c14819316f8070abb791574e5f7b0a86e262c119332c0c94","observation_id":"e5531e3a-38e1-423a-8b42-ad44ed35c59a","resolution":{"observed_at":"2026-08-06T15:01:53.645208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.622154Z","title":"Cogview: Mastering text-to-image generation via transformers","venue":null,"work_id":"27beb205-d0af-4ec8-b91b-0ba0dc7915f8","year":2021},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.210094Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:b31811f696d0897cd31344207268b44ab075e9ea5ad0b55ba11f63b2a18ab3bb","observation_id":"7a840b82-e008-4775-abc9-d7e62f1a7d72","resolution":{"observed_at":"2026-08-06T15:01:53.627074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.215333Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.215333Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:38fa15128db8218d5e87c83cd8d983e12e12c912c1be1dac71c80a3d5409cd01","observation_id":"8cad3c74-3d26-436f-ac96-f036b47e3f99","resolution":{"observed_at":"2026-08-06T15:01:52.215333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.593682Z","title":"DPOK: Reinforcement learning for fine-tuning text-to-image diffu- sion models","venue":null,"work_id":"9dac6eea-ed6f-4d83-89cc-1e0def2a28ad","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.220132Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:96dcb03fd85fed51b3780ce9f8c94958639c89d2a117390b4a315767cf9844b1","observation_id":"41cb1387-aa9d-4c76-ae4e-f2046d7fd1be","resolution":{"observed_at":"2026-08-06T15:01:53.598235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.224431Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.224431Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:0893fa8ad8690127b7612f19cab9759cc41f25999eb61b0fdfc13e547d2710a1","observation_id":"2ec0318e-7b3d-4610-9ee5-19cc19ca7bb2","resolution":{"observed_at":"2026-08-06T15:01:52.224431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.563281Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":"59bae68f-a743-4086-9c36-fbb2b7c79b70","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.228582Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:a123a4154a6d843d5acf62d0cefc9f071489387b9d343e660925258916f8d803","observation_id":"b668eda1-6ab9-4385-b393-4e9b5541dd2f","resolution":{"observed_at":"2026-08-06T15:01:53.570232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10640","last_updated":"2024-02-25T23:23:00Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:57:37Z","title":"LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10640","snapshot_observed_at":"2026-08-06T15:01:52.232968Z","title":"Llm blueprint: Enabling text-to-image generation with complex and detailed prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.232968Z"},"links":{"cited_paper":"/paper/2310.10640","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:2a762bfbfeadbf596846a793b792529790aac20ffe84dde74e6576b5edb417b9","observation_id":"d2feb80e-38fb-46c3-bf8f-41a51c693c73","resolution":{"observed_at":"2026-08-06T15:01:52.232968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.545063Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment","venue":null,"work_id":"2be56de8-1f8c-4fc2-82ba-ee1eea986050","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.237769Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:2ce35ad4ae873fe42933ad91365a8b8456f0155a556e26006686b3f9167e7d69","observation_id":"7fb07d2c-bc98-4ba5-a989-8c9a404d06ba","resolution":{"observed_at":"2026-08-06T15:01:53.551291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T15:01:52.241657Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.241657Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:171eddf059813eaf438e2d34d934e9c488e3fced940df8855fd3a91873540fd9","observation_id":"607496b9-0335-4ba5-8b1e-70b831dbe442","resolution":{"observed_at":"2026-08-06T15:01:52.241657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T15:01:52.246022Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.246022Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:2a1853c558798b093037ded866587a31813bb6ef262221b912e110f451194e60","observation_id":"5d66487a-27c2-485b-a521-03b2ffe11767","resolution":{"observed_at":"2026-08-06T15:01:52.246022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.523080Z","title":"Few-shot classification and anatomical localization of tissues in spect imaging","venue":null,"work_id":"b4b022fb-e2a9-4bb9-969c-e087c2695ff7","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.250084Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:fe2bf8b0e316ed5915838fd87327a3ecade26ca8a811ff28a7a7b179067545ec","observation_id":"7b7040ec-03fc-4003-bbd9-b6762caf11d4","resolution":{"observed_at":"2026-08-06T15:01:53.529471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.504091Z","title":"Clas- sification of microstructure images of metals using transfer learning","venue":null,"work_id":"c2970d3d-7da8-43e4-9b7b-afe332ea89be","year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.254159Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:a48ceb4941a9664209b7ff86f5fcd9ea26bbffb45d97aacfd6c50d317d1d4f80","observation_id":"f334e179-6c0b-4836-805a-a3a84e487e3a","resolution":{"observed_at":"2026-08-06T15:01:53.510571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.487790Z","title":"Alina: Advanced line identification and notation algorithm","venue":null,"work_id":"b94e9a83-baf1-40c0-a920-4a2ba8fab405","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.258108Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:ac1d434235a4c818b877b6ca32cb883bc6a9ca02c81a2bc3f606d9b1ed6a8993","observation_id":"ac1bfb0e-b880-4f05-a352-0d20f21c9884","resolution":{"observed_at":"2026-08-06T15:01:53.492598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.470708Z","title":"Gen- erating images with multimodal language models","venue":null,"work_id":"a4bc6ef1-4368-4abd-be9f-19f586b6ee5e","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.262537Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:fe9f707c755dfa8b44d40b935ff23ae0b56104c1a3c7df0203ddebe6adc9a459","observation_id":"4fbd46a4-5c4d-46b5-96cd-ec8e50de5cb6","resolution":{"observed_at":"2026-08-06T15:01:53.476091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12642","last_updated":"2024-12-26T01:49:20Z","snapshot_observed_at":"2026-07-06T18:47:51.907417Z","submitted_at":"2024-07-17T15:10:01Z","title":"Zero-shot Text-guided Infinite Image Synthesis with LLM guidance","version":2},"cited_work":{"arxiv_id":"2407.12642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12642","snapshot_observed_at":"2026-08-06T15:01:52.891924Z","title":"Zero-shot Text-guided Infinite Image Synthesis with LLM guidance","venue":"cs.CV","work_id":"81251dd8-ca14-4172-819d-a1bf02e1a1c7","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.267531Z"},"links":{"cited_paper":"/paper/2407.12642","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:4b9ef4d2e83f4fa5898b9729a41040831398e2396bfe3bfad5397c4e304a4fe3","observation_id":"1e8729aa-64a5-400f-8ff6-9fa8c1c86155","resolution":{"observed_at":"2026-08-06T15:01:52.927761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.453922Z","title":null,"venue":null,"work_id":"ecdb3eb1-da64-46a6-95d3-d388f37c7ffe","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.273106Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:2284b6a1352871295e48c13853fa08bad198568adafe8c8fd4eb24eb81b26184","observation_id":"0b04754e-ca52-4c10-965f-b0fc759b9aa5","resolution":{"observed_at":"2026-08-06T15:01:53.458307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-06T15:01:52.277213Z","title":"Aligning text- to-image models using human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.277213Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:8d63a883584883abcef05efb940ec9b3ff888020863ff8345d28a05ef0188a25","observation_id":"c458aae0-ddd2-42cd-8521-ce422abd5c84","resolution":{"observed_at":"2026-08-06T15:01:52.277213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.281822Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.281822Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:2a4b292ddc9fd817896ba14d3b72cf67928535f1d30c0b5994f72127f129ae47","observation_id":"ed207dd5-73fc-477d-b770-76d4b4edfa32","resolution":{"observed_at":"2026-08-06T15:01:52.281822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.422368Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"efa76ec3-c1c1-4ff2-9036-e17a673e5601","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.285748Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:dcfb3bf96c6d9e171ef76b85af79431e051f82d9ead1e8028d6eb38e9b3ed83d","observation_id":"b870a995-e2de-4ba2-9621-f8a92b33a46a","resolution":{"observed_at":"2026-08-06T15:01:53.429341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13655","last_updated":"2024-03-04T18:43:49Z","snapshot_observed_at":"2026-08-07T08:09:13.605920Z","submitted_at":"2023-05-23T03:59:06Z","title":"LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13655","snapshot_observed_at":"2026-08-06T15:01:52.290435Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.290435Z"},"links":{"cited_paper":"/paper/2305.13655","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:4e663857263836a1c1703787cdac263d39c07ca1a96e53dd75b7e545eb214b2d","observation_id":"0f586462-6019-4bfd-a6d6-84efb249685e","resolution":{"observed_at":"2026-08-06T15:01:52.290435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-08T15:18:23.500459Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-08-06T15:01:52.294824Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.294824Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:c1df04a4cbe711f8eaa78bf901bdbe2822ba3d9c0fb1384445a7e4f14cf51464","observation_id":"666964f2-506d-4ca3-860c-6dda68be8baa","resolution":{"observed_at":"2026-08-06T15:01:52.294824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-06T15:01:52.299646Z","title":"Inference-time scaling for diffu- sion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.299646Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:175f8056e6df4f60f58666907d2c0766b58f96fcb302077d40e5464cb0fcb0e9","observation_id":"d2b90bad-7946-40f5-a4b1-644a8afd93a2","resolution":{"observed_at":"2026-08-06T15:01:52.299646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11802","last_updated":"2024-09-21T06:53:58Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:49:01Z","title":"PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11802","snapshot_observed_at":"2026-08-06T15:01:52.303932Z","title":"Phybench: A physical common- sense benchmark for evaluating text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.303932Z"},"links":{"cited_paper":"/paper/2406.11802","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:9a3fb3253f29deea472f8e40e3d629dbe62b6d7add286e78ef89ba300a489c7f","observation_id":"c69a07c1-9aec-482b-b49f-5660feabae24","resolution":{"observed_at":"2026-08-06T15:01:52.303932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.402060Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"f2d847c8-f964-4823-9ec4-6ee35c2da346","year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.308732Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:ae17f4b22bdbc6fe181ffe580b8fef54bfe5cce921d08a957220238ae8a939d3","observation_id":"0827f241-f3f2-4252-abbf-8283292521de","resolution":{"observed_at":"2026-08-06T15:01:53.409155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T15:01:52.313124Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.313124Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:cf0d62af7cec946beef198552bec138fd81c4ed8f05f2ae397978b0d0623e826","observation_id":"7e5399fb-d84e-42d3-b10c-bd914fde2f4b","resolution":{"observed_at":"2026-08-06T15:01:52.313124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.385685Z","title":"Localizing object-level shape variations with text-to-image diffusion models","venue":null,"work_id":"bf80856e-945d-45d2-9226-dd06855e372a","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.318058Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:571036f68659ed5d11410089b908f92f1ff41ad6a4bd367aa87f5494af3f5407","observation_id":"3edf1190-2cbd-4ab6-9b5a-52d72c946208","resolution":{"observed_at":"2026-08-06T15:01:53.390860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T15:01:52.322258Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.322258Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:7c6aee1129a938516fff7d7e1bab2cde363ae2a0b899852a09385cce1dfcc538","observation_id":"7e66b17b-116f-467a-a772-e431decfacdc","resolution":{"observed_at":"2026-08-06T15:01:52.322258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.327594Z","title":"Diffusiongpt: Llm-driven text-to-image generation system","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.327594Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:6d3d922158cc11369adde0ce1655182d91c88b9dd672ba960f5b08df587fb105","observation_id":"8fc2749c-911d-4d41-a400-bcca2f8dbe4f","resolution":{"observed_at":"2026-08-06T15:01:52.327594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.367721Z","title":"Layoutllm-t2i: Eliciting layout guidance from llm for text-to-image generation","venue":null,"work_id":"362177b6-c772-43ef-a440-374d5b77af1a","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.331685Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:023ca6f7afc56455e83ed397b452743216502b2c89be6112a4e6d7152bc3c428","observation_id":"4be411d5-7a06-439d-8ffb-7f5fd95a4a65","resolution":{"observed_at":"2026-08-06T15:01:53.373242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.351131Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"da974013-a117-46a8-9ca2-ac8c8400b396","year":2021},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.335654Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:84a4608afa12327208786344f025b2ce85f6a80e931a0eb446ea9ca9e86851bc","observation_id":"95ae111d-5157-41a2-bd76-2f672cfde516","resolution":{"observed_at":"2026-08-06T15:01:53.356271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.329934Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"53e4b649-4587-41f3-952b-86f563c428cf","year":2021},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.339583Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:1f49b0a171e261c669807bd75d91379ad19d38147d4a94802455d771a1f76d27","observation_id":"dbe6e7c9-470f-4e2d-94b5-667c65a5c52f","resolution":{"observed_at":"2026-08-06T15:01:53.335735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T15:01:52.343453Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.343453Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:7faecf36ecf195bd4dd3ff1421169fbff410d77cc22cc3d72b62721db00553ef","observation_id":"f24677d5-041d-4729-8ad2-7a39540dd740","resolution":{"observed_at":"2026-08-06T15:01:52.343453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.347957Z","title":"Generative ad- versarial text to image synthesis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.347957Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:9f36cd5ab064872476d95b58bd5ae10579f3a464adc61bb5437b0f7fc53c4e11","observation_id":"5b6bbfd6-dd56-4e85-bb72-145d4820cb02","resolution":{"observed_at":"2026-08-06T15:01:52.347957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.302816Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"ccab0a2b-39d6-4501-8735-cb493519f338","year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.352213Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:e30bb5e85474cc7ccdcd6be4e3145730221b7cf2dc99445a028b54ed0b04e049","observation_id":"054a60bb-6615-44f5-bcb2-ca5f51cd2a55","resolution":{"observed_at":"2026-08-06T15:01:53.307768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.357931Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.357931Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:754b991a468add3991c96817691ed32b054f83f6b68b1900269bf671c9ff8f2e","observation_id":"34456057-989b-4c33-95f7-f18177b0478c","resolution":{"observed_at":"2026-08-06T15:01:52.357931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.276801Z","title":"Benchmarking awesome diffusion mod- els","venue":null,"work_id":"b519ff50-2b56-4172-bce3-013be60e1f84","year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.362885Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:10eaab967d3098d3f9396ad89e35018460fb19e6261fe217598195c8ad007777","observation_id":"a3b624fe-b3e8-4325-9b8a-77b0efa9309a","resolution":{"observed_at":"2026-08-06T15:01:53.281385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.244645Z","title":"Df-gan: A simple and effec- tive baseline for text-to-image synthesis","venue":null,"work_id":"f6c7b724-1782-43dc-ba5e-ccaa12707064","year":2022},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.371093Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:d566db33093d225d16f1a897e073ef413355958a649ba9297cd7ccf50e83ea7b","observation_id":"6f5a8638-aeef-488c-9eb8-5dd93c618c76","resolution":{"observed_at":"2026-08-06T15:01:53.249741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.228899Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":"74962ae4-64d2-4452-965f-274eee30efa8","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.375107Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:0e2968eedbe9a0c0d159021ca4188552e35cf999a6be2f689bad13b779dc307f","observation_id":"52b951c6-ecf2-45a9-ab21-7763cce1a45b","resolution":{"observed_at":"2026-08-06T15:01:53.233186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-06T15:01:52.379789Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.379789Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:1ec008a0caaff5873fcefee70ee63f3da8ee0a33a93b56151c658aa5ed98d5a7","observation_id":"8757f061-212b-41f5-9a4d-2d7b2673e23a","resolution":{"observed_at":"2026-08-06T15:01:52.379789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.213773Z","title":"Self-correcting llm-controlled diffu- sion models","venue":null,"work_id":"cc110ce3-3d02-4ea7-bdb7-0161a9f1aca3","year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.384252Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:55ba27711987741ba439470e2e1261b6f1cb50b050e630930f1440ff51b4d2d1","observation_id":"306d0874-42d8-4f2c-8762-a23c7dabc5b3","resolution":{"observed_at":"2026-08-06T15:01:53.218936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.196940Z","title":"Boxdiff: Text-to-image synthesis with training-free box-constrained diffusion","venue":null,"work_id":"b6b50512-fc0f-4796-94c4-14bb48826057","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.388650Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:a8b92a4c72618133d33a9b72529bd38acbbecf0b88d84147a77593de787db7c4","observation_id":"c40d7134-6a2b-4b31-99d2-0c92c2e7e2f6","resolution":{"observed_at":"2026-08-06T15:01:53.201848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.182570Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"0ab49a6f-a67e-488f-838f-6d73a6c72e08","year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.393591Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:25dc8b1dde3d05d940cdd69f23436ee2000d892abab89c4c38fc56bdfb16823a","observation_id":"585525c1-dfa8-4590-8882-11ae613bb283","resolution":{"observed_at":"2026-08-06T15:01:53.187417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T15:01:52.540099Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.540099Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:3245ee8f926b989b39a7d6e9d9faf060bc92409181beddb55821fc7002de3db2","observation_id":"e1077ab1-cc15-4f07-adb7-24b287ce6577","resolution":{"observed_at":"2026-08-06T15:01:52.540099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.167811Z","title":"Paint by example: Exemplar-based image editing with diffusion mod- els","venue":null,"work_id":"2d2bdc58-49b6-4521-97da-63f4104ac454","year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.547403Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:a14fc4400d8dd0b26cdac2ecdbab7fa6d069f3d0e64fa6f27516a02961da507f","observation_id":"de47594c-35f6-4206-8575-02af20cd8924","resolution":{"observed_at":"2026-08-06T15:01:53.172630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.554275Z","title":"Reco: Region-controlled text-to-image genera- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.554275Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:f520f9ae0fb9a0e837d4eaa1799dfce5f157c28ccc92d7e4d0b8295766a6fea7","observation_id":"f64aab34-d6b6-48cc-8bc1-1d97b6cceb17","resolution":{"observed_at":"2026-08-06T15:01:52.554275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.144437Z","title":"Stack- gan: Text to photo-realistic image synthesis with stacked generative adversarial networks","venue":null,"work_id":"3e573951-647b-4560-9461-03eb9325be8b","year":2017},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.562603Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:257d6f249f0c83b783cfa9a1ab9477449ae89b5d8234581eee19da13987e9c05","observation_id":"958ad8bd-cfe6-412a-8dfe-7f255a1b844e","resolution":{"observed_at":"2026-08-06T15:01:53.148697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:52.569855Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.569855Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:a53f8958475f7acc38780b48b726201fb89113dd4906d437bae229b09fee5fed","observation_id":"85a3587b-fc2c-4b79-928e-7d51e7409aa8","resolution":{"observed_at":"2026-08-06T15:01:52.569855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.118943Z","title":"Controllable text-to-image generation with gpt-","venue":null,"work_id":"79d593a1-8126-49e9-abbd-5f902237ba69","year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.576873Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:bea310ed779b3758aed17e02aeff223ee16685dad0611a075d2a02a6e4742efd","observation_id":"2513d08e-c38d-43c6-8d7f-5e9f15a9e864","resolution":{"observed_at":"2026-08-06T15:01:53.123489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.103406Z","title":"Dm-gan: Dynamic memory generative adversarial networks for text- to-image synthesis","venue":null,"work_id":"73325df5-b040-47f7-82cc-21724122d35e","year":2019},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.593493Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:eff32c798ccf5d5bda93d86a0e2ee96429704726aad818b2770ed8a9d1995d74","observation_id":"e7e3f439-9ce0-49a1-891c-c8ddd560bf47","resolution":{"observed_at":"2026-08-06T15:01:53.108208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18583","last_updated":"2023-05-29T19:56:47Z","snapshot_observed_at":"2026-07-06T15:35:07.850568Z","submitted_at":"2023-05-29T19:56:47Z","title":"Controllable Text-to-Image Generation with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18583","snapshot_observed_at":"2026-08-06T15:01:52.585344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.585344Z"},"links":{"cited_paper":"/paper/2305.18583","citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:afc4554822ef96ceab0a5cd2367ddc8f629974f628d8ebf85d227264131116eb","observation_id":"6c7405c6-5644-493e-8975-3742ad478835","resolution":{"observed_at":"2026-08-06T15:01:52.585344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.088716Z","title":"Benchmark Datasets We use three benchmark datasets to assess compositional fidelity, prompt comprehension, and generalization: 9.1.1","venue":null,"work_id":"88da4d05-97df-4f7b-8627-e256cd84a95b","year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.601255Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:4c67959650f6bc7255506259baf2f5fc044ce19274e20cb0088303a61d6e79e2","observation_id":"b152ec5c-59c1-4354-b5b8-6dd4a6c28df3","resolution":{"observed_at":"2026-08-06T15:01:53.093043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.056608Z","title":null,"venue":null,"work_id":"ba71bb17-8f08-4d6c-aa02-468a43f52095","year":null},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.609484Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:c562779254a46ffc40e9bdd84183eba387018af080f253de97c32430a91b7e8f","observation_id":"0c053d58-a99d-4125-a188-9f923a76db6d","resolution":{"observed_at":"2026-08-06T15:01:53.078443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:53.261947Z","title":null,"venue":null,"work_id":"a8a94b4b-1534-4313-9df4-d4dbc26e2c01","year":2025},"citing_paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:52.367049Z"},"links":{"citing_paper":"/paper/2507.22076"},"observation_digest":"sha256:389504e55d8fd66bb8e10e947f9b7dc030d57915383ea881c0902068b0bda7b1","observation_id":"7bb962e7-2f81-48b0-a76f-fcc33561f370","resolution":{"observed_at":"2026-08-06T15:01:53.266861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22076","last_updated":"2025-07-22T20:30:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:20:26.670376Z","submitted_at":"2025-07-22T20:30:13Z","title":"Test-time Prompt Refinement for Text-to-Image Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 3 inbound Pith citation observations for arXiv:2507.22076."}