{"as_of":"2026-08-08T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e510236e3072d74174d60074a5f17774bf04c16d3a067e66d47378566c3cce14","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:32.127569Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T04:22:19.645747Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T12:01:03.744330Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"cited_work":{"arxiv_id":"2505.16915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16915","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.16915 , year=","venue":null,"work_id":"f40553de-5a65-4666-82bd-3252bf30f50a","year":null},"citing_paper":{"arxiv_id":"2604.18258","last_updated":"2026-04-20T13:31:36Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:31:36Z","title":"Long-Text-to-Image Generation via Compositional Prompt Decomposition","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T04:22:19.645747Z"},"links":{"cited_paper":"/paper/2505.16915","citing_paper":"/paper/2604.18258"},"observation_digest":"sha256:a0efae281acf0405751927670d0c9469ea1bd9b7c6b436b6f73bd1a502743b84","observation_id":"195a35c4-a2a8-4831-9f81-b7e23fe20712","resolution":{"observed_at":"2026-06-02T03:03:59.454800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16915/citation-record","integrity":"/paper/2505.16915/integrity","json":"/paper/2505.16915/citation-record.json","paper":"/paper/2505.16915"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:25.236529Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.236529Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:7e4d21a8193cb56434c2004864b238285975b9a86c3fa59183467e55128a3226","observation_id":"b8deb0b7-dfd9-464d-9da3-a7b1cbd601d2","resolution":{"observed_at":"2026-08-07T14:55:25.236529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:55:25.342327Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.342327Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:d06a2c0cbc0b6b5c8aa180ae4172c6addd873a51343046a13bd91ba0b2d39365","observation_id":"4498b290-d28e-4c13-8b66-d28935da35c7","resolution":{"observed_at":"2026-08-07T14:55:25.342327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:38.159731Z","title":"DeepFloyd IF : a novel state-of-the-art open-source text-to-image model with a high degree of photorealism and language understanding","venue":null,"work_id":"6d083f98-0e50-4b59-8c54-db4a8e02927a","year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.433566Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:0ab8b42accffb2acd6004c9a00c9ccff782ae579f1af2e1726f9c7c8235f7ac8","observation_id":"f0842ee5-ed83-4c63-b60e-84833b0e07c8","resolution":{"observed_at":"2026-08-07T14:55:38.220244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.979028Z","title":"Hrs-bench: Holistic, reliable and scalable benchmark for text-to-image models","venue":null,"work_id":"36d4f163-29c4-4974-b19d-91c14aa4ef9b","year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.519668Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:ddaa730ddd7dce4be9c54db4605a501059946719e221592c81fac7b3b56126f0","observation_id":"a4557e7d-0c77-40f5-bf90-7a8f4f35506c","resolution":{"observed_at":"2026-08-07T14:55:38.055478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:25.597506Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.597506Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:40a6b51471662a7ad9aedbe3f4daf98275777efc902b23c8fb7a24b41a9c7575","observation_id":"651e8506-075d-4375-88e3-58bc10c3913d","resolution":{"observed_at":"2026-08-07T14:55:25.597506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.753863Z","title":"A survey of ai-generated content (aigc)","venue":null,"work_id":"8ca121e0-3a96-4044-8a47-7a43eda01541","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.700744Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:1c905c631fe5d93fb623344269722bf1dd028030a84bee5ca35490f0cb599309","observation_id":"d2fa7e38-cfa9-4415-b6cf-853663cb796a","resolution":{"observed_at":"2026-08-07T14:55:37.868801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:25.758652Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.758652Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:38463cc7d544e30b336f2d371598f79c234bb6b1647560294a3b72eafdb38bef","observation_id":"a83e2d2d-7547-4196-af5c-909f41291762","resolution":{"observed_at":"2026-08-07T14:55:25.758652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.616391Z","title":"Data-juicer 2.0: Cloud-scale adaptive data processing for and with foundation models","venue":null,"work_id":"71ab19bf-172f-444a-b5b3-a198ce544aa7","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.856431Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:f74f3dea135167e4b5649784f5a70c21186ecd3c4003be948b683b6afe18b8ed","observation_id":"b4519c43-82da-4928-9b58-f0d06a162b60","resolution":{"observed_at":"2026-08-07T14:55:37.690180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.431109Z","title":"Data-juicer sandbox: A feedback-driven suite for multimodal data-model co-development","venue":null,"work_id":"4cdbbde5-eaf9-4dfa-b4bf-f2765ce102ce","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.923136Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:eb3648b8514a78afff5a6f7834ee727985b83e2cedc6937c840319d49d757737","observation_id":"fd7d9d22-bb62-4c69-9316-d6aa7ee9793e","resolution":{"observed_at":"2026-08-07T14:55:37.517849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:55:25.989364Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.989364Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:a0f18fe007fc69c4c1a4ca4717e603a69531a45c4f4916411e846530efc2dfe6","observation_id":"13a8bef6-d4c6-4bb7-9e4f-450488504528","resolution":{"observed_at":"2026-08-07T14:55:25.989364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-07-06T16:39:32.455002Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-07T14:55:26.052578Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.052578Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:8da62d1d9fb5ac9e3abbdc13d4b1810e7ac8ba97412f3829f40b2eb99589645b","observation_id":"70c08de5-668e-4f95-856b-e23380c9e598","resolution":{"observed_at":"2026-08-07T14:55:26.052578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-07T14:55:26.176849Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.176849Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:5528e9ce76c9725019fb44dcc90cf3f96b633bfb4094f566b48e539db970c59c","observation_id":"85f93c2a-e2e8-4692-8afb-1728d3548073","resolution":{"observed_at":"2026-08-07T14:55:26.176849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.232626Z","title":"Diffsynth: Latent in-iteration deflickering for realistic video synthesis","venue":null,"work_id":"12c009f0-059c-4162-9160-e66d6e85b399","year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.238858Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:6b841c61417bfe8c05fc05ce79b250789bca66d49de423b13c56821dc53e9390","observation_id":"94de4e54-9fd9-4681-82ff-b7f38d7b989b","resolution":{"observed_at":"2026-08-07T14:55:37.291485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:26.243518Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.243518Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:46caf98562615f9e9151f5a96b3a61f627f7d6ec436549cde9523acccba7e0b5","observation_id":"fc602498-e7b0-4e83-a5d0-f65b21eebc1c","resolution":{"observed_at":"2026-08-07T14:55:26.243518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.080895Z","title":"nsfw-image-detection","venue":null,"work_id":"c01c49b3-0586-4f8a-89b9-0a8d7398922e","year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.280885Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:b44187ddade5f4520af9e962e6a49b941437326ee7f4ac4e628646211b1b786d","observation_id":"18f1ba49-3f16-4ae5-af57-72a4be1e6706","resolution":{"observed_at":"2026-08-07T14:55:37.134203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10640","last_updated":"2024-02-25T23:23:00Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:57:37Z","title":"LLM Blueprint: Enabling Text-to-Image Generation with Complex and Detailed Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10640","snapshot_observed_at":"2026-08-07T14:55:26.445655Z","title":"Llm blueprint: Enabling text-to-image generation with complex and detailed prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.445655Z"},"links":{"cited_paper":"/paper/2310.10640","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:6e2833a165a3963fa641e4d32fcf0854c16826d5c211c4c8d2d6d511c1e86091","observation_id":"36d99a75-cc11-4bfa-9750-bf4d522af339","resolution":{"observed_at":"2026-08-07T14:55:26.445655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:26.527836Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.527836Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:178cb2b856b1ea34702badfcc4bcc6148cc1cf90bc641d94b88226ca1caad0a0","observation_id":"dcc1c580-9363-4814-a25a-deff32e7e82f","resolution":{"observed_at":"2026-08-07T14:55:26.527836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.879016Z","title":"Gemini 2.0 flash image generation","venue":null,"work_id":"bbb09996-3e85-4897-bd78-ebe748649873","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.698490Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:a0d25dc7e61c352262a397d790fa0b56a0a02e56ccfd7acc12a587d79aca1ce7","observation_id":"9663f881-1aad-40f0-98b6-da6612525720","resolution":{"observed_at":"2026-08-07T14:55:36.963214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T14:55:26.882061Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:26.882061Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:60c002af6f0670900f62f6268678f6a58faf09cd9fbcf1f677d38b63e981a4bd","observation_id":"5ddb6e81-0817-4e4c-b02d-47951ebf0898","resolution":{"observed_at":"2026-08-07T14:55:26.882061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:27.012502Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.012502Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:7596a43ec2742a052636136aaf1cee641bce3982be91a34476af9cb3060b9186","observation_id":"e33d1df4-9838-4c80-8e85-90391aebdd27","resolution":{"observed_at":"2026-08-07T14:55:27.012502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T14:55:27.234325Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.234325Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:319442d97cf1b89fcc1e7461e6277710adaf0f65815c076a9f4e38f06f482408","observation_id":"d601b964-d16a-4078-8aef-6441b89316ad","resolution":{"observed_at":"2026-08-07T14:55:27.234325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.710253Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"61cdd169-1e19-4b4d-80b6-a8f80704a60d","year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.337676Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:20f53f4fe808af7f7544c19e6343e35a429db4f2373419b4832bab2a927a9576","observation_id":"376db6c2-17d9-4866-97e1-94d7b530cce0","resolution":{"observed_at":"2026-08-07T14:55:36.778465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:27.465217Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.465217Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:6424b16e3119a6d989259aa7fee37d1e56d4ab8b2d7ea1829e9023aecf8bad06","observation_id":"5745046d-35de-419c-8175-f543fb3fc1a3","resolution":{"observed_at":"2026-08-07T14:55:27.465217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.478839Z","title":"Visual storytelling","venue":null,"work_id":"c48f781e-1bd6-4508-b917-5adda155819e","year":2016},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.620511Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:6f98f1e69f1f9cf8000e5021272ea463ebb642fb45a6d9bdab70eac2604219ac","observation_id":"340e6967-515d-4845-a9c9-69ae3e845280","resolution":{"observed_at":"2026-08-07T14:55:36.569719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17981","last_updated":"2024-12-19T11:25:34Z","snapshot_observed_at":"2026-07-06T17:23:10.017122Z","submitted_at":"2024-01-31T16:38:32Z","title":"From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17981","snapshot_observed_at":"2026-08-07T14:55:27.700565Z","title":"From training-free to adaptive: Empirical insights into mllms' understanding of detection information","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.700565Z"},"links":{"cited_paper":"/paper/2401.17981","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:9ce0fbec5abef35cc45cfa24924c926bfa1efa8fe8e2113dc9389cd9ffa92d7c","observation_id":"fe3c505b-b2cd-46c9-9c04-aa50bc229374","resolution":{"observed_at":"2026-08-07T14:55:27.700565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.285096Z","title":"Img-diff: Contrastive data synthesis for multimodal large language models","venue":null,"work_id":"43a6c3a7-bdf2-476b-a01e-7ba4369ac7ed","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.775137Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:1fcdda6ddc8183555f271550fd495458438421118a6b66125d51bc143c08b348","observation_id":"b3377342-8b73-4474-bc1e-cf5316b19167","resolution":{"observed_at":"2026-08-07T14:55:36.402490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.081117Z","title":null,"venue":null,"work_id":"e64e54bb-a5df-4f17-8464-a45309525b75","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.850025Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:2b00e54ce8172e3af55f01bad833f8ed1d9bf1b47619ffbd5a5380a7d49480a6","observation_id":"026e90cb-ef80-4780-a940-84c965a49dff","resolution":{"observed_at":"2026-08-07T14:55:36.167255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.853135Z","title":"Natural language understanding and inference with mllm in visual question answering: A survey","venue":null,"work_id":"e7abd52c-0ea6-4039-8b92-ebad4275b06b","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.883581Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:d9cdcf02ba4d3e03963f80c8576c7f74b232c906a3eff734317f8c2632764eb6","observation_id":"ace5e3e7-a0bc-432e-99c1-7798f52fe182","resolution":{"observed_at":"2026-08-07T14:55:35.935257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:27.977541Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:27.977541Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:5effce2d81465e4a3cdb46acf48597fa363001d7815f0236dfd335a3117b501e","observation_id":"a5646d32-438b-4632-8c88-535bea381d69","resolution":{"observed_at":"2026-08-07T14:55:27.977541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.648848Z","title":"Genai-bench: A holistic benchmark for compositional text-to-visual generation","venue":null,"work_id":"b5f3edd9-5404-466a-8009-d8b02d567f01","year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.067672Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:7eba154770a8011011ba3fe1321755386aa6de7dd7c8f99513d5a1db94ac1716","observation_id":"e98ab4f8-0e88-4dbe-a523-fdcadaff2faf","resolution":{"observed_at":"2026-08-07T14:55:35.735158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:55:28.147348Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.147348Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:2e256855b4b4ee61bbad8555d990a5c7c2b092f541fc31ceccf2ba5e5726f0b0","observation_id":"d8d60920-01de-4428-9bb3-3fe32c6d7d0c","resolution":{"observed_at":"2026-08-07T14:55:28.147348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-08-06T06:00:24.094085Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-08-07T14:55:28.217225Z","title":"mplug: Effective and efficient vision-language learning by cross-modal skip-connections","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.217225Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:ae80e8b05ec080ee51b8e97c69de11eaf84d10adc725e830219749d635faa60a","observation_id":"f4722c6c-9f1a-44ad-9e7b-9df5dcc26f57","resolution":{"observed_at":"2026-08-07T14:55:28.217225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.486092Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"33dc3dbc-5159-4106-b270-df529f533d7b","year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.364215Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:095bf9e0f133109bc1b8ebd6359c9160797a46f8681495b7e8807683c6cce744","observation_id":"b6258123-ccaa-4d7e-a9ff-7ac5b1aaea0b","resolution":{"observed_at":"2026-08-07T14:55:35.562786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.240877Z","title":"Rich human feedback for text-to-image generation","venue":null,"work_id":"2156e19c-72f1-42c2-8fdd-0013ab068721","year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.435060Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:775c35e760adb649b516c0dd6750adb5bf902e1a4712ec6aee64b28a245c532a","observation_id":"c07fe08f-5bdd-4f1d-af29-d3907d40fbec","resolution":{"observed_at":"2026-08-07T14:55:35.321901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:28.521024Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.521024Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:00f347d65e12b7edea6b6995c8d73e5effc3c61b0e486931a5f1179b62978f07","observation_id":"54a39d1b-4b6e-4480-892a-abc9840a58df","resolution":{"observed_at":"2026-08-07T14:55:28.521024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T14:55:28.590688Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.590688Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:98ae2e5cc0df8d542274adcbf546a03a7a87cece2294fa67f9a04a171cf93644","observation_id":"31d7a765-4198-4192-84a3-d8865643cad4","resolution":{"observed_at":"2026-08-07T14:55:28.590688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11817","last_updated":"2025-03-02T07:05:19Z","snapshot_observed_at":"2026-08-04T04:52:39.088264Z","submitted_at":"2024-10-15T17:46:31Z","title":"Improving Long-Text Alignment for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11817","snapshot_observed_at":"2026-08-07T14:55:28.663859Z","title":"Improving long-text alignment for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.663859Z"},"links":{"cited_paper":"/paper/2410.11817","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:fcf16d3043a4e6bebc5f1dd131afcf89f76c8692c1ce8da6a47d94f742a7ad62","observation_id":"a42b0a63-8dd3-4338-9b2b-71c18bb2a129","resolution":{"observed_at":"2026-08-07T14:55:28.663859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.016716Z","title":"Llm4gen: Leveraging semantic representation of llms for text-to-image generation","venue":null,"work_id":"4633edb8-ed12-411a-975b-595d61755100","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.737852Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:d3ea36c45d21fe00f3c2e0abfe718050cd9e616f692a0896481ef39990837d5a","observation_id":"ec8865cc-1e92-4e2e-b08d-73f4ef025517","resolution":{"observed_at":"2026-08-07T14:55:35.084854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.831133Z","title":"Browsing like human: A multimodal web agent with experiential fast-and-slow thinking","venue":null,"work_id":"59e4218e-65d2-469e-a79c-80a11ffc563e","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.822579Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:4a53a8efca2b92c45d366db47eb75e0b4de3bd8ea906fc4e9502bf7c70a9a9a9","observation_id":"a3c041d6-74d3-4ca9-b9be-cd9eaf8daabc","resolution":{"observed_at":"2026-08-07T14:55:34.922193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:28.916410Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:28.916410Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:39e0e3660a2030f58012264e5826b694964b94052d404ede004140921d96e29f","observation_id":"ebea15ab-0fab-4db2-959a-4de94a0538e8","resolution":{"observed_at":"2026-08-07T14:55:28.916410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.581882Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"9c18d188-249d-4aee-803d-d12786652eb9","year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.015512Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:32005ee14869649da017e63ff23712178da68465cc183b6936341755e40f991f","observation_id":"7836a0a7-e510-4929-a79a-eeac3e22b4dd","resolution":{"observed_at":"2026-08-07T14:55:34.685316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.378430Z","title":"Gpt image-1","venue":null,"work_id":"c4522108-024a-411c-81bd-63b4de3f5547","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.112322Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:8092d8ce2ca1a8fb61ad1c1afedda03356882ce360d34b4148448a8ec84ef8f0","observation_id":"799a5789-e1a5-4527-9d4b-59f31b1c951c","resolution":{"observed_at":"2026-08-07T14:55:34.472643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:55:29.176831Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.176831Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:d2b474c0c5e369f7321ecd843ee0d785acc10ec780becb16de76b801baeaf95b","observation_id":"847789b4-1643-4243-a9a9-46d16b3f80f6","resolution":{"observed_at":"2026-08-07T14:55:29.176831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.157748Z","title":"Connecting vision and language with localized narratives","venue":null,"work_id":"b2771a72-0fd3-48f8-8bdf-a36096a61407","year":2020},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.303856Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:96abd83888132fe080149c6ed2b0513eb9e89ed48fa25684855884c8102429b4","observation_id":"bdd8fa48-2e44-4616-a173-271eac2279ed","resolution":{"observed_at":"2026-08-07T14:55:34.272214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:29.375398Z","title":"The synergy between data and multi-modal large language models: A survey from co-development perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.375398Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:b6d5d263040087cbccfc1b50a62f04d9478ff41e4b1470e76c55c83101c2d6a1","observation_id":"88b6dadb-6586-4801-9d4f-6adab5c7c8d8","resolution":{"observed_at":"2026-08-07T14:55:29.375398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:29.453485Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.453485Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:059dd9dcf42c7868b9a6c604c30917aab5b1cc4268b21ec1775640739a203c25","observation_id":"c0a9b799-f4f9-4374-9ce0-686c4e6f1026","resolution":{"observed_at":"2026-08-07T14:55:29.453485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:29.545971Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.545971Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:44309278d4ba1b9e317f8d313632d2bc94584b28395ae73716068cbb38bd5d63","observation_id":"0e87bdd9-aa69-4edd-b4ac-a88a34bff960","resolution":{"observed_at":"2026-08-07T14:55:29.545971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:29.616410Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.616410Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:7d4edf169d57ab46aa6193799dc7d8e47b3eca490766623b53cc5dcbcbe92fa5","observation_id":"6a18da4a-a3bd-4b14-8136-bef38c15809d","resolution":{"observed_at":"2026-08-07T14:55:29.616410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T14:55:29.680330Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.680330Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:07556e2944e8d86c78ed42c99b55e24f8a3711822c8ee1abdfd756e5df0e0982","observation_id":"f33bc5ee-1b2f-4aa3-9137-ff085641cb8d","resolution":{"observed_at":"2026-08-07T14:55:29.680330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:29.766420Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.766420Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:675286d1d17ebba91f7c94c2b30dbab553d0cac0826d7075e4e7d75d99da7375","observation_id":"832c8e8c-ba0c-4335-9ec4-f8c2fa9bd9b6","resolution":{"observed_at":"2026-08-07T14:55:29.766420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:29.865585Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.865585Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:0b1d8bb783ee66b8c67ec1b1b55589b730b2e68bbaee5b94b7f879da4ab6d939","observation_id":"c90e7de4-d2c4-40c4-a356-8e9eee85db9d","resolution":{"observed_at":"2026-08-07T14:55:29.865585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:29.955998Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:29.955998Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:e949584000d62bf3e588e9ff6faae4d8d0c58d89ad9d38111bdb2c746edaee08","observation_id":"24284bcc-236a-49c8-ba13-ad16aab445ac","resolution":{"observed_at":"2026-08-07T14:55:29.955998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:30.108583Z","title":"Qwen2.5-vl, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.108583Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:6178132e13645764c3e84032380471ea491339a10f98871c98bafba10848dce9","observation_id":"20e604a6-2e47-42a5-b3d4-d55e3474f228","resolution":{"observed_at":"2026-08-07T14:55:30.108583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:55:30.161568Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.161568Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:7da63d9211516f9155d708442f858b13ae25ae8d73b7129ad5bb01f61a69b2d1","observation_id":"bc85ca40-36c9-411c-999e-ef73ef931a32","resolution":{"observed_at":"2026-08-07T14:55:30.161568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:30.205142Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.205142Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:c4ec399a75070423fd81c69795724c6a0fe2566efc43fbd7197a6d3052252204","observation_id":"2393ae33-faf9-40f2-810e-b4e652465405","resolution":{"observed_at":"2026-08-07T14:55:30.205142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:30.315937Z","title":"Yoloe: Real-time seeing anything","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.315937Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:d30f63ae30cbcdffc8ac4e7d9d36bb2bbee38d536f8ec4acaf2c86074ae2c80e","observation_id":"6fdd3748-9ce4-435a-9085-ae2758737043","resolution":{"observed_at":"2026-08-07T14:55:30.315937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16820","last_updated":"2025-03-17T15:53:14Z","snapshot_observed_at":"2026-07-06T18:05:42.862609Z","submitted_at":"2024-04-25T17:58:43Z","title":"Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16820","snapshot_observed_at":"2026-08-07T14:55:30.485554Z","title":"Revisiting text-to-image evaluation with gecko: On metrics, prompts, and human ratings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.485554Z"},"links":{"cited_paper":"/paper/2404.16820","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:c198a990aa6bdceaa40461538fbc678949927bc65ec14418b69c7345d2653b98","observation_id":"475f24c2-1a02-417d-9cba-5689a313e5f6","resolution":{"observed_at":"2026-08-07T14:55:30.485554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:33.858847Z","title":"Integrating aigc with design: dependence, application, and evolution-a systematic literature review","venue":null,"work_id":"4e6d462b-b983-4bf6-8e98-6a8d59ae15aa","year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.628688Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:6fbae2d5a41db35d23e5544eccb6b8b81631d56675156927d799503f1d344790","observation_id":"75a52ecf-47e7-4b2b-a687-21ff57103e09","resolution":{"observed_at":"2026-08-07T14:55:33.955445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14284","last_updated":"2025-05-06T16:45:30Z","snapshot_observed_at":"2026-07-06T16:51:44.144280Z","submitted_at":"2023-11-24T05:17:01Z","title":"Paragraph-to-Image Generation with Information-Enriched Diffusion Model","version":3},"cited_work":{"arxiv_id":"2311.14284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.14284","snapshot_observed_at":"2026-08-07T14:55:32.480275Z","title":"Paragraph-to-Image Generation with Information-Enriched Diffusion Model","venue":"cs.CV","work_id":"bf2d29ab-f005-4d53-ac8b-99346e25fecb","year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.742887Z"},"links":{"cited_paper":"/paper/2311.14284","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:192c08210bf7debd92927e626815b160e25afe53f3984bab12b5aaf7427495ce","observation_id":"6c71d2c5-22f8-424b-ac87-c8e8699b7c2f","resolution":{"observed_at":"2026-08-07T14:55:32.556802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T14:55:30.880719Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.880719Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:ae1112dfccba5fbf325edb84984acbdbcb1a09f33a0cdcd9762a7ae5e851631b","observation_id":"7310ce93-a0cd-4ba1-8456-37d18132868f","resolution":{"observed_at":"2026-08-07T14:55:30.880719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:33.643655Z","title":"Ai-generated content for academic visualization and communication in maker education","venue":null,"work_id":"faa12c7d-16d2-4442-b952-3a4fc0823efe","year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:30.977005Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:cfcf360756c469b734ab66f0dfe28d0d461c1dd42c0a0317c1585721c32a3196","observation_id":"e86b5052-4331-46b5-b4aa-667881abd215","resolution":{"observed_at":"2026-08-07T14:55:33.766597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:33.472655Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":"778f3bcd-8b78-4c69-b7d9-e222d404c51c","year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.138577Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:0b9a6d29212d18840af3398e1f5ee9a6ddf9f2288d25f8a47ab295eab31a7893","observation_id":"777260f2-95bd-41c6-b8a2-9070e44a3889","resolution":{"observed_at":"2026-08-07T14:55:33.557281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:33.267404Z","title":"Mindgym: What matters in question synthesis for thinking-centric fine-tuning? In NeurIPS, 2025","venue":null,"work_id":"a1cb6be3-69cd-415c-af20-4ffa61946973","year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.270697Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:3c0b4db4e5dff3a67dc66ee368945a6f170c8a1a220bbb66f68eca76d0a16508","observation_id":"93500081-3e27-4364-b17d-349786e9f3bb","resolution":{"observed_at":"2026-08-07T14:55:33.352502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:31.424327Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.424327Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:921e70dfc75f2de2602d7e2d9d915075690ec9d0c39a8a8fba4a0e7ab51dd8c3","observation_id":"ec8c97eb-28ee-49ab-aea7-b5128f283d87","resolution":{"observed_at":"2026-08-07T14:55:31.424327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T14:55:31.570990Z","title":"Scaling autoregressive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.570990Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:ff47fc7c39aca49d1a2f1842254c5335ef7c8f1f6d8bd436d0565028e679b064","observation_id":"78e39d37-354c-4b90-8b8a-310c159b4d0f","resolution":{"observed_at":"2026-08-07T14:55:31.570990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:33.096232Z","title":"Learning multi-dimensional human preference for text-to-image generation","venue":null,"work_id":"1f1f38dd-f227-4139-b5d2-b10b919c57a4","year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.661280Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:682f54928a0660b08e15302814c2ac8ee778c13e84a57155df89a2d1f5790317","observation_id":"0c89e2fb-f098-4e1f-b590-f1e16dab8d27","resolution":{"observed_at":"2026-08-07T14:55:33.160463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17574","last_updated":"2026-04-13T15:05:36Z","snapshot_observed_at":"2026-07-06T20:12:09.120832Z","submitted_at":"2024-12-23T13:45:56Z","title":"HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17574","snapshot_observed_at":"2026-08-07T14:55:31.757051Z","title":"Humanvbench: Exploring human-centric video understanding capabilities of mllms with synthetic benchmark data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.757051Z"},"links":{"cited_paper":"/paper/2412.17574","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:0a0dd7cea185228b82c51d7f768b264f67b653894473ebaec974189745261062","observation_id":"75def250-758c-4cb5-8ddf-c262e8bf8340","resolution":{"observed_at":"2026-08-07T14:55:31.757051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:55:31.815809Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.815809Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:dd630abb464f9965424391c64499fa495253f8a988317fd9cf96f876ec78147d","observation_id":"e0be45fa-a2ce-4835-a6c3-ca0b0df87e13","resolution":{"observed_at":"2026-08-07T14:55:31.815809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:55:31.877954Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.877954Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:f94def6cce3fcd787f967cd02aa90e5bdd5fb7a4e83cdf813de585279a9b8cb1","observation_id":"9886c18f-904d-4ce6-b7fa-422291e00bf2","resolution":{"observed_at":"2026-08-07T14:55:31.877954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:31.966273Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.966273Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:cd7d7ff3415274ffe49b16238b264dbeeed90cce6b8a0721786d597cf4a11279","observation_id":"30ba720a-8d0a-4e45-a39c-377cd3a76e7b","resolution":{"observed_at":"2026-08-07T14:55:31.966273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:32.044986Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:32.044986Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:a6fc82b7b6f7f0158914beaf034c778b79fb6bb1d07add0c6c9101ca0f531dd1","observation_id":"4ae61024-0f7d-451f-b140-e12d019141ad","resolution":{"observed_at":"2026-08-07T14:55:32.044986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:32.127569Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:32.127569Z"},"links":{"citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:8f178c22fef0bb9a880532134ee226e40e0defb55e24f6dea678b371fb01c8ef","observation_id":"bcf72c9f-a956-4dad-9e6d-346bb6bc02d4","resolution":{"observed_at":"2026-08-07T14:55:32.127569Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 1 inbound Pith citation observation for arXiv:2505.16915."}