{"as_of":"2026-08-14T20:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d648818b86aad68ad91aff302a168dd1be950668f4c746b1c7f3491bad64613","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":49,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T01:00:03.278624Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T05:54:33.573861Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:17c689c54d4c10742af303b85833f647da1b7aca299df569ef134c32a095660a","observation_id":"980e8f8d-e3ac-469e-800e-3510a6600510","resolution":{"observed_at":"2026-05-11T10:56:09.215592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:50.009149Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2410.10629"},"observation_digest":"sha256:c00ff532a591a60203c61f72e40d03922685539a7754922e874ebac152da7175","observation_id":"07ee6c8e-8d94-4799-a876-ac6f425c9e61","resolution":{"observed_at":"2026-05-15T00:56:50.092999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:b9c57de83f6f8bfb27450c74c94aed4bf85ca03198a5a62edee7d5cdcab53d87","observation_id":"2977e68d-84b7-41bd-ada7-f78dfcb54bca","resolution":{"observed_at":"2026-05-10T12:38:24.494101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T08:38:27.946746Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.00131"},"observation_digest":"sha256:d77fe6e4d5b8f1bedd05ecf222228abf2163427042e2586fcc6327de66ff4fbc","observation_id":"01114a68-abbe-4329-91d7-036312b2936f","resolution":{"observed_at":"2026-05-23T08:42:45.153879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-12T01:00:03.278624Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01794","last_updated":"2025-03-16T21:10:57Z","snapshot_observed_at":"2026-08-12T02:17:49.123890Z","submitted_at":"2024-12-02T18:40:19Z","title":"IQA-Adapter: Exploring Knowledge Transfer from Image Quality Assessment to Diffusion-based Generative Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T01:00:03.278624Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.01794"},"observation_digest":"sha256:24fe75c70502afef79757f54cd47bdc7b82b36693c52f8a5588915dc44a41d43","observation_id":"355e14f9-495f-4100-942e-305553f47ac2","resolution":{"observed_at":"2026-08-12T01:00:03.278624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-12T00:56:59.636337Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-14T06:34:24.845098Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.636337Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:7a8c5a939e792958e17d5f61e0cc992683688f67e3fb5fd9a297deb15860162e","observation_id":"142d523d-929d-47ef-826e-9084208b1384","resolution":{"observed_at":"2026-08-12T00:56:59.636337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-11T22:05:33.785966Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03859","last_updated":"2025-08-06T16:10:06Z","snapshot_observed_at":"2026-08-14T02:28:13.930087Z","submitted_at":"2024-12-05T04:09:47Z","title":"CreatiLayout: Siamese Multimodal Diffusion Transformer for Creative Layout-to-Image Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:05:33.785966Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.03859"},"observation_digest":"sha256:4b6279daf4446f4260860803e13258ca63f70524fd424c08940bf3c6538dc8f1","observation_id":"a114ed54-6af2-4595-9c78-ef507dfa1625","resolution":{"observed_at":"2026-08-11T22:05:33.785966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-11T20:13:47.588552Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05983","last_updated":"2025-07-26T14:45:01Z","snapshot_observed_at":"2026-08-14T09:40:33.773143Z","submitted_at":"2024-12-08T16:10:42Z","title":"Chimera: Improving Generalist Model with Domain-Specific Experts","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:13:47.588552Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.05983"},"observation_digest":"sha256:2c3ce9b39180c0bcf4119b1890aeb4a9fb0464782aaea3d3563933b57d1212a5","observation_id":"d68d6a65-9d14-42f4-86ce-3d4ff418d0bb","resolution":{"observed_at":"2026-08-11T20:13:47.588552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-11T16:55:34.988363Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09618","last_updated":"2024-12-12T18:59:48Z","snapshot_observed_at":"2026-08-13T01:30:47.696305Z","submitted_at":"2024-12-12T18:59:48Z","title":"EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:55:34.988363Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.09618"},"observation_digest":"sha256:6110f47cc43777e2b18c7930e705bce80f79e229dad744f7a01cad2456fa8671","observation_id":"cdcbe4cc-da18-4798-bece-32dd43acc6ff","resolution":{"observed_at":"2026-08-11T16:55:34.988363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-11T16:56:01.711945Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09619","last_updated":"2024-12-12T18:59:53Z","snapshot_observed_at":"2026-08-13T20:41:16.231958Z","submitted_at":"2024-12-12T18:59:53Z","title":"SnapGen: Taming High-Resolution Text-to-Image Models for Mobile Devices with Efficient Architectures and Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:01.711945Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.09619"},"observation_digest":"sha256:42ac0132f678745b0416a07b456e07c9fe8b8f4cf9b77a871b3a7a4fabb4a16b","observation_id":"1a8ebef6-b50d-4aee-ab40-3d7f7d1f899e","resolution":{"observed_at":"2026-08-11T16:56:01.711945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-08-13T00:09:27.237577Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:06c2a7393f3ff1c80b69daa1a445b4154b4d0cd33dec6df3bff9f0fcab67c5a4","observation_id":"a64fa0b6-6fba-4423-8591-c0e820380f6f","resolution":{"observed_at":"2026-05-17T15:07:39.859781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-11T04:39:36.630126Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18653","last_updated":"2024-12-24T19:00:02Z","snapshot_observed_at":"2026-08-13T11:19:19.475091Z","submitted_at":"2024-12-24T19:00:02Z","title":"1.58-bit FLUX","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:39:36.630126Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.18653"},"observation_digest":"sha256:129e4af043c70d24978cd2bb2c712a99cd01ff7a9cf42f15daac69f0fd5dd95e","observation_id":"2b7d4d9a-5f22-48e9-8f3c-87bf35b52059","resolution":{"observed_at":"2026-08-11T04:39:36.630126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-11T04:24:20.039877Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18928","last_updated":"2024-12-25T15:19:02Z","snapshot_observed_at":"2026-08-14T03:11:06.523302Z","submitted_at":"2024-12-25T15:19:02Z","title":"UNIC-Adapter: Unified Image-instruction Adapter with Multi-modal Transformer for Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:24:20.039877Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.18928"},"observation_digest":"sha256:4807711279d5e0fc4776d5d4e9ffad40561aa2d520d60f0b92aa13fceb9f0e1e","observation_id":"1a4f5851-5d71-4b49-9184-deeaefb6e187","resolution":{"observed_at":"2026-08-11T04:24:20.039877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-10T22:34:14.355306Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01423","last_updated":"2025-03-10T11:43:42Z","snapshot_observed_at":"2026-08-11T01:06:46.210110Z","submitted_at":"2025-01-02T18:59:40Z","title":"Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:34:14.355306Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2501.01423"},"observation_digest":"sha256:2411d8014ee7c71ff7e3b67fa3b163ac5f157b37e956d0cf10eb9c8076f30b45","observation_id":"8a02f3cc-7f46-4de5-8ec3-04ece55250d7","resolution":{"observed_at":"2026-08-10T22:34:14.355306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-10T20:01:21.490589Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09503","last_updated":"2025-05-01T09:16:20Z","snapshot_observed_at":"2026-08-14T15:32:46.083706Z","submitted_at":"2025-01-16T12:28:39Z","title":"AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:21.490589Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2501.09503"},"observation_digest":"sha256:815338554025f93edd5e9b7d0e23cf24028349aa99eee72b6b03d6d78b5c08ff","observation_id":"dac03e54-6e18-4ed8-ae35-d7cff5977a2c","resolution":{"observed_at":"2026-08-10T20:01:21.490589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-10T16:18:12.220781Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13349","last_updated":"2025-06-30T09:57:33Z","snapshot_observed_at":"2026-08-13T09:57:29.735821Z","submitted_at":"2025-01-23T03:18:23Z","title":"MSF: Efficient Diffusion Model Via Multi-Scale Latent Factorize","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T16:18:12.220781Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2501.13349"},"observation_digest":"sha256:6bcfa90d095ad8c4492a3ca129cd18d12a0ba50924fa16ea2daf3053e7c0e1a4","observation_id":"39954511-0346-4579-987d-00fb6dd8ff98","resolution":{"observed_at":"2026-08-10T16:18:12.220781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-10T14:10:43.637061Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15598","last_updated":"2025-01-26T16:52:27Z","snapshot_observed_at":"2026-08-14T12:36:38.180436Z","submitted_at":"2025-01-26T16:52:27Z","title":"Diffusion Generative Modeling for Spatially Resolved Gene Expression Inference from Histology Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:43.637061Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2501.15598"},"observation_digest":"sha256:fb7dfd1acd2189e13165fd531b2e785d0de9808c45d52aac4e652d0716168382","observation_id":"d6399c26-8129-41ab-b7d8-37bb20ad8fcb","resolution":{"observed_at":"2026-08-10T14:10:43.637061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-09T23:37:12.431235Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-13T17:55:42.231540Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T23:37:12.431235Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2501.18427"},"observation_digest":"sha256:d5c81f84b16c73e7256372a2428780a5afa93d361a3552a02832b50e2d4a0a49","observation_id":"e88ed9b2-121a-47e5-9f2c-726b37ef1b9e","resolution":{"observed_at":"2026-08-09T23:37:12.431235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-08T10:24:41.559300Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-13T06:52:04.132418Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.559300Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:cb549ec8186a6a483baf19534851ca1fe382d48a5658a79e4b13e8e6a6fe5165","observation_id":"4ed10bf5-00e1-4e10-b85f-b2740dd74a1c","resolution":{"observed_at":"2026-08-08T10:24:41.559300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T15:26:13.514247Z","title":"Playground v3: Im- proving Text-to-Image Alignment with Deep-Fusion Large Language Models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15172","last_updated":"2025-05-21T06:42:17Z","snapshot_observed_at":"2026-08-13T01:45:46.110293Z","submitted_at":"2025-05-21T06:42:17Z","title":"Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:13.514247Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2505.15172"},"observation_digest":"sha256:5574b74bf28667e934747c48f06db91ee193f199361cc94bc4c25e22809b53ae","observation_id":"2f33ea93-ae88-49b2-a526-072b95ab80fc","resolution":{"observed_at":"2026-08-07T15:26:13.514247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T14:49:04.771360Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17540","last_updated":"2025-05-23T06:44:26Z","snapshot_observed_at":"2026-08-13T19:07:51.690570Z","submitted_at":"2025-05-23T06:44:26Z","title":"RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:49:04.771360Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2505.17540"},"observation_digest":"sha256:ce3548c4045af03562eb201997d490ed786cdb223baf0bddb1d00ef3f6450fad","observation_id":"5b7f518a-5f1d-4917-824d-cf9e5d79b6bf","resolution":{"observed_at":"2026-08-07T14:49:04.771360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T13:42:36.902137Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21179","last_updated":"2025-06-03T02:46:07Z","snapshot_observed_at":"2026-08-14T02:32:26.715375Z","submitted_at":"2025-05-27T13:30:46Z","title":"Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:36.902137Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2505.21179"},"observation_digest":"sha256:0bd313e1e20010c906b3d7e15e408d50cd907063ce43b1f55ebd6536423cf52b","observation_id":"5c9985a9-f60c-436a-9496-d462c89a3dda","resolution":{"observed_at":"2026-08-07T13:42:36.902137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T13:08:04.804019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-13T00:07:33.143025Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.804019Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:04ca1d1faa20f6a57214e66c1eb3525d6f36adee1db405b841d581e281f3e842","observation_id":"25002f22-4f2d-4fbf-9222-f49370bb2c88","resolution":{"observed_at":"2026-08-07T13:08:04.804019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T12:48:05.725545Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-09T05:32:01.732887Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.725545Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:3439e9e596458401ff3cc0f8c0c5cf17b6d2072e7c56a160b1304442db155b24","observation_id":"715e4c1a-801f-4b0a-ba64-1693121f496e","resolution":{"observed_at":"2026-08-07T12:48:05.725545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T11:50:42.929835Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01331","last_updated":"2025-06-02T05:19:40Z","snapshot_observed_at":"2026-08-09T17:03:24.895633Z","submitted_at":"2025-06-02T05:19:40Z","title":"Ultra-High-Resolution Image Synthesis: Data, Method and Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:42.929835Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2506.01331"},"observation_digest":"sha256:693cace2bd7a40ffa9b13e6d59e6f5e565447592cc75ad5235dd298cdd499532","observation_id":"b09a834a-4aeb-4896-b560-eb95b88b368c","resolution":{"observed_at":"2026-08-07T11:50:42.929835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-08-12T23:49:38.644434Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T17:34:26.951644Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2506.03147"},"observation_digest":"sha256:b218af17ea74a43bbfce18720ed5b688da5044c092aedbec0badbcb7f7fe0d86","observation_id":"7c750e13-1c5c-4021-aa34-6f2c99e27283","resolution":{"observed_at":"2026-05-12T17:34:27.139415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T05:20:51.115963Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large lan- guage models.arXiv preprint arXiv:2409.10695, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-13T15:52:16.724752Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.115963Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:ae656691343bc9d6a41eda2a836a62b1288893dc671b2e406751bc863110e609","observation_id":"78c10748-bbdd-4373-b842-1ba1ad57c327","resolution":{"observed_at":"2026-08-07T05:20:51.115963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T04:23:42.752815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10741","last_updated":"2025-06-12T14:28:12Z","snapshot_observed_at":"2026-08-14T15:32:43.371685Z","submitted_at":"2025-06-12T14:28:12Z","title":"PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:23:42.752815Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2506.10741"},"observation_digest":"sha256:887d399e30ec33253433f3e4871dc8d12a7487817ddc34d243d9369cc2fadf68","observation_id":"d796aa71-2a65-4bfb-8a60-b5db591ac07a","resolution":{"observed_at":"2026-08-07T04:23:42.752815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-06T21:49:43.492175Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23347","last_updated":"2025-07-07T16:20:58Z","snapshot_observed_at":"2026-08-08T19:09:33.549872Z","submitted_at":"2025-06-29T17:43:04Z","title":"CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.492175Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2506.23347"},"observation_digest":"sha256:26bce4663e6075b01178771334de079741ce0dfbaa920fb1f494612d103a5503","observation_id":"82e9cc49-9856-4f30-86c5-0eab0a8f9263","resolution":{"observed_at":"2026-08-06T21:49:43.492175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-06T19:41:23.713635Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04947","last_updated":"2025-07-07T12:45:23Z","snapshot_observed_at":"2026-08-10T07:36:03.612176Z","submitted_at":"2025-07-07T12:45:23Z","title":"DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:23.713635Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2507.04947"},"observation_digest":"sha256:e71b311eb2f0bc4142c6f6eeb109ebd58fb8f53261cc67affa92e93555c97cd4","observation_id":"7a3d0dcb-6129-494c-8159-78cd2e95eefa","resolution":{"observed_at":"2026-08-06T19:41:23.713635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-06T18:50:43.618673Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08039","last_updated":"2025-07-09T18:40:17Z","snapshot_observed_at":"2026-08-13T16:31:34.285846Z","submitted_at":"2025-07-09T18:40:17Z","title":"Towards Evaluating Robustness of Prompt Adherence in Text to Image Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:50:43.618673Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2507.08039"},"observation_digest":"sha256:4e6e8f42f73999777423fd3b38a307e780f6f5888eebfacbeb54779c98948bf6","observation_id":"d8ca69b2-8667-48f6-b93e-685d041ce13e","resolution":{"observed_at":"2026-08-06T18:50:43.618673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-06T16:22:49.672354Z","title":"Souza, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13708","last_updated":"2025-07-23T13:00:06Z","snapshot_observed_at":"2026-08-09T01:02:26.043071Z","submitted_at":"2025-07-18T07:33:08Z","title":"PoemTale Diffusion: Minimising Information Loss in Poem to Image Generation with Multi-Stage Prompt Refinement","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:22:49.672354Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2507.13708"},"observation_digest":"sha256:d86702b24ddad0f0568d467e20214e1fe4201a09305d8d8fe31cfffe2e24ce02","observation_id":"43827c62-29e4-4125-abcf-d0cb4571445f","resolution":{"observed_at":"2026-08-06T16:22:49.672354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-06T15:02:25.641058Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17049","last_updated":"2026-07-21T08:27:18Z","snapshot_observed_at":"2026-08-08T10:16:29.282120Z","submitted_at":"2025-07-22T22:15:59Z","title":"Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:25.641058Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2507.17049"},"observation_digest":"sha256:83ac4cb07792d4206c189c6b2725fd147dab3b6b192a4dfcae9eec79b1b3f40d","observation_id":"6dfb72e3-ca11-4f38-bf33-48afc8e80cc3","resolution":{"observed_at":"2026-08-06T15:02:25.641058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-05T22:58:36.402785Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-14T15:33:30.690043Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.402785Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:fedf065fa59895d397784070ecde5cb5473958fa8eebef4332a6656350036007","observation_id":"2799051a-0be3-4f43-b590-fc8bc919b5c3","resolution":{"observed_at":"2026-08-05T22:58:36.402785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-04T22:36:08.047169Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07295","last_updated":"2026-06-25T06:17:40Z","snapshot_observed_at":"2026-08-13T03:30:32.489704Z","submitted_at":"2025-09-08T23:59:32Z","title":"Reconstruction Alignment Improves Unified Multimodal Models","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T22:36:08.047169Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2509.07295"},"observation_digest":"sha256:2a4f872ecba657ae0e029053306291eb41195fc3b32dab708550ada96c95dcb0","observation_id":"9a3cf6d0-8645-4517-8060-6e46deb526bf","resolution":{"observed_at":"2026-08-04T22:36:08.047169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2511.20645","last_updated":"2026-04-16T17:04:25Z","snapshot_observed_at":"2026-08-14T05:00:16.800739Z","submitted_at":"2025-11-25T18:59:25Z","title":"PixelDiT: Pixel Diffusion Transformers for Image Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T04:30:07.417197Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2511.20645"},"observation_digest":"sha256:4ff85d466f9ea3abfd70bd046aad5359bf1ede8ded32474b5f9a2cd4d246e879","observation_id":"55a9c309-62ac-4231-b2ca-f588b283ca0e","resolution":{"observed_at":"2026-05-17T04:31:31.192384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-13T15:06:04.699163Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T07:06:20.470686Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2601.03233"},"observation_digest":"sha256:e2f594d54bdcfa8b2e7ce48092d555d60d5a10a7fb7e3bf0904da43a9534fe80","observation_id":"66178e1a-860b-4bc5-8d26-ebf20949ed5e","resolution":{"observed_at":"2026-05-13T07:06:20.664484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-03T10:56:13.748789Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.08303","last_updated":"2026-07-06T07:20:34Z","snapshot_observed_at":"2026-08-07T13:59:11.336528Z","submitted_at":"2026-01-13T07:46:46Z","title":"SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T10:56:13.748789Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2601.08303"},"observation_digest":"sha256:2d24bf54c9c7b6a03ac617d7c385fdabb8a56976db963aed2b196bdffc1127b5","observation_id":"32dab576-631f-471d-9d62-61a173be5449","resolution":{"observed_at":"2026-08-03T10:56:13.748789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-02T18:25:55.817521Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-14T11:53:10.773161Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:55.817521Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:c4040d397c27d0ed36f6e570ca271eb164c1785fd630300abd67aac630121065","observation_id":"fa2482c6-3010-442f-898e-3e3ff850af99","resolution":{"observed_at":"2026-08-02T18:25:55.817521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2604.12322","last_updated":"2026-04-14T05:54:33Z","snapshot_observed_at":"2026-08-13T19:20:45.250177Z","submitted_at":"2026-04-14T05:54:33Z","title":"Self-Adversarial One Step Generation via Condition Shifting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:37:36.994169Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2604.12322"},"observation_digest":"sha256:195b9e264b12eb9c18233bdcc494c523b8c30d8a101deff69f401103e0ffcf20","observation_id":"81dce721-b284-41cc-8f68-c2ec56106a31","resolution":{"observed_at":"2026-05-11T10:11:01.983027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2604.18168","last_updated":"2026-04-20T12:28:58Z","snapshot_observed_at":"2026-08-13T04:52:25.391449Z","submitted_at":"2026-04-20T12:28:58Z","title":"Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T05:15:22.907880Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2604.18168"},"observation_digest":"sha256:0a45f8e7d5fd862de8c4122cbe39871e9fad8a98510367b37fef3c5272f942b0","observation_id":"6cdca740-2263-4059-b665-c36a3b372e93","resolution":{"observed_at":"2026-05-10T09:28:39.561935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2605.15684","last_updated":"2026-05-15T07:13:27Z","snapshot_observed_at":"2026-08-14T09:47:58.113083Z","submitted_at":"2026-05-15T07:13:27Z","title":"ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-20T20:00:27.987481Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2605.15684"},"observation_digest":"sha256:b3885300c98a362800fcba7124fdbf7d256d21f8404a5dbba1f554557f2512bc","observation_id":"32535488-c446-47fe-a0f8-0ef98a2b0971","resolution":{"observed_at":"2026-05-20T20:03:43.913986Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2605.20147","last_updated":"2026-05-19T17:35:09Z","snapshot_observed_at":"2026-08-14T13:34:56.300162Z","submitted_at":"2026-05-19T17:35:09Z","title":"PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T05:19:30.372528Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2605.20147"},"observation_digest":"sha256:f429b2dc268712ab931c7c747c077c35fa3ac45a5d7ab068b6b118afa684aa98","observation_id":"c1a8333e-c3ff-4c31-9b29-2753e52145dc","resolution":{"observed_at":"2026-05-20T05:23:03.899503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T05:29:19.111071Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:ce09b30df14f7aca7f1605da74da1b996acbbbbb53e33fbf4067c0f62fd797ef","observation_id":"08d28f16-20af-41e7-9b0c-9632f7f59757","resolution":{"observed_at":"2026-05-21T05:29:39.396388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2605.20708","last_updated":"2026-06-16T17:19:08Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T05:07:15Z","title":"Rethinking Cross-Layer Information Routing in Diffusion Transformers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T17:50:22.258541Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2605.20708"},"observation_digest":"sha256:f8b47ddeb6bf517ccae08de3043b03a67ee2b87d680fdfc2c5d66b3b1307ab7f","observation_id":"dedc7eea-de42-41a8-a0c0-99e448820e77","resolution":{"observed_at":"2026-06-30T17:54:57.989038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2605.27235","last_updated":"2026-05-26T16:16:19Z","snapshot_observed_at":"2026-08-07T22:39:02.399197Z","submitted_at":"2026-05-26T16:16:19Z","title":"MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T18:32:37.613906Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2605.27235"},"observation_digest":"sha256:3ac6da2594f7cdbd38063b76d25228fb46b6907c38bd41278a8134af5261d20a","observation_id":"1fa295a3-67e7-41c1-b558-572677447c3a","resolution":{"observed_at":"2026-06-29T18:33:50.289517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2606.01803","last_updated":"2026-06-01T07:21:01Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:21:01Z","title":"OctoT2I: A Self-Evolving Agentic Text-to-Image Router","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T14:22:57.822123Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2606.01803"},"observation_digest":"sha256:5dbe862abc2ba4d2eb503846c6e67c9d9f85e0ef2ea2d53ff045f1b9371305b3","observation_id":"768b2830-16b2-463c-95a0-c5816281b7a7","resolution":{"observed_at":"2026-07-01T23:26:22.528525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2606.24021","last_updated":"2026-06-22T23:54:40Z","snapshot_observed_at":"2026-08-07T11:57:53.207364Z","submitted_at":"2026-06-22T23:54:40Z","title":"Token-to-Token Alignment of Text Embeddings for Semantic Blending","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T08:34:23.842302Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2606.24021"},"observation_digest":"sha256:52e26fb27dda64078d645189687f402b9ecb80c636f39b0c8faec41aa412b9bb","observation_id":"45069593-a195-4503-8515-5c61b7404054","resolution":{"observed_at":"2026-07-04T10:39:46.159754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:368af32d96bd78589f2b6c6e524640da7f709b2bf9597365a52070815ff73baf","observation_id":"e9ae30cd-31e1-49b4-b55f-ea999ddbf0a9","resolution":{"observed_at":"2026-07-08T05:54:33.575294Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2409.10695/citation-record","integrity":"/paper/2409.10695/integrity","json":"/paper/2409.10695/citation-record.json","paper":"/paper/2409.10695"},"outbound":[],"paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T17:26:48.873943Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 49 inbound Pith citation observations for arXiv:2409.10695."}