{"as_of":"2026-08-08T07:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:381d7cd0eb51fce8e745f9acbcc9b0fa697e27b877665db7f5778fb85f0b896a","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:20:51.244779Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08210/citation-record","integrity":"/paper/2506.08210/integrity","json":"/paper/2506.08210/citation-record.json","paper":"/paper/2506.08210"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.07126","last_updated":"2024-11-11T16:58:31Z","snapshot_observed_at":"2026-07-06T19:48:32.368124Z","submitted_at":"2024-11-11T16:58:31Z","title":"Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07126","snapshot_observed_at":"2026-08-07T05:20:50.977218Z","title":"Edify image: High-quality im- age generation with pixel space laplacian diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.977218Z"},"links":{"cited_paper":"/paper/2411.07126","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:aee34e56237f2149bbd8d8d5cdf4d512e9cfa4fbd84439e7b3f8a4db6f1e3576","observation_id":"398c47e8-fb10-4e8a-a0e9-f818b192f0c9","resolution":{"observed_at":"2026-08-07T05:20:50.977218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-07T05:20:50.982334Z","title":"ediff-i: Text-to-image dif- fusion models with an ensemble of expert denoisers.arXiv preprint arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.982334Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:995ab30468dc85e1e635cb7c3246ae4ea094df9501898c1f42518acde95bc6cc","observation_id":"aa460d2e-26ff-4f00-8a19-b5c09a34d2db","resolution":{"observed_at":"2026-08-07T05:20:50.982334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:50.986447Z","title":"Imagen 3.arXiv preprint arXiv:2408.07009, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.986447Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:cc7071171c5a216c40b5bb414f58521364bb71a715ca02279364209152933e9b","observation_id":"61d7c6d3-68f9-41d1-a5cb-65495b3ba30f","resolution":{"observed_at":"2026-08-07T05:20:50.986447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-08T03:53:14.177644Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-07T05:20:50.990041Z","title":"Llm2vec: Large language models are secretly pow- erful text encoders.arXiv preprint arXiv:2404.05961, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.990041Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:89897a0dc6d4793125e1b6e2dad63a51ac36da025245cb0f7387c72c0a8b1745","observation_id":"1634a2a4-269c-4570-bf60-f9799e1fad0e","resolution":{"observed_at":"2026-08-07T05:20:50.990041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18786","last_updated":"2023-05-31T17:55:44Z","snapshot_observed_at":"2026-08-07T22:13:29.011268Z","submitted_at":"2023-05-30T06:40:08Z","title":"Scalable Performance Analysis for Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2305.18786","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.18786","snapshot_observed_at":"2026-08-07T05:20:51.591495Z","title":"Scalable Performance Analysis for Vision-Language Models","venue":"cs.CV","work_id":"5cbffe05-6860-4bc6-a0ed-2cc405d12cce","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.994543Z"},"links":{"cited_paper":"/paper/2305.18786","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:d56be14a6273bb38d9a004174176f4bc4d56d8303a6859f230af4ab6a2ea26a2","observation_id":"e697754a-d932-4d75-9ef7-6b3d7692d37a","resolution":{"observed_at":"2026-08-07T05:20:51.597266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T05:20:50.998688Z","title":"PixArt-alpha: Fast Training of Diffu- sion Transformer for Photorealistic Text-to-Image Synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:50.998688Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:7fe9c8a903bddc6e79b30bee6ea9e233732d7cd4b02be94dfb1007aeeb284e2d","observation_id":"9b84a85a-28d1-424a-ae5d-98817c55b024","resolution":{"observed_at":"2026-08-07T05:20:50.998688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:52.023339Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":"52d9a996-a0ba-47dd-937e-8dd9e262deea","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.006114Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:58df882bb628d90154980c43141f3e9bb168ad454661cb5807ec5af1934c21f0","observation_id":"c575c6f6-6984-4190-8a71-a26d056f684d","resolution":{"observed_at":"2026-08-07T05:20:52.027527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-07T05:20:51.010211Z","title":"Bge m3-embedding: Multi- lingual, multi-functionality, multi-granularity text embed- dings through self-knowledge distillation.arXiv preprint arXiv:2402.03216, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.010211Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:3d37b2db369ebae44cb2c35ea5fd66e7cecc7b6ff74b14601234f86eb021baf8","observation_id":"853b019a-3335-47a9-8701-ce431034a2e2","resolution":{"observed_at":"2026-08-07T05:20:51.010211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:52.011768Z","title":"Visual pro- gramming for step-by-step text-to-image generation and evaluation","venue":null,"work_id":"9354e27d-8898-4abf-b99a-2c7a63afa455","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.014921Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:1121daa3ffe8f4c2241955a749bb6846943b51399f08f45150d7b853d8813c32","observation_id":"c497bdec-1a28-48ba-876e-9ebb948eda0c","resolution":{"observed_at":"2026-08-07T05:20:52.015758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:52.000288Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"42a203b5-0dbd-4426-922c-f2b3c5c44618","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.018690Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:d8271f3d9b597c30370be406a44378186185ddaae70949998452c0152a1cc9dd","observation_id":"23195d1b-b58d-4436-8aed-e94a525398a1","resolution":{"observed_at":"2026-08-07T05:20:52.004536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02535","last_updated":"2023-12-24T23:11:19Z","snapshot_observed_at":"2026-07-06T13:49:23.138584Z","submitted_at":"2022-09-06T14:36:57Z","title":"Analyzing Transformers in Embedding Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02535","snapshot_observed_at":"2026-08-07T05:20:51.022450Z","title":"An- alyzing transformers in embedding space.arXiv preprint arXiv:2209.02535, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.022450Z"},"links":{"cited_paper":"/paper/2209.02535","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f209facff36063b240f047afd78d51387904081fd79fdb268f974afaabf8dbe5","observation_id":"9924718c-6b1b-4cff-a924-0ff9529cfff8","resolution":{"observed_at":"2026-08-07T05:20:51.022450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.989746Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"724b367c-ce16-4876-beb6-7e1aac7d67db","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.027375Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:26e1539dd2bb7bbb9a0fe0ad37e28684f7868ca39ba511b1e75d76c566345acc","observation_id":"e5739900-abb2-4b2c-a8d6-cef0fd7ec774","resolution":{"observed_at":"2026-08-07T05:20:51.993821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-07T05:20:51.030846Z","title":"Lumina-t2x: Transforming text into any modality, reso- lution, and duration via flow-based large diffusion transform- ers.arXiv preprint arXiv:2405.05945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.030846Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:202f75d5c48424d03435a8febe34d6a9fd49f3d51f0a56d8b8678b9d26aa03d2","observation_id":"becaf3ad-2e97-42fc-9820-e757bec27070","resolution":{"observed_at":"2026-08-07T05:20:51.030846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.978763Z","title":"Visual fact checker: en- abling high-fidelity detailed caption generation","venue":null,"work_id":"57f2ff69-28a5-4e36-869c-0bb678dd0400","year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.034740Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:ac361d2365aa474dec655ec1db6cc87334989b8645d02955fdb54fc7216b2a0b","observation_id":"941aed29-e666-4cc1-ae4c-391ecdcb3f49","resolution":{"observed_at":"2026-08-07T05:20:51.982389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:20:51.038814Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.038814Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:e70e260a2b9159902d4c4739ce684494a11defcd12a835a6ee11cb7359d66092","observation_id":"c4abb752-e600-45c3-8439-85cbfcb3b568","resolution":{"observed_at":"2026-08-07T05:20:51.038814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07614","last_updated":"2024-07-11T11:05:53Z","snapshot_observed_at":"2026-08-06T02:29:21.167648Z","submitted_at":"2024-07-10T12:52:49Z","title":"MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07614","snapshot_observed_at":"2026-08-07T05:20:51.042386Z","title":"Mars: Mixture of auto-regressive mod- els for fine-grained text-to-image synthesis.arXiv preprint arXiv:2407.07614, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.042386Z"},"links":{"cited_paper":"/paper/2407.07614","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f253fb790fc7fc58282ca87b758720d9212124408e7a10c2102ef7f48c747119","observation_id":"fbc237b3-b337-479e-8e9a-c9f999690795","resolution":{"observed_at":"2026-08-07T05:20:51.042386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T05:20:51.046257Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning.arXiv preprint arXiv:2104.08718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.046257Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:dc01134cbd4500f95565f2debaebf88f369b97dbb55f6f0d83dbaa09dd953b32","observation_id":"ea91496f-857e-48f3-9b51-e200fe3e3686","resolution":{"observed_at":"2026-08-07T05:20:51.046257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.968973Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"f12ea4c2-50ee-4617-8bff-6e8bbc34e196","year":2017},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.051035Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:f11689e1541e8e24f738ee95ffc298b959c8f97771979c5eb40b03234c1c862e","observation_id":"6d8bb99b-0573-4499-ae53-3369c5a78347","resolution":{"observed_at":"2026-08-07T05:20:51.972571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T05:20:51.054665Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.054665Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:bde17805267285cba1952742036d6991931c2bd416b6231e22c3cc2bb98bfb12","observation_id":"039cbba8-4e40-41f8-b62d-971cdaf3469e","resolution":{"observed_at":"2026-08-07T05:20:51.054665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T05:20:51.058500Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.058500Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:14d0b131475c8c8637a404a2503a26b6a85381348eb3556a0f5c1618ee1edd41","observation_id":"927c9c3c-c01b-44c8-bdbb-8c2e2d661b09","resolution":{"observed_at":"2026-08-07T05:20:51.058500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.957805Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"64b8fb5c-d62e-4831-a2d2-341ea8eeb969","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.062379Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:4a0d7cac2ba4011ffc330a0304c2510339a584d709e73c06ec77a5c0c7087e21","observation_id":"6f26b31b-c794-4861-bf2b-2305a5e532db","resolution":{"observed_at":"2026-08-07T05:20:51.961439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.946185Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"d6d81e4b-6f21-4495-8b1a-e95dc51deb0f","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.066724Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:d98b6c38c26540d0e2f7328f94e8db87b8df5a072915f05c3d7195b54f3e7007","observation_id":"87b63063-c52e-4bc7-bce0-91687dd6dc4d","resolution":{"observed_at":"2026-08-07T05:20:51.950410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:20:51.070312Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.070312Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:886a69f6eff5e0db48130a7d4d505a45933b5c4ebe81ed5f790b5d0f5e2ada93","observation_id":"23a02f78-89ab-48d2-941a-1acf24767390","resolution":{"observed_at":"2026-08-07T05:20:51.070312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.934405Z","title":"What does bert learn about the structure of language? InACL,","venue":null,"work_id":"07f474a9-857f-4d00-8afb-2766a659c544","year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.074586Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:275c4ab14cba915403eb61a8dbe27d89e8474aa701a9cd9cbb5172482f5f2d1d","observation_id":"5f9e4d79-9629-4745-bedf-a538a28a0496","resolution":{"observed_at":"2026-08-07T05:20:51.938958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T05:20:51.078207Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.078207Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:7d7f7d991a9c1eab0ec09f4f4f90669636757e70ac592a13de571c95b543b38c","observation_id":"a744e85c-dbf0-40ea-8e1b-74831bdc6daa","resolution":{"observed_at":"2026-08-07T05:20:51.078207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01502","last_updated":"2024-05-02T17:32:59Z","snapshot_observed_at":"2026-08-03T18:23:58.571986Z","submitted_at":"2024-05-02T17:32:59Z","title":"Analyzing the Role of Semantic Representations in the Era of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01502","snapshot_observed_at":"2026-08-07T05:20:51.082207Z","title":"Analyzing the role of semantic representations in the era of large language models.arXiv preprint arXiv:2405.01502,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.082207Z"},"links":{"cited_paper":"/paper/2405.01502","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:eb4c49abcf61b3732ef2f701e7c710c932676369949bc7c7218f21aba1943f39","observation_id":"d6902ad0-3b3b-41c4-8c12-dd1929b6dc40","resolution":{"observed_at":"2026-08-07T05:20:51.082207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.923646Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"228f8ee8-319d-4be8-9bad-5c216cab2090","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.086581Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:6232e6c7fa5de95a8e2fc57b6c3e80941cc3c4de4b82d833d4ef4d480075d7dd","observation_id":"79b400d3-f8ac-4ef6-9dff-60a433fc1530","resolution":{"observed_at":"2026-08-07T05:20:51.927459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.911064Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":"003fc098-0b3b-41aa-b2f3-609f93155522","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.089829Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:2e75a7f9b73ed97179ccecae5ba887430f9f29f1b05ff1ba82517a6394e883fe","observation_id":"b44455d0-a6cc-4098-bd00-f884dce11158","resolution":{"observed_at":"2026-08-07T05:20:51.916207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-07T05:20:51.093052Z","title":"Nv- embed: Improved techniques for training llms as generalist embedding models.arXiv preprint arXiv:2405.17428, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.093052Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:62880740f79b0d569e0da63c5ed60e84ba5e4799071f7fbf10207ef86f362674","observation_id":"8f166b0a-9b9b-4618-8442-4e80d4ff018d","resolution":{"observed_at":"2026-08-07T05:20:51.093052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13743","last_updated":"2024-11-03T20:22:32Z","snapshot_observed_at":"2026-07-30T19:48:58.731788Z","submitted_at":"2024-06-19T18:00:07Z","title":"GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13743","snapshot_observed_at":"2026-08-07T05:20:51.096656Z","title":"Genai-bench: Evaluating and improv- ing compositional text-to-visual generation.arXiv preprint arXiv:2406.13743, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.096656Z"},"links":{"cited_paper":"/paper/2406.13743","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:edb1e456b0b4c92d1b62408b652eb5e938f4ebc18428e330985f5314c0381715","observation_id":"4093adbf-4e7f-4333-9802-e5abbf15e686","resolution":{"observed_at":"2026-08-07T05:20:51.096656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03281","last_updated":"2023-08-07T03:52:59Z","snapshot_observed_at":"2026-08-04T23:10:23.964516Z","submitted_at":"2023-08-07T03:52:59Z","title":"Towards General Text Embeddings with Multi-stage Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03281","snapshot_observed_at":"2026-08-07T05:20:51.100614Z","title":"Towards general text embeddings with multi-stage contrastive learning.arXiv preprint arXiv:2308.03281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.100614Z"},"links":{"cited_paper":"/paper/2308.03281","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:e0146cb63069e2da26a63d7b145fd57000de159c7528388c1bdd00c19f0d1971","observation_id":"ce625a39-7946-45c8-88db-e4bd5b49427b","resolution":{"observed_at":"2026-08-07T05:20:51.100614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.899590Z","title":"Llm- grounded diffusion: Enhancing prompt understanding of text-to-image diffusion models with large language models","venue":null,"work_id":"1a985b82-ca7b-43b6-9112-c74e736d4c7d","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.104499Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:fa656b28968667cbae6646f04c682da50fa3a239763b67b9be4db1d4880a810e","observation_id":"6fe2513e-05dc-4728-b10f-6418a9231af6","resolution":{"observed_at":"2026-08-07T05:20:51.903817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.889011Z","title":"Common diffusion noise schedules and sample steps are flawed","venue":null,"work_id":"8c9dc00e-1be6-4cc8-850a-f868a7db373a","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.108275Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:5e33023081e0b500bd5fbb35de930dd7854d40d09525527465fc9336330462f4","observation_id":"e25b3597-2306-45ac-b073-ecdae4731aad","resolution":{"observed_at":"2026-08-07T05:20:51.892766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.878762Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":"badbe3fb-9492-4614-8b6b-ee267eb65807","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.112353Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:d0ac123e2767a9f807e674c0580b28536a2ab3b4b4673ed6380d3b32e60fab80","observation_id":"04ead64d-cb04-459d-bb57-c2d51b0d4bf9","resolution":{"observed_at":"2026-08-07T05:20:51.882601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-07-06T19:16:23.103921Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T05:20:51.115963Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large lan- guage models.arXiv preprint arXiv:2409.10695, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.115963Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:626d9b8fdfd36867f54638fd4d527e2225423bdc0801eb5f5a462bc6e48669a3","observation_id":"78c10748-bbdd-4373-b842-1ba1ad57c327","resolution":{"observed_at":"2026-08-07T05:20:51.115963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10562","last_updated":"2023-05-03T16:36:38Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:23Z","title":"Character-Aware Models Improve Visual Text Rendering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10562","snapshot_observed_at":"2026-08-07T05:20:51.120173Z","title":"Character-aware models improve visual text rendering.arXiv preprint arXiv:2212.10562, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.120173Z"},"links":{"cited_paper":"/paper/2212.10562","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:5832e248283a54f8a750b784a55e1e67234b80572386b0def5527d971fdfacce","observation_id":"46685bd4-1272-4c9a-a0e6-f226a9a9bce3","resolution":{"observed_at":"2026-08-07T05:20:51.120173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01509","last_updated":"2024-06-09T13:07:50Z","snapshot_observed_at":"2026-08-02T03:54:54.655157Z","submitted_at":"2024-03-03T13:14:47Z","title":"Fantastic Semantics and Where to Find Them: Investigating Which Layers of Generative LLMs Reflect Lexical Semantics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01509","snapshot_observed_at":"2026-08-07T05:20:51.123785Z","title":"Fan- tastic semantics and where to find them: Investigating which layers of generative llms reflect lexical semantics.arXiv preprint arXiv:2403.01509, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.123785Z"},"links":{"cited_paper":"/paper/2403.01509","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:814ab2154f529394c168f8fe1a95462320afa8952d338bbe1042a0939cfe6b39","observation_id":"9494912b-8c09-407f-8ccd-0cbc9de6a8ff","resolution":{"observed_at":"2026-08-07T05:20:51.123785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.867528Z","title":"Decoupled weight decay regularization, 2017","venue":null,"work_id":"bcb189d0-4c88-45b4-bbca-5eb9aa904cea","year":2017},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.127292Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:aee50df882fee7546ce64cb7e5168851d89690486f924efa0f4dfb561ffb0725","observation_id":"f5a33c4b-94c4-443c-99bd-e73523f50273","resolution":{"observed_at":"2026-08-07T05:20:51.870995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.855743Z","title":"Salesforce AI Research’s SFR-embedding, the top performing text-embedding model","venue":null,"work_id":"fdf451f5-1ec5-4496-ab38-8c368b17821b","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.130898Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:c2fdfbbd54514b0bf6aa9cfef401463c352bce698987c9bd3f55d8f3284133fa","observation_id":"5e1143d1-e17e-46dc-b0ad-588a8094bacf","resolution":{"observed_at":"2026-08-07T05:20:51.860167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-07-06T14:04:58.943383Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-07T05:20:51.134528Z","title":"Mteb: Massive text embedding benchmark.arXiv preprint arXiv:2210.07316, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.134528Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:3bb92a4277a20431bed5b6c804b0b7c39c714096c72072c25ecc3c7917ad8119","observation_id":"08adad73-ee57-430b-936f-99f7ffdda3e4","resolution":{"observed_at":"2026-08-07T05:20:51.134528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.139116Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.139116Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:4665f243187a91f606e5f98bc0b94bbc92b234fd810a893de6e41da33e72c923","observation_id":"b6d0ab25-1849-45fd-b079-deb6eeff7e55","resolution":{"observed_at":"2026-08-07T05:20:51.139116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T05:20:51.143069Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.143069Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:ca06313a14186d419965d518f6387d6ffa84f31e9e01fd5fa7b46705c42ca64f","observation_id":"08aee82c-0c41-472e-9dcb-815af9af02ab","resolution":{"observed_at":"2026-08-07T05:20:51.143069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.838522Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"975a7c2d-b23f-445a-88d0-f861036539a3","year":2021},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.147265Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:2e1521b3a763a276d06100933dc145235c84de9673d152f82193fb8f6ff63b81","observation_id":"be6f771f-b28b-44e4-b94d-fd8c5e1e1042","resolution":{"observed_at":"2026-08-07T05:20:51.842843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.828908Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.JMLR, 2020","venue":null,"work_id":"c832337a-23ab-4d95-b77b-e25b835c3c1d","year":2020},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.150903Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:aaca5024e703c95d9b0e4150650f1ded10e2ae2232d4170960c9aee7d172a55e","observation_id":"30bb8684-6000-4e2c-a8f7-3ee077efd3ab","resolution":{"observed_at":"2026-08-07T05:20:51.832409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T05:20:51.154397Z","title":"Hierarchical text-conditional image gen- eration with clip latents.arXiv preprint arXiv:2204.06125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.154397Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:7772bc6bd0d76bf4509db8dacbd61c6193c0f202dffabdc5ad50cf1c104fc6a5","observation_id":"8f990867-8353-45e4-9157-07fab43f9504","resolution":{"observed_at":"2026-08-07T05:20:51.154397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.818738Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"93d8d7e5-3c61-4210-bb83-2ee84f648791","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.158439Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:e073b3b8dfb6cc10de3bf6ece32c876ddf5e255d71548938007cf3edb01e4272","observation_id":"d242fceb-18b2-42b1-b1f2-e59bf4045b48","resolution":{"observed_at":"2026-08-07T05:20:51.822625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.807858Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"ac37c17a-bbaf-41f9-bf6d-93cc5bab23e5","year":2015},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.161994Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:b5bc6a79c210fd5ebdb46ba85c55787a6f52c4a83899bfa967a75cc48afecc21","observation_id":"cf875356-8584-4dfa-b89e-7565d2e257a6","resolution":{"observed_at":"2026-08-07T05:20:51.811734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.796506Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"3853c255-693e-4f47-9e0b-4cafeb983437","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.165570Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:3410d8d4f1045991e2d58fdfe15028794a431281e8861a26b28902802d7e8974","observation_id":"1d1708d4-fdd0-4ca0-8d8e-d1275221830b","resolution":{"observed_at":"2026-08-07T05:20:51.800992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.786346Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"1442eb36-da5b-4094-b79a-f646c4a573c9","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.169459Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:a87f0de776707ca35d9d2255ebf2563d00f16bd67199458a3dde677f2a03528a","observation_id":"c2cf3cc2-a1d7-4f07-9be7-d6131df0fd71","resolution":{"observed_at":"2026-08-07T05:20:51.790009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15449","last_updated":"2025-09-07T18:50:16Z","snapshot_observed_at":"2026-08-08T06:06:41.534202Z","submitted_at":"2024-02-23T17:25:10Z","title":"Repetition Improves Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15449","snapshot_observed_at":"2026-08-07T05:20:51.173283Z","title":"Repetition improves lan- guage model embeddings.arXiv preprint arXiv:2402.15449,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.173283Z"},"links":{"cited_paper":"/paper/2402.15449","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:e0586dd3a55d5c5c6310ccd62e51185b5b57c73326bfa4f6ca39b31b89b0ab76","observation_id":"554f8853-d4a0-49a4-9075-33be8ee69c87","resolution":{"observed_at":"2026-08-07T05:20:51.173283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T05:20:51.181220Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.181220Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:52602a6ef061aae662c65671a152327ffce798224d6fc88372803ec60ba13747","observation_id":"8f9e3754-0106-4a25-8f2d-4963b637f538","resolution":{"observed_at":"2026-08-07T05:20:51.181220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.775540Z","title":"Stable diffusion training with mo- saicml.Mosaic Research Blog, 2023","venue":null,"work_id":"3998fa56-9479-421c-baa3-3dd8e6012f87","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.184771Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:346da806c63217f4b94a945e89a61d23dbdf6e6df8a0880ffd7042680776560b","observation_id":"ce1863b8-9a5e-46e5-a0ea-e282955f68fd","resolution":{"observed_at":"2026-08-07T05:20:51.779633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06316","last_updated":"2019-05-15T17:48:56Z","snapshot_observed_at":"2026-08-07T09:02:14.264924Z","submitted_at":"2019-05-15T17:48:56Z","title":"What do you learn from context? Probing for sentence structure in contextualized word representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06316","snapshot_observed_at":"2026-08-07T05:20:51.188280Z","title":"What do you learn from context? probing for sentence struc- ture in contextualized word representations.arXiv preprint arXiv:1905.06316, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.188280Z"},"links":{"cited_paper":"/paper/1905.06316","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:6c22fa363bb94bf4a8c86c131ecbf606644b09fe656d3dc05af3ff58a602972f","observation_id":"650e3c80-0662-460e-a644-f33a1de5cf4b","resolution":{"observed_at":"2026-08-07T05:20:51.188280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.764254Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"81ed514b-f94c-4f21-9334-0ade7f597cfd","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.192566Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:ae742863e8ea7821f1506cc5af1ea0ad4cb62c5041eb1771f8ed8e4f6cc73141","observation_id":"8256558b-81e8-4136-ab26-a8ed29f1c08f","resolution":{"observed_at":"2026-08-07T05:20:51.768198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:20:51.196243Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.196243Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:ec51b94bd6c55ec3ab1eb793c375436594ef170525b879b4fa7af4a25279b08e","observation_id":"df1e8bc0-cccc-4034-90a9-ac8b7fbfef8c","resolution":{"observed_at":"2026-08-07T05:20:51.196243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.752063Z","title":"Diffusers: State-of-the-art diffusion models.GitHub repository, 2022","venue":null,"work_id":"6ed2b645-65f7-4ade-8216-adb86a484e71","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.199902Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:6e945944caf7c33f6f85f7535f3b2c98b0009604bf67b090a534e7e2ec2bf512","observation_id":"c1827cbc-35e5-458e-96d8-66c9a8fe0679","resolution":{"observed_at":"2026-08-07T05:20:51.756013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-07T05:20:51.203423Z","title":"Text embeddings by weakly-supervised contrastive pre- training.arXiv preprint arXiv:2212.03533, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.203423Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:b441a32a7073a6988fc8f774c04d97dbdc80797f4339044eb054df9c74135b98","observation_id":"5727adb9-dd26-4d48-b90c-70e3e7357347","resolution":{"observed_at":"2026-08-07T05:20:51.203423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.740732Z","title":"Improving text embeddings with large language models","venue":null,"work_id":"aad8bfbe-cb6f-4887-bf26-6789aeb9fd51","year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.206990Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:8c30b60a120432f68666981c0b695f2393b60227f5c3e48c9a1e2b383b63c722","observation_id":"3189fe56-8ea4-442d-b5f1-2e8540898742","resolution":{"observed_at":"2026-08-07T05:20:51.744839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16820","last_updated":"2025-03-17T15:53:14Z","snapshot_observed_at":"2026-07-06T18:05:42.862609Z","submitted_at":"2024-04-25T17:58:43Z","title":"Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16820","snapshot_observed_at":"2026-08-07T05:20:51.210596Z","title":"Revisiting text-to-image evaluation with gecko: On met- rics, prompts, and human ratings.arXiv preprint arXiv:2404.16820, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.210596Z"},"links":{"cited_paper":"/paper/2404.16820","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:aafb27379a05568eb758adc6d0d1b02744e2af6175b46a44b31ec1e44b3c3f7d","observation_id":"f715e3cf-606d-4af0-979d-491ffc7800f5","resolution":{"observed_at":"2026-08-07T05:20:51.210596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T05:20:51.214409Z","title":"Sana: Ef- ficient high-resolution image synthesis with linear diffusion transformers.arXiv preprint arXiv:2410.10629, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.214409Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:85dfaca393cc5964ecb05b1f7cfb08e97e270f4debeb03bc334d2c857358e854","observation_id":"fd00a9b6-0f84-43ba-831f-ebc5df508ea0","resolution":{"observed_at":"2026-08-07T05:20:51.214409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.728746Z","title":"ByT5: Towards a token-free future with pre-trained byte- to-byte models.TACL, 2022","venue":null,"work_id":"1cdf2ae7-cb2b-4485-933e-94f60460aff3","year":2022},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.218461Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:de18f807ff8732b00a4e22ed736ad7fd6fa78d915725bfdd0cef1bb5c300a2b9","observation_id":"eca2e838-1853-4e5e-aa53-4efa5424ae8d","resolution":{"observed_at":"2026-08-07T05:20:51.733137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:20:51.222983Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.222983Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:0ee23eaa96ec79458cf131829c515f432ba79a025776ff49d3fb4ca6d5d23843","observation_id":"1f715680-9d55-44af-af67-261e85e2dc28","resolution":{"observed_at":"2026-08-07T05:20:51.222983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.718111Z","title":"What you see is what you read? improving text- image alignment evaluation","venue":null,"work_id":"d61178f4-90ba-4479-b9a2-c9b4157e9b69","year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.226960Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:974cc1845f75c63b3492211ab7f207cd4637ce203b8a84ef78b070e94e91f21d","observation_id":"8ca66ea2-ab10-4a4d-8f5a-92033c24c6b7","resolution":{"observed_at":"2026-08-07T05:20:51.721893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14381","last_updated":"2024-09-22T09:53:13Z","snapshot_observed_at":"2026-07-06T19:19:24.759288Z","submitted_at":"2024-09-22T09:53:13Z","title":"Investigating Layer Importance in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14381","snapshot_observed_at":"2026-08-07T05:20:51.230669Z","title":"Inves- tigating layer importance in large language models.arXiv preprint arXiv:2409.14381, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.230669Z"},"links":{"cited_paper":"/paper/2409.14381","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:0f003b0363dc723abe691beb6cdcb6eeffd0f2e5097dd5ec60e251c3a6a86ae7","observation_id":"c5623f59-da6b-48f4-81dd-6f7bd2954a2d","resolution":{"observed_at":"2026-08-07T05:20:51.230669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T05:20:51.235247Z","title":"Pytorch fsdp: experi- ences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.235247Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:bfa366f5e891a8bf58ba2d37abd08fcd3e87d4829444db2f7d6411136407589c","observation_id":"d7afd82b-89f1-4642-9c27-61a1bdf32373","resolution":{"observed_at":"2026-08-07T05:20:51.235247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18583","last_updated":"2024-06-05T17:53:26Z","snapshot_observed_at":"2026-08-06T11:25:48.819238Z","submitted_at":"2024-06-05T17:53:26Z","title":"Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18583","snapshot_observed_at":"2026-08-07T05:20:51.240632Z","title":"Lumina-next: Making lumina-t2x stronger and faster with next-dit.arXiv preprint arXiv:2406.18583,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.240632Z"},"links":{"cited_paper":"/paper/2406.18583","citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:14c5d6281ccb3d194910e130a805c346a92faa98a8c4b518e1f8fbb32390674f","observation_id":"ae66d45d-f3f5-45a0-91f6-994ca9ad6a26","resolution":{"observed_at":"2026-08-07T05:20:51.240632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:51.707073Z","title":"a beautiful morning in the woods with the sun peaking through the trees","venue":null,"work_id":"2ec48032-9968-4ee6-a33b-64d959d58544","year":null},"citing_paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:51.244779Z"},"links":{"citing_paper":"/paper/2506.08210"},"observation_digest":"sha256:55fd36a47cc563521d5fd32b4478fb58b9525ae73dca75f1930ece797875d592","observation_id":"275b4bab-9df2-45e8-a30a-4291d5d7f937","resolution":{"observed_at":"2026-08-07T05:20:51.711029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08210","last_updated":"2025-06-09T20:29:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:14:44.444253Z","submitted_at":"2025-06-09T20:29:53Z","title":"A Comprehensive Study of Decoder-Only LLMs for Text-to-Image Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2506.08210."}