{"as_of":"2026-08-09T08:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93f195bcb6b6a6d2f491af83d632f4a552e68212e91c20159a07fb311c653fef","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:42:44.693479Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16679/citation-record","integrity":"/paper/2506.16679/integrity","json":"/paper/2506.16679/citation-record.json","paper":"/paper/2506.16679"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.01324","last_updated":"2023-03-14T00:22:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-02T17:43:04Z","title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01324","snapshot_observed_at":"2026-08-06T23:42:39.205574Z","title":"eDiff-I: Text-to-image diffusion models with an ensem- ble of expert denoisers.arXiv:2211.01324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.205574Z"},"links":{"cited_paper":"/paper/2211.01324","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:746d70c93576dffc45787fb00d9ea6e4c9e8e67f5d5f5eae40ff952806d46ede","observation_id":"b29b55f1-1eae-4431-8287-c32b58950ab5","resolution":{"observed_at":"2026-08-06T23:42:39.205574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:39.318251Z","title":"Improving image generation with better captions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.318251Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:a15547c64ab16cfd8803aaf945542f6f04480a079ae627d361cd016f8e4a27c8","observation_id":"b7ccddc5-04e7-49b8-b370-194bce0d1623","resolution":{"observed_at":"2026-08-06T23:42:39.318251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:39.446715Z","title":"Easily Ac- cessible Text-to-Image Generation Amplifies Demographic Stereotypes at Large Scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.446715Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:3b6b61d70ab87bdbd832e9261a0578fd64d81e8eb770e20309f5fa28660ac234","observation_id":"e9c07c11-e186-4cf8-810b-83d1fd08c5fa","resolution":{"observed_at":"2026-08-06T23:42:39.446715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:39.584832Z","title":"Se- mantics derived automatically from language corpora con- tain human-like biases.Science, 356(6334):183–186, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.584832Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:1e44deb8d65498d52ded581ac224423b3c2d9bcd1ffdf1f33bc183f7942ca8f3","observation_id":"558f82cb-ca6b-4513-bf14-22cd904bf406","resolution":{"observed_at":"2026-08-06T23:42:39.584832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T23:42:39.794485Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.794485Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:4a9704673f2fdd03c2e646e0d8b800cd7052a6b7123c3c463490aa51c5d1737e","observation_id":"2155edb3-d6f1-4785-8840-a235f3b9fe30","resolution":{"observed_at":"2026-08-06T23:42:39.794485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:39.904443Z","title":"Lmdeploy: A toolkit for com- pressing, deploying, and serving llm.https://github","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.904443Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:cb777549a45903c2701d7bc95e86fd62c920fa11beb83b061266b4fe4756f5b7","observation_id":"6624f839-a4f3-4b3a-8d99-8774cb2628d5","resolution":{"observed_at":"2026-08-06T23:42:39.904443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:40.102939Z","title":"DeepFloyd-IF-I-XL-v1.0: DeepFloyd’s Image Generation Model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.102939Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:ea18f398623963412f416eaf31640737210dc805e05a41b3f08d4ea1f3048f55","observation_id":"6a27f1dc-6ac3-4360-9fe3-16dc6ee37eab","resolution":{"observed_at":"2026-08-06T23:42:40.102939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:40.255286Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.255286Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:f51f58f11cb6de1a585aceff027f365306c47fa6681f8a5a32209b5eb17aa62c","observation_id":"d0220b11-71d3-4c05-8397-1d2acf8f482f","resolution":{"observed_at":"2026-08-06T23:42:40.255286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:40.405376Z","title":"Auditing and instructing text-to-image gener- ation models on fairness.AI and Ethics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.405376Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:6713ce4a11c3ee09422143f05cb8331cffa2f1f5aa3ec6822182af90fce8a3d6","observation_id":"347fc60b-73ce-4c28-b156-dd2933804507","resolution":{"observed_at":"2026-08-06T23:42:40.405376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:40.495626Z","title":"Multilingual text-to-image generation magnifies gender stereotypes and prompt engineering may not help you, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.495626Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:d9c6e442ad523f10ea42cadd07ff25e8523e78a5260bd2f4b6c2213f553b2d80","observation_id":"a1c12695-5946-44e0-8b8d-c2ddea93614f","resolution":{"observed_at":"2026-08-06T23:42:40.495626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:40.624921Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.624921Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:1987da81d94a95ea2cb38259343a6c71a401ca470b09f5d389f8b8f0ddea9017","observation_id":"22dec8b3-0204-4ef4-89e8-31bd5a06cafd","resolution":{"observed_at":"2026-08-06T23:42:40.624921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16825","last_updated":"2023-10-25T17:56:07Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:56:07Z","title":"CommonCanvas: An Open Diffusion Model Trained with Creative-Commons Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16825","snapshot_observed_at":"2026-08-06T23:42:40.734956Z","title":"Com- moncanvas: An open diffusion model trained with creative- commons images.arXiv preprint arXiv:2310.16825, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.734956Z"},"links":{"cited_paper":"/paper/2310.16825","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:ed1e67fcb6621c624e53e78859800387f5841371fcddf81685509e45bfb8fe31","observation_id":"61b54fcd-4a5f-434d-944c-ae818c146561","resolution":{"observed_at":"2026-08-06T23:42:40.734956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:40.846001Z","title":"Hal- lusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision- language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.846001Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:949843d6cd28990b7064f27b791a21fb99e372bbbf296e3a13ff352ec3bc0cf7","observation_id":"54200460-ec09-4521-bc29-7146b74c3f7b","resolution":{"observed_at":"2026-08-06T23:42:40.846001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:40.966618Z","title":"Benchmarking of deep architectures for segmentation of medical images.Trans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.966618Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:b757ce33e669c706f838bb780d0ec837cdb55e5cb03d697335104dd17d38fa19","observation_id":"4b7918e8-bed1-449e-b904-6cf61361700b","resolution":{"observed_at":"2026-08-06T23:42:40.966618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:41.194882Z","title":"CLIPScore: a reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:41.194882Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:30313e71d6c0761dbda75e8b0c9e1b6f750cff6329c2c6252c1f8ef10e2745df","observation_id":"fc7b575b-4bc4-4a28-8285-15bc81136e46","resolution":{"observed_at":"2026-08-06T23:42:41.194882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:41.290350Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:41.290350Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:c7f90e470264a0560c3e34afee07231669848ff21f86332cd7131047488787ca","observation_id":"c571d370-70d8-47c8-b310-bf761d777dbf","resolution":{"observed_at":"2026-08-06T23:42:41.290350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T23:42:41.417383Z","title":"Classifier-free diffusion guidance.arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:41.417383Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:e128f8c57932006b7b568921500b33dbfb1fb7b95d35ef044426cac8e60ebdd9","observation_id":"b095a204-ce0b-497f-80f7-b008bf11c865","resolution":{"observed_at":"2026-08-06T23:42:41.417383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:51.784338Z","title":"Fairface: Face at- tribute dataset for balanced race, gender, and age for bias measurement and mitigation","venue":null,"work_id":"1f48444e-cedf-4bf7-9f9c-d7f348df6c32","year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:41.602235Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:60f605db0890a991b8436971da67eca9183b3703225814308a326d40634817ca","observation_id":"81b22947-d3cf-4904-9aca-c6978eecb2f8","resolution":{"observed_at":"2026-08-06T23:42:51.905389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:51.370852Z","title":"Transformers are minimax optimal nonparametric in-context learners","venue":null,"work_id":"4d0e1b25-1179-4bec-9972-6e12d9fde058","year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:41.764753Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:b7bd05fa6b609f9685554784d944914e430d000c97d56293da3da1bcbfe8b4e8","observation_id":"58cfc80b-e862-46cc-a7cb-63029ed7ea07","resolution":{"observed_at":"2026-08-06T23:42:51.555707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:51.120552Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":"9038464c-4bfa-4ce5-9ec6-765c179b3392","year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:41.934753Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:099f8b9059ae5ea19c029acda37fd231eeb2efb8e9b18324bbbb6a38dbed24ff","observation_id":"0a02f6ce-6ae5-48ba-a14f-a37192251143","resolution":{"observed_at":"2026-08-06T23:42:51.178767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:50.684781Z","title":"Genai-bench: Evaluat- ing and improving compositional text-to-visual generation,","venue":null,"work_id":"da5ac3ed-0d38-4d79-bf33-3cf5058dd41f","year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.064986Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:a578c20ef3ec1d2e0a77d310156cfacfb6216ee9c1891e22cf25d97a8012c660","observation_id":"08b35d18-f633-4871-9784-f9114dbe2b77","resolution":{"observed_at":"2026-08-06T23:42:50.974970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T23:42:42.178165Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.178165Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:1f5bb29c39231db78aa04c73fade11a28ac8f642d17a36718873ed0ff9d28957","observation_id":"da717749-599d-4916-9ecb-f93dbace5d54","resolution":{"observed_at":"2026-08-06T23:42:42.178165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:50.324867Z","title":"Manmatha, Ashwin Swaminathan, Zhuowen Tu, Stefano Ermon, and Stefano Soatto","venue":null,"work_id":"778c981a-e936-4016-9630-3df71a9d1b26","year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.375184Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:6b483667f999441d40ac26a43a70c311957a2526c26fb2a09ff05a3afebc250d","observation_id":"6e38cb9e-9dfb-4235-9150-5a65b0a9f6fb","resolution":{"observed_at":"2026-08-06T23:42:50.455089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.974747Z","title":null,"venue":null,"work_id":"e2a3b114-b8cd-4108-a184-4ffab0ed8322","year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.455111Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:a1ea1336a90f66c2b1cb3d450659fffa6cea2d5525caf0448a967549ac07e668","observation_id":"1b97e62d-a13d-48ba-a05f-7af49f06fea8","resolution":{"observed_at":"2026-08-06T23:42:50.064635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.674745Z","title":"MVPTR: multi- level semantic alignment for vision-language pre-training via multi-stage learning","venue":null,"work_id":"b6cdd9a3-829d-46f5-84c0-2835dc4b8e43","year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.544752Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:303b3a3104ae45ef0f95302c8c2d6c883985dc145465ca5b93214bbc7d001215","observation_id":"908c64c8-763d-4626-b7b0-54265600e425","resolution":{"observed_at":"2026-08-06T23:42:49.814499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.416121Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large lan- guage models, 2024","venue":null,"work_id":"181bd4b4-4051-49c8-9d8b-5526d88ba920","year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.629743Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:84111951ea62a5e167fd05efa8d8bc5bc3db07727a2e7392c387175913334b0c","observation_id":"d98e2388-d1ae-4244-977f-c4bbd7a40305","resolution":{"observed_at":"2026-08-06T23:42:49.498510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.187057Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"4f2bd822-2011-4a1a-ad46-2582cca484b9","year":2019},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.715356Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:a5d7e04d96b8c5abd04ab4dad381a4ffec1cd5a50969c299ed768ff1cd2e3066","observation_id":"990f61d5-5c46-4105-ba7e-0679f2c7a42d","resolution":{"observed_at":"2026-08-06T23:42:49.261266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11393","last_updated":"2025-07-13T20:17:49Z","snapshot_observed_at":"2026-08-07T16:02:05.316023Z","submitted_at":"2025-04-15T17:02:15Z","title":"DataDecide: How to Predict Best Pretraining Data with Small Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11393","snapshot_observed_at":"2026-08-06T23:42:42.799200Z","title":"Hwang, Luca Soldaini, Akshita Bhagia, Jiacheng Liu, Dirk Groeneveld, Oyvind Tafjord, Noah A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.799200Z"},"links":{"cited_paper":"/paper/2504.11393","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:018d7996a805f5777e4e9c4ef23748eee5846578348c78db1e83591b9952a31c","observation_id":"7b80c2bb-db38-4371-8bc0-d7b1e7857db7","resolution":{"observed_at":"2026-08-06T23:42:42.799200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.974826Z","title":"On aliased resizing and surprising subtleties in GAN evaluation","venue":null,"work_id":"2d7576af-eb69-4410-b35b-ad39d012d9e3","year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.975038Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:f9d1a61056317ac7a8a2833c325138f75fdb3fb4d7c09bb7338c02b5b7910837","observation_id":"5583e7a2-d656-4ab7-9bce-9fadce231b7f","resolution":{"observed_at":"2026-08-06T23:42:49.045221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T23:42:43.044829Z","title":"Hierarchical text-conditional image gener- ation with CLIP latents.arXiv preprint arXiv:2204.06125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.044829Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:01e4e3019144dc552eb87e5e95fb5a08aad5e8ac9bd4216329db1d3ce1e116ed","observation_id":"a0f40c02-ffab-472f-9a2c-777a7742a149","resolution":{"observed_at":"2026-08-06T23:42:43.044829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.695643Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"dc5f387b-03b9-4edc-83aa-ee7a41b8879c","year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.133552Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:cd21e8568383ae9e4fa4e57843e3f6d8ff897b339e512e2e85d6f9e1d2cd01a4","observation_id":"99aa93f8-c68d-42aa-87c6-b454a4a6f723","resolution":{"observed_at":"2026-08-06T23:42:48.820391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.435344Z","title":"Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":"141e7cb4-f4b0-4287-86b6-97bdbfcd8691","year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.199837Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:2e99cc3c1a5342f280b87087606efbe69cb810992cfca91f420db8ad369172ea","observation_id":"547bb8b8-6e95-42d6-a8f6-2dd81afe9eec","resolution":{"observed_at":"2026-08-06T23:42:48.515166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12015","last_updated":"2024-03-18T17:51:43Z","snapshot_observed_at":"2026-08-06T10:10:20.333853Z","submitted_at":"2024-03-18T17:51:43Z","title":"Fast High-Resolution Image Synthesis with Latent Adversarial Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12015","snapshot_observed_at":"2026-08-06T23:42:43.346847Z","title":"Fast high- resolution image synthesis with latent adversarial diffusion distillation.arXiv:2403.12015, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.346847Z"},"links":{"cited_paper":"/paper/2403.12015","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:d6214b97458a006fe87aba0cf327d521c674651b4231c4c5435d9643de4bc566","observation_id":"4dd22a3e-4cda-4a02-9453-0aa14946d9a1","resolution":{"observed_at":"2026-08-06T23:42:43.346847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.234828Z","title":"Safe latent diffusion: Mitigating inappro- priate degeneration in diffusion models","venue":null,"work_id":"8ae0694b-8115-4648-8cdc-e9abd1f0224d","year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.454840Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:2385847d3712de966657369f868ae7703e6204687fefd58f9c6acb89b89180fc","observation_id":"901e554f-1db5-4b46-a477-311ee7b789d0","resolution":{"observed_at":"2026-08-06T23:42:48.294749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.941492Z","title":"LAION- 400M: open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":"7105d261-508c-4488-ba12-6643708d47de","year":2021},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.546387Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:6a2ccf3b38e95199e0c33827002b9cb533e508d8f25758032d1f60dbbea0a25e","observation_id":"fb5fa092-cb34-4479-b4f0-4d7e0a19c085","resolution":{"observed_at":"2026-08-06T23:42:48.074836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.705526Z","title":"Laion-5b: An open large-scale dataset for training next gen- eration image-text models","venue":null,"work_id":"3349641a-c8b1-464a-81a3-39bc1626ac9f","year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.727063Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:e52604ee7238c3bd5e47254c772f6ca7aa6f218238285e47af1107625343dfe6","observation_id":"e9f375a3-88be-4dab-bf85-3746ad49ef47","resolution":{"observed_at":"2026-08-06T23:42:47.803600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.467347Z","title":"The bias amplification paradox in text-to-image generation","venue":null,"work_id":"aa66f002-2a67-4a0f-9eef-63cf6cba489a","year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.854962Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:3764eff17bd0c63b2435f1bde8c7010471541c6cafdb03d9e512d3bb488325b2","observation_id":"99029762-b815-4202-903e-33770a0a3c76","resolution":{"observed_at":"2026-08-06T23:42:47.536040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.231368Z","title":"Scaling autoregressive models for content-rich text-to-image generation.Transactions on Machine Learn- ing Research, 2022","venue":null,"work_id":"d0eda6bc-f53b-4860-8599-e34a3ad6b400","year":2022},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:43.941301Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:6ae85d6f12fd41730d870ecf00c348de1d736bb23e221b2c5c0bcf522ec80906","observation_id":"716dcf68-43c4-4a15-97de-064c5d401727","resolution":{"observed_at":"2026-08-06T23:42:47.312561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.065852Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"899da0b9-c656-4295-a067-a90c6a8663a6","year":2023},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:44.054838Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:931f4f4fbb41bb065d919370aeae74be84e74078d954bcbd4e522d2b28a6f61c","observation_id":"517e503f-be60-4ce8-938e-aaf294774c0c","resolution":{"observed_at":"2026-08-06T23:42:47.121589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.804833Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"c26ad695-d72d-410c-b014-cb4865b46ab3","year":2018},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:44.165791Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:a6f5ff104fc9172706f8c625d0ed1d8621a0dccb935ffb920ba6ec7f3e08111d","observation_id":"c3150f97-83ce-48d9-837e-d5497f7ee3cc","resolution":{"observed_at":"2026-08-06T23:42:46.932291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-06T23:42:44.284962Z","title":"The image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:44.284962Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:6a2680018ae286a4a343ff686dc150392f0637c69e20d97560c1eca8eb33ed07","observation_id":"0aef22c2-3279-4cba-a8ce-a278e4b1b84e","resolution":{"observed_at":"2026-08-06T23:42:44.284962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.594736Z","title":null,"venue":null,"work_id":"38c643b1-d564-411f-bd65-d08d97018f33","year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:44.394752Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:94d7f3b99f1afb00109c40f1730fca4258aae6790d4ba76b44b73b243bec3d4b","observation_id":"e9e566db-2c49-4d4b-bd6b-68a5572cd0ec","resolution":{"observed_at":"2026-08-06T23:42:46.644753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.324785Z","title":null,"venue":null,"work_id":"7b5d7d02-7f02-4e3c-b819-b1862342d3b6","year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:44.514755Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:1a0a5d829536531080d7dbe245920f124b1d41a06ee0897d5a9a0b3eac57b780","observation_id":"ee55de2c-6c89-4dc3-8284-a4fb32739b76","resolution":{"observed_at":"2026-08-06T23:42:46.457415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.025280Z","title":null,"venue":null,"work_id":"d99363f8-fe83-4709-8084-0cf9feb647f5","year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:44.616284Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:0f18864be4232a0d4ba5c967e6209cecb70d7192bb1d22a62e6faa73b6415f03","observation_id":"96d665c8-a8f2-4835-bba7-91f98df2851c","resolution":{"observed_at":"2026-08-06T23:42:46.138421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.774810Z","title":"psychologist","venue":null,"work_id":"b20a5658-2c4c-49ef-8f7e-7dce36de5600","year":null},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:44.693479Z"},"links":{"citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:115b515a423541faefd0c0ac7a26686ee9b2c574a65bd1d2d4ce5b9e1ccd45c3","observation_id":"9fa2384b-0944-42cf-99c9-b5e9f07da3c9","resolution":{"observed_at":"2026-08-06T23:42:45.864900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2506.16679."}