{"as_of":"2026-08-23T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09712084da0e29b40740b586ec89f000f3c57e6c04e37ebf7ecf5a6c0d6f0cab","coverage":[{"denominator":135,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:27:16.407874Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08071/citation-record","integrity":"/paper/2506.08071/integrity","json":"/paper/2506.08071/citation-record.json","paper":"/paper/2506.08071"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.924618Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.924618Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:e5c59a79f0aecd5b0e340c20e457828829da3b14a6124dbdeebae18b7cf03aca","observation_id":"5ccffc51-ea97-40cf-a12f-4fa4d70903d7","resolution":{"observed_at":"2026-08-07T05:27:15.924618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.930555Z","title":"In- specting the geographical representativeness of images from text-to-image models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.930555Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:78efc11e637513d0817f4a8d89d35ae6c7a42085a5509564fd0af46e724cd8cf","observation_id":"25693321-6866-4409-bc0a-d39c017db58e","resolution":{"observed_at":"2026-08-07T05:27:15.930555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08914","last_updated":"2025-06-25T17:32:22Z","snapshot_observed_at":"2026-08-20T22:31:58.903706Z","submitted_at":"2025-02-13T03:05:42Z","title":"Diffusion Models Through a Global Lens: Are They Culturally Inclusive?","version":2},"cited_work":{"arxiv_id":"2502.08914","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.08914","snapshot_observed_at":"2026-08-07T05:27:16.885862Z","title":"Diffusion Models Through a Global Lens: Are They Culturally Inclusive?","venue":"cs.CV","work_id":"e9279957-4df1-4938-8cdf-94b5f9e2fa6e","year":2025},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.935482Z"},"links":{"cited_paper":"/paper/2502.08914","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:e0b653bd9370acd18d63947da2610b0834fd9daef3ea0d7682f742bb99150123","observation_id":"acbecfee-32d1-4c6b-934e-47012251de5e","resolution":{"observed_at":"2026-08-07T05:27:16.891120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.940757Z","title":"Improving image generation with bet- 12 ter captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.940757Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:94c5e82e785481011c4ef99dd0acdf05e47adfda321757940599e6165a73b844","observation_id":"b3c6dc4b-7917-460c-90bf-f5812cf7d944","resolution":{"observed_at":"2026-08-07T05:27:15.940757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.945463Z","title":"Easily acces- sible text-to-image generation amplifies demographic stereo- types at large scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.945463Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:3b42a6489a42d8687f5b517366c7649453caf7fc2cf57f3e63689835d5cbf791","observation_id":"e193dca0-491f-4db5-8cf2-5860a1162162","resolution":{"observed_at":"2026-08-07T05:27:15.945463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.949933Z","title":"Demystifying mmd gans","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.949933Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:81f2ea53eeef6d83377521741faa2d16f4a5dde37ef2c702e5e28ea21e2771fc","observation_id":"8cb13184-6e1b-42b5-aa99-ac5d23ffb205","resolution":{"observed_at":"2026-08-07T05:27:15.949933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01963","last_updated":"2021-10-05T11:47:27Z","snapshot_observed_at":"2026-08-17T20:03:41.214987Z","submitted_at":"2021-10-05T11:47:27Z","title":"Multimodal datasets: misogyny, pornography, and malignant stereotypes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.01963","snapshot_observed_at":"2026-08-07T05:27:15.955192Z","title":"Multimodal datasets: misogyny, pornography, and ma- lignant stereotypes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.955192Z"},"links":{"cited_paper":"/paper/2110.01963","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:b615b55f7e85663916e88751b65bec43f71c06f1fb6850d8073376b37c2bfb97","observation_id":"de181d9f-789c-4e49-86c3-ac554e5d5348","resolution":{"observed_at":"2026-08-07T05:27:15.955192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.960258Z","title":"Into the laion’s den: Investigating hate in multi- modal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.960258Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:8dbd59fe0ca8800d88f35ae17b190817fa2ec2a6534b9d64d09035856923f81c","observation_id":"660a2971-7460-4d2b-aca8-85ce4d1eca2d","resolution":{"observed_at":"2026-08-07T05:27:15.960258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.964976Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as-a-judge with vision-language benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.964976Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:85b455559b0a03086bd776d04cd627f69cadea87b79784bbd7ccc3e780d5dcda","observation_id":"8a7e2de3-6889-4e7e-b523-6699f4b2f062","resolution":{"observed_at":"2026-08-07T05:27:15.964976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.969953Z","title":"Pal: Sample-efficient person- alized reward modeling for pluralistic alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.969953Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:67845f438b65b9d2f4dcc8169e18bc0916a752557541e10e8dc22dbcdfbd9f4f","observation_id":"74fccfd5-1d59-43a8-8e39-8bdc0457ca28","resolution":{"observed_at":"2026-08-07T05:27:15.969953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.974490Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.974490Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:6e0ce42cfd3fd49c61d719059d7d3e189231d3daa9687bc470933b283996b1c9","observation_id":"869db556-81ea-47e2-adb3-1e6990aeae62","resolution":{"observed_at":"2026-08-07T05:27:15.974490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.979180Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to- image generation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.979180Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:4a9fd7267dd3a377a87f6bd64457250bd8f6b5360216dfc4a0bc5009b2e13797","observation_id":"ab6fe6d8-f18d-4f54-83e5-c3235c835a40","resolution":{"observed_at":"2026-08-07T05:27:15.979180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.983680Z","title":"Food and culture","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.983680Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:731830c67037a7379a71069340e54f0b3dca4c374330486d3ceed6813ca9eb8e","observation_id":"361f6fc5-6190-4ffa-ac65-f3fa284124d5","resolution":{"observed_at":"2026-08-07T05:27:15.983680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.987814Z","title":"Does object recognition work for ev- eryone? In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition workshops , pages 52–59, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.987814Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:bef2a0cf48c978641ef089ae6e9f5b1d1226f5e52e98edde939863f6eef1526b","observation_id":"55f1e540-9c22-4523-8bc8-2bfc863a3953","resolution":{"observed_at":"2026-08-07T05:27:15.987814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.992355Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.992355Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:58a528566a5917892822b2267b8f1891778c1fb76f6e6e07f53479fe69a60f00","observation_id":"e78dfdc5-2538-4c1e-871e-5b6c087fa2b4","resolution":{"observed_at":"2026-08-07T05:27:15.992355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:15.996795Z","title":"Internet, phone, mail, and mixed-mode surveys: The tailored design method","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:15.996795Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:58cb04afbbf2166dc8ff3365c42942b43f3629f66f301ce66d0c04aa740587f5","observation_id":"e4ef9141-17f7-42bc-a6f7-7adfef3291f2","resolution":{"observed_at":"2026-08-07T05:27:15.996795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.001810Z","title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.001810Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:0bdeef06d7efba4ddfcbf2a9f4be13de8b9e499a4d5aedb0fc5ea109ec0e2167","observation_id":"543c2df9-82ae-4bd8-8869-40ded8eea129","resolution":{"observed_at":"2026-08-07T05:27:16.001810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T05:27:16.006555Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.006555Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:359f35d910f8b6199978a3ba5aa5a6a628aab93ec4e6e293de6a18c075c7b115","observation_id":"cb98e8aa-fbb2-4873-b7fb-8a9fe0292508","resolution":{"observed_at":"2026-08-07T05:27:16.006555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.011719Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.011719Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:30c9d4c81824889594071ed5fc71b577dde84d50f6f848057e2c9b534c43e575","observation_id":"0d647f27-9c85-46d8-ade4-7412b47249be","resolution":{"observed_at":"2026-08-07T05:27:16.011719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-19T09:37:08.990859Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-07T05:27:16.016313Z","title":"Mul- timodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.016313Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:621714038628b0de47a1b8bc3aed16175826c31d17aa14f48a0300304413a691","observation_id":"73860be0-67e3-4044-ad80-3203f726ffc8","resolution":{"observed_at":"2026-08-07T05:27:16.016313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.021145Z","title":"The vendi score: A diversity evaluation metric for machine learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.021145Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:f75da0e00adf50cef45464376220fbb6a8345f8c24aad605c1368bd0ff5d37b3","observation_id":"a050371d-be8e-4240-999e-3c273d8c289e","resolution":{"observed_at":"2026-08-07T05:27:16.021145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-08-21T15:23:53.574722Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-07T05:27:16.025685Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.025685Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:ef1002d989a334ee616ab2792a708d5c52b0720f6055eb6fc15879ec00681ef2","observation_id":"1a413808-640f-485c-a0d7-4112960d33e7","resolution":{"observed_at":"2026-08-07T05:27:16.025685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.030824Z","title":"Imagenet-trained cnns are biased towards texture; increasing shape bias improves accuracy and robustness","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.030824Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:22fe2757b6d0cd89dd628223c86b53bf375513bf85c67ba883326477d84a07b4","observation_id":"8d525726-2811-49d7-b2c4-df95970968aa","resolution":{"observed_at":"2026-08-07T05:27:16.030824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.035641Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.035641Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:81cb67bb4ab32e40ff4458f8459bc1e75f8365895fd93c23a7b8ad5b73bfc95d","observation_id":"a351a1a7-4796-4b84-8ab1-53ca4ee3dcc5","resolution":{"observed_at":"2026-08-07T05:27:16.035641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.040288Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.040288Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:39ad42e1463a9e79c2639eee89a0c8de5f65f656c87c337ae62e152aba7a21b2","observation_id":"89d9ff3b-a25c-4e7a-9870-27c9903c2687","resolution":{"observed_at":"2026-08-07T05:27:16.040288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.045849Z","title":"Culture’s consequences: Comparing val- ues, behaviors, institutions and organizations across nations","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.045849Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:1176155e2cd86f2aa67ca41c22eb207531ec7a8151cfd65b1dae4950ea735d45","observation_id":"fe4c2157-9f82-4d97-a1bb-2eb9edbec7a1","resolution":{"observed_at":"2026-08-07T05:27:16.045849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.050617Z","title":"Visage: A global-scale analysis of visual stereo- types in text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.050617Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:a7d8c28fe57ef7ca39f1318a1746f80fe330e73c552f13d8b2acda2f6b982c55","observation_id":"373c2df4-19fc-4cbd-a201-87376d0711a8","resolution":{"observed_at":"2026-08-07T05:27:16.050617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.055557Z","title":"Billion- scale similarity search with gpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.055557Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:e9ec5b643c0af74950751d238b5bdbc349b95fc9acfa8de5f2b40653cb6320c1","observation_id":"703a7ef3-9892-49ee-8683-73fa492c62df","resolution":{"observed_at":"2026-08-07T05:27:16.055557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.060227Z","title":"Scal- ing up gans for text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.060227Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:dc738d7f29be943042b0aadf522f5669ba08e0c30579c27103a17510f7e24e77","observation_id":"2c640ac9-06b3-4f7d-b9da-99101e1d521b","resolution":{"observed_at":"2026-08-07T05:27:16.060227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.064651Z","title":"Beyond aesthetics: Cul- tural competence in text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.064651Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:653e5dbeaa61356ad8ecc487a72d01f4ebeee4bfcba7472201484b4f93aee347","observation_id":"e55b9359-4d2d-42ee-8275-3bbc3f468269","resolution":{"observed_at":"2026-08-07T05:27:16.064651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.069141Z","title":"An image speaks a thousand words, but can everyone listen? on image transcreation for cultural relevance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.069141Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:a662da51ac13be7c36b38ec3d3b85ad3d963cdccf8c4466811e3d8bf53c552cb","observation_id":"100f431c-79e5-4fe2-8ba5-7bbc19aac226","resolution":{"observed_at":"2026-08-07T05:27:16.069141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.073746Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.073746Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:06aa1cbc33be802138dbf9a3e806fe3b1e449ef3c7bd86f5de73e3c47baebc52","observation_id":"5ae514e7-bbe4-4906-866e-08f3aa68468c","resolution":{"observed_at":"2026-08-07T05:27:16.073746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.078439Z","title":"Openimages: A public dataset for large-scale multi-label and multi-class im- age classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.078439Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:fd9276675322d2dc0d257441fb62a6982527c8d0551371201c7ae02444fa3a94","observation_id":"ab964ca6-a411-4df4-8a99-bd5cf2a644d7","resolution":{"observed_at":"2026-08-07T05:27:16.078439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.083764Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.083764Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:73595973267bb002e598e70d9a4cec3397ec8b103da7a0d5d0fe0ceedf074702","observation_id":"5030653e-5e32-4d1d-942d-c22a283c7183","resolution":{"observed_at":"2026-08-07T05:27:16.083764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.088186Z","title":"Research methods in human-computer interaction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.088186Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:be1991c6ddbdfb8bafcfc4d11e455f1496d515ad1115a1d5aa7aa29f2b4c0964","observation_id":"1ed4b56a-bbcc-4fbb-8f2b-9ddfa14d3f36","resolution":{"observed_at":"2026-08-07T05:27:16.088186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.092910Z","title":"A technique for the measurement of attitudes","venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.092910Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:cecc4d7e6a1060fcf7ad46b7635233e754cfed15df9148d3638eeb787186430b","observation_id":"22396198-c54a-4da5-baa9-aa70b91c9921","resolution":{"observed_at":"2026-08-07T05:27:16.092910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.097576Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.097576Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:0cd52ff6894cdeae8278dc797d2e9eaf0f6d989d8de7717435700c1a238548a9","observation_id":"c843b734-c4fc-4000-a06a-23f124dfcf9d","resolution":{"observed_at":"2026-08-07T05:27:16.097576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.101992Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.101992Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:83a29f22736600e5022be7a7875312c3c30a97576d93997232f5efc50460ec0d","observation_id":"4e732b65-8aa1-4d68-abce-62611a20f646","resolution":{"observed_at":"2026-08-07T05:27:16.101992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12073","last_updated":"2023-04-26T15:41:05Z","snapshot_observed_at":"2026-08-16T15:59:34.730006Z","submitted_at":"2023-01-28T03:10:33Z","title":"Towards Equitable Representation in Text-to-Image Synthesis Models with the Cross-Cultural Understanding Benchmark (CCUB) Dataset","version":2},"cited_work":{"arxiv_id":"2301.12073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.12073","snapshot_observed_at":"2026-08-07T05:27:16.799735Z","title":"Towards Equitable Representation in Text-to-Image Synthesis Models with the Cross-Cultural Understanding Benchmark (CCUB) Dataset","venue":"cs.CV","work_id":"3466356f-d49b-4447-9e2d-99cfc839fda4","year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.106680Z"},"links":{"cited_paper":"/paper/2301.12073","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:20860f93564ffbba04170eb69487f4330d3c69801b7e6992b91a012a120db154","observation_id":"7cfc05fb-5fb8-4930-9606-3d392a600a6b","resolution":{"observed_at":"2026-08-07T05:27:16.805069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11408","last_updated":"2023-11-09T22:37:29Z","snapshot_observed_at":"2026-08-20T23:48:39.597602Z","submitted_at":"2023-03-20T19:32:49Z","title":"Stable Bias: Analyzing Societal Representations in Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11408","snapshot_observed_at":"2026-08-07T05:27:16.111962Z","title":"Stable bias: Analyzing so- cietal representations in diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.111962Z"},"links":{"cited_paper":"/paper/2303.11408","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:80d8f07b3fb3c48a0e2ca5d97a860cc6759b58d9c7fcf536ea4baa7d90cb4ff2","observation_id":"de261306-e54f-4c7e-ac49-36d940addc15","resolution":{"observed_at":"2026-08-07T05:27:16.111962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06034","last_updated":"2023-03-30T05:29:13Z","snapshot_observed_at":"2026-08-19T22:58:27.629501Z","submitted_at":"2023-03-30T05:29:13Z","title":"Social Biases through the Text-to-Image Generation Lens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06034","snapshot_observed_at":"2026-08-07T05:27:16.116473Z","title":"Social biases through the text-to-image generation lens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.116473Z"},"links":{"cited_paper":"/paper/2304.06034","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:7707c84a3c3b0ff0af3aa485086955b2eba7e97bc0b6972854e2a3667783e8be","observation_id":"db412f09-cac5-41b1-87dd-21a1bb2161fd","resolution":{"observed_at":"2026-08-07T05:27:16.116473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.121632Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.121632Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:4489ae43066da0f6de37299edfb7b8edadd4fb59480a011aa88c63f076c16b30","observation_id":"5b2ce63b-2484-4465-a6c8-a719e0c83d4d","resolution":{"observed_at":"2026-08-07T05:27:16.121632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.126398Z","title":"Dinov2: Learning robust visual features without super- vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.126398Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:b3ca9f3b7e04b7e2982055973d11f5b11e28a305c28726c80d8020dbf0239ec1","observation_id":"f0a65d2f-4973-43cc-91db-fe17ed13a4de","resolution":{"observed_at":"2026-08-07T05:27:16.126398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.131100Z","title":"The neglected tails in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.131100Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:db6d90437817175983d5a83739711de1625ae5ca5f0f20eea2d59876c7415e32","observation_id":"3b8ea62a-ca64-474c-a854-9a08673b377d","resolution":{"observed_at":"2026-08-07T05:27:16.131100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.136052Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.136052Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:9ed3eb794e1311789063ffaa3badce4324f9242169dd6795a1bccb347c2b0106","observation_id":"c7a21050-0778-4865-a0ae-8ebf01c82d5b","resolution":{"observed_at":"2026-08-07T05:27:16.136052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.140883Z","title":"Prolific","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.140883Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:379b3aa4c6650cfeac9cb18e999c643a5d76fa16778101eb44418338cf286341","observation_id":"5d1c5810-be6c-4d4c-84e1-bd1360b22a9c","resolution":{"observed_at":"2026-08-07T05:27:16.140883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.146399Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.146399Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:03d851310260733aab74c356a35dc696cbe37d756762af9159d2cb06a9644121","observation_id":"aa19e671-73f6-4944-ab68-40e9008824b8","resolution":{"observed_at":"2026-08-07T05:27:16.146399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T05:27:16.152285Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.152285Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:b5deeaa49165c873979ac5080c6b80025b805d94251acc1e3551bcc5fb0bb502","observation_id":"adbba0e7-ec88-493c-b19f-513a5e26e16a","resolution":{"observed_at":"2026-08-07T05:27:16.152285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04610","last_updated":"2022-11-10T10:07:37Z","snapshot_observed_at":"2026-08-19T14:14:31.764537Z","submitted_at":"2022-10-03T14:04:46Z","title":"Red-Teaming the Stable Diffusion Safety Filter","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04610","snapshot_observed_at":"2026-08-07T05:27:16.156591Z","title":"Red-teaming the stable diffusion safety filter","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.156591Z"},"links":{"cited_paper":"/paper/2210.04610","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:f9d70b829fb98f147590d34ec5014f1e185409b3b00063de3f6d431a14cae47d","observation_id":"4d43f506-93da-43b2-ac54-1d6a5f4cba90","resolution":{"observed_at":"2026-08-07T05:27:16.156591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.161903Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.161903Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:38dca8d951c005e2d4d1a49ce244ce657836d36a12183d82833560583065e83d","observation_id":"3530e545-e619-47c4-a440-17ebca269109","resolution":{"observed_at":"2026-08-07T05:27:16.161903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.167582Z","title":"Cvqa: Culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.167582Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:74145061aa9b40669e9d76c56ad47b41773ee1b433fe4573f0cbdb8f15398ae3","observation_id":"dd89d7fc-eadb-48c4-8ba9-234dc5575fa9","resolution":{"observed_at":"2026-08-07T05:27:16.167582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.173429Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.173429Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:be63720313a40c84c47328e871214563e0ca5dde298a2c0bf8169052ff8c4d6f","observation_id":"279f7626-3ebc-4c14-a88b-d12f1c9af501","resolution":{"observed_at":"2026-08-07T05:27:16.173429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.177941Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.177941Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:3213f50e5a84c44720eb431e324794126096fdaa8d480739ee47d0451649c403","observation_id":"5f984929-06bb-4f1b-9a9c-695a571cb8e3","resolution":{"observed_at":"2026-08-07T05:27:16.177941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09515","last_updated":"2023-01-23T16:05:45Z","snapshot_observed_at":"2026-08-18T04:27:14.951052Z","submitted_at":"2023-01-23T16:05:45Z","title":"StyleGAN-T: Unlocking the Power of GANs for Fast Large-Scale Text-to-Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09515","snapshot_observed_at":"2026-08-07T05:27:16.182909Z","title":"Stylegan-t: Unlocking the power of gans for fast large-scale text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.182909Z"},"links":{"cited_paper":"/paper/2301.09515","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:bb01ccecc1aca6fcd7bbfd16ae1332347ac308ce5137cbf4bb7ef82d7d040496","observation_id":"479a2177-7322-40d8-bf94-f3f9cbc931df","resolution":{"observed_at":"2026-08-07T05:27:16.182909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.188438Z","title":"LAION-400M: Open dataset of CLIP-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.188438Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:270f2c3b6c7be7b38690fa86459dd0c0d84f10977230a495307c73a2e731d1a5","observation_id":"5f2a4a7d-5183-4e00-8e65-d5ad092cfec7","resolution":{"observed_at":"2026-08-07T05:27:16.188438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.193435Z","title":"LAION-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.193435Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:cf9b8c212d07516ad060617b314b0648409c76e2fe2cbc93e0a727397bbf0212","observation_id":"3c4d6499-dddc-4c7d-acf7-a643e0054302","resolution":{"observed_at":"2026-08-07T05:27:16.193435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.198181Z","title":"The bias amplification paradox in text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.198181Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:338778d5159bfa07033cdd5d62e6f266a09d98337010be478761fc85a92775e8","observation_id":"0eedd2ac-29d3-4a6c-a186-0a349c5df058","resolution":{"observed_at":"2026-08-07T05:27:16.198181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.204197Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.204197Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:97a2993d25b3eb496013318ad578e5e36497d7eeab0114fa134a3883846ad4ea","observation_id":"88d0df70-d5f0-45d0-99c3-91d32a1506de","resolution":{"observed_at":"2026-08-07T05:27:16.204197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.209536Z","title":"Identifying and eliminating csam in generative ml training data and models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.209536Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:d9ca1cfbd730809f92bb5f5fc5330fcd5ea0c85d0ea76796f338e14ca3bf6fc5","observation_id":"a9f34779-0d9e-42a2-8942-207c7a771c65","resolution":{"observed_at":"2026-08-07T05:27:16.209536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.214642Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.214642Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:36dacdfd36954508297554ee56d85733734ded1e43ab71f4d7bec14828bc11dd","observation_id":"9b96bb0d-ae73-4747-9a18-db36702df433","resolution":{"observed_at":"2026-08-07T05:27:16.214642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-17T07:24:03.168446Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-07T05:27:16.219845Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.219845Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:e1cd4b4d1cc70ca8fe7110eb065ef03c4496925b9c96bd88aaee445917bb881a","observation_id":"cdeb985f-4f9c-4cec-8b2e-1f7f728354dc","resolution":{"observed_at":"2026-08-07T05:27:16.219845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.224537Z","title":"All groups composi- tions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.224537Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:0eae1658e328669b47ae5d6236b6e2e9e824d3b669a28eadc7c2db8208376221","observation_id":"e1e19652-a2a2-4448-ab36-3c5580322d51","resolution":{"observed_at":"2026-08-07T05:27:16.224537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T05:27:16.229693Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.229693Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:35e42d04cb0be13660faf69ed2f2c738d1f44c0501259209f43a35ef752579d1","observation_id":"ce34ff8e-1f63-4f4a-adca-38e12b56a9c3","resolution":{"observed_at":"2026-08-07T05:27:16.229693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.234629Z","title":"How ai reduces the world to stereotypes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.234629Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:4c3a9240385088bb4db153fd914e11a436fc93c8ca73c576df5b8c775285b903","observation_id":"066150cc-028f-4d49-b47b-cde87fda7095","resolution":{"observed_at":"2026-08-07T05:27:16.234629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01929","last_updated":"2024-08-13T08:11:49Z","snapshot_observed_at":"2026-08-16T14:55:33.593892Z","submitted_at":"2023-10-03T10:13:36Z","title":"Navigating Cultural Chasms: Exploring and Unlocking the Cultural POV of Text-To-Image Models","version":3},"cited_work":{"arxiv_id":"2310.01929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01929","snapshot_observed_at":"2026-08-07T05:27:16.663395Z","title":"Navigating Cultural Chasms: Exploring and Unlocking the Cultural POV of Text-To-Image Models","venue":"cs.CL","work_id":"aef20abd-7eef-4dd4-9be6-ad8781fd3e08","year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.239099Z"},"links":{"cited_paper":"/paper/2310.01929","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:a06d0c48bdfcf104d9ff598dca999e50def3d97b11487fee5d1f10fa24828594","observation_id":"5096e753-a611-4d5d-a0c3-6d8285bbc5ba","resolution":{"observed_at":"2026-08-07T05:27:16.670699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.244909Z","title":"The factuality tax of diversity-intervened text-to-image genera- tion: Benchmark and fact-augmented intervention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.244909Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:a8966c88a890e1af836c09abab77ccb54fc3c07cb326467f5af794a6464e967c","observation_id":"04baddba-989b-448d-bd6e-dd544a87a06f","resolution":{"observed_at":"2026-08-07T05:27:16.244909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.250458Z","title":"Revise: A tool for measuring and miti- gating bias in visual datasets","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.250458Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:589e273de68eb059114048ae1ee5b22049561864de74e8ec8a96ae782f7a34f8","observation_id":"a2ceb1c5-1d6e-4371-b37e-1210543f5029","resolution":{"observed_at":"2026-08-07T05:27:16.250458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T05:27:16.255086Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.255086Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:2d482eac95738937e5b3e3aa490f48a83ad8d665df82445557f32b22ffd7bb15","observation_id":"e794e716-929b-4ff2-842a-18c92d71e4cb","resolution":{"observed_at":"2026-08-07T05:27:16.255086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.259502Z","title":"Wikimedia Commons","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.259502Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:9fe36a313a884b3e57acd9fc3d2d3af6090f6fd01860a037222d6afb6d281003","observation_id":"787d0faa-e24f-44d9-9e07-01f174347629","resolution":{"observed_at":"2026-08-07T05:27:16.259502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:16.263784Z","title":"American== white in mul- timodal language-and-image ai","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.263784Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:8175c170e404a817e4c268c4934f89f76bd9d1b759aa9b7c6622c198cfca9895","observation_id":"43dc7413-778d-4f95-9919-882592f9cf9b","resolution":{"observed_at":"2026-08-07T05:27:16.263784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.858869Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":"31b733ba-0de1-4849-ad92-713c8a5b26fa","year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.268640Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:6e7dc0c1f1d367ca6954aad853d023b8295ecf3cef0f1715a16b5979b028851d","observation_id":"c8bf6938-28ed-4d93-b32e-ce0562f6c6be","resolution":{"observed_at":"2026-08-07T05:27:17.863684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.844674Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"cdf22312-e03f-43aa-b9ff-f2ef88701764","year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.273315Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:45139fb303b97dcacb4b3dbea3ac2df65793841e70d2ec869d3e5dd841db2a8a","observation_id":"180d85c4-b8b9-45cd-9740-2c4ae3f804e7","resolution":{"observed_at":"2026-08-07T05:27:17.849441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-08-18T22:18:02.034966Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-07T05:27:16.277893Z","title":"Scaling autoregres- sive models for content-rich text-to-image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.277893Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:8b960a997e22627edc589c2efeeb093e4a62ecca972dc5f181204edab590873d","observation_id":"65d4e749-b8d0-4fda-93f8-6157a89cb6a3","resolution":{"observed_at":"2026-08-07T05:27:16.277893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-22T07:43:22.442935Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T05:27:16.282820Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.282820Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:15ec797e0f23c7fea230fc41a0c82d9e1b72219417f155ab947095cc0c7651d8","observation_id":"cddd270a-1f4d-403d-a095-4b938064210e","resolution":{"observed_at":"2026-08-07T05:27:16.282820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.829371Z","title":"Partiality and miscon- ception: Investigating cultural representativeness in text-to- image models","venue":null,"work_id":"32f1f353-5d0f-4f95-9de7-2e65a928d8dc","year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.287765Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:f25fd048ce643481051b376e957d6cbbf3781389f6fbeb73ba7b2b8953a451bf","observation_id":"ca74304f-7eb1-4177-ab77-e17542eb6ad2","resolution":{"observed_at":"2026-08-07T05:27:17.834482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.814532Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"1793f47c-db59-4f4d-a04b-ab46dfa1a75d","year":2018},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.292155Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:eb940e24f0286026668f9929772bc0a1f2c483af58260bfd6e41b9a623f81966","observation_id":"569de26d-30a5-47eb-9516-b5283d1f4b7e","resolution":{"observed_at":"2026-08-07T05:27:17.819267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.800033Z","title":"Finding a CuRe through Information","venue":null,"work_id":"32aed2dd-72cb-4fc3-b07e-a8c2225d3ffe","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.296558Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:15fcfc9ad192735ecc83fea9b0c8b8d39d8e76647c23b8825af1f49f6b9efe6a","observation_id":"6dd7c01f-18c6-4eb1-9492-15f7c4a2f143","resolution":{"observed_at":"2026-08-07T05:27:17.804867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.785240Z","title":"User Study","venue":null,"work_id":"afa4756e-5306-452a-b777-88d7f1edcdb5","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.301129Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:e63d7261cc55129bf44ac70d3602d063c96be899588fbb1125621f90526b7c57","observation_id":"2b80502c-7df6-4571-a7b2-aa64b4e680d7","resolution":{"observed_at":"2026-08-07T05:27:17.789830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.770308Z","title":"[category name] by country","venue":null,"work_id":"5377341d-0775-437f-804f-5ab61e9951b7","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.305664Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:03f1e39efdb3fb0430d5d7fafb5e3cc5c78668df8b5bf68c303ad02b803ae4d6","observation_id":"fa7cd3ca-5f3a-4188-be38-8ee89f8d3d0c","resolution":{"observed_at":"2026-08-07T05:27:17.775043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.755319Z","title":null,"venue":null,"work_id":"eeafa7af-6f93-4d6b-9204-bf0805c38a52","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.310618Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:c8963bb87f8d90fa76851a8b7ce8687dca1825eaff6d61ff42fa5270b9ff4d9c","observation_id":"a757d909-7100-4458-911d-da2a7e8972de","resolution":{"observed_at":"2026-08-07T05:27:17.759873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.740113Z","title":null,"venue":null,"work_id":"f06c9793-8964-4280-9ae5-e779761b95c0","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.315104Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:415af12ff2da0a94e81b977dbb9dc150dfe704c16aef055cccc70d9e41d46750","observation_id":"7b584e09-2da9-4897-b061-2a23b11586fc","resolution":{"observed_at":"2026-08-07T05:27:17.744657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.725826Z","title":null,"venue":null,"work_id":"d7499987-7aa3-49eb-ba3a-f79006e84870","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.320514Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:4a6e7a1ba4c17b6d0f67d4e59b46b85e72f9badb4a50d04fb8c1ca6c18eaebe8","observation_id":"83502377-398a-498a-b435-207c34cac0f4","resolution":{"observed_at":"2026-08-07T05:27:17.730296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.710662Z","title":null,"venue":null,"work_id":"ab5dd609-cc3a-4196-a35b-561b0699e366","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.325235Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:b5bfdd8ff427cc4a518c8856c4e7c52cd7cffe722afb0b6fe608c3e2de219199","observation_id":"0c4417d3-11c0-4445-ace0-cbd2f0241c5c","resolution":{"observed_at":"2026-08-07T05:27:17.715801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.694418Z","title":null,"venue":null,"work_id":"b84cc746-2c80-4e81-976c-4793706bfae6","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.330214Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:2c10719d743714a362f6bd151b251782c4afd57aef4cae5eae95e14ccf25eda0","observation_id":"f7da0268-fca1-47c2-9b85-2c395be350ac","resolution":{"observed_at":"2026-08-07T05:27:17.699193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.677276Z","title":"How similar do you think the generated image on the left is to the real images on the right?","venue":null,"work_id":"4199cb20-ad16-48dd-a927-e26ae57907c7","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.334848Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:d299897bc35b691cc104ea62b616f7c01f3d953a5e32d17c1747bb01c888ec89","observation_id":"2b72d76a-d610-429a-a442-192097360ff5","resolution":{"observed_at":"2026-08-07T05:27:17.683360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.662265Z","title":"stereotypical","venue":null,"work_id":"4082cd83-8842-44d5-9956-6bd807f73377","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.340062Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:1d9a6ca11a774b851d63d3618135ba53201f534e11a871d2bce7fcefc9ef5ffc","observation_id":"5a43a0df-74c2-4a53-8f79-a03559db25e7","resolution":{"observed_at":"2026-08-07T05:27:17.666944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.647209Z","title":"some of the small blue domes are futher apart than others","venue":null,"work_id":"6d830b0a-ffbf-4200-8bc7-008480d5f1a0","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.345717Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:ec54b13810abb0b38828c1feaa25b7f6c399076e864cb2ae69617098bae80034","observation_id":"c6d3aa84-3b75-49a6-bbdb-3879c224cf30","resolution":{"observed_at":"2026-08-07T05:27:17.652140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.630713Z","title":null,"venue":null,"work_id":"1a25e855-23fc-4ba5-a7a9-8f3adeffee88","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.350264Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:dae306803887f4ed327f265515268b28b2db3448393bb899471f4b42295f1617","observation_id":"f128a410-d835-4fd8-b9d1-2ab1a636ad8e","resolution":{"observed_at":"2026-08-07T05:27:17.635441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.615973Z","title":null,"venue":null,"work_id":"ad3c7c97-069e-4d8b-a572-53b5f7da0b4d","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.355123Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:8a20f2bc41bcfafa4ef84f892dec830df9f432ee41408f4cdc6c58ce1ce96581","observation_id":"7bea4bd7-e645-43c0-8381-f47b60614d5e","resolution":{"observed_at":"2026-08-07T05:27:17.620439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.600171Z","title":"ϕ∗CuRe= 4.0/5 ϕGT(n) = 0.808 ϕP S(n) = 0.581 ∆ϕP S(n, c) = 0.486 ∆ϕP S(n, c, r) = 0.486 E3 George Lucas","venue":null,"work_id":"a80f9b97-6f57-4552-8f72-f12000ada038","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.361141Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:dd98c6091a6a1e514a1ae8238514a89c23431e46aa3805e99f57a5c8639cd1a9","observation_id":"e35803db-ee07-41d0-a19a-80f293c4b22e","resolution":{"observed_at":"2026-08-07T05:27:17.604915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.585326Z","title":"There’s nothing particularly unique about it that would NOT make it apart of my culture","venue":null,"work_id":"f9b769ed-c5b4-4696-a163-a363847b0b8f","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.366073Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:ca32371e1573760d2b7e0c8464c27d4a4b5ae93ca1afaad1f6ac138d6acef543","observation_id":"adbd7d3c-8ccf-44fb-89e2-bed16f8dff70","resolution":{"observed_at":"2026-08-07T05:27:17.590221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.570570Z","title":"They are obviously AI","venue":null,"work_id":"51ab58c9-8212-4079-bdd5-dc6c1b43c2f9","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.370770Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:462c6fde1106141cc73e6f817f62e816d318bc2e04d6f53e1f271811cc52e73f","observation_id":"df732714-13f8-439f-b33b-4622ad4eae0b","resolution":{"observed_at":"2026-08-07T05:27:17.575431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.553721Z","title":null,"venue":null,"work_id":"2a41d986-dfd7-40e6-8460-dc4f382592d6","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.375414Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:18518af888298a1a7104091925df8ce12b3c17582bdfffb561bb7373b468fbed","observation_id":"b9d32c74-1438-43e6-8399-7e5863bee4ce","resolution":{"observed_at":"2026-08-07T05:27:17.559661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.537601Z","title":null,"venue":null,"work_id":"3bca2379-cd1d-4c2f-b75b-1be422197bf3","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.380069Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:27ce0b8cd2880b65a894388a952a9997a07efe960bb1a00068d91ac2320dba7e","observation_id":"d7382ea9-73d1-48e8-9553-b7fda0991d9c","resolution":{"observed_at":"2026-08-07T05:27:17.542933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.523236Z","title":null,"venue":null,"work_id":"e7259ca4-d117-41ea-9a84-66f8ce535b03","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.384842Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:5f4fce8565de78ccebeb4105db044e220d65d0760bceb4a66a2a7f1707ab965d","observation_id":"e4155fd4-601c-4870-866b-af66b24f57f7","resolution":{"observed_at":"2026-08-07T05:27:17.527962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.508044Z","title":"ϕ∗CuRe= 1.0/5 ϕGT(n) = 0.712 ϕP S(n) = 0.757 ∆ϕP S(n, c) = 0.504 ∆ϕP S(n, c, r) = 0.473 E6 Hmong textile art","venue":null,"work_id":"8dbbc186-3145-4cea-b627-79998bc1bbc2","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.389230Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:8993b68a0df1bdc2f6d530a4e8b294ec1fdda1f9ab6b512814d86032fecb3acd","observation_id":"f9193bbf-060c-4dd8-a917-e38e0a6e70f2","resolution":{"observed_at":"2026-08-07T05:27:17.512674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.491199Z","title":null,"venue":null,"work_id":"3b3ef119-f909-42ae-b590-8824a01ffff7","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.393640Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:6acb00aec8780d160d315a5622b55969d3e5da43a08b6ea99651041bd67f477b","observation_id":"cbe644b6-bb39-4007-a4b9-87bd1aa45180","resolution":{"observed_at":"2026-08-07T05:27:17.496048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.476121Z","title":"An image from Australia","venue":null,"work_id":"7fc20f1e-4890-4908-b395-d249593da295","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.398971Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:805c327f52918f41cf8c979f6efe9ac1b8102cf5197c5b08d671c1496005a660","observation_id":"d08ca0de-bc40-45fd-8ecd-b5e234321d2e","resolution":{"observed_at":"2026-08-07T05:27:17.481067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.460232Z","title":null,"venue":null,"work_id":"f1fefa65-259e-477a-b358-981f478acfb5","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.403749Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:4f232648e51dbaae099b49c1e1e3f911aaa17cc1a74bb7c0d452928a05825350","observation_id":"6ebea203-045d-4320-91dc-6e8ea86387d7","resolution":{"observed_at":"2026-08-07T05:27:17.464812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:27:17.444276Z","title":"[31]= 0.060 Ventura et al","venue":null,"work_id":"d6b45c1c-99e9-4e8d-987d-a7b770503b86","year":null},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.407874Z"},"links":{"citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:da79042f140aab87e61c0fd4a8eb115805c2485195b9cfcb9291919215eb1261","observation_id":"0189dbce-d33c-4426-99a2-f43a0cd2229a","resolution":{"observed_at":"2026-08-07T05:27:17.449855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T12:58:28.865722Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":3,"verified_fuzzy":16},"total_outbound_references":135},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 135 outbound references and 0 inbound Pith citation observations for arXiv:2506.08071."}