{"as_of":"2026-08-07T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f8e7d5583e8d1c3500bbfdef88bbbff869d6fe22098f366fe7b4fd34c703d15","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:59:32.123895Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08940/citation-record","integrity":"/paper/2509.08940/integrity","json":"/paper/2509.08940/citation-record.json","paper":"/paper/2509.08940"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.509018Z","title":"Introducing stable diffusion 3.5.https: //stability.ai/news/introducing- stable- diffusion-3-5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.509018Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:b1489193bc95c71ba45dabff0709d4053177dba43b199dee822ebe42adec8dd6","observation_id":"81d039fb-fbed-48b0-84d4-1165c0c6dac0","resolution":{"observed_at":"2026-08-04T19:59:30.509018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.572637Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.572637Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:56c4d81f239932618f83f3c6e40301f9092970a9cd08b71f0f0d72f5dc8ccaf7","observation_id":"d2f8f49d-fac9-4b2d-af55-eee6ea2b0e75","resolution":{"observed_at":"2026-08-04T19:59:30.572637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.630088Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.630088Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:63049011ec0b252712a4942c6ba1f452c800b63b285b9a832233e424d178eca1","observation_id":"cde85b98-1207-46ac-8138-6887510d2aec","resolution":{"observed_at":"2026-08-04T19:59:30.630088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.670621Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.670621Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:7f268a064133d8810416ace72818b6c6c9fdf1fba930b11395d3cabeaa6a4097","observation_id":"658233e9-adde-4865-a2db-dcacc943a1fd","resolution":{"observed_at":"2026-08-04T19:59:30.670621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.726321Z","title":"Easily acces- sible text-to-image generation amplifies demographic stereo- types at large scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.726321Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:68930d4cde02dc9e2e29bd6bb06c1ff2e50c8f2ac4dcb0d17020862939db0043","observation_id":"575aad73-607b-4e71-859d-cd4b190fae62","resolution":{"observed_at":"2026-08-04T19:59:30.726321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.794154Z","title":"Pixart-α: Fast training of dif- fusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.794154Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:6f717f36e7895573fd6ca34581ae94ea21dbeb0a8585e521ad5a6965f57debcd","observation_id":"f0ae3c7b-fea0-486c-8abb-f3698004014e","resolution":{"observed_at":"2026-08-04T19:59:30.794154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.862605Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.862605Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:0898c0dd24b62170a9be3473b85a974ddaa3c208857f63cf0777c754edee07c5","observation_id":"54253f9e-cf96-4ccb-a43d-44dd05b20277","resolution":{"observed_at":"2026-08-04T19:59:30.862605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.919450Z","title":"Tibet: Identifying and evaluating biases in text-to-image generative models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.919450Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:2e5fd2fb94a77ba3d04fc016d82d4ce8bec097de4d4b791414ebc055584af265","observation_id":"700c5ccc-d7d5-4033-a837-7a52cb22dfff","resolution":{"observed_at":"2026-08-04T19:59:30.919450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:30.975637Z","title":"Evolving interpretable visual classifiers with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:30.975637Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:91083deaa2aeb367055726aafe98b3bb6e61fd0fda702bf6851643cffa928ca4","observation_id":"e1a3396b-a157-4784-913f-8f9fc3dd4e82","resolution":{"observed_at":"2026-08-04T19:59:30.975637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04053","last_updated":"2023-08-30T18:41:01Z","snapshot_observed_at":"2026-07-06T12:35:45.839780Z","submitted_at":"2022-02-08T18:36:52Z","title":"DALL-Eval: Probing the Reasoning Skills and Social Biases of Text-to-Image Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04053","snapshot_observed_at":"2026-08-04T19:59:31.032268Z","title":"Dall-eval: Probing the reasoning skills and social biases of text-to-image generative transformers.arXiv preprint arXiv:2202.04053, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.032268Z"},"links":{"cited_paper":"/paper/2202.04053","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:5a5356a587b7e48ebdbbd1ed740bde549d8d5134670e0faf345d4be433b3b0bb","observation_id":"8ab89cb5-043b-46de-b2a5-680c1a4830ec","resolution":{"observed_at":"2026-08-04T19:59:31.032268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.088012Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.088012Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:a24f50e498d85b48d3fc931748d2ea8bf3428284b3c581bcdeb0a8dd5a0c969d","observation_id":"7e424687-ddf0-4094-bdc9-7f316ebd0c48","resolution":{"observed_at":"2026-08-04T19:59:31.088012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.140277Z","title":"Weighted kappa: Nominal scale agreement provision for scaled disagreement or partial credit.Psycho- logical Bulletin, 70(4):213–220, 1968","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.140277Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:8a4c0499b30ba9296afc8f160a67b5f92e87c0c076f66d186af17b6cdf046cf3","observation_id":"d569b897-1298-4865-885b-d2048051c200","resolution":{"observed_at":"2026-08-04T19:59:31.140277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.210195Z","title":"Openbias: Open-set bias detection in text-to-image generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.210195Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:9094996505c8206d3271d9fc03fca5ae4681420410e995b95d12565644eed788","observation_id":"75866fca-59b5-4ce0-a1d1-3d259f8014b2","resolution":{"observed_at":"2026-08-04T19:59:31.210195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.252564Z","title":"Gradbias: Un- veiling word influence on bias in text-to-image generative models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.252564Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:567e70522c720ededea2eead3728e438b2b697f0f626e890b3eb072f46f57cde","observation_id":"117896d1-2121-4d68-a9b4-188d0ff66711","resolution":{"observed_at":"2026-08-04T19:59:31.252564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.334975Z","title":"Efros, and Assaf Shocher","venue":null,"work_id":null,"year":1934},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.334975Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:9f162e26d2f1b21dcae161ab3956150d0285822db8aef82003bdf22c10510c83","observation_id":"cf8c470f-4422-42dd-8416-b9d2450aa94d","resolution":{"observed_at":"2026-08-04T19:59:31.334975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.388678Z","title":"Dreamlike photoreal 2.0.https:// huggingface.co/dreamlike- art/dreamlike- photoreal-2.0, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.388678Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:b1f3e8835deb0f05b09ccd4396c55938eaa372d7af9dd74d074522ff1b821941","observation_id":"5d4a7d17-d9b7-48f6-bd1f-2230cdc08195","resolution":{"observed_at":"2026-08-04T19:59:31.388678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.441662Z","title":"Gonzalez, and Serena Yeung-Levy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.441662Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:bd0340499d5cb2b218d0d33c3331cda604b2b1f4fdb04f4e30017a6a4bfa16ff","observation_id":"335b10f0-374b-4c09-9299-ba91392bec29","resolution":{"observed_at":"2026-08-04T19:59:31.441662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10893","last_updated":"2023-07-17T12:13:46Z","snapshot_observed_at":"2026-07-06T14:54:19.013733Z","submitted_at":"2023-02-07T18:25:28Z","title":"Fair Diffusion: Instructing Text-to-Image Generation Models on Fairness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10893","snapshot_observed_at":"2026-08-04T19:59:31.465984Z","title":"Friedrich, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.465984Z"},"links":{"cited_paper":"/paper/2302.10893","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:df5a8844d37747a5f847d6e9763e44ed0a2f6e5fae51f5b9683ac4fbcffcba61","observation_id":"cdce51d6-1966-4bdd-8166-5e1bba124c1a","resolution":{"observed_at":"2026-08-04T19:59:31.465984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.544269Z","title":"Efros, and Jacob Steinhardt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.544269Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:9cdb653ae74e31b173db8c9b9bd41ab7649014c518904c3f319be730c0f87530","observation_id":"48a5780a-0dae-4c8e-a589-78089860f677","resolution":{"observed_at":"2026-08-04T19:59:31.544269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.688526Z","title":"Efros, and Jacob Steinhardt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.688526Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f627248101fa1b44f160810822d583a28307976dff0503f7f1e5ec139e209073","observation_id":"7780a2b4-0b73-4ee3-8341-0f819671a46e","resolution":{"observed_at":"2026-08-04T19:59:31.688526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.819527Z","title":"Ghosh and A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.819527Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:b04a0065ce714721c08fcfdd91800af881772bbc024b26e81a88b364b656a741","observation_id":"bf268ded-2e1a-4d72-bd74-f93353855218","resolution":{"observed_at":"2026-08-04T19:59:31.819527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:31.990501Z","title":"Tiam - a metric for evaluating alignment in text- to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:31.990501Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f18ada0b5d3021181f08240c87347ab3144f6aedb69e10d8eb11c035e859bedb","observation_id":"0ebd14a9-d23e-420f-b2f8-17859a48516b","resolution":{"observed_at":"2026-08-04T19:59:31.990501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00997","last_updated":"2024-11-01T19:41:28Z","snapshot_observed_at":"2026-08-04T06:31:15.904174Z","submitted_at":"2024-11-01T19:41:28Z","title":"Identifying Implicit Social Biases in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00997","snapshot_observed_at":"2026-08-04T19:59:32.033940Z","title":"Hamidieh, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.033940Z"},"links":{"cited_paper":"/paper/2411.00997","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:6f3a572d3f6fd48de8ec379958585a3ae77e5822f52d84c677072c1dc8df4079","observation_id":"573cc18c-e153-4aa5-9451-413924bd9151","resolution":{"observed_at":"2026-08-04T19:59:32.033940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-04T19:59:32.037428Z","title":"Hessel, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.037428Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:601b6f5be6fd23c20caaa174308c4286f280a538a84d99c94c4fcb689d2dc786","observation_id":"bea47ca7-3a83-499c-b14e-e4876a7cd95f","resolution":{"observed_at":"2026-08-04T19:59:32.037428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.041162Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.041162Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f3f36ffb81170e7283e5b058104e0c10d314c4561891607f6d26ca0dc3edf8ee","observation_id":"8d74983c-a919-460e-9f64-e3fd7bf8a8d1","resolution":{"observed_at":"2026-08-04T19:59:32.041162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11897","last_updated":"2023-08-17T21:45:52Z","snapshot_observed_at":"2026-07-06T15:06:11.896701Z","submitted_at":"2023-03-21T14:41:02Z","title":"TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11897","snapshot_observed_at":"2026-08-04T19:59:32.044233Z","title":"Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering.arXiv preprint arXiv:2303.11897, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.044233Z"},"links":{"cited_paper":"/paper/2303.11897","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:fd77df165e4c847ca0cac1c9b52e473de4415d6995a92c1053b1715fc3aee1df","observation_id":"e75287e3-5e9d-47c4-a4c7-88e450328cb7","resolution":{"observed_at":"2026-08-04T19:59:32.044233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.047680Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.047680Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:0e79e233dadce894f0dd1f60c5883db3f64caae3bf283daba897b3fc8446bf37","observation_id":"f9db45c6-f7d3-4417-9b63-288275eabe67","resolution":{"observed_at":"2026-08-04T19:59:32.047680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.050946Z","title":"Open- clip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.050946Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:b67f69c97f0f043c363473f12532927688e3979cc0df174567c94636b1e395d6","observation_id":"e55b4387-1553-4dc5-a1fa-aa39c0951488","resolution":{"observed_at":"2026-08-04T19:59:32.050946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.053809Z","title":"Building and better understanding vision- language models: insights and future directions., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.053809Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:7563cc61dc8222a5104856d2442eaf66c2023cd9c7be304c31ec2596e5aaf82f","observation_id":"66c8cbd8-6895-4518-9141-9f6df24f13ca","resolution":{"observed_at":"2026-08-04T19:59:32.053809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.056711Z","title":"Holis- tic evaluation of text-to-image models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.056711Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:80cdb9228ba0c48ec1b90cfd5f2032b2ba57d5e424769c5124b25d564e2854ac","observation_id":"e8659c36-7678-4992-99a1-1dca0441ace6","resolution":{"observed_at":"2026-08-04T19:59:32.056711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.059366Z","title":"Playground v2.5: Three insights towards enhancing aesthetic quality in text-to-image genera- tion, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.059366Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:6851a359b8678bb43cf09904855579520fbaa0ba9d8dd75ee2d6fc9b251099ba","observation_id":"d07116be-2f74-448a-b26f-3fdb1ada69bb","resolution":{"observed_at":"2026-08-04T19:59:32.059366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.061975Z","title":"Sdxl- lightning: Progressive adversarial diffusion distillation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.061975Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:97db06c95ec76855bf81a205971178d750bf0e5a0483732b33c13b4f83ac033b","observation_id":"0a15c961-a024-4cae-9d5e-7aa955d8f3a1","resolution":{"observed_at":"2026-08-04T19:59:32.061975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.064740Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.064740Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:f950c3ee7dea0e085fd2d1eb07a999cda2993483e0b3c8f73827fa516bcf0d93","observation_id":"a02f7ee7-a224-455c-9956-212f628ceef1","resolution":{"observed_at":"2026-08-04T19:59:32.064740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05217","last_updated":"2026-04-11T14:28:03Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:21:46Z","title":"Organizing Unstructured Image Collections using Natural Language","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05217","snapshot_observed_at":"2026-08-04T19:59:32.067260Z","title":"Organizing unstructured im- age collections using natural language.arXiv preprint arXiv:2410.05217, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.067260Z"},"links":{"cited_paper":"/paper/2410.05217","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:9d6b2d9cab1fed1c3ddb9bc99939d7e50dca7b719b353f9c9f63e91c9b4fb867","observation_id":"171b2240-bc8f-4a71-9800-182e1ed4b7c4","resolution":{"observed_at":"2026-08-04T19:59:32.067260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.070457Z","title":"Stable bias: Analyzing soci- etal representations in diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.070457Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:88462ae2c8ba8da305654227f00e51542f80cc1e75622ab970ad649bac57dae3","observation_id":"d14f0be7-c498-4e5f-8451-4601b979c91a","resolution":{"observed_at":"2026-08-04T19:59:32.070457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.073286Z","title":"Hello gpt-4o.https : / / openai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.073286Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:e785a4926ce9dc693475ecf17762fa79eef222612304464adc386dbd98cbe060","observation_id":"aebf6db7-c0ea-4aa6-a4b4-213acf902880","resolution":{"observed_at":"2026-08-04T19:59:32.073286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.075920Z","title":"Benchmark for compositional text- to-image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.075920Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:d13117132d2146136c56f09d80afab0e9fc63f51f568bda29e39bb648fcd87ab","observation_id":"6df17b41-fbad-4187-ad41-e67b5d501381","resolution":{"observed_at":"2026-08-04T19:59:32.075920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.078562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.078562Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:b4455d17d4afbaf50eca38d2862c6da850e9cae78d77b39f0982300b4ef4bf9c","observation_id":"f54ee6c5-47e8-43c4-80ad-90b76730763a","resolution":{"observed_at":"2026-08-04T19:59:32.078562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-04T19:59:32.081276Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.arXiv preprint arXiv:2205.11487, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.081276Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:fbcd1d76b363aabbd6abc01e626a29a3cd050d292f65e98adcd9b3748d8ab0a9","observation_id":"21388654-3437-4853-9b88-d3721b64b3c5","resolution":{"observed_at":"2026-08-04T19:59:32.081276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.084590Z","title":"Improved techniques for training gans","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.084590Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:523da1c06e2be3cd5d97c0e605884a6a286602d3b8674cd2a8f16cbc429e6265","observation_id":"ffdd2c57-7085-4399-acc6-6a47636313b7","resolution":{"observed_at":"2026-08-04T19:59:32.084590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.087095Z","title":"LAION-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.087095Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:1db7bac187f8cbab5f069ebff9d8593e4ae5635e805733a2dc81aff333437efc","observation_id":"f12b4483-ce9a-46e1-8933-4b9ef7e9cbfc","resolution":{"observed_at":"2026-08-04T19:59:32.087095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.089618Z","title":"A statistical interpretation of term specificity and its application in retrieval.Journal of Doc- umentation, 28(1):11–21, 1972","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.089618Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:66e55ffb5fcdf7b0c9828eb4a9d65ce2ad1d6274132a86ffa49772581c8a6f1e","observation_id":"32a75aa1-daab-46ca-a27b-a5d9e181727a","resolution":{"observed_at":"2026-08-04T19:59:32.089618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.092171Z","title":"Smith, Luke Zettlemoyer, and Tao Yu","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.092171Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:c5775099a9d9a7954ea324f699e295a791253fcb9330a72788692b382689e8ce","observation_id":"78791598-ae31-4022-b818-64b9a3878497","resolution":{"observed_at":"2026-08-04T19:59:32.092171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.094821Z","title":"Mass- producing failures of multimodal systems with language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.094821Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:d554bcf85934b16af21ab69915cb909a79542400c2f9fd59161dc88bb2b4dce0","observation_id":"7be95edd-8ab4-421b-8e90-478a11565aab","resolution":{"observed_at":"2026-08-04T19:59:32.094821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.097314Z","title":"T2iat: Measuring valence and stereotypical biases in text-to-image generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.097314Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:a4f659ac8234718cf3d84cc9775835eeec47b06c15b5a69eb674c8f11267d534","observation_id":"4f259602-53d9-4f67-a401-16dbfe2b7ad2","resolution":{"observed_at":"2026-08-04T19:59:32.097314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.099866Z","title":"To- wards fairness in visual recognition: Effective strategies for bias mitigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.099866Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:b29ee9a583ac6329c06f14fd05de3bff04abf69fde0724387f32bc75c8300ae7","observation_id":"34019dc5-ca7b-4465-8223-ecac12c6e0be","resolution":{"observed_at":"2026-08-04T19:59:32.099866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-04T19:59:32.102328Z","title":"Menacing appearance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.102328Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:4277dbadd0ec186d30356106ca34738929f7326562bfad59b81bbc8420060276","observation_id":"d2e44fef-7cac-4680-9705-e9a6e449ee52","resolution":{"observed_at":"2026-08-04T19:59:32.102328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.105888Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.105888Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:3be50f1dfc9b17ca870c8a9c76539382180c8b3efc9b0bdc655f53c5143e259d","observation_id":"921c4e1d-f5e3-4d66-962b-090e29092c7f","resolution":{"observed_at":"2026-08-04T19:59:32.105888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.108777Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.108777Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:fbf0b0d651ae3f29a6a9a818ae94df839d2261167fc35d7c3a558bc8a7956d96","observation_id":"3af71953-bca0-4f5c-9321-3df22450f3d9","resolution":{"observed_at":"2026-08-04T19:59:32.108777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.112135Z","title":"- A rating of 1 means the two attributes are not similar at all, and images containing one attribute would not contain the other","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.112135Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:9545a1c5f05c5b3d92ab2a48dccb96cfabd4691eb85c4b2509804eca898113b5","observation_id":"affaa59b-5103-4c11-a36f-7bb0f6e1b690","resolution":{"observed_at":"2026-08-04T19:59:32.112135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.114861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.114861Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:0d2d0f1643f011d5c67b3c7ae6846d11a502febb998dbeda2a71c602555f13bd","observation_id":"409bd186-dbb0-4374-a5e7-ee56b3f829e9","resolution":{"observed_at":"2026-08-04T19:59:32.114861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.117776Z","title":"vines” Prompt Description: “technology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.117776Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:8d2841748dac44d724d6a10ee704a3b5077c23ff7a87a423e397a0c33a2d3ad6","observation_id":"6c7f7fba-7e33-4005-a19c-60163e70ba71","resolution":{"observed_at":"2026-08-04T19:59:32.117776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.121160Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.121160Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:3288d0f2e6e85ec68f27ba7f53d701aaa1263faf32c076fb990771f9a13bd527","observation_id":"70ef2912-9052-44cf-a71e-640cf2c80661","resolution":{"observed_at":"2026-08-04T19:59:32.121160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:32.123895Z","title":"Menacing appear- ance","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:32.123895Z"},"links":{"citing_paper":"/paper/2509.08940"},"observation_digest":"sha256:c9f63caffb3994a8f87344c88e5f63f9300a364f0c80a72cadbc90a2c893791f","observation_id":"e3b5eab2-3813-4db2-a236-f302e8333a3f","resolution":{"observed_at":"2026-08-04T19:59:32.123895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08940","last_updated":"2025-09-10T19:07:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T19:59:22.946787Z","submitted_at":"2025-09-10T19:07:55Z","title":"Discovering Divergent Representations between Text-to-Image Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2509.08940."}