{"as_of":"2026-08-13T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e27ad6662be0ea0c79a02a0945d37d1b4abfeb4b8cf1eec88928c6c40ea200ef","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:41:16.429938Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05538/citation-record","integrity":"/paper/2412.05538/integrity","json":"/paper/2412.05538/citation-record.json","paper":"/paper/2412.05538"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T20:41:15.947995Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:15.947995Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:71b703650e41f067fb52c13275feff657e96afa7d498bb753b46c849016358ed","observation_id":"02c3b149-e711-4e9f-b4f9-54b4e28b75d7","resolution":{"observed_at":"2026-08-11T20:41:15.947995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.891881Z","title":"Elijah: Eliminating backdoors injected in diffusion models via distribution shift","venue":null,"work_id":"a9140055-9fd1-486d-b05a-670acbc4ca30","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:15.953987Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:2b69c38eabe05958c4b98078e80665932402da52d0997dab2513fb52472d521d","observation_id":"abd15361-39cc-430a-9b77-130ad3f1c618","resolution":{"observed_at":"2026-08-11T20:41:17.897375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.875137Z","title":"Defense-prefix for pre- venting typographic attacks on clip","venue":null,"work_id":"225b94c7-6edf-458e-ac83-4fc3676e9ace","year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:15.964529Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:cca3bb9ea0226b000e9e3b74615e3df57a80af39fdbae866f1c7dd4508fd69a5","observation_id":"0e15bbd9-5082-4a9d-9b0a-e90da71f9b81","resolution":{"observed_at":"2026-08-11T20:41:17.880241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.856215Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"4d9b9a39-2411-46ba-aec7-04ba41e9fa71","year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:15.977376Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:d384869d526e9bcbc77176ec10837b6255df00ad0aa8e1e4c5859ce2954390af","observation_id":"8652d655-23e9-48d5-a5b0-0e03519bbee9","resolution":{"observed_at":"2026-08-11T20:41:17.863071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:15.986038Z","title":"Controllable generation with text-to-image diffusion models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:15.986038Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:6e7f62848da0363ef03165d9d18d91eb2d232ecd5091a8ed77bc0d2cc5685733","observation_id":"ec4da44d-6208-4b9a-be51-1f4b2a33fdf3","resolution":{"observed_at":"2026-08-11T20:41:15.986038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:15.992611Z","title":"Trojdiff: Trojan at- tacks on diffusion models with diverse targets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:15.992611Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:09ffe9d38bfa48a5ed9ec79ca25abbc8035a8b8f02b21de2725bc1b1d891bf69","observation_id":"a36bde21-ca20-4645-84da-095867d5f8f4","resolution":{"observed_at":"2026-08-11T20:41:15.992611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.824911Z","title":"Rbformer: improve adversarial robustness of trans- former by robust bias","venue":null,"work_id":"187cb385-c3ad-454b-97ce-ccc5776646d0","year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.006151Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:e80160c1a051148e5f3a1f3f53736d5c9e172b6c13ec1904637d96d8db1fc8a7","observation_id":"6ec6bbc9-f0e4-4517-85ff-7d68f2b3b65f","resolution":{"observed_at":"2026-08-11T20:41:17.830272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.807698Z","title":"Un- veiling typographic deceptions: Insights of the typographic vulnerability in large vision-language model.European Con- ference on Computer Vision (ECCV), 2024","venue":null,"work_id":"a9b2c8b0-fa04-44b0-bb52-a28cf55a9081","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.016806Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:225d7dd919efc7ee81fa40025b58b9efb8f1151ee847ecac30e7f7f1ce51459e","observation_id":"efe0e062-367b-4ca2-be35-99b0f8466608","resolution":{"observed_at":"2026-08-11T20:41:17.813758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.790626Z","title":"Villan- diffusion: A unified backdoor attack framework for diffu- sion models","venue":null,"work_id":"439ff2d8-05cd-4351-b426-85c9f502d3b9","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.023213Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:4d366e8ce678ed5d2581ba6d512e5e6ce0aca400c61558f3779d1b16e948da94","observation_id":"a3a5a015-2408-493d-870a-f6109ce08919","resolution":{"observed_at":"2026-08-11T20:41:17.795940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.775113Z","title":"Style injec- tion in diffusion: A training-free approach for adapting large- scale diffusion models for style transfer","venue":null,"work_id":"38f76a73-07a2-4bc7-882f-4fa69b1382d9","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.029599Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:4bed8da2bfeb112c5b47ff7cca3101d015972dea11a2f5098509b2b097c98171","observation_id":"16e1dc5d-bbac-4df9-99be-1d86e7b699c6","resolution":{"observed_at":"2026-08-11T20:41:17.779803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:16.035929Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.035929Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:2507c3223f10630fa65618ae0e7e09e0c4d4cc361de3fe6e1abdea2682b98da5","observation_id":"9d9acdc3-f871-4b96-85d0-ce93883dfc4d","resolution":{"observed_at":"2026-08-11T20:41:16.035929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.747692Z","title":"Shifting attention to relevance: Towards the predictive uncertainty quantification of free-form large language mod- els","venue":null,"work_id":"23caff96-1ac0-46cd-8865-63aaf29b351b","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.042720Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:1307cdd91f27752375f0ac0e1c2603e341624db841facb6d039155e5801ba53a","observation_id":"e05161cf-4914-4abd-8678-1f1d68a22132","resolution":{"observed_at":"2026-08-11T20:41:17.752409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.731241Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"8262c7f8-6b58-43b8-8a67-e24a8b0e529d","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.047918Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:277bd5c15122e2eb607a55824d707437d3ef68455a8ad104f1ed0e8a8b8296b3","observation_id":"2917006e-fb9a-409d-99d4-e0e4a1009d8c","resolution":{"observed_at":"2026-08-11T20:41:17.736563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13896","last_updated":"2024-12-15T05:13:26Z","snapshot_observed_at":"2026-08-12T22:57:49.220226Z","submitted_at":"2024-08-25T17:33:40Z","title":"HTS-Attack: Heuristic Token Search for Jailbreaking Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13896","snapshot_observed_at":"2026-08-11T20:41:16.054907Z","title":"Rt-attack: Jailbreak- ing text-to-image models via random token","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.054907Z"},"links":{"cited_paper":"/paper/2408.13896","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:19237cd7292c2af8cfe327e0eafc43cc4144b8d907a3a18f08578fe443df450d","observation_id":"0c41b359-e9af-422b-8fca-b3ff5eae6d77","resolution":{"observed_at":"2026-08-11T20:41:16.054907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:16.063958Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.063958Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:5447edc87ca7e3964cf42f1cf1c4ef147470a39015f3c75be02d856d3a2374c1","observation_id":"4be1fb8b-9bcd-4c1e-ad14-8c4871f8c365","resolution":{"observed_at":"2026-08-11T20:41:16.063958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05783","last_updated":"2024-09-03T16:23:55Z","snapshot_observed_at":"2026-08-13T00:34:45.821858Z","submitted_at":"2024-04-08T17:53:21Z","title":"A Survey on Responsible Generative AI: What to Generate and What Not","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05783","snapshot_observed_at":"2026-08-11T20:41:16.069137Z","title":"Responsible generative ai: What to generate and what not","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.069137Z"},"links":{"cited_paper":"/paper/2404.05783","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:8d2483092820e528907cb5a1920e215fccfcae52de64c8a52af43d92fae831ff","observation_id":"f7930752-df99-4fad-b256-ba8d862dca48","resolution":{"observed_at":"2026-08-11T20:41:16.069137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.701401Z","title":"Detoxify","venue":null,"work_id":"e8f8df40-0b71-4c63-8f1c-3c301e7d797b","year":2020},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.074800Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:560d0ac0903bf4335c93cc27625310f50008d782286b1784e46998079509edfc","observation_id":"3d8ba173-6825-4b65-b867-427842bf5224","resolution":{"observed_at":"2026-08-11T20:41:17.706588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12162","last_updated":"2025-03-26T03:12:17Z","snapshot_observed_at":"2026-08-10T20:24:08.152443Z","submitted_at":"2020-02-26T02:03:00Z","title":"Defending against Backdoor Attack on Deep Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12162","snapshot_observed_at":"2026-08-11T20:41:16.079816Z","title":"Defending against backdoor attack on deep neural networks","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.079816Z"},"links":{"cited_paper":"/paper/2002.12162","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:8494a13b4140f267169a6eed4aaaf3d3d663fb3f4eb82959c845b308d14e9020","observation_id":"eebffb7d-1594-474f-a07f-2d6b85a74a38","resolution":{"observed_at":"2026-08-11T20:41:16.079816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.684432Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"fb8ddfcb-813c-4c60-9e0b-0e354861b9bc","year":2017},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.086090Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:3cad92016195e9fff517ad582857361695a415d408bc6db886293b42f4ee9d4a","observation_id":"5bd09f48-55c7-4aa7-a65b-0af1229f569b","resolution":{"observed_at":"2026-08-11T20:41:17.690423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:16.092015Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.092015Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:5836e55b6ef7bafbd397f30533e1c7c82f05416ef311e5b9eaa90eca4308e5e4","observation_id":"4ee3f535-3742-4566-bde3-bb6122d1ba35","resolution":{"observed_at":"2026-08-11T20:41:16.092015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.656990Z","title":"All but one: Surgical concept erasing with model preservation in text-to- image diffusion models","venue":null,"work_id":"8a7c8ef1-d8fe-4e63-ac4d-1012c40b1a2c","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.098181Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:e66b0f2baf23460d8c109d4f6076bc8d89b3ae7f49ed1f460167f5432e1ba1d8","observation_id":"556bce85-0274-4106-8ef4-9007da1ab1df","resolution":{"observed_at":"2026-08-11T20:41:17.662419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-13T00:51:41.824778Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-11T20:41:16.103292Z","title":"Llama guard: Llm- based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.103292Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:e2cc510265490ad7ec6d6facb1a191dcdca3c40ea3a99bb0df69f4c90e74e7f2","observation_id":"0481bf68-d92a-4e53-84db-4cc62e665811","resolution":{"observed_at":"2026-08-11T20:41:16.103292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10196","last_updated":"2018-02-26T15:33:34Z","snapshot_observed_at":"2026-07-06T06:06:26.276752Z","submitted_at":"2017-10-27T15:28:35Z","title":"Progressive Growing of GANs for Improved Quality, Stability, and Variation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10196","snapshot_observed_at":"2026-08-11T20:41:16.109298Z","title":"Progressive growing of gans for improved qual- ity, stability, and variation.arXiv preprint arXiv:1710.10196,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.109298Z"},"links":{"cited_paper":"/paper/1710.10196","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:e6e61e33fc6d9ed906902bd8a9c72fe0e08621a6a5e5b105b182780f1b6edc13","observation_id":"f5ad5d92-219f-4c07-8b82-ece074facc03","resolution":{"observed_at":"2026-08-11T20:41:16.109298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T20:41:16.116002Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.116002Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:453f6a6da247f9aa235dab5f07cf4de821c84b5b6d174e6b7183e73423fced60","observation_id":"70d9bd6f-303d-43ab-bc83-c483a9a15efe","resolution":{"observed_at":"2026-08-11T20:41:16.116002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.638841Z","title":"Self-discovering interpretable diffusion latent di- rections for responsible text-to-image generation","venue":null,"work_id":"30769692-2a64-43fd-ba95-5e243366e9e2","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.123141Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:a8737df74c86bbdef0cd7bc3c83e4e79f4e7672fe904ecb204f128aa9e61d1de","observation_id":"92f5ceb6-770f-4805-883a-6b85eeaebe98","resolution":{"observed_at":"2026-08-11T20:41:17.644039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T20:41:16.137150Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.137150Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:b4e3b8ee56f56a0cf4e9c6aeb62acdcf8690bf6282ea8d04daa3c4c59be277fc","observation_id":"3dd086a4-7e79-471b-ab56-56afba6db1ab","resolution":{"observed_at":"2026-08-11T20:41:16.137150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.620628Z","title":"Spd-ddpm: Denoising diffu- sion probabilistic models in the symmetric positive definite space","venue":null,"work_id":"bc16b6ad-ce7f-42ec-bf99-ac6136f6099a","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.144757Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:0eb950b9d06a00ab184b7222598aa101faae37a3b2af2de54a4bed5d77daf929","observation_id":"71f0f88a-8fbf-4865-a174-bfb8436f0712","resolution":{"observed_at":"2026-08-11T20:41:17.626817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04578","last_updated":"2023-06-06T06:34:46Z","snapshot_observed_at":"2026-08-13T12:48:10.468409Z","submitted_at":"2023-02-09T11:36:39Z","title":"Adversarial Example Does Good: Preventing Painting Imitation from Diffusion Models via Adversarial Examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04578","snapshot_observed_at":"2026-08-11T20:41:16.152540Z","title":"Adversarial example does good: Preventing paint- ing imitation from diffusion models via adversarial exam- ples","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.152540Z"},"links":{"cited_paper":"/paper/2302.04578","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:f48b0d4a783e7ef734347c9ca22cda5e9be2e93ca81e5ab2f2e52cd79a50031f","observation_id":"e1d08a69-acfa-4ea1-9b94-ef572a375614","resolution":{"observed_at":"2026-08-11T20:41:16.152540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.601843Z","title":"Which model generated this image? a model- agnostic approach for origin attribution","venue":null,"work_id":"cefcfc26-f7ae-480c-96b2-9f841bba8757","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.158775Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:28605734a4a27b14f8221b08e0cdbc927b4dc69b7bc979b56ead062b33cc95af","observation_id":"8bc0d17b-7152-4eb6-af9e-3b002e5dac2c","resolution":{"observed_at":"2026-08-11T20:41:17.607534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T20:41:16.165369Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.165369Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:af8e585be1bcebe13ced2af7b0ab2971f53fd3925fd74b7e0a8dc1cca3f8795e","observation_id":"2ccc9a99-8687-48b0-9a78-b768756d6e54","resolution":{"observed_at":"2026-08-11T20:41:16.165369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T20:41:16.171091Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.171091Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:79af2063a92e7daa7033e2694a40758211e7f23222f6cec488ca802b6a66526a","observation_id":"467148d4-0fec-4a41-84a1-ba0a941534a0","resolution":{"observed_at":"2026-08-11T20:41:16.171091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.585434Z","title":"Latent guard: a safety frame- work for text-to-image generation","venue":null,"work_id":"604339dc-a78a-4c24-8808-a7777ddf2229","year":2025},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.182742Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:44c4a6acd622c3039a7de71d095bb97c5993e9643974e7293996fd8bcf0a578f","observation_id":"fcd2f6c9-6a9c-468f-8eb5-57078ab22787","resolution":{"observed_at":"2026-08-11T20:41:17.590711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.566452Z","title":"Multimodal prag- matic jailbreak on text-to-image models","venue":null,"work_id":"93ed93e4-ee3d-42ec-b314-b474257e5fc4","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.188138Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:5c099f33e79456ef86c38766262528ad2550a8dfb21cf6ec561cd8442ac9ceeb","observation_id":"c05fc1f7-6df0-48dc-80aa-8acbf6ed9b58","resolution":{"observed_at":"2026-08-11T20:41:17.573013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17600","last_updated":"2024-06-19T08:32:14Z","snapshot_observed_at":"2026-08-13T05:14:33.075899Z","submitted_at":"2023-11-29T12:49:45Z","title":"MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17600","snapshot_observed_at":"2026-08-11T20:41:16.195700Z","title":"Query-relevant images jailbreak large multi-modal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.195700Z"},"links":{"cited_paper":"/paper/2311.17600","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:ce6d451356bdcc8527e459b2b0e1b81b06778e233a57e2f00d302a08a9103ddc","observation_id":"16392452-1f48-41ed-a583-505200cdc8f9","resolution":{"observed_at":"2026-08-11T20:41:16.195700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.549199Z","title":"Large-scale celebfaces attributes (celeba) dataset","venue":null,"work_id":"4f0f072e-adb7-42b1-8445-d7c2cca2dd2a","year":2018},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.202074Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:29ee930a7ece65c728e103cae80115cefab09b2b02144387d160ea4e39a25e89","observation_id":"2435339a-a0c1-480a-a9b8-1a3770a8d3de","resolution":{"observed_at":"2026-08-11T20:41:17.554589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.531207Z","title":"Information constraints on auto-encoding variational bayes","venue":null,"work_id":"a21d86ce-95ab-4585-9963-12d1d8f231aa","year":2018},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.210370Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:194a8caf190d865ed4cb1714a2af43cec7a669711042094f3dac5e0296e44843","observation_id":"a06b4bea-ebaa-42a4-a776-85fd4c93f603","resolution":{"observed_at":"2026-08-11T20:41:17.537226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.513401Z","title":"An image is worth 1000 lies: Transferability of adversarial images across prompts on vision-language models","venue":null,"work_id":"ba1dd67b-6517-4630-a7be-c2531b8b328d","year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.219957Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:7877d671904119fc0e823febd0abda09a2f598d676b362a5343c6e3baf6ecb76","observation_id":"a0275460-a58a-46f9-ac1a-58dd1529dece","resolution":{"observed_at":"2026-08-11T20:41:17.518701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02928","last_updated":"2025-05-26T11:46:09Z","snapshot_observed_at":"2026-08-13T00:39:28.566369Z","submitted_at":"2024-04-02T09:49:35Z","title":"Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02928","snapshot_observed_at":"2026-08-11T20:41:16.226826Z","title":"Jailbreaking prompt attack: A controllable adversarial attack against diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.226826Z"},"links":{"cited_paper":"/paper/2404.02928","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:6501a3e2f9f11131e62cf6297f0267ad5a02d99e643cb526f3cf66bab99a12f6","observation_id":"198e468f-803d-4cee-a8a4-9e0d4bd57a69","resolution":{"observed_at":"2026-08-11T20:41:16.226826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.495539Z","title":"A holistic approach to undesired content detection in the real world","venue":null,"work_id":"c1fee675-7ddf-408f-b4ce-cabe54d8b3c2","year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.233197Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:1a4f22ab9cd0cf83fe30009ae08351a54d46f997115bedb8c2614c10d2b11e29","observation_id":"e2edfa60-77c8-47ce-934a-0d9a200ea5dd","resolution":{"observed_at":"2026-08-11T20:41:17.500221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02549","last_updated":"2024-06-04T17:59:32Z","snapshot_observed_at":"2026-08-12T23:50:15.040473Z","submitted_at":"2024-06-04T17:59:32Z","title":"Dreamguider: Improved Training free Diffusion-based Conditional Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02549","snapshot_observed_at":"2026-08-11T20:41:16.247131Z","title":"Dreamguider: Improved training free diffusion-based conditional generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.247131Z"},"links":{"cited_paper":"/paper/2406.02549","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:979dda4f0f08dc26b5cb5a8b05c64d798b3aaca0cadbec754577f2133f1a3f02","observation_id":"7626b988-ae74-4559-bbe6-3495c130d857","resolution":{"observed_at":"2026-08-11T20:41:16.247131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.478554Z","title":"At-ddpm: Restoring faces degraded by atmospheric tur- bulence using denoising diffusion probabilistic models","venue":null,"work_id":"d8fff3c6-1740-44aa-b373-af07f405443c","year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.262943Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:72c5d043acc7e6719d463ec42e03926a44f631795d26f4fc8dc3f4e76a7ff92e","observation_id":"1dc9f6e0-757f-4237-bf2d-85d1d5b31f90","resolution":{"observed_at":"2026-08-11T20:41:17.484104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.461834Z","title":"Contrastive denoising score for text-guided latent diffusion image editing","venue":null,"work_id":"4910b687-1691-4995-8ed3-84ccdf2a1966","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.272875Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:61d561845f4dfbd2840141382f5f3084522a8dfc56570ccdfbbb28295ff83578","observation_id":"d700a64a-157c-41d8-aa2a-db3adfbc0425","resolution":{"observed_at":"2026-08-11T20:41:17.467275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06405","last_updated":"2024-11-21T16:42:56Z","snapshot_observed_at":"2026-08-13T10:35:45.982990Z","submitted_at":"2023-08-11T22:03:36Z","title":"White-box Membership Inference Attacks against Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06405","snapshot_observed_at":"2026-08-11T20:41:16.279099Z","title":"White-box membership inference attacks against diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.279099Z"},"links":{"cited_paper":"/paper/2308.06405","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:08d8bfd52d0a24e14ea65145a019d87575ab4f6946b5ca414faf426bad503a40","observation_id":"11ea48a6-e231-4b9b-a4a2-dc2a461d0fb1","resolution":{"observed_at":"2026-08-11T20:41:16.279099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T20:41:16.285778Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.285778Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:8a649bed8e871eb85b91074743790edba204fd58e82ca0f617a528f91d947358","observation_id":"580454fc-c7ef-4465-8431-183ef9cace1e","resolution":{"observed_at":"2026-08-11T20:41:16.285778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.444554Z","title":"Safe-clip: Removing nsfw concepts from vision-and-language models","venue":null,"work_id":"ec92db26-07a5-41d0-b1f9-564c5cba7024","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.294864Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:9371d558bcc76452a660c3c8322c9d55473e5e61fa69b37d46fce4d470257675","observation_id":"d24ded01-08f6-4477-91f8-1bef07cad98f","resolution":{"observed_at":"2026-08-11T20:41:17.450071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.426405Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"0802a84b-ca6b-4c53-93e9-4223ed3172b8","year":2021},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.302095Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:9fe7da36da36f8bc591842f235c7916577a49c9c177923f15a56c6dab3f208ec","observation_id":"f3fdfe8d-e283-48ab-8b0c-c59edf536f87","resolution":{"observed_at":"2026-08-11T20:41:17.431641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:16.311262Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.311262Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:55f82390aa36a218ca061de121823b85a9d96b49d7f46dfa09e1a2bc0ad6e772","observation_id":"79bb20c5-c338-4f24-9e9c-1e481733286c","resolution":{"observed_at":"2026-08-11T20:41:16.311262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T20:41:16.317220Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.317220Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:17b2923865468a7ff751eb3d0b27d11adfa9f1445d8d1dd25ac29df390bb59d7","observation_id":"e85317c9-32b4-4461-8a2b-435af4216843","resolution":{"observed_at":"2026-08-11T20:41:16.317220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04610","last_updated":"2022-11-10T10:07:37Z","snapshot_observed_at":"2026-08-13T14:14:06.761771Z","submitted_at":"2022-10-03T14:04:46Z","title":"Red-Teaming the Stable Diffusion Safety Filter","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04610","snapshot_observed_at":"2026-08-11T20:41:16.323922Z","title":"Red-teaming the stable diffusion safety filter","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.323922Z"},"links":{"cited_paper":"/paper/2210.04610","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:39f8daf7ca7fcc1a8bebb6914d55a649c5e60585c95b4603976989618487b3a2","observation_id":"e1901301-6bd3-469d-9c37-12a2c11fd13e","resolution":{"observed_at":"2026-08-11T20:41:16.323922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:16.330422Z","title":"Gener- ating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.330422Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:67e7a22037a2f277b574d6d2bfb694fc2ca13fdb1e5d84375536cb500dda2348","observation_id":"c466172a-b985-4d33-9e9a-f83673b770fc","resolution":{"observed_at":"2026-08-11T20:41:16.330422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:16.335821Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.335821Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:e3b60ab000a87ea8673a17d67fc276006d32be1a398441da5328d27383148556","observation_id":"8750fd41-ada9-4845-9cb1-f114b81e8ce3","resolution":{"observed_at":"2026-08-11T20:41:16.335821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06588","last_updated":"2023-02-13T18:38:42Z","snapshot_observed_at":"2026-08-13T12:45:15.619938Z","submitted_at":"2023-02-13T18:38:42Z","title":"Raising the Cost of Malicious AI-Powered Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06588","snapshot_observed_at":"2026-08-11T20:41:16.342958Z","title":"Raising the cost of malicious ai-powered image editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.342958Z"},"links":{"cited_paper":"/paper/2302.06588","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:2e1119a2b9d9ab09bc7668ee9119ed7d1c882f5ccaeb8bd5ed638ce52ec3319b","observation_id":"d081260a-f4b2-496e-baf4-607ff318d5d7","resolution":{"observed_at":"2026-08-11T20:41:16.342958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:16.349013Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.349013Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:f3a02fbd5ba4432238c59def0f35d2c3f384e3b4b4a83759601695e80f8341f9","observation_id":"4c45e4a7-1f94-466f-ab87-acc99dd4d8b5","resolution":{"observed_at":"2026-08-11T20:41:16.349013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.365089Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":"1a245eca-6953-41dd-991f-d87e0af7f20f","year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.354839Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:87f40e39ab5157199240c594340be80f512a720ba89b8a511edb1ee73eb02126","observation_id":"f961a41a-8ff6-474c-966e-e71c5bb3d1e8","resolution":{"observed_at":"2026-08-11T20:41:17.372299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.339078Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":"d6d3d324-5d6d-44d6-9f41-29cd6f41964d","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.361162Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:810d175f58cad4d9e23b58fd273ee60fbaca2d343baafd39b8416c65e5ea4257","observation_id":"e802768e-17cc-4a74-9438-ca6a84111fd6","resolution":{"observed_at":"2026-08-11T20:41:17.344759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T20:41:16.368896Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.368896Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:870c7973d139451409dd34ec72c7621405f4c62753e9528674f571a34dc75ad7","observation_id":"b939e121-7ed5-4950-9f0e-5c6f072d5143","resolution":{"observed_at":"2026-08-11T20:41:16.368896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.319477Z","title":"Gcd-ddpm: A generative change detection model based on difference-feature guided ddpm","venue":null,"work_id":"b56d6c2a-512b-44f4-bf64-d831447b96fa","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.379570Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:37a7b029e630ccc84933d51793dd8e61d3a8ebd8950f8b7d8a9aa4830c246d3e","observation_id":"8ba5fa7b-4918-401d-8eb1-8e8bb97917b7","resolution":{"observed_at":"2026-08-11T20:41:17.325116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13817","last_updated":"2025-03-17T16:05:34Z","snapshot_observed_at":"2026-08-13T08:13:29.830302Z","submitted_at":"2024-12-18T13:04:30Z","title":"Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13817","snapshot_observed_at":"2026-08-11T20:41:16.386103Z","title":"Nullu: Mitigating object hallucinations in large vision-language models via halluspace projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.386103Z"},"links":{"cited_paper":"/paper/2412.13817","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:40b778c99330f5e5b6eb029cb8e8b035c1dfaa320d91b503c9c8eca68f0da4a3","observation_id":"31f190b1-04b0-4372-8834-c35e970dbfb7","resolution":{"observed_at":"2026-08-11T20:41:16.386103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.302181Z","title":"Sneakyprompt: Jailbreaking text-to-image generative models","venue":null,"work_id":"82dfcf4a-87f9-4a5a-9b02-344535c0efdc","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.396910Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:e30bd750aed0f761e065b8a38125e5ce99bd61bf2233f521916bd835ee78d9ca","observation_id":"e8f7d067-0e3b-4097-8732-9a4e1e7fa217","resolution":{"observed_at":"2026-08-11T20:41:17.307571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T20:41:16.402465Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.402465Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:5fd3e075eb4749cdaaea7cd0de210056251d7e8efc0ed13caa9997bf0970e367","observation_id":"cc4ba249-05ba-46ef-9cf8-ef0e9ef2fa5b","resolution":{"observed_at":"2026-08-11T20:41:16.402465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.285728Z","title":"Inversion-based style transfer with diffusion models","venue":null,"work_id":"a5dc0a38-79d7-411a-ac2d-66710e006bbe","year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.408500Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:558e7d0306b6ccd9e3a3872172027f16b8af414062e7a6fa9856fe20145dc0ae","observation_id":"8c07f2aa-0b95-473c-8239-696ad4c3029f","resolution":{"observed_at":"2026-08-11T20:41:17.291166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:17.266714Z","title":"Defensive unlearning with adversarial training for robust concept erasure in diffusion models","venue":null,"work_id":"165cee24-46e7-4239-bcaa-5fcfd2a6d4ee","year":2024},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.422936Z"},"links":{"citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:5a25b1488ccfc0017a941e63b4b446e235606a61975beb37548281da420303cb","observation_id":"d2ec859b-e882-477c-a0fb-e1c0ca8066d8","resolution":{"observed_at":"2026-08-11T20:41:17.274376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T20:41:16.429938Z","title":"analog film photo, faded film, desaturated, 35mm photo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T20:41:16.429938Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.05538"},"observation_digest":"sha256:7ac20c4420eff6695ed2c9210ca16ff1236de05a6b3dcaefa10f988f6cde599c","observation_id":"b5acb7ce-93af-49d7-8d8b-8ddd9a55b355","resolution":{"observed_at":"2026-08-11T20:41:16.429938Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.05538","last_updated":"2025-04-29T23:35:42Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:54:41.375187Z","submitted_at":"2024-12-07T04:55:39Z","title":"Not Just Text: Uncovering Vision Modality Typographic Threats in Image Generation Models"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2412.05538."}