{"as_of":"2026-08-09T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:944d316fac256c0a3d9f3de620a19953eb2b7a338c389d14802fb5ab08ef25ef","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:10.698924Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T05:59:14.478279Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T06:01:34.637502Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"cited_work":{"arxiv_id":"2505.23161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23161","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Im- plicit inversion turns clip into a decoder.arXiv:2505.23161","venue":null,"work_id":"ae5cc242-4016-49d5-8ae4-36af631bff43","year":null},"citing_paper":{"arxiv_id":"2511.18359","last_updated":"2026-04-07T10:36:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-23T09:12:48Z","title":"TRANSPORTER: Transferring Visual Semantics from VLM Manifolds","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T05:59:14.478279Z"},"links":{"cited_paper":"/paper/2505.23161","citing_paper":"/paper/2511.18359"},"observation_digest":"sha256:2ae613dd97dfd278296b2ed227b68d56030f7486ebcd70260c6282af44916993","observation_id":"03541f61-cfda-4171-8baf-abe75c8eaa76","resolution":{"observed_at":"2026-05-17T06:01:34.645135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23161/citation-record","integrity":"/paper/2505.23161/integrity","json":"/paper/2505.23161/citation-record.json","paper":"/paper/2505.23161"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:07.384279Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.384279Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:36a21f07a6bddd67a09b77adae8bef281bb5192890deceb8fa0243b30bcbeca5","observation_id":"876088c6-7e5b-41f8-8739-0174a1bfc2e7","resolution":{"observed_at":"2026-08-07T12:58:07.384279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:14.388702Z","title":"Large scale gan training for high fidelity natural image synthesis","venue":null,"work_id":"9b4070e3-1ef5-450c-b59d-0d8bd33eee2e","year":null},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.428202Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:219a8dc874216e0e057b112dd60bf7edc84bf84618ac6be186b0298162b0715f","observation_id":"4ccd19de-977b-4eb4-810d-959586a79573","resolution":{"observed_at":"2026-08-07T12:58:14.474171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:07.536052Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.536052Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:2da2cbfef2df2bdaca32e514a4924b862c329cbc9bf34713c178b8f92de89cad","observation_id":"87f781c1-351d-4049-85f7-e9a7f42ad304","resolution":{"observed_at":"2026-08-07T12:58:07.536052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13948","last_updated":"2024-10-27T08:32:11Z","snapshot_observed_at":"2026-08-06T16:12:42.070710Z","submitted_at":"2023-05-23T11:17:45Z","title":"Decoupled Kullback-Leibler Divergence Loss","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13948","snapshot_observed_at":"2026-08-07T12:58:07.599829Z","title":"Decoupled kullback-leibler divergence loss.arXiv preprint arXiv:2305.13948, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.599829Z"},"links":{"cited_paper":"/paper/2305.13948","citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:04a5f66e606dfc1e50e33fff4cc7c815edde106f3ba43423e0fbfcfce3f6d784","observation_id":"9e4f1577-1828-4b29-92fd-05ca4b5f50a0","resolution":{"observed_at":"2026-08-07T12:58:07.599829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:14.229243Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"20b81315-7b2b-4cf6-8686-be6f5b9cf984","year":2024},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.666223Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:7f3592f26160c549b6449d3d9547940e949899485debcc288f6e3bd518fc0eb7","observation_id":"b7abad66-fc79-4a3c-b181-3cf3525f6915","resolution":{"observed_at":"2026-08-07T12:58:14.302657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07753","last_updated":"2025-02-11T18:27:27Z","snapshot_observed_at":"2026-08-08T14:51:46.857146Z","submitted_at":"2025-02-11T18:27:27Z","title":"Direct Ascent Synthesis: Revealing Hidden Generative Capabilities in Discriminative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07753","snapshot_observed_at":"2026-08-07T12:58:07.753995Z","title":"Direct ascent synthesis: Revealing hidden generative capabilities in discriminative models.arXiv preprint arXiv:2502.07753, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.753995Z"},"links":{"cited_paper":"/paper/2502.07753","citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:3ef2213296f00a0856988184a57ce810712b8dca798dd474a6a0f94fea6a9b29","observation_id":"fa680c2a-7b2c-42db-9fa8-07e296413172","resolution":{"observed_at":"2026-08-07T12:58:07.753995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:14.095684Z","title":null,"venue":null,"work_id":"1bfe52b3-8fd9-46dd-8c05-5b35ab761c64","year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.811347Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:e237f4b730b72d898b2ae74a5f705d1beff6c86296aa182495e61b052da1f2a5","observation_id":"5073ed89-995d-485a-94f9-3b91c4e266c4","resolution":{"observed_at":"2026-08-07T12:58:14.148363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:13.858923Z","title":"Clipag: Towards generator-free text-to-image generation, 2023","venue":null,"work_id":"99202a8f-2c2a-4bd7-8ea1-a808b9d138a4","year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.863456Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:c6fe5a70f81bdd95e2fa4a8511c986f0a56be109d591a6ab00957c8057e36a5f","observation_id":"6dcba974-834a-4b23-b31f-e4efed793c96","resolution":{"observed_at":"2026-08-07T12:58:13.979757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:13.669791Z","title":"Text-to-image generation via energy-based clip, 2024","venue":null,"work_id":"349ab148-1731-4ff8-b92d-9c930a35f86b","year":2024},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:07.934371Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:0fade2f6ffddb4d91a1ed7d35601109484647f3627c20febe95a03e99befed02","observation_id":"6d690dea-e80b-4f6e-9b39-8a9b0256d9e0","resolution":{"observed_at":"2026-08-07T12:58:13.748850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:13.447394Z","title":"Do perceptually aligned gradients imply robustness? In ICML, 2023","venue":null,"work_id":"d86f2b89-3f9a-4c52-8082-b129bac79d75","year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.009967Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:582a6174c2a0cf66f6a75ce3e7990f6e23c3fcb7b2d66adc2ed959aab6240e9f","observation_id":"d0497f4d-25c0-43f4-b7fd-ae9417124f82","resolution":{"observed_at":"2026-08-07T12:58:13.544683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T12:58:08.091170Z","title":"Clipscore: A reference-free evaluation metric for image captioning.arXiv preprint arXiv:2104.08718, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.091170Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:ca1654840343704791aa52254bab9c44272bce634e0ceb3a6133d35aabfc3f39","observation_id":"2516449c-a1b7-489b-adfd-4d8491f0bbf7","resolution":{"observed_at":"2026-08-07T12:58:08.091170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.180237Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.180237Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:f17cd496ce24d0055449864a1fdf55a7fc3bddbbcd4a4cb603f6925b4460a192","observation_id":"a4c2a3aa-bc88-4629-a2bc-d2ce68928a45","resolution":{"observed_at":"2026-08-07T12:58:08.180237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:13.212862Z","title":"Measuring forgetting of memorized training examples","venue":null,"work_id":"2b29a735-40e5-46e9-a0ea-8cfa0df6c3b9","year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.227639Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:2b51523528887c89df27edd1df06db27d5fd1c9606df7e8e7626152ff2d926f8","observation_id":"13840c18-16f4-4a51-8995-bd82eac1f610","resolution":{"observed_at":"2026-08-07T12:58:13.323699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.996813Z","title":"What do we learn from inverting clip models? InNeurips Safe Generative AI Workshop 2024","venue":null,"work_id":"2a141049-dfba-4bb4-9f85-f28836765894","year":2024},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.307888Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:0e846cd6c9a6eda9848f678639a6f522b1ed626418e06a0bc19391fbf7e4adee","observation_id":"c3d23fb3-01eb-448e-870b-4c552bd8a99b","resolution":{"observed_at":"2026-08-07T12:58:13.094119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.418361Z","title":"Glow: Generative flow with invertible 1x1 convolutions.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.418361Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:3242307ed7e87d335ac9bc00671e2f3ff8c6fd0e6cb1fb9b0baa5198d08ceef2","observation_id":"e0d917ef-9d7f-4070-9461-88ecdba5dc9c","resolution":{"observed_at":"2026-08-07T12:58:08.418361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.755068Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":"67653179-f3c4-41b5-9db3-c00261b418f4","year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.486591Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:1642f458794379b36816be96a5f49e2e3930901241caca1b762660664a65cad1","observation_id":"80d5b421-c28d-4f49-9ab9-c955977759cc","resolution":{"observed_at":"2026-08-07T12:58:12.865703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.592981Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Systems, 35:17612–17625, 2022","venue":null,"work_id":"fc332221-090d-47e6-ad30-54aedb11b90b","year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.565073Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:212afdc743d623c8250b9a1ebe634362499e702e91363cbf76b47452afbdf350","observation_id":"b3942c63-d086-4914-b67a-413c8562847e","resolution":{"observed_at":"2026-08-07T12:58:12.657206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.650663Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.650663Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:6f7adff9a1923daa42cb6f43489e630e9922640592e7164f71267095f4703fa0","observation_id":"94efc4ae-f9c3-48d2-a6f5-7e3d3836b215","resolution":{"observed_at":"2026-08-07T12:58:08.650663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.458419Z","title":"Finer: Flexible spectral-bias tuning in implicit neural representation by variable-periodic activation functions","venue":null,"work_id":"be6dfaf1-5158-4392-b062-8d4a7cfb016e","year":2024},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.720447Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:20dba66bdae532321b9187c640bfe9f376f56591ef5b47b1e6966f6782cb1679","observation_id":"8fc2ac30-57e2-4ee3-ad91-175642a52bd8","resolution":{"observed_at":"2026-08-07T12:58:12.493719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:08.801151Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.801151Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:5a650b76c96d988875988dff5a311dec062fce20d1e6788d58300fd7accd45fc","observation_id":"94c8ee32-118e-4608-85db-fdee2e362338","resolution":{"observed_at":"2026-08-07T12:58:08.801151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.295242Z","title":"Latent space translation via semantic alignment.Advances in Neural Information Processing Systems, 36:55394–55414, 2023","venue":null,"work_id":"9f11e8ab-4808-4983-ba84-062d9fb2ded4","year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.880444Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:c1774ff1da53e4d4f69a3e14ce223baaeb5695e1df596bde85b9f9aa18600aef","observation_id":"9495bd32-66da-4db3-bdac-662c182667e2","resolution":{"observed_at":"2026-08-07T12:58:12.367338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:12.137189Z","title":"Shedding more light on robust classifiers under the lens of energy-based models","venue":null,"work_id":"a73c4bce-b277-43a8-9dd7-cf37350b30a0","year":2024},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:08.967242Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:a875f30a67f1a095978da5c2d5bbc04dd8c0007712bd7f2e22824bccdd7bc460","observation_id":"54e14a5d-3ea6-41fa-bb51-f654049a0600","resolution":{"observed_at":"2026-08-07T12:58:12.177703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.956263Z","title":"Cross the gap: Exposing the intra-modal misalignment in clip via modality inversion.ICLR 2025, 2025","venue":null,"work_id":"a3af844f-897e-4747-80d1-9fe733dc008a","year":2025},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.083108Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:d9940cc1c3c08d6e21eab8a5ee92ccf3cca0f2aa70739d4f722f0cb88b3b996b","observation_id":"1028b1d7-8134-40ff-88b2-5fd97489b81f","resolution":{"observed_at":"2026-08-07T12:58:12.059971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.178917Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.178917Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:c5f94d96a90a9f5cd69aa391f38d1d9d5e0d6c39c04302cc3f799d50beb3a5b5","observation_id":"c822e84d-b629-4995-ac6a-c165400da176","resolution":{"observed_at":"2026-08-07T12:58:09.178917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06434","last_updated":"2016-01-07T23:09:39Z","snapshot_observed_at":"2026-08-04T04:34:27.861448Z","submitted_at":"2015-11-19T22:50:32Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06434","snapshot_observed_at":"2026-08-07T12:58:09.271643Z","title":"Unsupervised representation learning with deep convolutional generative adversarial networks.arXiv preprint arXiv:1511.06434, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.271643Z"},"links":{"cited_paper":"/paper/1511.06434","citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:127bafc4753fff9455a35097fad3c06bf186d4a1e1fa792b4bcd895ca3371f2f","observation_id":"b2cce845-cdf2-4285-9e9b-6be9df94ccbf","resolution":{"observed_at":"2026-08-07T12:58:09.271643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.369056Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.369056Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:71da2a0b9ebaa04671a061ad891e8d729f7caecb370378a22bb77db136ecd441","observation_id":"d5744712-07d3-468d-99b8-3411affa1703","resolution":{"observed_at":"2026-08-07T12:58:09.369056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T12:58:09.470285Z","title":"Hierarchical text-conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.470285Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:03e2df141c3a104b8048f1d3de91df499920f45c2d98d4c20d7365b1adb187d1","observation_id":"99f73d79-d4a2-4391-b902-aa42af6f0e98","resolution":{"observed_at":"2026-08-07T12:58:09.470285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.564242Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.564242Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:3e13ca97b05b1041b242cf1bfc77c26bb476a6f6256d142191a1aaf037668bb1","observation_id":"c1dd0d8a-bd69-4a8e-9550-a6e0a8457613","resolution":{"observed_at":"2026-08-07T12:58:09.564242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.683431Z","title":"Photorealistic text-to- image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.683431Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:9e4b7346111a4a72ff005b39b7ec851985ede3c0f5cb3d0b1609a6e46e5eeae9","observation_id":"3dd5078f-dd69-4e45-9cce-6bf79e986fe5","resolution":{"observed_at":"2026-08-07T12:58:09.683431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.783758Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.783758Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:06bdfdbbaf2338494d8a27e43aab057267c43f33172cd7b3a51849d0cbf85cfa","observation_id":"af9da4ff-c882-42d1-a722-dcb0e99b053c","resolution":{"observed_at":"2026-08-07T12:58:09.783758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:09.878673Z","title":"Stylegan-t: Unlocking the power of gans for fast large-scale text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.878673Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:6d04473727abf8469bbd198a130054ae1d8c9463d5fc2c300ee43786ca5722a6","observation_id":"bc7de873-566a-4d58-8e97-804badb2b851","resolution":{"observed_at":"2026-08-07T12:58:09.878673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.766123Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 2022","venue":null,"work_id":"9a00bac9-fba3-4397-8ee7-ec47a032e808","year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:09.975411Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:6c6c3da1c633b599f4be5d95ea36f9a81aa8ba1af3115309de5acbf6a6180646","observation_id":"0a997127-283b-43bd-b5bf-99fbcc66f79c","resolution":{"observed_at":"2026-08-07T12:58:11.819929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.059412Z","title":"Implicit neural representations with periodic activation functions.Advances in neural information processing systems, 33:7462–7473, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:10.059412Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:ebe6b2f6f1218874d7b10a01fd4aadae956da01b4944da72a8905fca3f32a7f8","observation_id":"e94bf74b-3908-4632-8d71-444093796e30","resolution":{"observed_at":"2026-08-07T12:58:10.059412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.163326Z","title":"Srinivasan, Ben Mildenhall, Sara Fridovich-Keil, Nithin Raghavan, Utkarsh Singhal, Ravi Ramamoorthi, Jonathan T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:10.163326Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:bff71062a95136779c4beed9aef37748b23eb7bcfaef526bab0d7a164f9c5b0d","observation_id":"4c5756a4-e802-43fc-b432-a90f6c889392","resolution":{"observed_at":"2026-08-07T12:58:10.163326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.581394Z","title":"Galip: Generative adversarial clips for text-to-image synthesis, 2023","venue":null,"work_id":"4e19e84a-f127-4f30-89ae-70beb6fa46a7","year":2023},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:10.215380Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:79151646191ad074af65f87c949f22dbdf1087b0bd72518a86d30552f0ee5bdc","observation_id":"1f48e25c-3207-4b9f-b9aa-1cd18994deae","resolution":{"observed_at":"2026-08-07T12:58:11.672437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.431574Z","title":"Manifold alignment using procrustes analysis","venue":null,"work_id":"21d9b139-2579-402a-9ae3-adc46121b477","year":2008},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:10.289243Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:862b9f4093c313221588c7b2196ce7ba57d020bd750d61ba2841415572fe211c","observation_id":"35f7d5a6-a6e8-4309-92db-1fe2c72e733f","resolution":{"observed_at":"2026-08-07T12:58:11.503880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00386","last_updated":"2022-03-01T12:11:32Z","snapshot_observed_at":"2026-07-06T12:42:48.355901Z","submitted_at":"2022-03-01T12:11:32Z","title":"CLIP-GEN: Language-Free Training of a Text-to-Image Generator with CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00386","snapshot_observed_at":"2026-08-07T12:58:10.360905Z","title":"Clip-gen: Language-free training of a text-to-image generator with clip.arXiv preprint arXiv:2203.00386, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:10.360905Z"},"links":{"cited_paper":"/paper/2203.00386","citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:9826129f064ccd4ec4cc262f57274e9ea585a6cd8893d4b242758b5b5b62cd69","observation_id":"fc31449a-d54d-4159-8edc-c13736f48fc1","resolution":{"observed_at":"2026-08-07T12:58:10.360905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.287759Z","title":"Adversarial weight perturbation helps robust generalization","venue":null,"work_id":"54f08994-0240-4a7b-9c2d-21c920669d74","year":2020},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:10.473320Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:a6798bb7cc9e4159bbc076a6f2bb75739866d4933456c447a8085d5c04412277","observation_id":"d6d1836a-fabf-499a-a508-062e0b693a9d","resolution":{"observed_at":"2026-08-07T12:58:11.343399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:11.086697Z","title":"Xing, Laurent El Ghaoui, and Michael I","venue":null,"work_id":"b8f1f67c-fc04-4f39-ba6c-87a1bc5c5515","year":2019},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:10.601370Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:42c14fcc998b61524c7494224b92f4b1245ee26da3956e2d7c7a7589399e8288","observation_id":"e19d0072-ac9d-40fb-87f6-6d1c31345b8b","resolution":{"observed_at":"2026-08-07T12:58:11.181507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:10.929966Z","title":"Connect, collapse, corrupt: Learning cross-modal tasks with uni-modal data.ICLR 2024, 2024","venue":null,"work_id":"1a4506bf-3be9-4cc3-bbfd-9059a30a2e5c","year":2024},"citing_paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:10.698924Z"},"links":{"citing_paper":"/paper/2505.23161"},"observation_digest":"sha256:afb7826c20cad802c2b8b5b26ea396f1b4387ec3a743f1581473569e6b40341b","observation_id":"990fc5c1-5a31-490c-9891-7eb92e7df2e5","resolution":{"observed_at":"2026-08-07T12:58:10.976536Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23161","last_updated":"2025-06-04T10:30:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T14:52:16.860158Z","submitted_at":"2025-05-29T06:55:26Z","title":"Implicit Inversion turns CLIP into a Decoder"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2505.23161."}