{"as_of":"2026-08-08T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bec15e5f69944da4883765a9c60129facbd71d29e5d74f6220002f0f48220ddf","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:06.804098Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:52:56.122056Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24517","snapshot_observed_at":"2026-08-04T16:52:56.122056Z","title":"arXiv preprint arXiv:2505.24517v1 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11247","last_updated":"2025-09-14T12:46:39Z","snapshot_observed_at":"2026-08-08T06:48:54.291640Z","submitted_at":"2025-09-14T12:46:39Z","title":"Contextualized Multimodal Lifelong Person Re-Identification in Hybrid Clothing States","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T16:52:56.122056Z"},"links":{"cited_paper":"/paper/2505.24517","citing_paper":"/paper/2509.11247"},"observation_digest":"sha256:5b118ca465e5b01ad57d7478c69a7fb70877e0edaad9ce62c4a109dd99a2f7bf","observation_id":"a18f549d-a4f2-4469-b88c-04a5501947f9","resolution":{"observed_at":"2026-08-04T16:52:56.122056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24517/citation-record","integrity":"/paper/2505.24517/integrity","json":"/paper/2505.24517/citation-record.json","paper":"/paper/2505.24517"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.973261Z","title":"Diffusion feedback helps CLIP see better","venue":null,"work_id":"b992c2e6-b249-445a-8769-3502fa55686e","year":2025},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:04.776421Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:e7927a65ba7f54b685a6a7e67217a3215f87310761b6bbe0cd12d17f1876f88f","observation_id":"f8decafb-89d9-422c-8e51-12b366787cdd","resolution":{"observed_at":"2026-08-07T12:27:09.033380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19480","last_updated":"2025-07-31T13:18:52Z","snapshot_observed_at":"2026-08-07T16:38:56.461384Z","submitted_at":"2025-03-25T09:15:34Z","title":"GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19480","snapshot_observed_at":"2026-08-07T12:27:04.943789Z","title":"GenHancer: Imperfect generative models are secretly strong vision-centric enhancers.arXiv preprint arXiv:2503.19480, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:04.943789Z"},"links":{"cited_paper":"/paper/2503.19480","citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:545a68d39a49e4d0ffb1528f8e1507303b0ccb48a771733831de670ae72193a4","observation_id":"2b0098d5-599b-4683-bec8-64439fc9930b","resolution":{"observed_at":"2026-08-07T12:27:04.943789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:05.029316Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.029316Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:2162da6552694be83b7dc40ea583d4d000972765da273034175d8d5bcd199bdc","observation_id":"b5cd51aa-8bbf-4623-a730-9047d014e94a","resolution":{"observed_at":"2026-08-07T12:27:05.029316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.770562Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"1f8299e7-fa84-4fd2-8d9b-cf2539a8625a","year":2018},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.126707Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:ac30cc29500d107b9090c3df2bd082ac8f6b625574c71094c5f24491c54503c5","observation_id":"9685119f-158e-4797-aca5-ffda49f9e336","resolution":{"observed_at":"2026-08-07T12:27:08.853198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.582588Z","title":"CLIPScore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"5246f7a9-48da-4b55-8e62-624546027766","year":2021},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.227208Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:e3c9379023bbf7663a6490f4bbea5e86eb4b8539f9ac1792323d11852b3a3be9","observation_id":"5a750fcb-d2a8-4465-b1a5-6f6cf941383d","resolution":{"observed_at":"2026-08-07T12:27:08.662957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.449151Z","title":"ImageNet: Alarge-scalehierarchical imagedatabase","venue":null,"work_id":"c1d77c76-1820-4c73-b130-990d4fde5a19","year":2009},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.321714Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:575bc3ade5db77d8cee684251e014de1d9137b9838e3246c0813e29d31328f1b","observation_id":"a8ee72a1-d4c5-4330-a5c1-07e9e357b5b7","resolution":{"observed_at":"2026-08-07T12:27:08.496592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:05.445687Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.445687Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:9d008e7229ee00148b8b0c3317913338e8359495fe2927d8d1a41b5779411363","observation_id":"450a6e0c-ebc1-49a8-9eea-85a30eb2d1e7","resolution":{"observed_at":"2026-08-07T12:27:05.445687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.247095Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories","venue":null,"work_id":"530e3294-595c-48fb-bc05-ed203d5c8958","year":2004},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.585534Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:53327c19aee7852889c52c36b0e24e39257ff4b5a0832b8dd6c5dca7d144a804","observation_id":"dac2d6b2-91ef-48ae-9261-cb508f2a8a55","resolution":{"observed_at":"2026-08-07T12:27:08.328385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:08.091998Z","title":"SUN database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"0c378f94-5e47-491b-9ae6-bcf764bf394a","year":2010},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.735773Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:aa784fc31df0f815f65413b41ec1ff103572d63178002c5dcbf2c7be5e35ca2a","observation_id":"9dc554cc-5143-40a2-bf09-1ffd4178d65c","resolution":{"observed_at":"2026-08-07T12:27:08.146328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-07T12:27:05.810939Z","title":"Fine-grained visual classification of aircraft.arXiv preprint arXiv:1306.5151, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.810939Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:120eed5a1f4afd4ceee082738389abde80676e7e11efbe75167875d35ce8e3f9","observation_id":"b058fb0d-93bf-4129-9bb9-8bedd0dd5634","resolution":{"observed_at":"2026-08-07T12:27:05.810939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.930265Z","title":"3D object representations for fine-grained categorization","venue":null,"work_id":"6632f80e-c298-415e-93f3-a27b7358b067","year":2013},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:05.983789Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:0866342e4d76d63f49097b60edadb98cf4f78c1decee599895602a0b94725d69","observation_id":"eb23a36c-aac5-4c53-ad97-4ac07fab9df9","resolution":{"observed_at":"2026-08-07T12:27:07.979623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.796288Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ce565910-3bbd-4317-90de-634736c588f0","year":2021},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:06.099267Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:843ccf4375bd8735779e03a8196c9b79e0b3a577a97b03f84bb8eb55920d0f83","observation_id":"04ae1e6c-089f-487c-bf8f-2cf426f8d10e","resolution":{"observed_at":"2026-08-07T12:27:07.864479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:06.207996Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:06.207996Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:3b3fa35a8790f89910896092701ed20ced1ad262f014360ef9dc886c7f08a6ac","observation_id":"db4a49ef-ec28-454e-8f5d-f190b68c98fc","resolution":{"observed_at":"2026-08-07T12:27:06.207996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:06.305565Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:06.305565Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:e4467705edd9bebea64f87db5ecf42f7a30388e269ee6875f12dda9af873f5df","observation_id":"34cb4615-b0c3-4ee6-92f6-f98d34176b37","resolution":{"observed_at":"2026-08-07T12:27:06.305565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:06.385555Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:06.385555Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:034536a6b820aff0cad870fd676ec7d2217418a292a3248012b417d8027ce498","observation_id":"8113b8a4-38b8-4481-8a74-9671483e6906","resolution":{"observed_at":"2026-08-07T12:27:06.385555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:06.485464Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:06.485464Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:5b825a15e38ba705c3266f354aa29168aa04e1c7d30a92f038e4496d352e3bee","observation_id":"5c4840e2-e6fb-41ee-bd03-61833601c4ce","resolution":{"observed_at":"2026-08-07T12:27:06.485464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.498860Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"ed8e396e-3e78-474a-afe3-a533cf2ea355","year":2014},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:06.580118Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:418e8fdb95f4ab4af5a2bc9276a1d5626f444dca2b640e4a4d618cef65369cd9","observation_id":"24a119c1-ab39-42ba-90a8-cd0bcce3bff1","resolution":{"observed_at":"2026-08-07T12:27:07.592046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.311442Z","title":"Maskedautoencoders are scalable vision learners","venue":null,"work_id":"c7959820-f8b0-4db6-b8cd-05756663e3a9","year":2022},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:06.692441Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:64e8352a11ace9f002fff663547726f072fdecca17b01a1cc1ee100034375a13","observation_id":"a6cf2a6a-7620-4174-90ab-90c378d3418f","resolution":{"observed_at":"2026-08-07T12:27:07.396381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:07.085883Z","title":"An empirical study of training self-supervised vision trans- formers","venue":null,"work_id":"bf5d0b48-5bf8-49c4-81ef-d5d19e0808d4","year":2021},"citing_paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:06.804098Z"},"links":{"citing_paper":"/paper/2505.24517"},"observation_digest":"sha256:4027d149b8f9fb3b459eb870c5c99f0d23cbe003216f3323b98227d9563535ef","observation_id":"bc77f57a-521b-4c72-8f61-d3d68647ff96","resolution":{"observed_at":"2026-08-07T12:27:07.219444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24517","last_updated":"2025-05-30T12:29:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:17:06.621849Z","submitted_at":"2025-05-30T12:29:38Z","title":"un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2505.24517."}