{"as_of":"2026-08-08T15:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:784fd3f9eb32a87e2d58d8006a19e86775bb9e7429bd1ceaa2836f4a7a553404","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:52.768260Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T23:23:36.310592Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T18:08:55.311069Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2208.01618"},"observation_digest":"sha256:fe1a0abae66617ed639a39fe8e2585ec328f8fc725dfc68bb451c6920480aee8","observation_id":"b72a58df-b73e-4dff-bf74-7be0b4222d5e","resolution":{"observed_at":"2026-05-11T18:08:55.450615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T22:43:10.880338Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2302.05543"},"observation_digest":"sha256:6112e362562862c1d168cc467c60e3fa541fd428d05380cc2639739b72413f7c","observation_id":"bbf81b39-5674-4d5a-898e-052eaf597d6d","resolution":{"observed_at":"2026-05-16T22:43:10.987817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T11:11:36.847364Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2303.05499"},"observation_digest":"sha256:50d4ade82449975dc57e7d60529829b94bc980c6e33646558ea1938690304992","observation_id":"c097a2d0-d901-4d7a-83f4-fb2e73ffe158","resolution":{"observed_at":"2026-05-11T11:11:36.979529Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":202,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:a3bec339281320b1f16a9898b060438bd0400f1d71d5bf11bb20ef5014129899","observation_id":"28e64406-67e1-4019-ba21-738b2169d270","resolution":{"observed_at":"2026-05-14T23:07:42.951425Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T08:41:04.743886Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2304.15010"},"observation_digest":"sha256:c5e64c6694d6d58ce35ff673eaf6da45cf87f9e4f531a8b9b7740615713710ea","observation_id":"61a35d66-312c-4a3f-be7a-6e7bfc6afb7b","resolution":{"observed_at":"2026-05-15T08:41:04.876978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"reference_index":195,"source":"arxiv_source","source_observed_at":"2026-05-15T16:35:47.826165Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2312.17090"},"observation_digest":"sha256:38ea0421e41d3bfdd6249764654709a9a5654c41ba0e4748a1d93a83d98a75c2","observation_id":"6424d0d0-15a5-4132-a410-f31e6449ce9d","resolution":{"observed_at":"2026-05-15T16:35:48.111287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2407.17491","last_updated":"2026-04-03T23:10:26Z","snapshot_observed_at":"2026-08-02T18:34:18.562354Z","submitted_at":"2024-07-04T02:35:00Z","title":"Robust Adaptation of Foundation Models with Black-Box Visual Prompting","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T23:23:03.562550Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2407.17491"},"observation_digest":"sha256:ba65148597ba39d00ca40d982e9eb6d29a9fcf4b3632399ea8f36c9d76955670","observation_id":"a2026741-05e0-45bf-b428-d6a4a0b0eb3f","resolution":{"observed_at":"2026-05-23T23:23:36.314337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-07T14:25:52.768260Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.768260Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:f3c516d0ca371f9792da4eb49614df40b681e79508d194702ad46b928a17189e","observation_id":"816bed74-d1f1-4642-bb44-4ad8b8361707","resolution":{"observed_at":"2026-08-07T14:25:52.768260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-07T12:52:46.278075Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:46.278075Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:76934ca470376c6b6618fe2678914fb1c06a42e72f16461bfab65bc27472fad4","observation_id":"e0bfc597-ddae-4ac7-9bf9-2bf7e9f83ac8","resolution":{"observed_at":"2026-08-07T12:52:46.278075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-07T12:41:47.428858Z","title":"CLIP-Adapter : Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24088","last_updated":"2025-05-30T00:16:53Z","snapshot_observed_at":"2026-08-08T02:54:22.698846Z","submitted_at":"2025-05-30T00:16:53Z","title":"Proxy-FDA: Proxy-based Feature Distribution Alignment for Fine-tuning Vision Foundation Models without Forgetting","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:41:47.428858Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2505.24088"},"observation_digest":"sha256:325643ec4227a42028305dee43ff0e3fdfb71194307d16060ac5db0bb3708529","observation_id":"8d07c900-70c3-42d7-ae87-1fd1be7b6793","resolution":{"observed_at":"2026-08-07T12:41:47.428858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T19:51:52.021631Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.021631Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:6f83933192001e1dc18d7af0b8d7d5a0fb674da701cafc2b1f0aff85fb334271","observation_id":"7b745bcb-5c88-475d-b6fc-c15536b35469","resolution":{"observed_at":"2026-08-06T19:51:52.021631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T16:45:01.932831Z","title":"Clip-adapter: Better vision- 5 language models with feature adapters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12750","last_updated":"2025-07-17T03:08:26Z","snapshot_observed_at":"2026-08-07T22:19:30.108386Z","submitted_at":"2025-07-17T03:08:26Z","title":"Multimodal-Guided Dynamic Dataset Pruning for Robust and Efficient Data-Centric Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T16:45:01.932831Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.12750"},"observation_digest":"sha256:ee23fd376e9d8b1440b9e817441946960a1d10368e36dc07814852042acb2af6","observation_id":"0041a258-e634-4362-89d4-a2981ace20f3","resolution":{"observed_at":"2026-08-06T16:45:01.932831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T16:37:18.530702Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:18.530702Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:d5cc8cff0dab72745238f62c66dcb48b6b724a6dc186d4d9748b89773918d0b5","observation_id":"062cd90d-afa2-40bf-b4ed-a5ecf1e1fef6","resolution":{"observed_at":"2026-08-06T16:37:18.530702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T13:56:31.568388Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19908","last_updated":"2025-07-26T10:41:55Z","snapshot_observed_at":"2026-08-06T13:56:30.980881Z","submitted_at":"2025-07-26T10:41:55Z","title":"TrackAny3D: Transferring Pretrained 3D Models for Category-unified 3D Point Cloud Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:31.568388Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.19908"},"observation_digest":"sha256:40d7a6540980f11696c52b0058530f413ee2a42e5f63a226a1213434c691efc6","observation_id":"5b1d91b1-9982-4e84-9702-900d907448db","resolution":{"observed_at":"2026-08-06T13:56:31.568388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T13:23:34.803336Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20745","last_updated":"2025-07-28T11:52:56Z","snapshot_observed_at":"2026-08-07T22:14:10.868497Z","submitted_at":"2025-07-28T11:52:56Z","title":"Regularizing Subspace Redundancy of Low-Rank Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:23:34.803336Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.20745"},"observation_digest":"sha256:20ea66dac4686287b2890df01c8773a1fd863a65607241a109f91046f6da82f9","observation_id":"050025fe-d975-4125-8a71-5a79d424d946","resolution":{"observed_at":"2026-08-06T13:23:34.803336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-05T10:38:32.816317Z","title":"Clip- adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03895","last_updated":"2025-09-04T05:42:02Z","snapshot_observed_at":"2026-08-08T05:55:17.633643Z","submitted_at":"2025-09-04T05:42:02Z","title":"Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:38:32.816317Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2509.03895"},"observation_digest":"sha256:b53adf2ed31a4f5bec01c47d1a44e43aa04c8a4997ba60d18e3a7f848816009a","observation_id":"2a6c4d74-0d82-42b3-95e9-63219634dfb2","resolution":{"observed_at":"2026-08-05T10:38:32.816317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2601.09746","last_updated":"2026-01-11T20:36:47Z","snapshot_observed_at":"2026-07-06T22:41:43.594456Z","submitted_at":"2026-01-11T20:36:47Z","title":"Multi-Agent Cooperative Learning for Robust Vision-Language Alignment under OOD Concepts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T15:22:35.204623Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2601.09746"},"observation_digest":"sha256:583986a356b5e9737906ab64df116780dace4bc7c1a1866ed2b5f687bc677580","observation_id":"79b66bf9-aea1-449c-a6a8-283d765ac7da","resolution":{"observed_at":"2026-05-16T15:23:01.918374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2603.03577","last_updated":"2026-05-13T20:51:32Z","snapshot_observed_at":"2026-08-06T23:44:49.959863Z","submitted_at":"2026-03-03T23:11:17Z","title":"From Local Matches to Global Masks: Template-Guided Instance Detection and Segmentation in Open-World Scenes","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T16:19:15.019645Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2603.03577"},"observation_digest":"sha256:c19d9545d32265307e8a604b5ab87d1ce597e2261945d5b7952f14219f3206e0","observation_id":"afbdcc36-e4aa-4436-8e10-50a70d4dc60e","resolution":{"observed_at":"2026-05-15T16:20:09.709803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2605.06477","last_updated":"2026-05-07T16:01:59Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T16:01:59Z","title":"GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T13:17:48.295630Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2605.06477"},"observation_digest":"sha256:52f4e1b79dcf8aed0a4351cbf6d7a353dee6108c21dc6566e02066983196a547","observation_id":"bb36a05e-73be-4bb2-ab22-3274e1625924","resolution":{"observed_at":"2026-05-11T18:56:06.912472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":"2110.04544","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":"27d73cce-f5b6-4e7e-9173-584dd7fb6cfc","year":2021},"citing_paper":{"arxiv_id":"2605.11939","last_updated":"2026-05-12T10:50:43Z","snapshot_observed_at":"2026-08-06T06:51:52.292771Z","submitted_at":"2026-05-12T10:50:43Z","title":"Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:56:31.648428Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2605.11939"},"observation_digest":"sha256:ecdadca1c13254c3c65f194435ca29dc27bcbb7425685bd557ce9814b0e02141","observation_id":"a6d60b2f-8e99-4e12-bb6e-c15450028fd8","resolution":{"observed_at":"2026-05-13T05:57:22.563299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2110.04544/citation-record","integrity":"/paper/2110.04544/integrity","json":"/paper/2110.04544/citation-record.json","paper":"/paper/2110.04544"},"outbound":[],"paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2110.04544."}