{"as_of":"2026-08-13T10:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6d80994a20ec8ecdee1fb19653b86a4a735cf614a341c0e9731d0523581b508","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:01:03.741366Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:17:07.355857Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T23:17:13.799020Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2411.15735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15735","snapshot_observed_at":"2026-08-05T23:17:13.799020Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","venue":"cs.CV","work_id":"b3415012-7168-4329-a6ca-40b0a313c740","year":2024},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-13T01:29:52.382726Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":221,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:07.355857Z"},"links":{"cited_paper":"/paper/2411.15735","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:a245e2062c9e5343959e4d5c8d62be1593b9775651ebc430eba8b70878eaf4a2","observation_id":"cb684f1f-ed82-4bb9-bf15-2a5b600d5309","resolution":{"observed_at":"2026-08-05T23:17:13.804027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15735/citation-record","integrity":"/paper/2411.15735/integrity","json":"/paper/2411.15735/citation-record.json","paper":"/paper/2411.15735"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.428687Z","title":"Tent: Fully test-time adaptation by entropy minimization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.428687Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:1fb105800fd72361acda69d903572c3bb98cdcfedbbc748fb51d84fc6eb1e260","observation_id":"f08db507-ae75-49c3-963d-f5955904e6a8","resolution":{"observed_at":"2026-08-12T14:01:03.428687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.437391Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.437391Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:9197405f49e8d9cc2121fdcb598799c79f9a3d319d83ba7944a96370db9e22c1","observation_id":"46c49f65-5b71-4736-97cf-c8f6ffe35ce8","resolution":{"observed_at":"2026-08-12T14:01:03.437391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:04.663953Z","title":"Delving into out-of- distribution detection with vision-language representations,","venue":null,"work_id":"bd4a3078-452c-470d-a8bc-78524362121e","year":2022},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.446188Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:0d00fe92e0753117e725ec6089825cc5740f61ada0e1227f120bb6edc0f9ddd0","observation_id":"2e5ff6c4-6f14-41bd-a645-0021c18b6300","resolution":{"observed_at":"2026-08-12T14:01:04.676366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.453358Z","title":"Zegclip: Towards adapting clip for zero-shot semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.453358Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:5c8995a6c3d7c26ddd746be2ddb3ca50bfeb8a80fba2e433b2493116051b192b","observation_id":"af9d8b3a-160a-4de5-906a-0b838fcb0bae","resolution":{"observed_at":"2026-08-12T14:01:03.453358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.461119Z","title":"Test-time prompt tuning for zero-shot generalization in vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.461119Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:7bea05763ce88d5611eedc6cb4fda8aa542002008003781938ca3a0c43c0f4ec","observation_id":"0a7052bb-ab3a-4a7a-b0f2-01a71f2f9988","resolution":{"observed_at":"2026-08-12T14:01:03.461119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.471032Z","title":"Diverse data augmentation with diffusions for effective test-time prompt tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.471032Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:f668ee421294a48108a3a6b7ddce5ef753486c023e130cf898afe6af513c3779","observation_id":"8a0479df-7901-4996-bdb2-76b6ab36e820","resolution":{"observed_at":"2026-08-12T14:01:03.471032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.481841Z","title":"Efficient test-time adaptation of vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.481841Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:935d2b6f965b60e223be3c2f0e2021b9e310bf65739290f9bf5072ac6bfacb46","observation_id":"db942817-1d2e-411e-b453-bb4c500ed33b","resolution":{"observed_at":"2026-08-12T14:01:03.481841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.494180Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.494180Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:9eafb7f0dafa31ab0496649f329f880a31a4703b80f645453db427aa693e2bba","observation_id":"e87d1ded-e2d9-48ce-a88b-694c7b1ed8c8","resolution":{"observed_at":"2026-08-12T14:01:03.494180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.501922Z","title":"Reducing domain gap by reducing style bias,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.501922Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:de30ad5a501378247ddcc7f38653f09d2d94204ba46a6a2768013b186e1daf9f","observation_id":"20db518e-459f-41fc-a038-cad76c9c4501","resolution":{"observed_at":"2026-08-12T14:01:03.501922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.507807Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.507807Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:dc824d03f2c96019128fe03ba66f347f199520c56ab4adebceb9397ea4b23b42","observation_id":"3046b4c5-72aa-4f2d-b00e-ba19543476b2","resolution":{"observed_at":"2026-08-12T14:01:03.507807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.521707Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.521707Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:e3d4c870296cc4894a239b436fb03cbe38e285efed1ca34c3737b146c5364839","observation_id":"a2d6e9af-d5aa-4555-bf10-f14d8bbb093a","resolution":{"observed_at":"2026-08-12T14:01:03.521707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.533892Z","title":"Meta-adapter: An online few-shot learner for vision-language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.533892Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:b7c2689cec5ae46e9abf0271c17af22de3410cd41367cd26d353e3062c3a328e","observation_id":"230723c3-bde8-4d6d-a611-01da2decf356","resolution":{"observed_at":"2026-08-12T14:01:03.533892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:04.430504Z","title":"Sam-adapter: Adapting segment anything in underperformed scenes,","venue":null,"work_id":"5e40a808-85cf-4ac4-8524-eaf85461c60a","year":2023},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.541099Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:bbec204f6f3ea17181b1c618fffd2fcd03c47a8d5eff591dbc557d770239a90f","observation_id":"dd086116-0609-4746-bce5-ec75237b3c0c","resolution":{"observed_at":"2026-08-12T14:01:04.458547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.550072Z","title":"T2i- adapter: Learning adapters to dig out more controllable ability for text- to-image diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.550072Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:f34cb051437b0884d79b1f537696eb7a314e9b079cb19aba2504388d894871c0","observation_id":"7f4f5155-cb4b-4593-9846-475fd9a5c50f","resolution":{"observed_at":"2026-08-12T14:01:03.550072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:04.380685Z","title":"On the effectiveness of adapter-based tuning for pretrained language model adaptation,","venue":null,"work_id":"c5441621-90a9-43ba-8448-52db33974cf2","year":2021},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.557563Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:d8ecc2d27dc284ca3986b36de40c7205c5c995fae66d7f10c76470d303a2691d","observation_id":"0531b097-0e24-482b-b584-11acb00ceb86","resolution":{"observed_at":"2026-08-12T14:01:04.387438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.563346Z","title":"Non-local neural net- works,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.563346Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:0b202519b593fb3d957208def7ba7341af985166048f985d799270c2003a1a8e","observation_id":"003ad52b-c0ce-4957-bb1a-678968847919","resolution":{"observed_at":"2026-08-12T14:01:03.563346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:04.340872Z","title":"Deep hdr imaging via a non-local network,","venue":null,"work_id":"dd871cfb-8b97-4583-8740-04ff6bfc8624","year":2020},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.572958Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:8fa3142c25f6f948df78d577717fdc34a1988aec4a69bfbad34e9a9d28dca8c7","observation_id":"83101b7d-5b0c-4b27-8397-d79055b07963","resolution":{"observed_at":"2026-08-12T14:01:04.347036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:04.303771Z","title":"Gcnet: Non-local networks meet squeeze-excitation networks and beyond,","venue":null,"work_id":"807fb8d9-eff2-4f0e-bddc-25396c9eb85c","year":2019},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.579541Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:e5429c5f930172ca7508d7b3e54aac598969b0a2e8874f6dd3e8f0418800187b","observation_id":"6f61b317-bd42-4ee4-9ff6-ecf38de3518e","resolution":{"observed_at":"2026-08-12T14:01:04.315257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.586938Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.586938Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:365b60fa511f0001dedd9b36e443c68a827ad69fd3d130b0ecfb549c70832397","observation_id":"0e8cca97-369e-4138-a6f5-d74e375a0a13","resolution":{"observed_at":"2026-08-12T14:01:03.586938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.593394Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.593394Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:56ac8618d83c7ee4941cf83106f7595ff9e9fef42df0a92ac007fa8cf733bdca","observation_id":"25eee1ad-353f-4e83-849e-1db87ab7297e","resolution":{"observed_at":"2026-08-12T14:01:03.593394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.599296Z","title":"Natural adversarial examples,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.599296Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:7fcd9753c8d20b04e12f14e17c5440ee7c339307c89a7267ce513bcba8e12662","observation_id":"85dd4266-d250-4185-b535-2d5d8c56290f","resolution":{"observed_at":"2026-08-12T14:01:03.599296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.605767Z","title":"Do imagenet clas- sifiers generalize to imagenet?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.605767Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:112c357546420cb76f9c0f41ba2f200790b2f17d6601902c3e2a61c9ef53c941","observation_id":"02883d40-5108-4480-b74b-e2ee57fe6d3e","resolution":{"observed_at":"2026-08-12T14:01:03.605767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.614683Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.614683Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:30832c587d53839875ba69b2d0a349921bb3bbbadd1ecc3865185c79a3f47736","observation_id":"aeba4a97-0d7b-49be-992d-549b8a235b23","resolution":{"observed_at":"2026-08-12T14:01:03.614683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.621859Z","title":"Learning robust global representations by penalizing local predictive power,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.621859Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:4d6eed68d7e3cc7366cd9a93efa1daa7ea40d9a76549870d4ee0cce6be88ab71","observation_id":"064fcb73-0169-4a6d-bed3-c3dab959fe2d","resolution":{"observed_at":"2026-08-12T14:01:03.621859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.628647Z","title":"Cats and dogs,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.628647Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:51b12fa123fa369382e7fc33be1a7b08237ab93a1f074468636009aa863f2a14","observation_id":"556defe0-2b13-4f4a-93b6-12d3e07bb07a","resolution":{"observed_at":"2026-08-12T14:01:03.628647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.636814Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classi- fication,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.636814Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:030a8c1844b2359cd97abfca5aa8a0296224cfddea5d3d1aa10bc9f360691958","observation_id":"636bdf8d-ca92-47a0-a2ae-34be77b27e49","resolution":{"observed_at":"2026-08-12T14:01:03.636814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-12T14:01:03.644111Z","title":"Fine- grained visual classification of aircraft,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.644111Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:b71cf5073aa7173dd5343db269e7a2f31c0aac94db6a458947d5359aeda03a3d","observation_id":"01b18169-c001-4db4-934f-3817804b37b5","resolution":{"observed_at":"2026-08-12T14:01:03.644111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.651194Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.651194Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:38c98fccd9b7ec2b20517209e6baf820badf92fe1e2e1ee4ae9ae7b2ac7fba89","observation_id":"46a677d3-5584-4d37-9f69-019c88ad1cf0","resolution":{"observed_at":"2026-08-12T14:01:03.651194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-12T17:34:19.526460Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-12T14:01:03.657723Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.657723Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:17f3e28301f931d597fdc40e7ef52639a7abd44d1516bc63f3bae8b27b472e29","observation_id":"7177a570-5f34-4bcf-b037-388250ac2c3a","resolution":{"observed_at":"2026-08-12T14:01:03.657723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.668749Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.668749Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:a29bf488b37f12f83a9267fc6fb53826bb674b03dce32286cdf2a08d553cb55f","observation_id":"f3142568-87b5-40ae-8b2d-f333139d967c","resolution":{"observed_at":"2026-08-12T14:01:03.668749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.679835Z","title":"Describing textures in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.679835Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:6b64e35f8285d6799a206a68eeeaacaffccbdca67bc89a50f2fb57ee25808e28","observation_id":"6025d7ab-d41c-4d0a-ad23-10d484180af4","resolution":{"observed_at":"2026-08-12T14:01:03.679835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.686137Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.686137Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:d07c60ad495942cbeceec1a81180513add07f65e65d8ddc27bd83a4fe310d1c7","observation_id":"251f7b29-3466-4b20-838d-3bc810010434","resolution":{"observed_at":"2026-08-12T14:01:03.686137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.694266Z","title":"Food-101–mining discriminative components with random forests,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.694266Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:dfe2750821399cc1d14fbb4b094867113ca66a417b7c7f9f328d09858b86d067","observation_id":"89090f0e-3a9d-424a-af1b-a1a5587273fa","resolution":{"observed_at":"2026-08-12T14:01:03.694266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.700287Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.700287Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:5964050d8090bd28eb8db9216ccfaa110ea85fd82101043b89d4df63da2253c6","observation_id":"afbd4f95-131e-416c-b3d4-505e2383a710","resolution":{"observed_at":"2026-08-12T14:01:03.700287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.709389Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.709389Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:d7386f8555b0e3102fc41eb87bbaf472de7451edca61e90ebd8c54f691a615bb","observation_id":"332bbe8a-9c9c-480e-ab37-b8bc2f0b948b","resolution":{"observed_at":"2026-08-12T14:01:03.709389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:01:03.717611Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.717611Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:4dccbad113d106309d3d63a81249cece7ae2fb39023a9d72bf7d9acac48f7599","observation_id":"42e04e59-a9c3-40fd-b9df-2b42970bf6a9","resolution":{"observed_at":"2026-08-12T14:01:03.717611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.726856Z","title":"Learning to prompt for vision- language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.726856Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:cf9b07d85db3c141eac9befe140c3b5ecbe86213884b65c29e27f3637f13c6f6","observation_id":"30c2ab1b-efe1-4df5-a171-3c490a9fef98","resolution":{"observed_at":"2026-08-12T14:01:03.726856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:01:03.741366Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:01:03.741366Z"},"links":{"citing_paper":"/paper/2411.15735"},"observation_digest":"sha256:5a4e6d4ecfbd096d74ae10eec247a15bc2fc4ab8db85313c782a9b068540d599","observation_id":"9d2dbec9-d3ec-4146-ad3b-df2327a46a98","resolution":{"observed_at":"2026-08-12T14:01:03.741366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.15735","last_updated":"2024-11-24T06:43:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:55:33.798345Z","submitted_at":"2024-11-24T06:43:38Z","title":"Test-time Alignment-Enhanced Adapter for Vision-Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2411.15735."}