{"as_of":"2026-08-22T22:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9606241209b87c801e72cd9e452b3050a233877c5553b27144486c5df427af6b","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:42:16.515695Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15480/citation-record","integrity":"/paper/2507.15480/integrity","json":"/paper/2507.15480/citation-record.json","paper":"/paper/2507.15480"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.968299Z","title":"Align your prompts: Test-time prompting with distribution align- ment for zero-shot generalization","venue":null,"work_id":"a2842196-3321-4ac0-b88b-0203fea4d148","year":2023},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:11.650459Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:e18a72b38e223be82d4152ce07fe1b2b51d618a301ddc20ba8d54f6e907da8de","observation_id":"321dcd3b-9e0e-457d-a8cd-e4970c7b7d33","resolution":{"observed_at":"2026-08-06T15:42:16.970643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.961869Z","title":"Objectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","venue":null,"work_id":"be773514-2ed0-4bc9-8a5e-d58d631e81f0","year":2019},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:11.726490Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:6bea36a1f2218ce47a6aaa2025e1e8992454fb3517aaea8c7edf158d1856702d","observation_id":"dbc2113f-d2af-4331-af92-f33e5587c5db","resolution":{"observed_at":"2026-08-06T15:42:16.964204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:11.878130Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:11.878130Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:142baed18920231baa619810eb1950f338a2043beddbcd643108a7583ef59170","observation_id":"66259e06-ce9c-44cf-aea3-cf82d209198f","resolution":{"observed_at":"2026-08-06T15:42:11.878130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.951247Z","title":"Improved test-time adaptation for domain gen- eralization","venue":null,"work_id":"e4d47604-a4cf-4420-9dbf-927d525d867c","year":2023},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:12.052169Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:803056d13994f6aa998b6d27bf2e4a4e6e29bcf74de68b77f3ebbdd452eae370","observation_id":"ec0bcd0c-b9ed-43de-a3be-9facfa120c7a","resolution":{"observed_at":"2026-08-06T15:42:16.953617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.944629Z","title":"Domain generalization via rationale invariance","venue":null,"work_id":"30eccd69-69c0-4e13-9cb5-3737d4d0e99b","year":2023},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:12.220184Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:6256f28240827b1746ef00627e613e47a24b7dbd4ec4277ab3652bb722203ce2","observation_id":"8dd90c77-46eb-418a-b889-cce7ab4a1de9","resolution":{"observed_at":"2026-08-06T15:42:16.946889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.937660Z","title":"Lfme: A simple framework for learning from multiple experts in domain generalization.NeurIPS, 2024","venue":null,"work_id":"86687735-f2b9-412b-8e15-5ae8cd4d3fd3","year":2024},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:12.385901Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:a51fa8a24994de23e05453d8cdf7d5ac368245e18778ed752dc075ab3c7be433","observation_id":"af2f4e97-fc3f-4daf-beb4-f14c7cc3646b","resolution":{"observed_at":"2026-08-06T15:42:16.939899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.931168Z","title":"A causal inspired early-branching structure for domain generalization.IJCV, 132(9):4052–4072, 2024","venue":null,"work_id":"26711519-f327-40e4-9e93-5c2f8df20a69","year":2024},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:12.550962Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:9c88d5cdb1ffadd6141167754a16aa0ebe75391a0a6b513c5e5b5c0ceedebdf3","observation_id":"65a4ae63-dc37-4d90-b6eb-455391ffeda7","resolution":{"observed_at":"2026-08-06T15:42:16.933568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.924768Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":"a9d7b449-d2c3-472c-9716-c9667819295a","year":2023},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:12.677415Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:e4ef9e9527f946ce4965fa8fcb1b3ccd42e564eb9851f082e8094e88b9001b08","observation_id":"6aab2e37-5c36-4390-b1a9-5944e6855af2","resolution":{"observed_at":"2026-08-06T15:42:16.927106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.918537Z","title":"Describing textures in the wild","venue":null,"work_id":"b83d6860-dded-485f-b021-2808e803a793","year":2014},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:12.812714Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:619c707c184c0fe26aa0cddb5ce60e364ae8785e2977fc5045c7d47527c474d4","observation_id":"253661df-edc8-4635-bca2-256884d2695e","resolution":{"observed_at":"2026-08-06T15:42:16.920711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.912170Z","title":"John Wiley & Sons, 1999","venue":null,"work_id":"ec554e95-7b83-44aa-b027-7a30d7a40d56","year":1999},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:12.992561Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:6aee9a3a38b6ea670a71fd5bbb7c17b20d322a0f800bb06d9e8ab6b02dbc57fc","observation_id":"1cc54bb4-8580-4eb3-8317-0bfbaed4e9aa","resolution":{"observed_at":"2026-08-06T15:42:16.914220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:13.113425Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:13.113425Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:2f987feb53ab23e0fb9c065ff9bb2135600448a5637744fb40d798a14a95c1dc","observation_id":"c8913d0f-2b25-4327-885d-1f98ac450c8e","resolution":{"observed_at":"2026-08-06T15:42:13.113425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.902035Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"9b6f2915-a5ff-4417-8555-078be7a27983","year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:13.269657Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:27545876bd1ce17b341c8dc41d18cf83c23dff5cbdf5a1235df30dfb9d1ba6bb","observation_id":"e19a8c1a-3472-4ffb-a77d-1483c2b7f8e2","resolution":{"observed_at":"2026-08-06T15:42:16.904261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.894837Z","title":"Magma–multimodal augmentation of generative models through adapter-based finetuning","venue":null,"work_id":"d534ac04-d0b9-4119-91d6-72e7d4139bd4","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:13.459632Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:71bf373720e94769c1339802e97e1ab7c2a3d8409626c11b996c60ae00a80340","observation_id":"b77fccd7-91ff-4a65-b4f8-0ace6adb402b","resolution":{"observed_at":"2026-08-06T15:42:16.897187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:13.614063Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:13.614063Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:05e425aba5821aeb5fb2acd517abf46545168eaec86d14a661e5a8abc74d66f3","observation_id":"63c7dc0a-99c8-4bbd-8d14-a5b0aae12bf4","resolution":{"observed_at":"2026-08-06T15:42:13.614063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.884636Z","title":"Clip-adapter: Better vision-language models with feature adapters.IJCV, 132(2):581–595, 2024","venue":null,"work_id":"d744eebe-c6f7-46c6-a5d9-5ee0b6ffd714","year":2024},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:13.758312Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:74a585ef96f93f20ddfc6a2d5d78d074305d8ea96c45f909473563d285857015","observation_id":"48dc7b24-8868-4700-93c9-f2e04161c3ad","resolution":{"observed_at":"2026-08-06T15:42:16.887176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.877775Z","title":"Finetune like you pretrain: Im- proved finetuning of zero-shot vision models","venue":null,"work_id":"7daa77df-3a72-4b07-bbbc-13e662824c8e","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:13.910566Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:583fab9425bc52ff77776eb39ffdb9e64e17b26fb003ea9e0062a9d03297769c","observation_id":"bfeb9dd3-97c7-405c-9b5f-1a680497910f","resolution":{"observed_at":"2026-08-06T15:42:16.879928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:14.055195Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:14.055195Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:0cf5e6cbccff55b4e018fd4580c973c946870379a06cedb14cdaed3f048dbe34","observation_id":"30bef324-0875-4ee7-ba15-1c57cab3c218","resolution":{"observed_at":"2026-08-06T15:42:14.055195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:14.224047Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:14.224047Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:b235cb96dbf1c8236c86f0a718f075b123d7bba378b04ef6e4b9516206a3b4b2","observation_id":"e558ee89-7489-4ad1-a3ac-1ae16a029c01","resolution":{"observed_at":"2026-08-06T15:42:14.224047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.863483Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization.ICCV, 2021","venue":null,"work_id":"ada63da9-0576-42ec-9af1-5f0f619f73a5","year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:14.361257Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:74198489659312ac6787e98a8be0b71e80d182fe62067b3843ba039d64498d44","observation_id":"c9983d55-8e37-4b6c-b9e2-c95356ff1d3e","resolution":{"observed_at":"2026-08-06T15:42:16.865977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.856928Z","title":"Natural adversarial examples","venue":null,"work_id":"18ca2958-73be-47b9-b2e2-d9086e95c6f2","year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:14.504720Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:cc9967be6d48d5d8b7d4748148602b355db18e51851f98a1e0763916dd1de98b","observation_id":"988166e3-e1f1-4edf-97e3-3ad96b945bfc","resolution":{"observed_at":"2026-08-06T15:42:16.859038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.850503Z","title":"Open- clip, 2021","venue":null,"work_id":"af3e1f05-b1ad-4ae0-b5a4-fed744692220","year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:14.637867Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:58d17c80e8068b10e836d66cc1b4a1f40d37c89e6b93157285d13401e995a0d0","observation_id":"2786a37f-8214-4474-853d-a8637647470e","resolution":{"observed_at":"2026-08-06T15:42:16.852641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.844088Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"6dae1d0e-e4e4-4463-bdb1-2fc57391448d","year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:14.799608Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:f7b14d0102f9c4d74de959abfcec4728b541d50a21533ad41273f2db99480428","observation_id":"a6a73f54-886b-4776-86a7-b67ebc3b9008","resolution":{"observed_at":"2026-08-06T15:42:16.846580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.837918Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"86a05f55-4085-459c-83c7-9370a3bb73cd","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:14.965203Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:77466d90f8f044f350c16e673a83c6a2b9cf07ffc2de98146384212e5ed99795","observation_id":"6bb61b29-3ceb-4454-bbde-9bf854be401b","resolution":{"observed_at":"2026-08-06T15:42:16.840036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.831409Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"75633337-952d-4c05-b719-9b8b2f517938","year":2023},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:15.153022Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:c684c13a5bb9d1917835b79307114667418e9edb4143a10bbbccb4a20e8b47ab","observation_id":"15eb36b3-c394-4a95-bc76-f5b6466dfb38","resolution":{"observed_at":"2026-08-06T15:42:16.833700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:15.303596Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:15.303596Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:01ca9399e638e178a3f37e237e4f0e2e552702205fc6a0b499af08217bca3a43","observation_id":"ea2d5154-40d3-4ea3-8bbb-33e6ea943c4c","resolution":{"observed_at":"2026-08-06T15:42:15.303596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.821030Z","title":"Fine-tuning can distort pretrained fea- tures and underperform out-of-distribution","venue":null,"work_id":"57bb2e53-b7ec-4ddf-b06c-ac859a108f08","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:15.455137Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:5cc9e51632549c2793bfab1805e82691865e7041c343400ae999f2dce104b07a","observation_id":"56fa0de1-2420-437c-8f1b-e48b6b17d613","resolution":{"observed_at":"2026-08-06T15:42:16.823263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.814186Z","title":"Su- pervision exists everywhere: A data efficient contrastive language-image pre-training paradigm","venue":null,"work_id":"05df76c1-0973-4556-9aed-69fd57ecff58","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:15.619578Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:e4f80712880c813acf3861e0c6d5bfdfe7ef634ec78500dbc64463f12825fbac","observation_id":"e25a7b87-2e78-4a2e-bbd8-28c9b150114f","resolution":{"observed_at":"2026-08-06T15:42:16.817023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.806940Z","title":"Ttt++: When does self-supervised test-time training fail or thrive? InNeurIPS, 2021","venue":null,"work_id":"55a024c9-5bf8-490c-9e17-d02ba4c418ba","year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:15.750028Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:0e571cc435077d57c9097157f01c0bb589a2ce08ea8cfac2b75ea5c78b94ab4e","observation_id":"00737bd9-52cf-4d5f-9bb6-4760ecf175a5","resolution":{"observed_at":"2026-08-06T15:42:16.809627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.800490Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"9cdcb550-5569-41cd-ad49-b2e79102251c","year":2019},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:15.980425Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:a1bcb4fa3c8bffe7b7c0cb5be8aca9113069eadfff3d92af33463735cc70b98c","observation_id":"053395b7-fb28-4de3-ba59-055f091220e1","resolution":{"observed_at":"2026-08-06T15:42:16.802900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.14745","last_updated":"2021-11-29T17:49:24Z","snapshot_observed_at":"2026-08-18T04:04:22.310952Z","submitted_at":"2021-11-29T17:49:24Z","title":"A Simple Long-Tailed Recognition Baseline via Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.14745","snapshot_observed_at":"2026-08-06T15:42:16.043292Z","title":"A simple long-tailed recognition baseline via vision-language model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.043292Z"},"links":{"cited_paper":"/paper/2111.14745","citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:0af0735871cde56d82830fc182326264e87df2049423fd183a3f763228088357","observation_id":"a2ac80c5-e7ab-46a5-95d3-68808ae6df8e","resolution":{"observed_at":"2026-08-06T15:42:16.043292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-06T15:42:16.121014Z","title":"Fine-grained visual classi- fication of aircraft.arXiv:1306.5151, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.121014Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:dfea561da31c466b3774fb5d6b168660775c351b21373a278f7a5a353b476e07","observation_id":"36181347-35d0-41b1-9d1a-f95f1aa1c8d8","resolution":{"observed_at":"2026-08-06T15:42:16.121014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.244453Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.244453Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:093f1e943ebf0c98af0eb8a9d865606ba01ddbb7a40f95d3106aa314d328bce1","observation_id":"020b82f6-5802-4349-bdb6-8cce96cb92ea","resolution":{"observed_at":"2026-08-06T15:42:16.244453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.350170Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.350170Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:1d636685f618b00371e4636b9a7cd0a5ac3e716dab38d7d5335154c2bf9f6e4f","observation_id":"c6adfb22-443e-4f5c-93f8-203da76a9710","resolution":{"observed_at":"2026-08-06T15:42:16.350170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.786649Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"2fcee1a9-8852-4aee-a9c6-83542ce062d6","year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.423283Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:7e9a72558f02f8c4f8ed203fe4ccd0d73e8e9857d05f69854e3a9bed939cd0d9","observation_id":"779e1ce5-b2f5-4364-ae70-0edef3638ac0","resolution":{"observed_at":"2026-08-06T15:42:16.788954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.428228Z","title":"Do imagenet classifiers generalize to im- agenet? InICML, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.428228Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:69204d38680b72a7b0cf0826d59b81f3d4f6b150b0befe7b67db05306426c1b5","observation_id":"2f9248d8-b7b1-47f7-9218-c9d206f1f8e6","resolution":{"observed_at":"2026-08-06T15:42:16.428228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.776204Z","title":"Towards parameter-efficient integration of pre- trained language models in temporal video grounding","venue":null,"work_id":"049bc6cd-b20b-40f8-ba45-cc369d4f2f47","year":2023},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.430708Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:ec4fc860226a17443ec6f09b7562991ba60444281233da51c6cf86cced1b9da6","observation_id":"2619913b-af4b-4c99-a640-00c443a5023c","resolution":{"observed_at":"2026-08-06T15:42:16.778807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.769476Z","title":"Test- time prompt tuning for zero-shot generalization in vision- language models","venue":null,"work_id":"00f85848-fd45-4604-93bd-c8cfbc10e146","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.432660Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:84dbc0202da05b2e4526561993a3339105ce18ac42f8fa7892024807d5c6585e","observation_id":"fa70a0ce-9d68-4777-bb3e-bc0d626848ec","resolution":{"observed_at":"2026-08-06T15:42:16.772165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T15:42:16.434722Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild.arXiv:1212.0402, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.434722Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:ad8cd3da7e3cbb54f6854904737c5fdf70f7f1af42ebb998466ec4f8011cf7ec","observation_id":"cad5eda9-24c2-4941-a8ea-f89d0c988cf1","resolution":{"observed_at":"2026-08-06T15:42:16.434722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.762677Z","title":"Test-time training with self- supervision for generalization under distribution shifts","venue":null,"work_id":"c5a50cae-f396-43b5-9f9c-34e7abac9e24","year":2020},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.437649Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:34cb4413242509c624b8fe37074d6fcf8c4639cec625d8db1a98e89686a3cf01","observation_id":"d23df06a-72b1-4b50-a336-8ed954083cb1","resolution":{"observed_at":"2026-08-06T15:42:16.764962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.756237Z","title":"Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks","venue":null,"work_id":"c512aa21-0b68-4210-b199-6fd7a3c5952a","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.439970Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:ec523e512399c218162b163cefeac56774f5298bf8a31b22d97cbfd3b8414057","observation_id":"a5c4ec97-e1bc-4078-8841-06758dd210df","resolution":{"observed_at":"2026-08-06T15:42:16.758464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-16T09:10:10.815975Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-06T15:42:16.441899Z","title":"The information bottleneck method.arXiv preprint physics/0004057, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.441899Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:fa2606c62e35da54b2cc2c6747daa4fd4031cf279b19665c69963cec0f8f840b","observation_id":"2f8b4646-4474-4279-8f55-9ed25583b46c","resolution":{"observed_at":"2026-08-06T15:42:16.441899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.749513Z","title":"Visualizing data using t-sne.JMLR, 9(11), 2008","venue":null,"work_id":"f028042d-ec23-4837-882d-eb89a9031c14","year":2008},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.444249Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:931f296472b3cd1edbb614acdda39b325dba18b144740498adae2acdc0565fb5","observation_id":"79f71ec9-7d94-430d-81a9-ec98b2ea5d3d","resolution":{"observed_at":"2026-08-06T15:42:16.751715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.742984Z","title":"Attention is all you need","venue":null,"work_id":"e0dcc1aa-8cc0-469a-89ed-45e6ca591dff","year":2017},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.446291Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:8d67052f5cec3ce0547701ff7fb5acf60b287a221edbfad187093877257021fa","observation_id":"31758730-5040-4e60-9897-046bdc88e252","resolution":{"observed_at":"2026-08-06T15:42:16.745284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.736809Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":"d225cecb-fae6-44e3-b8bf-27c76f6e8d41","year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.448328Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:f42705a6d572876158129d56c34ee6d6124ada976f2595c9299e1be3d1a44f49","observation_id":"b23944ac-2d87-4188-9460-edcc38dc012a","resolution":{"observed_at":"2026-08-06T15:42:16.738958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.450753Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.450753Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:0ece7e6092c92b6aa3a7fd2f2560c4308b9be43cbd62025636359afaef0218f8","observation_id":"4e166775-ef4f-4b91-87ff-cbddc4eca21e","resolution":{"observed_at":"2026-08-06T15:42:16.450753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.726294Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"0af8071c-3690-4f51-8f10-62c7f0521d42","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.452861Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:c68c3715915fb3b93e09103b3a0127fc4f0c7bd9a82a121d010cdadceec69976","observation_id":"95dd0666-7e44-4b3e-bf21-8c59c4a10674","resolution":{"observed_at":"2026-08-06T15:42:16.728739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.455470Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.455470Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:a1c199c452b9f8f0f25aea7c685c9fe3f50d2b9e0a9ae5c8aeeb6f5b43d3948b","observation_id":"22ddd1b0-7c36-4a93-bdb6-e26ff3c73e1e","resolution":{"observed_at":"2026-08-06T15:42:16.455470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.714086Z","title":"Explicit inductive bias for transfer learning with convolutional net- works","venue":null,"work_id":"e406ac0d-227e-4ff4-9205-470748074c98","year":2018},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.457851Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:61aa502ce887c92d7435c570babac5205a9b27e2b6f184d940ae199db165c68c","observation_id":"b49a82fa-951f-48ef-9666-241c2e2cf0a3","resolution":{"observed_at":"2026-08-06T15:42:16.716235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.708317Z","title":"Mma: Multi-modal adapter for vision-language models","venue":null,"work_id":"ca825808-02d6-422e-a92f-d970fce61e82","year":2024},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.460336Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:7a46ca1270d049e2493ee8c8cef66d9ab8958e1a3e17f4d3a942e6cb29fec296","observation_id":"ba807956-e646-412e-875f-fdfec71eced4","resolution":{"observed_at":"2026-08-06T15:42:16.710424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.701844Z","title":"Visual- language prompt tuning with knowledge-guided context op- timization","venue":null,"work_id":"25eb09a0-a511-4b06-8f31-87e41e319228","year":2023},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.462589Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:0fb2c1fe428cbcdab5558fe4b71c0b314db75e06cff55521345a384b4c38e823","observation_id":"83eff9e0-d053-41ee-86eb-3dab779de8c0","resolution":{"observed_at":"2026-08-06T15:42:16.704017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.695621Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":"4201f925-8b99-4a41-8ddb-d27c6e28e660","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.464690Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:02a151a6f9f6803f3cf305f453485bd2251c6178a273a2857beeb5bb2485544c","observation_id":"05fd11fb-97eb-45ba-9795-134c26d756d9","resolution":{"observed_at":"2026-08-06T15:42:16.697968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-06T15:42:16.466941Z","title":"Florence: A new foundation model for computer vision.arXiv:2111.11432, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.466941Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:bb4f0d45f100402c83587d29e48453a81cc13e27bd0d6b8907801a38129a6e81","observation_id":"e04ae707-b228-4540-b38a-0bd58c63ec1b","resolution":{"observed_at":"2026-08-06T15:42:16.466941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.689067Z","title":"On the test-time zero- shot generalization of vision-language models: Do we really need prompt learning? InCVPR, 2024","venue":null,"work_id":"945fc5ed-e761-4afb-ae39-0e8b041fe801","year":2024},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.469568Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:a5c8ddb94b00d635a3e84b593f95e978ad15ef472b6f3e210074574b17ad2f80","observation_id":"9ce889c6-3b7b-4414-9249-2591b49e9343","resolution":{"observed_at":"2026-08-06T15:42:16.691779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07225","last_updated":"2022-10-13T17:50:24Z","snapshot_observed_at":"2026-08-18T09:28:49.447974Z","submitted_at":"2022-10-13T17:50:24Z","title":"Unified Vision and Language Prompt Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07225","snapshot_observed_at":"2026-08-06T15:42:16.472212Z","title":"Unified vision and language prompt learning.arXiv:2210.07225, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.472212Z"},"links":{"cited_paper":"/paper/2210.07225","citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:a61553052bdd3ac497676cf463de143b8988674f2d40cf3e0353a6b7451e55b5","observation_id":"4e1bf780-8215-4fab-ba9e-e3142fd70d09","resolution":{"observed_at":"2026-08-06T15:42:16.472212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.682927Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"795e61d8-bc85-46d6-9f46-2a9166c876cb","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.474653Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:7c21fa6f92b72e5d4f0198065ca0a08e9f437dac03397a203e0689eb57196b69","observation_id":"3f0159fe-460e-41d4-951d-032cbe362786","resolution":{"observed_at":"2026-08-06T15:42:16.685112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.676452Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"9f708173-53e7-4982-8150-b0ee38d984f7","year":2023},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.477069Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:093c9ec10d3485bbd7fe2cfe88d4d2303229357d3cd2d025ff55435c315fbe76","observation_id":"f11ace67-f3e9-4537-9b16-8c6aa389621e","resolution":{"observed_at":"2026-08-06T15:42:16.678790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.669882Z","title":"Dept: Decoupled prompt tuning","venue":null,"work_id":"e7d447cd-68cf-4aed-95a2-ec247ed53960","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.479244Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:30e707e8c96b7f97dcca3d1a0b77984640dec227223c54442dc46f33b4271428","observation_id":"10b35865-6f5b-4912-9a6a-262893b6697f","resolution":{"observed_at":"2026-08-06T15:42:16.672157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.662172Z","title":"Tip-adapter: Training-free clip-adapter for better vision- language modeling","venue":null,"work_id":"4f5653d6-70cb-45b6-b492-036f798693ec","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.481674Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:93f0e9915f07632ab964422cc899492308729f8edc48bfe55743d41061e69a66","observation_id":"b16be42a-3d49-4ac0-bd57-2a0ff8eb4a0d","resolution":{"observed_at":"2026-08-06T15:42:16.665583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.655816Z","title":"Contrastive learning of medical visual representations from paired images and text","venue":null,"work_id":"8779540b-f0d4-41bf-945c-6b905438e783","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.484156Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:9673cb3101484dacf360c86c9d8593cd84d5e8109d4b277aaf9aaa61ed1f38e2","observation_id":"4ad50816-c248-4367-a7d6-41b1f42c3860","resolution":{"observed_at":"2026-08-06T15:42:16.658055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.649393Z","title":"Test-time adaptation with CLIP reward for zero-shot gener- alization in vision-language models","venue":null,"work_id":"a43ad995-85fa-429f-98ef-36bba4e6b7d8","year":2024},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.486387Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:80e36f9470dbc0af026e72989ea7ecea4ccfb2057858b7bf4218817070772bb1","observation_id":"0b89c9b0-e712-437e-8243-2b5620fdf9ee","resolution":{"observed_at":"2026-08-06T15:42:16.651821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.642004Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"2d9ee485-afde-4c49-894c-8c8ed0301212","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.488483Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:3d28f0c272d2c1d59db33d41406aae72939837a71e587450f98d1ed61a810d10","observation_id":"094ee6ae-acb3-4ee1-844f-fa96c536c8ce","resolution":{"observed_at":"2026-08-06T15:42:16.644663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.634471Z","title":"Learning to prompt for vision-language models.IJCV, 130(9):2337–2348, 2022","venue":null,"work_id":"2cbea475-ff78-4a12-9c17-e0e6009207e5","year":2022},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.490812Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:f4141433652244c9b454c0a1197b5ce172f7ef60680efb45faa3f9a37a77d348","observation_id":"103dbb33-df2f-4fcb-b776-e99d61f8419d","resolution":{"observed_at":"2026-08-06T15:42:16.637664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.493608Z","title":"Prompt-aligned gradient for prompt tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.493608Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:f2c3225aa475d880f95badbf7fe7acb204c0bb79cb0a8c8f4a3f6cd8783058fd","observation_id":"573d9c7d-1b03-47f8-99ba-c30e38096a83","resolution":{"observed_at":"2026-08-06T15:42:16.493608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.617327Z","title":null,"venue":null,"work_id":"641da9bd-7328-43a6-a97c-cc6c958d8f89","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.498525Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:865d6845ac3d7dd8325af990f57a2d8dda5dc50795e681ea9c6b53a508545f5a","observation_id":"bbe56590-6381-4766-a7ea-2159f28bd6bb","resolution":{"observed_at":"2026-08-06T15:42:16.619436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.610333Z","title":null,"venue":null,"work_id":"26b43ddb-ab73-44b6-8435-2026bff2df93","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.501196Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:c7595444568595c63871f06522a4e7af4453109af16898b693d8fe52c94b54ac","observation_id":"3359f93b-f114-44d9-a5c1-434bc51df1ab","resolution":{"observed_at":"2026-08-06T15:42:16.612667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.603414Z","title":null,"venue":null,"work_id":"be1f41c6-e437-48ec-bd04-c723a59c9f9c","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.503631Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:e06ea3704c142af57d47f6c6c6c0623e3e0b39176278b2e34540617a8679ccbf","observation_id":"a7c747b0-b24a-4f85-ac34-562a4dadde03","resolution":{"observed_at":"2026-08-06T15:42:16.605544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.596958Z","title":null,"venue":null,"work_id":"0be57f72-75de-4abd-9727-58e2b0c06f7a","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.506226Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:fb7af658074198ab4dd266d2010716d051b1e1a82af6bb8fab261f2870995397","observation_id":"23b32ef5-7b8d-43de-a7c6-b7ba33d02163","resolution":{"observed_at":"2026-08-06T15:42:16.599082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.590417Z","title":null,"venue":null,"work_id":"6d27d3a3-3d84-4736-bee2-eb3ef3b846ab","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.508717Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:2cc2a335eee229e721555e543437a2a7de417bdb7e8fd1dcbd50a8ba25feabf9","observation_id":"ffd7b327-ec0f-407e-8e76-a9be7d8984ad","resolution":{"observed_at":"2026-08-06T15:42:16.592721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.584396Z","title":null,"venue":null,"work_id":"5eebebae-acea-4e37-a06f-b6713db3e08a","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.510946Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:420e40ba828f2961bbafcd85c4110c92495fecba6287afb212c9e02bf3a51505","observation_id":"9b1e13f8-f4e7-45d9-9509-873b823b639d","resolution":{"observed_at":"2026-08-06T15:42:16.586440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.578124Z","title":null,"venue":null,"work_id":"048c2f70-435e-490f-9048-44e813c36e9c","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.513762Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:a36ba4ffef4f41d6e5128ee5c9e156c55b50b77ae8456edf6985b8dbfbf4eb06","observation_id":"af778d57-1ff4-4d95-b488-6d4e478ff2d8","resolution":{"observed_at":"2026-08-06T15:42:16.580101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.570124Z","title":null,"venue":null,"work_id":"30c6775d-ae0a-426e-aad3-46250d1d6961","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.515695Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:98fc18e601ef1ed40669f4b40b263a78cdc4dc8b8c8d7bbc0ab3cc2e42fc2680","observation_id":"e4ec6e15-a9f9-4fca-afb6-33c5f6a5e5d1","resolution":{"observed_at":"2026-08-06T15:42:16.573354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:42:16.623458Z","title":null,"venue":null,"work_id":"004714a5-19ea-4cd7-affb-ea405c750451","year":null},"citing_paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:42:16.496076Z"},"links":{"citing_paper":"/paper/2507.15480"},"observation_digest":"sha256:0b76f030898c84055c0107021fd6662ae1f43167d5057f7581857a0c3662ce07","observation_id":"c9bf58b0-bae0-4806-bfdc-3dc927ec7d76","resolution":{"observed_at":"2026-08-06T15:42:16.625722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.15480","last_updated":"2025-07-28T04:47:15Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T16:59:22.499731Z","submitted_at":"2025-07-21T10:35:32Z","title":"One Last Attention for Your Vision-Language Model"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2507.15480."}