{"as_of":"2026-08-08T02:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fcfb1d52f9b792a5d7bee8f13d2447c70b028995d1cdb9594ce1eecc3652a4cd","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:30:26.374735Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21755/citation-record","integrity":"/paper/2505.21755/integrity","json":"/paper/2505.21755/citation-record.json","paper":"/paper/2505.21755"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.381515Z","title":"To- wards Causal VQA: Revealing and Reducing Spurious Cor- relations by Invariant and Covariant Semantic Editing","venue":null,"work_id":"d5d4398f-6951-4b78-9cee-6a61dc55b09f","year":2020},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.018950Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:83b6c36ecd9acf4397ede3cefcb5c7fe99b0e7ceb09448a5981ab54cfa02b79d","observation_id":"99298249-d5ce-4d24-b7ed-7a2ec893d70d","resolution":{"observed_at":"2026-08-07T13:30:36.480682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00377","last_updated":"2018-06-03T15:32:06Z","snapshot_observed_at":"2026-08-02T15:53:30.552107Z","submitted_at":"2017-12-01T15:48:50Z","title":"Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00377","snapshot_observed_at":"2026-08-07T13:30:19.101688Z","title":"Don’t Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.101688Z"},"links":{"cited_paper":"/paper/1712.00377","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:4bd7873bfbba318b3050bd7edd2685d51945e5a2a90c72f5840e98f755dcf105","observation_id":"7c3886df-9f77-4bec-8bf0-cc141573074c","resolution":{"observed_at":"2026-08-07T13:30:19.101688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12191","last_updated":"2023-04-01T07:07:44Z","snapshot_observed_at":"2026-07-06T13:13:29.808768Z","submitted_at":"2022-05-24T16:44:45Z","title":"Reassessing Evaluation Practices in Visual Question Answering: A Case Study on Out-of-Distribution Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12191","snapshot_observed_at":"2026-08-07T13:30:19.222653Z","title":"Reassessing Evaluation Practices in Visual Ques- tion Answering: A Case Study on Out-of-Distribution Gen- eralization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.222653Z"},"links":{"cited_paper":"/paper/2205.12191","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:9db3019581ef88ebb47d5ead9bd700c8ff1b050916f5f51472554236d77bb43d","observation_id":"6ad4b3af-339d-4ff5-854f-99457823b23a","resolution":{"observed_at":"2026-08-07T13:30:19.222653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T13:30:19.360656Z","title":"PaliGemma: A versatile 3B VLM for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.360656Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:288a1573397fc83cc2ed8cfdf34a89aed3a9b499b7f04a11783914be309fab00","observation_id":"4e779346-0c0d-4320-95e4-07b7788f6653","resolution":{"observed_at":"2026-08-07T13:30:19.360656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.145316Z","title":"Cunningham","venue":null,"work_id":"0e4e168b-ffcf-4660-8095-1e569812d30e","year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.440154Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:c00025da06716e3daa698a25873887e69bde74e758c3395a050f7321e1aa554e","observation_id":"9ebf6be0-401f-4a07-97d5-2046c39be37b","resolution":{"observed_at":"2026-08-07T13:30:36.279981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.969357Z","title":"VizWiz: nearly real-time answers to visual questions","venue":null,"work_id":"7beab5e4-4828-4210-81ea-56ccb329cb5d","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.536741Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:31a326439fc74164043a241040df642fbc6a90ea1aeba6f14830df7d7c79d801","observation_id":"8ba14324-63cd-4c7b-a137-3ebabc3d09e7","resolution":{"observed_at":"2026-08-07T13:30:36.028569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.779809Z","title":"Behind the scene: Revealing the secrets of pre-trained vision-and-language models, 2020","venue":null,"work_id":"992f8384-97ee-4619-9c54-0f28816e7e72","year":2020},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.664338Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:4dd660cac870d5a250620386c7911ce8c62cd0d513becc027597f8cf69f26426","observation_id":"e50859f1-9e25-4f6f-b1d8-9dbd59188da5","resolution":{"observed_at":"2026-08-07T13:30:35.887545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.679294Z","title":"Benchmarking robustness of adaptation methods on pre-trained vision-language models, 2023","venue":null,"work_id":"86fcd856-7577-4ed1-8176-dce86c445267","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.809894Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:52130d8810abd36cff0900814bb9d5701a85872f82e252f25339532e80aa8045","observation_id":"77e73c75-bb3d-49f4-b248-701bdd331e89","resolution":{"observed_at":"2026-08-07T13:30:35.718142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03149","last_updated":"2021-09-01T09:11:58Z","snapshot_observed_at":"2026-07-06T10:57:17.838513Z","submitted_at":"2021-04-07T14:28:22Z","title":"Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question Answering","version":3},"cited_work":{"arxiv_id":"2104.03149","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.03149","snapshot_observed_at":"2026-08-07T13:30:28.621167Z","title":"Beyond Question-Based Biases: Assessing Multimodal Shortcut Learning in Visual Question Answering","venue":"cs.CV","work_id":"6a34afb7-0e52-4ea7-8ad1-c18ee0f6ffc0","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.956939Z"},"links":{"cited_paper":"/paper/2104.03149","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:9191fbae949d12eb1781fc36b1e1a50d2113aa3958287d25a734a3cfef72f570","observation_id":"44971840-6caa-4117-abe1-8330f81867b9","resolution":{"observed_at":"2026-08-07T13:30:28.679257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.478192Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"35fcde6e-16fc-4c37-9e06-dc3718abdbda","year":2009},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.044752Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:1f755d5019bc6a66f337e08ca88b62a7fd94253d40bc9c52227db9f156325fd7","observation_id":"c0f29e56-f5ff-4e9f-b049-7c03a6c03f70","resolution":{"observed_at":"2026-08-07T13:30:35.581963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:20.156174Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.156174Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:8445bc31e1e40d647ab984e12fe48b1b5bf2c1b935e587dcea36262b38c37f16","observation_id":"aea9155f-6a9a-4985-9e7e-b5502aed4e13","resolution":{"observed_at":"2026-08-07T13:30:20.156174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.246061Z","title":null,"venue":null,"work_id":"019a4e9e-af86-4579-bcbf-11eabb82a885","year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.272974Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:900ca58a1a956dbee978d85f047dc70609f5e8954a6da93299584d69d9233522","observation_id":"82cba0ee-3bdf-4bd5-9d4b-0a5e2146c87a","resolution":{"observed_at":"2026-08-07T13:30:35.329020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:20.442632Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.442632Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:6a6349a08db5632e35b630a38ad4e64cdc6fcfb3b565502e55d9bd88b0ef32ca","observation_id":"10ed4b95-718c-4c46-8997-a868a8d4c553","resolution":{"observed_at":"2026-08-07T13:30:20.442632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.082993Z","title":"Ex- ploring the limits of out-of-distribution detection, 2021","venue":null,"work_id":"eb5ea0b1-da9f-4be8-8ceb-c6343d12b0e6","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.550685Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:5d29fbe578160b775b118cc83f18c7643acb8b3ca0398f3bfeb9119ee0e84fdf","observation_id":"3fd68671-db85-402f-9296-56412498f622","resolution":{"observed_at":"2026-08-07T13:30:35.140662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08325","last_updated":"2020-07-15T22:39:12Z","snapshot_observed_at":"2026-07-06T08:58:33.611352Z","submitted_at":"2020-02-19T17:57:46Z","title":"VQA-LOL: Visual Question Answering under the Lens of Logic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08325","snapshot_observed_at":"2026-08-07T13:30:20.658990Z","title":"VQA-LOL: Visual Question Answering under the Lens of Logic, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.658990Z"},"links":{"cited_paper":"/paper/2002.08325","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:02cb0189fe45f19c83605118ccdcddff46803ee2d072390ca6d4f8c1d4cd64f8","observation_id":"3bcc6fc5-54b4-4187-8022-96eedcfaa940","resolution":{"observed_at":"2026-08-07T13:30:20.658990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.871815Z","title":"paligemma-3b-pt-224.https : / / huggingface","venue":null,"work_id":"3b1ceb21-eaa9-4296-90a8-fb8c3d8358bb","year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.880562Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:9fc23cd7500eabd9f287453eda1581b17a803c97b53717590c5ecbf5046edcdf","observation_id":"c8732f46-27d1-4d29-8f49-7bf25efb7c6e","resolution":{"observed_at":"2026-08-07T13:30:34.953633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08253","last_updated":"2021-01-15T16:05:16Z","snapshot_observed_at":"2026-08-05T23:57:20.570067Z","submitted_at":"2020-02-19T16:00:47Z","title":"Distance-Based Regularisation of Deep Networks for Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08253","snapshot_observed_at":"2026-08-07T13:30:20.970889Z","title":"Hospedales, and Massimiliano Pontil","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.970889Z"},"links":{"cited_paper":"/paper/2002.08253","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:2d3091a6d5c340d97b05f50edb4cb5752962fc8272e869c90561fab946fae973","observation_id":"be0a20f7-6c23-4b5e-9163-7a69bc48e666","resolution":{"observed_at":"2026-08-07T13:30:20.970889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.640475Z","title":"Finetune like you pretrain: Im- proved finetuning of zero-shot vision models","venue":null,"work_id":"caa34577-c438-42e4-9fa1-3d6c89e3e9a3","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.092328Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:3004d285bba8cb9b869f4369405cd8a2af397e1f52865603f8e51db4978cfff0","observation_id":"faf0a017-4266-436e-8b13-55f39c81540f","resolution":{"observed_at":"2026-08-07T13:30:34.763178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00837","last_updated":"2017-05-15T17:58:49Z","snapshot_observed_at":"2026-07-06T05:21:10.284182Z","submitted_at":"2016-12-02T20:57:07Z","title":"Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00837","snapshot_observed_at":"2026-08-07T13:30:21.172080Z","title":"Making the V in VQA Matter: Ele- vating the Role of Image Understanding in Visual Question Answering, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.172080Z"},"links":{"cited_paper":"/paper/1612.00837","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:80f72a4182293c333b26a88ccdec8281bb057cc33dc37384e97421c63bf0d9f5","observation_id":"f59dcad5-8993-44fe-b3f2-142718843a77","resolution":{"observed_at":"2026-08-07T13:30:21.172080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.449219Z","title":"Rasch, Bern- hard Scholkopf, and Alexander J","venue":null,"work_id":"4ed72d16-aaef-4722-8ac0-704cb99f116b","year":2008},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.290993Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:6127d8795089a87569ebf9f9d9b54b02c1ac7524c9bcf1f30239b4f976d2895c","observation_id":"e87c518b-01a9-425f-9299-bd734b8ffbc4","resolution":{"observed_at":"2026-08-07T13:30:34.536315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.289357Z","title":"The many faces of robust- ness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"84465ef3-03fc-4e9e-99b9-a256803a4579","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.394139Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:0ef8e2445ebf5e1c855c8855eafd995d98bcafb07056de85dd21288fa3457f0a","observation_id":"c1e5c8ef-62a2-40d5-82f1-ce0e51eaea32","resolution":{"observed_at":"2026-08-07T13:30:34.369265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.027757Z","title":"Natural adversarial examples","venue":null,"work_id":"98c1ed62-497e-46cc-9d4b-ca5c2e79abbb","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.479518Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:cb0a731b03a289f4a4124e6cedc15eeff469ff6868ff8dbeb8ea2c20dc2b6d31","observation_id":"2634c300-530b-41dd-a524-07c7847c98ad","resolution":{"observed_at":"2026-08-07T13:30:34.128657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.851070Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"578adc68-e9ed-4c04-b2db-960f3acdbb4f","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.569817Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:2a50ea889e0618faca1d65f9dedb555eb98195cb6eaa8ec9fc60ebe3175bf148","observation_id":"c7664a7c-0b7f-4741-a1a9-3fcfcba3c88f","resolution":{"observed_at":"2026-08-07T13:30:33.937969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.702830Z","title":"Llm-adapters: An adapter family for parameter- efficient fine-tuning of large language models, 2023","venue":null,"work_id":"3c22b1f7-58c8-47f8-b0cc-635e349d4cbe","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.734597Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:11a5d3af3f78b4b07667311f32d92909411ebd644a1ba440bf47d62688e82c6a","observation_id":"1a0fa88d-cea0-4893-9918-b7a371fa3a56","resolution":{"observed_at":"2026-08-07T13:30:33.789467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.535358Z","title":"Directional gradient pro- jection for robust fine-tuning of foundation models, 2025","venue":null,"work_id":"519c0590-b244-4c24-8f94-f2a7db66ab73","year":2025},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.845558Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:dddc911f915b6931b0e9f2eeb6853b29b4eac7d788ebdfc3a135ce30fec355af","observation_id":"f819ba40-316b-4a04-af4b-b2d3997b083c","resolution":{"observed_at":"2026-08-07T13:30:33.617956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:22.034752Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.034752Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:69b04b6ff6807bf050a3af5b0dcc0d60139dff998e4b4543961d6420e116d150","observation_id":"5b9d8667-9123-4559-9f65-d7330808bd6e","resolution":{"observed_at":"2026-08-07T13:30:22.034752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.306211Z","title":"Roses are red, violets are blue","venue":null,"work_id":"d2e4d304-f300-4754-ae50-3ad134002b97","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.147432Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:77bc3fbe6e911af16e1e6d908fe5b59fae3ca6d0226260dd40fb28495d9ea729","observation_id":"38927f64-8faf-4754-ba47-630122dc47f3","resolution":{"observed_at":"2026-08-07T13:30:33.411709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.102516Z","title":"Fine-Tuning can Distort Pre- trained Features and Underperform Out-of-Distribution,","venue":null,"work_id":"6e2483fb-fe2b-4446-8cae-75e5c00f5de0","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.264829Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:46f5e1197c51bdbd265fa0d1e48038487a79d3c32bb38d841cb04e7c083a0e6d","observation_id":"38c1c61e-f2ce-4191-878a-a44fc2f8c45c","resolution":{"observed_at":"2026-08-07T13:30:33.216026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.880754Z","title":null,"venue":null,"work_id":"4860dab5-2045-4618-a9ca-e5431162ca9c","year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.408385Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:eab578e81572690bfa4e4ac4276e99b5545ec84b085e236aaa4b1690d3cb49dc","observation_id":"69669264-d650-4b15-a2e2-dae32b297438","resolution":{"observed_at":"2026-08-07T13:30:32.968130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.642617Z","title":"A Closer Look at the Robustness of Vision-and-Language Pre-trained Models,","venue":null,"work_id":"99c4d470-3c2d-4f7f-84e5-0546ecf70a3b","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.500847Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:37409443545f7b1bb3a301cb8fe754d841d2c024d42bd07b2887597e6326e464","observation_id":"1fd31f06-8625-42f2-9ae5-51f6f54e6a0d","resolution":{"observed_at":"2026-08-07T13:30:32.743187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00245","last_updated":"2021-08-13T07:01:48Z","snapshot_observed_at":"2026-07-06T11:14:40.299783Z","submitted_at":"2021-06-01T05:54:41Z","title":"Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models","version":2},"cited_work":{"arxiv_id":"2106.00245","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.00245","snapshot_observed_at":"2026-08-07T13:30:28.321459Z","title":"Adversarial VQA: A New Benchmark for Evaluating the Robustness of VQA Models","venue":"cs.CV","work_id":"2662acd5-7142-4359-9d41-c3bfefe1308e","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.701978Z"},"links":{"cited_paper":"/paper/2106.00245","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:6b4f8d2c4a673ee5f495dd5534699a8e55dc7c3f2d2f3042c667a755a03c9892","observation_id":"fb99404b-2d19-48aa-870b-19bb764409bc","resolution":{"observed_at":"2026-08-07T13:30:28.504421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.01483","last_updated":"2018-06-06T08:50:30Z","snapshot_observed_at":"2026-07-06T06:21:49.379500Z","submitted_at":"2018-02-05T15:58:40Z","title":"Explicit Inductive Bias for Transfer Learning with Convolutional Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.01483","snapshot_observed_at":"2026-08-07T13:30:22.787019Z","title":"Ex- plicit Inductive Bias for Transfer Learning with Convolu- tional Networks, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.787019Z"},"links":{"cited_paper":"/paper/1802.01483","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:19ffc7fd33cae5b26efddf1c5a02dc697db2195b234d6238af7166699a458d1b","observation_id":"898e22db-0104-4d4b-86ed-89407c199d5c","resolution":{"observed_at":"2026-08-07T13:30:22.787019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08673","last_updated":"2021-03-30T23:51:50Z","snapshot_observed_at":"2026-08-08T01:33:22.286787Z","submitted_at":"2020-12-15T23:41:42Z","title":"A Closer Look at the Robustness of Vision-and-Language Pre-trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.08673","snapshot_observed_at":"2026-08-07T13:30:22.632151Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.632151Z"},"links":{"cited_paper":"/paper/2012.08673","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:abf88afd86058a868a7ffc11e549589462bc188289cd1facc8675119904e779d","observation_id":"f660c6de-5279-4c97-8d8e-b59d828749fe","resolution":{"observed_at":"2026-08-07T13:30:22.632151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.234564Z","title":"Robust Visual Ques- tion Answering: Datasets, Methods, and Future Challenges,","venue":null,"work_id":"a93a3346-253e-47cc-b59d-dcdcc28a662c","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.966162Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:8680809783ecdee3ffd99181e50f8a53ddd2c381d6f33b705fe5e88672a2e476","observation_id":"a1ffed09-94f3-46ab-9c52-9630f9bc08ce","resolution":{"observed_at":"2026-08-07T13:30:32.299018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:23.184037Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.184037Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:bcf3cc8cec93cea33fe9c06ae81fd1abcda5fd648dbb35b4ddc55f3e2eb07749","observation_id":"4269af3a-bb07-4034-97a6-0a7463af80b3","resolution":{"observed_at":"2026-08-07T13:30:23.184037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.400262Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"695ee067-da11-453e-8ff2-eb01bc7a076a","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.844130Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:aff10ed8cf679c2392b0b2af77da32c5cdc46591fc1bb132fe918290ca3d9eb6","observation_id":"90c00bb2-bd48-4863-b076-1d19ca4046e0","resolution":{"observed_at":"2026-08-07T13:30:32.543685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.739432Z","title":"Maximum mean discrep- ancy for generalization in the presence of distribution and missingness shift, 2022","venue":null,"work_id":"a99f6673-a781-4ab5-9dc8-fd259651a01d","year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.335849Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:b017a4eac2d51d65772992330483c009448320470aba98268533efd6d14f81bc","observation_id":"b7231ea7-fe95-46c9-9adb-f7da0ac9cfb9","resolution":{"observed_at":"2026-08-07T13:30:31.868985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:23.427466Z","title":"Moment matching for multi-source domain adaptation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.427466Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:ff9a4f239113a619d2c8611aec7873dbe1f22624e7423968815611f4c8f21f0e","observation_id":"0e73b822-b0da-4290-9ba1-a09fb3a64d27","resolution":{"observed_at":"2026-08-07T13:30:23.427466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T13:30:23.504571Z","title":"Learning Transferable Vi- sual Models From Natural Language Supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.504571Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:4f351510a5545ebdbb55e0be0e74865efe321398770166c64283256e2378ad74","observation_id":"88f7ff7c-038f-4bda-b3a1-b973613dad95","resolution":{"observed_at":"2026-08-07T13:30:23.504571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.004826Z","title":"Generalized out-of-distribution detection and be- yond in vision language model era: A survey, 2024","venue":null,"work_id":"426b1731-abb4-450a-8dea-1d85af289399","year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.272303Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:122619790d70b523d8f2cce54fac1073b7ccc2d5a796c860fdd4fe08ab867852","observation_id":"61fbbd8a-08f4-49c3-8cb9-3fdc7df2d140","resolution":{"observed_at":"2026-08-07T13:30:32.111032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.294640Z","title":"Cycle-Consistency for Robust Visual Question Answering,","venue":null,"work_id":"076e3206-8953-43bf-86c2-e4d05540eccf","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.712779Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:bef3ac7c5030bcc4505b206cc9ffe467430ca3642f010f533ee729e879a95a57","observation_id":"d080134e-5c9b-43f2-8bcd-be03d72a3bab","resolution":{"observed_at":"2026-08-07T13:30:31.381355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02280","last_updated":"2021-06-04T06:25:32Z","snapshot_observed_at":"2026-07-06T11:15:52.991403Z","submitted_at":"2021-06-04T06:25:32Z","title":"Human-Adversarial Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.02280","snapshot_observed_at":"2026-08-07T13:30:23.821325Z","title":"Human-Adversarial Visual Question Answer- ing, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.821325Z"},"links":{"cited_paper":"/paper/2106.02280","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:e8afc0d608a3cd79bdb3e75aca6323e39539bc9ed765f2041db141f4643db131","observation_id":"d0823e45-7a42-42a4-b1a4-ca9660017ca5","resolution":{"observed_at":"2026-08-07T13:30:23.821325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.137961Z","title":"Benchmarking out-of- distribution detection in visual question answering, 2024","venue":null,"work_id":"1854e0af-3edb-4080-b680-fb58de396e0d","year":2024},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.931683Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:867ca8e1e6370621ac684f613fe2004a157fd12d60a369e2041e5d0d2fc6304f","observation_id":"fd9ff035-e16b-4adf-9f57-3b6b0094dd7f","resolution":{"observed_at":"2026-08-07T13:30:31.214236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.481741Z","title":"Do imagenet classifiers generalize to im- agenet? InInternational Conference on Machine Learning, pages 5389–5400","venue":null,"work_id":"6c69ecac-43d9-423d-b77b-7f105bd042db","year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.652233Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:eb685a12876e6db4a4e667f10a1ed6176a2ab0a7cd4d6413b2f9bbef5d0595fa","observation_id":"2388f9b5-1477-41d1-8439-7a3747386f0b","resolution":{"observed_at":"2026-08-07T13:30:31.584883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-07-06T07:47:04.116217Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-07T13:30:24.067003Z","title":"Towards VQA Models That Can Read, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.067003Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:b3ccd8a605710d7ffd44de4031800127e24325192c93ab9cb3119aeb16a39348","observation_id":"8bbb6535-3567-4ef4-aa60-0102cf1f9303","resolution":{"observed_at":"2026-08-07T13:30:24.067003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10720","last_updated":"2023-03-28T15:04:36Z","snapshot_observed_at":"2026-07-06T15:05:27.729596Z","submitted_at":"2023-03-19T17:30:44Z","title":"Trainable Projected Gradient Method for Robust Fine-tuning","version":2},"cited_work":{"arxiv_id":"2303.10720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.10720","snapshot_observed_at":"2026-08-07T13:30:27.300346Z","title":"Trainable Projected Gradient Method for Robust Fine-tuning","venue":"cs.CV","work_id":"ddc29845-6bb5-4141-a850-6ca59d89bb21","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.161750Z"},"links":{"cited_paper":"/paper/2303.10720","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:eff7a036a8092414f500531aa3026dbbc5fb3d4cb6103b65ed49852d83bb1abe","observation_id":"0e42019f-cbda-4e04-ba92-79ac1ec40df9","resolution":{"observed_at":"2026-08-07T13:30:27.443352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.939866Z","title":"Fast Trainable Projection for Robust Fine-Tuning,","venue":null,"work_id":"58e3e368-3f64-4864-9c3c-3fceaa84adb9","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.217760Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:08669fd01d04326c846d1c269d9b8d264106a11ebce24cb79c79f2385851213f","observation_id":"33668d0f-2c8c-4cc1-ac66-6d6060229712","resolution":{"observed_at":"2026-08-07T13:30:30.993713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.768778Z","title":"Rethinking weight decay for robust fine-tuning of foundation models,","venue":null,"work_id":"db0836b6-5b9e-48b8-b5fe-d0a1cf1ad7b4","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.338273Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:d6c8d2c7a8063421f50e0a7c65e195a6bae564ffc49ad58e9065d7bf914215fe","observation_id":"47b5d286-8974-4be9-89b1-1f5097860ca0","resolution":{"observed_at":"2026-08-07T13:30:30.903064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04692","last_updated":"2022-10-10T13:39:08Z","snapshot_observed_at":"2026-07-06T14:03:05.338990Z","submitted_at":"2022-10-10T13:39:08Z","title":"Language Prior Is Not the Only Shortcut: A Benchmark for Shortcut Learning in VQA","version":1},"cited_work":{"arxiv_id":"2210.04692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.04692","snapshot_observed_at":"2026-08-07T13:30:27.863644Z","title":"Language Prior Is Not the Only Shortcut: A Benchmark for Shortcut Learning in VQA","venue":"cs.CV","work_id":"67bb270d-22c2-48d2-9421-70fb39cb9d61","year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.986835Z"},"links":{"cited_paper":"/paper/2210.04692","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:d50c4e20a06e218858aef04ec7ccd68e2f62b7b5c6d20d4adce1908d25f4266d","observation_id":"811af034-14bf-4280-b2cd-fe90acc791f7","resolution":{"observed_at":"2026-08-07T13:30:27.964956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:24.624114Z","title":"Learning robust global representations by penalizing local predictive power.Advances in Neural Information Pro- cessing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.624114Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:5e8963aa3d7dc08ab6ef6090c5e1b0579d611756d98835d5796fd5dd2ef56055","observation_id":"1904a24e-0b23-4a90-b896-316e078bdc05","resolution":{"observed_at":"2026-08-07T13:30:24.624114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.583426Z","title":"Ledsam, Patricia MacWilliams, Pushmeet Kohli, Alan Karthikesalingam, Si- mon Kohl, Taylan Cemgil, S","venue":null,"work_id":"40515725-87ae-4400-82fa-023a672734eb","year":2020},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.721174Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:2d8659fd1240b12ef12d32bb9018db59c18a4d6b49a8ecf3cca245acd7bf6de3","observation_id":"384808c0-cd99-425e-bbff-20e5b2a95988","resolution":{"observed_at":"2026-08-07T13:30:30.671410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01903","last_updated":"2022-06-21T21:50:28Z","snapshot_observed_at":"2026-07-06T11:44:19.030296Z","submitted_at":"2021-09-04T17:11:28Z","title":"Robust fine-tuning of zero-shot models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01903","snapshot_observed_at":"2026-08-07T13:30:24.804961Z","title":"Robust fine-tuning of zero-shot models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.804961Z"},"links":{"cited_paper":"/paper/2109.01903","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:bcd650d47959b89af0864a4b397b7c203aaec1df91a44fd5ff905ac0c98f0e1a","observation_id":"4d9224da-b56a-4bd2-9780-c3c15738bbe4","resolution":{"observed_at":"2026-08-07T13:30:24.804961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.449212Z","title":"Domain-robust vqa with di- verse datasets and methods but no target labels, 2021","venue":null,"work_id":"25d23867-46fb-4d2d-a3b5-b59c9bf27dfa","year":2021},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.935344Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:558bf0b4d8c0e500e88604012f682744c1db41129170787a1d8e1368461ac60b","observation_id":"4c6aae56-da85-417d-b12f-b6f063fb4c4e","resolution":{"observed_at":"2026-08-07T13:30:30.489788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.281164Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":"9809dea4-c92a-4e3f-a415-7fdfe1b90e9e","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.034749Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:e7d11ee791a1c2b1efb2dff913294eb0bb8b837d62ecd05b12279ff8f5cec8b3","observation_id":"941f0fc7-0f4d-4992-9b64-cae1526f5f1b","resolution":{"observed_at":"2026-08-07T13:30:30.323868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00807","last_updated":"2023-11-01T19:43:56Z","snapshot_observed_at":"2026-07-06T16:41:51.334062Z","submitted_at":"2023-11-01T19:43:56Z","title":"VQA-GEN: A Visual Question Answering Benchmark for Domain Generalization","version":1},"cited_work":{"arxiv_id":"2311.00807","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00807","snapshot_observed_at":"2026-08-07T13:30:26.774745Z","title":"VQA-GEN: A Visual Question Answering Benchmark for Domain Generalization","venue":"cs.CV","work_id":"9f71d36f-4a50-4404-bd90-e51a3fb830f3","year":2023},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.515854Z"},"links":{"cited_paper":"/paper/2311.00807","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:f374394f6100f486e4579b45a8a657efd1e217cf6c83407114616d575107fa8f","observation_id":"d2431941-ff05-4f0e-b6d8-23218ac4ef36","resolution":{"observed_at":"2026-08-07T13:30:26.964752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.097582Z","title":"We use the LA VIS [29] public repository to fine-tune all methods","venue":null,"work_id":"e9afd2dc-5b7a-4235-bb84-9262c42ce460","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.244751Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:9120b141d900f8b290913b39e803c2916bbc810a6ad46e74a089b0370b5d0b8f","observation_id":"80a62b49-695d-4d90-ba59-05d7e6b9cb98","resolution":{"observed_at":"2026-08-07T13:30:30.195941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.934288Z","title":null,"venue":null,"work_id":"c9dbd067-0c97-4ac3-9625-7b2f229cd820","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.374892Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:e5f39498d20fc20507c320b97ec1934b7d7658a7a0de1f2431df96734d7f8591","observation_id":"69fa2271-0d8d-48be-93be-d702805d9b76","resolution":{"observed_at":"2026-08-07T13:30:29.997695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.723292Z","title":"7 shows the correlation between shift and performance for different embeddings under different fine-tuning meth- ods","venue":null,"work_id":"8dcf26e5-3681-4db0-aa4c-8ed94dbb740e","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.632830Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:c2d3e145a42a4df5097591bc23c351406c96b45625b2f9fe79e33fc858b5f424","observation_id":"fb31c073-9b8d-4691-bbd2-38ea04c2bb51","resolution":{"observed_at":"2026-08-07T13:30:29.837989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.597525Z","title":"5 shows the heatmap of the correlation between uni- modal and multi-modal shifts per dataset","venue":null,"work_id":"aafa0074-b914-4588-91c5-189f7292045a","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.742953Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:aacc37447f030cdd17a693f1a6d095a7728041c1b787330e8aedc419abe8dac5","observation_id":"be9795bd-9761-486a-a85a-21852dd5a165","resolution":{"observed_at":"2026-08-07T13:30:29.630166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.355396Z","title":"13 and 14 show the variation of MIv and MIq w.r.t","venue":null,"work_id":"549ffc84-f8a3-436f-8a19-a26758667113","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.865612Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:6a21dc9f96bff5578923f02daac14fcbffeee4a6f7904e0a35f67f08eb00aaa8","observation_id":"b7f031ed-deeb-45c6-932c-10e582a2fabb","resolution":{"observed_at":"2026-08-07T13:30:29.448148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.179088Z","title":"8, including LLaV A- 7B [33] with LoRA and PaliGemma-3B with full fine- tuning","venue":null,"work_id":"9688700c-4c5f-4a60-8726-c43ba9dd9fb5","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.995036Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:77c5408c0d5d129469e2fbadd553d36f3b6ae4f764a0a649096805dd2627dec3","observation_id":"84e2c426-a2b8-4bfa-bdec-637609601f3e","resolution":{"observed_at":"2026-08-07T13:30:29.274521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.942478Z","title":"The only exception, GQA-OOD [27] (based on GQA [26]), has only answer shifts","venue":null,"work_id":"545e35c1-a728-43e6-9ea9-790acc568e67","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.134838Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:f41e554e31d63add5e4b136c36dd4a4ec5bafbc57ecd2c766a39bb55129ec478","observation_id":"1692ec5f-f3e9-49f8-a3bb-aef9de954d75","resolution":{"observed_at":"2026-08-07T13:30:29.064764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.848784Z","title":"We further compare shifts using Maximum Mean Discrepancy (MMD) [12, 20, 37] with RBF kernel in Tab","venue":null,"work_id":"cc1ac5de-4f73-45ef-b14e-d8d8e111b85f","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.255127Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:3cb4dcc824ddeeb22591e7fbfb153da3e153d7385c78c04b772c1c25c8413132","observation_id":"21b24e27-5652-4d7f-a8f0-b4f6b21c4e7e","resolution":{"observed_at":"2026-08-07T13:30:28.908369Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.777944Z","title":"This also serves as a veri- fication of the reliability in quantifying shifts via feature- based representations","venue":null,"work_id":"c181b2eb-2b1e-4576-b2b1-3c8124384cb7","year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.374735Z"},"links":{"citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:a71dcb95d9fe9f0e80a6600eed05cf5928ac60fb5697508ef72daed201269cbb","observation_id":"58e707d3-ed14-4556-88d1-c455496b3fa2","resolution":{"observed_at":"2026-08-07T13:30:28.802066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05660","last_updated":"2019-02-15T02:07:18Z","snapshot_observed_at":"2026-08-04T11:18:15.073564Z","submitted_at":"2019-02-15T02:07:18Z","title":"Cycle-Consistency for Robust Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.05660","snapshot_observed_at":"2026-08-07T13:30:23.772858Z","title":null,"venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.772858Z"},"links":{"cited_paper":"/paper/1902.05660","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:7aeda56cc9efc98117ce5d9198378ed7e6263743f39c0b64df0ab8edce7888fd","observation_id":"975ea182-8c39-49c2-a8b6-9a6b49c69ca0","resolution":{"observed_at":"2026-08-07T13:30:23.772858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T13:30:21.655216Z","title":"5, 6, 8, 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.655216Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:273ed2bda3eb016a0ece8df305add1d5e93e118cacf007ab7b79c7b0c99f6179","observation_id":"79e8ca76-f1a5-4db2-b092-1033396ce1e4","resolution":{"observed_at":"2026-08-07T13:30:21.655216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10054","last_updated":"2022-02-21T09:03:34Z","snapshot_observed_at":"2026-08-04T02:30:25.691953Z","submitted_at":"2022-02-21T09:03:34Z","title":"Fine-Tuning can Distort Pretrained Features and Underperform Out-of-Distribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10054","snapshot_observed_at":"2026-08-07T13:30:22.333864Z","title":"2, 4, 6, 8, 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.333864Z"},"links":{"cited_paper":"/paper/2202.10054","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:5b41667258380f42c99034d2c1698fc023fd5fe9109b5587c1e5f403121e85e7","observation_id":"e257422a-c06e-47bf-8cc4-76b650191457","resolution":{"observed_at":"2026-08-07T13:30:22.333864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19182","last_updated":"2023-10-29T22:52:43Z","snapshot_observed_at":"2026-07-06T16:40:12.014275Z","submitted_at":"2023-10-29T22:52:43Z","title":"Fast Trainable Projection for Robust Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19182","snapshot_observed_at":"2026-08-07T13:30:24.269594Z","title":"2, 4, 5, 6, 8, 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.269594Z"},"links":{"cited_paper":"/paper/2310.19182","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:82078394372401b13280c524947b010dcfa5bcd73514b528f4f549ac261819fc","observation_id":"d014ed24-983a-45e9-8e21-1acf215453ba","resolution":{"observed_at":"2026-08-07T13:30:24.269594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11471","last_updated":"2024-02-18T08:00:19Z","snapshot_observed_at":"2026-08-06T23:46:22.347744Z","submitted_at":"2023-07-21T10:12:09Z","title":"Robust Visual Question Answering: Datasets, Methods, and Future Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11471","snapshot_observed_at":"2026-08-07T13:30:23.075341Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.075341Z"},"links":{"cited_paper":"/paper/2307.11471","citing_paper":"/paper/2505.21755"},"observation_digest":"sha256:29f3d10af5ead8c431f21f8db6610696db9630125f9c4e333459ac616b89fa58","observation_id":"46c7e70c-9d2e-4cca-9013-9010f64a7775","resolution":{"observed_at":"2026-08-07T13:30:23.075341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21755","last_updated":"2025-06-20T19:32:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:21:29.320603Z","submitted_at":"2025-05-27T20:44:44Z","title":"FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":5,"verified_fuzzy":37},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2505.21755."}