{"as_of":"2026-08-08T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e83291cc430b2f7d21fad012cf768966636a9817e3e1d6e8442610bcd1333d9","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:49:00.730675Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22398/citation-record","integrity":"/paper/2507.22398/integrity","json":"/paper/2507.22398/citation-record.json","paper":"/paper/2507.22398"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:13.033042Z","title":"Generative imperceptible attack with feature learning bias reduction and multi-scale variance reg- ularization,","venue":null,"work_id":"eec244d0-9d1e-45d6-b113-303556026922","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:53.381010Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:bac2302dcba44cd97085f77ce7655e951c10fdb63c5cf627c62795335200ac64","observation_id":"4c0d25a3-723b-47a2-9d5c-e9793788d893","resolution":{"observed_at":"2026-08-06T11:49:13.092441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.854884Z","title":"Semantically consistent visual representation for adversarial robustness,","venue":null,"work_id":"96eef835-eefa-4685-acf1-61ba0251cd26","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:53.524003Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:a8854fdf3e0d112cfb676dbd6247eef0c3f0ff65f8914085df12e6befb7770cc","observation_id":"6d052d42-c2e6-41ba-9152-ed135c622b0b","resolution":{"observed_at":"2026-08-06T11:49:12.923994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.723515Z","title":"B-avibench: Toward evaluating the robustness of large vision-language model on black-box adversarial visual-instructions,","venue":null,"work_id":"25455007-9c64-4c07-bb16-8f956549f317","year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:53.694335Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:55bc30c27f75d10b967866f5fa5928b1581cbadd2ee965a7ba892a7a5b18c041","observation_id":"61961627-a33c-488e-b0b0-1c4c9e16ae8a","resolution":{"observed_at":"2026-08-06T11:49:12.788844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.535148Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":"e4aafb12-7c07-40de-a688-5a9fd11e6b26","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:53.847722Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:a6ce663b7b7d5a1029a912f5733fbedd90b7e411adfd842344747623ee9e7309","observation_id":"3b074a1b-1473-440b-8fff-70fca5dcb847","resolution":{"observed_at":"2026-08-06T11:49:12.623017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:12.175815Z","title":"Towards multimodal disinformation detection by vision-language knowledge in- teraction,","venue":null,"work_id":"e2713eb7-33b8-45a7-9687-983ffcfd079c","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.034062Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:f79f087bc1c54b9118ccdfd7ef5f181703b1814db82d946adad8dec05537a148","observation_id":"9d41d25e-c688-4f82-98e2-9b244706faef","resolution":{"observed_at":"2026-08-06T11:49:12.376866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:11.805000Z","title":"Media forensics and deepfakes: An overview,","venue":null,"work_id":"acce2780-e875-47c8-8813-bdbb3ff5599a","year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.162755Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:45791a40308e0f1041607f66461b7b28d42d330fe50d1dbfee959234feb909ca","observation_id":"98b469a7-2b09-452b-a7f3-04c7de08e626","resolution":{"observed_at":"2026-08-06T11:49:12.011171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:11.416426Z","title":"Plausible may not be faithful: Probing object hallucination in vision-language pre-training,","venue":null,"work_id":"04be960b-322c-4515-a4d5-2d7f03f1d421","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.240297Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:947e7bc95ab37d091f974ed3ca7c249a73ca519aad84750bafdd86b85445341e","observation_id":"3d295e46-7ca2-492d-9a29-b22b6feaf7b5","resolution":{"observed_at":"2026-08-06T11:49:11.584947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:11.044697Z","title":"Application of fourier analysis to the visibility of gratings,","venue":null,"work_id":"b78ab2e5-4326-4687-9417-4003d6096e5e","year":1968},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.374282Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:d86576e3c574b4667b7c6ac85a8a2ed720622f1e1e7e795bb209cd2434a585db","observation_id":"d731e80b-8c65-4152-a5f6-f097f03d8d24","resolution":{"observed_at":"2026-08-06T11:49:11.207771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:10.765969Z","title":null,"venue":null,"work_id":"104d807c-4dc0-4830-adb9-7f9563068302","year":1988},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.463719Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:7703c7dd0ca642c8134fc91bb893c1988a5014b0c04bb134e675e0d6ebe5befe","observation_id":"ff2873a7-e0cc-47f3-afee-f875dae0e09d","resolution":{"observed_at":"2026-08-06T11:49:10.902256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:10.548311Z","title":"Drop an octave: Reducing spatial redundancy in convo- lutional neural networks with octave convolution,","venue":null,"work_id":"a0eaa778-a899-4d7e-9a9d-507248b7822a","year":2019},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.582544Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:f2525219d49ada61a4e6271b72312bd98de17e6713a8e4e88f97f430e828ad61","observation_id":"03207e74-cd22-4d8c-91dc-44eaa16a821d","resolution":{"observed_at":"2026-08-06T11:49:10.625000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:10.288785Z","title":"Spatial frequency enhanced salient object detection,","venue":null,"work_id":"8c111ff0-db94-4837-98d2-d981f9ad0b0b","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.703911Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:004dd7fb095a6203c4b8b783a15e865252a51283b077bd9ccde8327686e0bc69","observation_id":"036f9143-69cd-4594-8fcb-e79307a2c683","resolution":{"observed_at":"2026-08-06T11:49:10.391720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:10.118199Z","title":"Watch your up-convolution: Cnn based generative deep neural networks are failing to reproduce spectral distributions,","venue":null,"work_id":"4d7c4466-845d-4d09-8eb9-5ed776cb7a6f","year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.854386Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:85f21ec9f2f03be6a8919fb4176ba1fcf071ea215087c8c8187757e81e9ca409","observation_id":"da3eaef7-53ad-4ba4-ba5f-55871d3637ec","resolution":{"observed_at":"2026-08-06T11:49:10.199619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.931878Z","title":"Adversarial examples are not bugs, they are features,","venue":null,"work_id":"65be6211-8efc-437f-a77a-39d9d14e14c2","year":2019},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:54.989107Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:31ed0b92924e131cc1be22e4f43c376f534cdd7ff654321d97da85e161d92ad0","observation_id":"c54f1d73-6417-4877-8f05-2255039588a6","resolution":{"observed_at":"2026-08-06T11:49:10.007062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.777450Z","title":"A fourier perspective of feature extraction and adversarial robustness,","venue":null,"work_id":"48032203-8e88-4521-a87f-878a1a22dcb6","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.083160Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:0d153a9020eb5addb8c684973bcbc3b70bef12d497a809f4a5a182895f21deca","observation_id":"01a4bb00-98c3-407e-a328-4c17cdca6b6b","resolution":{"observed_at":"2026-08-06T11:49:09.852538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.613158Z","title":"Efficient generation of targeted and transferable adversarial examples for vision-language mod- els via diffusion models,","venue":null,"work_id":"912bea59-c289-4203-a82d-c2669174c99c","year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.242012Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:f20e1576d42bac8b79ce627491f22190bfd6de46c4249f5b1f503eda7ac7b0a3","observation_id":"10e1903c-90c7-426f-995b-544838185480","resolution":{"observed_at":"2026-08-06T11:49:09.692057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.403603Z","title":"Overload: Latency attacks on object detection for edge devices,","venue":null,"work_id":"f9987125-f058-4d48-9b80-dae613147aac","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.376691Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:4b6be5d2fea886e17acef08b9708978a6a483b2db1a71c65a19f52d81b084949","observation_id":"5608b035-fdd6-4672-b63f-59ca03ded807","resolution":{"observed_at":"2026-08-06T11:49:09.502931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:09.212488Z","title":"Survivability analysis of iot systems under resource exhausting attacks,","venue":null,"work_id":"180e2f8f-67e0-494e-a4a9-eb5e6b851fbb","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.465991Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:726a780071f2d1be18773a0c9ad369fd023376f18637e7141ecdba62c0f67b69","observation_id":"a6165b5e-6e49-4362-a3e9-853ac6e15b6e","resolution":{"observed_at":"2026-08-06T11:49:09.301503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.988533Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"4b4bdef1-39bc-47c9-8dc7-e33033af964f","year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.607924Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:df64eff7692557e7b19de5cd324b63a3b43deae6a2d25399863ab2f9ad9f4cf3","observation_id":"fafb8e57-56c8-49d3-9db2-644bb179cfe0","resolution":{"observed_at":"2026-08-06T11:49:09.021174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.858995Z","title":"Rgfreq dataset,","venue":null,"work_id":"b9f6b15d-0967-4703-abaa-c8199cd40adf","year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.716022Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:b0e413455f27c630c8bfb0a824d502b9836a253eabe47dad00e71e1c4300c8e9","observation_id":"016b78b8-ab9e-4d98-a18b-7bf08acdac9c","resolution":{"observed_at":"2026-08-06T11:49:08.910248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.752675Z","title":"Generative adversarial nets,","venue":null,"work_id":"a47c557b-4758-40d1-b493-81f6b6ae4edb","year":2014},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.850528Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:02d72b1b618e42aecfd616d2d09a47e2f889ab874d34ad794c085913a0e0f513","observation_id":"d16e8cf0-7a05-421f-94a4-c67c22d9cc14","resolution":{"observed_at":"2026-08-06T11:49:08.809408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.577816Z","title":"Auto-Encoding Variational Bayes,","venue":null,"work_id":"7e23526b-5ab2-4b7e-a697-bcc87f40aa69","year":2014},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:55.976502Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:4175cec80cf67cda97c6d5fc54e063ce2799c7103aae64b67dab6722d7a6c621","observation_id":"50a48247-b1b3-4424-a3f1-c1da1b2a3e75","resolution":{"observed_at":"2026-08-06T11:49:08.669446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:48:56.069518Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.069518Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:71355729dd10366c95f0b20e146166f1f23883f860a4142a511eb4402ce34be0","observation_id":"57756d8a-5c39-4ef2-8f70-507f57abacf4","resolution":{"observed_at":"2026-08-06T11:48:56.069518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.379342Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"b27762a2-cb0e-4344-8c3b-c5134790d2f8","year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.214438Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:d94ffe77687088dace8eca2409050bb10895867b7a1685a6580db0d8627c6eec","observation_id":"e99e9478-dd8e-4f9d-993e-26d6ba4ddf47","resolution":{"observed_at":"2026-08-06T11:49:08.453305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T11:48:56.317691Z","title":"Hierarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.317691Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:535beb6cc18b0736a40bb5cae62fc38b8968f635d8d66c088f187f83576aefbc","observation_id":"3b861ee7-7677-4123-bd13-d60d513f7535","resolution":{"observed_at":"2026-08-06T11:48:56.317691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-06T11:48:56.426876Z","title":"Photorealistic text-to-image diffusion models with deep language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.426876Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:932ac16956cc91a00ff011105777574fa00707e2027662feebf877f26cb35523","observation_id":"f4930038-8f85-41a0-adbc-34278f1dde92","resolution":{"observed_at":"2026-08-06T11:48:56.426876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:48:56.519554Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.519554Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:45ac139baf777d6c5bfe3de3365fcb75cac46b26450ab83214bd070346d321cf","observation_id":"5656f597-b103-41dc-aec6-99bee8c603b6","resolution":{"observed_at":"2026-08-06T11:48:56.519554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:08.149134Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"dbfe1ca6-16c4-455d-80ab-cbfb61e7d61a","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.617676Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:cc434b3fa1f74160c13077d99999c28a9219e0d6d6192b71f2cfc6b84b75b572","observation_id":"e996c045-102e-4fa6-b90a-8d9346c6ddf0","resolution":{"observed_at":"2026-08-06T11:49:08.244527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:07.820270Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":"a6f0ce60-35e9-4631-9486-a10fa73fd824","year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.751710Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:a3e4463e29f4cd7d2cbd9785cd856beca3efbf9ca352fe72d53f6d05cbdde0f1","observation_id":"067e66a3-4702-4c9c-885a-f1c8eba1a388","resolution":{"observed_at":"2026-08-06T11:49:07.968956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T11:48:56.858845Z","title":"SDXL: Improving latent diffusion models for high-resolution image synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.858845Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:090c07f6e2a35420de7e6f501a6f41bcd93bead62885c568030c909d3b36b296","observation_id":"b6af4463-bb7c-4896-97ea-ce064431e2c7","resolution":{"observed_at":"2026-08-06T11:48:56.858845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T11:48:56.970954Z","title":"Scaling rectified flow transformers for high-resolution image synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:56.970954Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:bac842147aa901aed16ee7ca86951faacd8e5ca5eec4e8b43e7184bfbb1e57a8","observation_id":"049ff463-59c0-490d-a62d-cc4a2489ae7f","resolution":{"observed_at":"2026-08-06T11:48:56.970954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:07.570700Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"4db5c5b6-ba9d-460d-9e61-4787ea57c6f8","year":2016},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.078710Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:a2a414ecbf6c949af4c10f7e5cddecf8758e12be35c70db325e624e2c35ef757","observation_id":"45241410-f1a7-43bd-bba6-56526e0e7326","resolution":{"observed_at":"2026-08-06T11:49:07.705074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:48:57.214238Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.214238Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:3a422abd1f41e79744d17f16e879301c9daa19a57fe14044ae04b5c67cc05b92","observation_id":"160d0fd3-e20d-434d-bad1-06107052b02e","resolution":{"observed_at":"2026-08-06T11:48:57.214238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:07.250789Z","title":"VQA: Visual question answering,","venue":null,"work_id":"db71eca5-29f5-4090-9af9-6f4c0e7291a2","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.274542Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:336eb9cd5fb76ae5e9fe2627c4e5a8985e759e1ff3fe4a003988a39ec5feb063","observation_id":"e03f12c1-c99b-4332-a56a-62c3b6783987","resolution":{"observed_at":"2026-08-06T11:49:07.408065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T11:48:57.401927Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.401927Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:13fc468b22c24de0eff1b30527ac2f82f8a0df8008d4c2072af5c3a8973b5c39","observation_id":"6f04ab39-33ee-467e-8d23-bade4cdae6c9","resolution":{"observed_at":"2026-08-06T11:48:57.401927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T11:48:57.486237Z","title":"On the opportunities and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.486237Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:ea643e1a07cbeb59c32c13b0febb298132b02e37bac3c98b5546e22339c74dcb","observation_id":"3ae7dffa-5f1c-47a3-85d5-8a06d8213297","resolution":{"observed_at":"2026-08-06T11:48:57.486237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04790","last_updated":"2021-04-07T18:43:54Z","snapshot_observed_at":"2026-07-06T09:19:11.452609Z","submitted_at":"2020-05-10T21:31:00Z","title":"The Hateful Memes Challenge: Detecting Hate Speech in Multimodal Memes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04790","snapshot_observed_at":"2026-08-06T11:48:57.553696Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.553696Z"},"links":{"cited_paper":"/paper/2005.04790","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:54095e3869822d1a3a472c1849e1ddc34c3d7cc97c20a9e2abeb652705baa61e","observation_id":"c417eae8-10df-4850-b83c-aa99fecaa0a1","resolution":{"observed_at":"2026-08-06T11:48:57.553696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:07.040245Z","title":"Stacked cross attention for image-text matching,","venue":null,"work_id":"109fe5e2-30eb-41ea-9c31-f4b10ee4cfb6","year":2018},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.611166Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:84b575871298c50abd29b6a69f1c06c9d0761d39b104b8360ec4916e9f1ffea8","observation_id":"fc519413-0044-4038-8a1e-5cba545dd609","resolution":{"observed_at":"2026-08-06T11:49:07.131768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.847927Z","title":"Flow straight and fast: Learning to gen- erate and transfer data with rectified flow,","venue":null,"work_id":"85c9ac85-f230-412a-a0fb-a33c815b414d","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.686928Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:f0d5ad4e174ef174d0dfeb92925a2fc06f5b0d4087c040dab351672ff6f1cedf","observation_id":"ac7ed211-57f0-46c3-a5e0-f35d2f2e9c74","resolution":{"observed_at":"2026-08-06T11:49:06.959729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T11:48:57.768485Z","title":"Qwen-VL: A versatile vision-language model for un- derstanding, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.768485Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:4d25d090c3bca80de40bd4b8752c168a296e434a234136af1ec8c8ff7611052e","observation_id":"05223133-1046-405e-8c29-7dba480fc75e","resolution":{"observed_at":"2026-08-06T11:48:57.768485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T11:48:57.846255Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.846255Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:47d70f0aecdfd99f0882035e5d7cb5c2e8ff6fa5269d9b13f099ba20cc711c77","observation_id":"947eb8e7-0bf3-4c46-af62-4d2abfe25553","resolution":{"observed_at":"2026-08-06T11:48:57.846255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T11:48:57.919979Z","title":"PaliGemma: A versatile 3b VLM for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.919979Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:1c3bc144f7725ab4f1a47d76f91f9cdd23d45b312d7500aea78690071d1615bd","observation_id":"e05920c8-ae1b-44ca-8bf9-7c8c4e00742d","resolution":{"observed_at":"2026-08-06T11:48:57.919979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.668931Z","title":"Learning Rich Features for Image Manipulation Detection,","venue":null,"work_id":"c3917f9c-20d8-4448-ae60-4f01c061b660","year":2018},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:57.996645Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:a598d1c17c64f551d1bae84a827907cd47936d42abc99236bfcc22321ab3752e","observation_id":"8bff78c8-6dd2-4631-9f2a-5dd7a507ecdc","resolution":{"observed_at":"2026-08-06T11:49:06.745194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.530451Z","title":"FaceForensics++: Learning to Detect Manipulated Facial Images,","venue":null,"work_id":"b5e53bf6-b736-444c-808b-25863e46682e","year":2019},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.056528Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:e7c149ab327c1622b94a53ac9680cd9f6962bd3a2464780367d795990b644f0d","observation_id":"51705b55-fca9-4cd7-9b43-01753069d571","resolution":{"observed_at":"2026-08-06T11:49:06.603598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-08-06T11:48:58.098243Z","title":"The DeepFake Detection Challenge (DFDC) Dataset,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.098243Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:bd7d347a485afe0242d8800b6ce4382ddf2d3db8d16b0c43bd192452bfb06cf5","observation_id":"451ffb2b-8583-4fbe-9b4b-193e5ae202e0","resolution":{"observed_at":"2026-08-06T11:48:58.098243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.389535Z","title":"Detecting images generated by diffusers,","venue":null,"work_id":"9456daa2-b71f-43fc-b12b-23b82eb93453","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.171704Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:2867a4240cb85092c344c4727ab7dc2adbf02861c9cba7864dd5098f7888bf53","observation_id":"bb25fbc3-6408-4605-8d91-6f958542493e","resolution":{"observed_at":"2026-08-06T11:49:06.449194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.281328Z","title":"DIRE: Diffusion Reconstruction Error for Diffusion-Generated Image Detection,","venue":null,"work_id":"846ade62-9607-400b-a839-95f71ec63e63","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.247670Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:6aaac1431ec275b27f71fbaff098494b915921ecf340d1958abae440ef699048","observation_id":"f2cea482-b55b-43d1-ab48-f162c7f83aff","resolution":{"observed_at":"2026-08-06T11:49:06.312019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02857","last_updated":"2026-05-27T00:37:53Z","snapshot_observed_at":"2026-08-07T17:29:40.662418Z","submitted_at":"2025-03-04T18:33:22Z","title":"Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02857","snapshot_observed_at":"2026-08-06T11:48:58.304025Z","title":"Deepfake-eval-2024: A multi-modal in-the-wild benchmark of deepfakes circulated in 2024,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.304025Z"},"links":{"cited_paper":"/paper/2503.02857","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:770744a0a5f54f05d99b22d37780beffa1e9389f44366f337556761a00df839d","observation_id":"06486be9-681b-4c88-83bc-174cc7e0d1b8","resolution":{"observed_at":"2026-08-06T11:48:58.304025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:06.053387Z","title":"Synth- Buster: Towards Detection of Diffusion Model Generated Images,","venue":null,"work_id":"b7273b06-3926-4bbd-881f-74dcb323f1e1","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.421807Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:2b971471c57447397a7c1fc0a602cc179a4a34b5650fcfb3d2524bdae85cd028","observation_id":"25bf8b96-e077-40c7-aaa1-7b61f56a2211","resolution":{"observed_at":"2026-08-06T11:49:06.153667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.898911Z","title":"Llms are not yet ready for deepfake image detection,","venue":null,"work_id":"62f8e6bb-74e7-499f-b994-b6f2ff32e12d","year":null},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.501192Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:c91a70169450388c7e90b418e738a6d738ea4946062d472bd3205196b33449b4","observation_id":"01f13274-0160-432a-827f-235708356229","resolution":{"observed_at":"2026-08-06T11:49:05.950694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.720835Z","title":"Intriguing properties of neural networks,","venue":null,"work_id":"a7c0ac57-1b98-4ade-b778-d2638dad3678","year":2014},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.627977Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:877fd25b48582fcb2e8fee48c63a61ef9aaaf9afebf889e5021fcfc22aa94180","observation_id":"e3f4bb67-701f-4c69-bd68-f2216bdd35c8","resolution":{"observed_at":"2026-08-06T11:49:05.827605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.543898Z","title":"Explaining and harnessing adversarial examples,","venue":null,"work_id":"a267a909-4910-4d1f-b4be-aeb74bb41d5a","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.690240Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:440fb714f6276fd3a346a06aed913784baa3fa7334ad8e5dad318228cfe3a749","observation_id":"8f0c9823-107c-4e67-a115-801a554765f0","resolution":{"observed_at":"2026-08-06T11:49:05.625289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.337907Z","title":"Towards deep learning models resistant to adversarial attacks,","venue":null,"work_id":"f9ec999e-7af9-4230-b8a8-657daeee81a7","year":2018},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.755851Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:2ccfcc8d82af853ce73ebecc722b31fd8dc4d775e6d1cdd756f34e724b11655a","observation_id":"a186785b-8188-426c-8f09-c83e788b7fb9","resolution":{"observed_at":"2026-08-06T11:49:05.426881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:05.153880Z","title":"Adversarial vqa: A new benchmark for evaluating the robustness of vqa models,","venue":null,"work_id":"29727779-3941-4ba8-89f1-9660a4e6a48d","year":2021},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.827962Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:6065a2d214ee1a7b098abd34610f9d450fa95016d0f12f1e9b0c6f71c6a180ee","observation_id":"ede04c7d-91bd-478b-8bea-cbdb0fac0d2b","resolution":{"observed_at":"2026-08-06T11:49:05.247004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.991881Z","title":"Attacking vqa systems via adversarial background noise,","venue":null,"work_id":"6e43d19c-16a2-4934-9989-33199510a976","year":2020},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.890444Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:c83ffbdd2f88b42ad531547cd8211d71ab3cc5562bc50ae602baa4a93cb76264","observation_id":"eab56efe-9611-4166-a34c-2b7548b0e96e","resolution":{"observed_at":"2026-08-06T11:49:05.069052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.867590Z","title":"On evaluating adversarial robustness of large vision-language models,","venue":null,"work_id":"ce11f2e1-095f-481e-97a4-20fb1e63f50a","year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.960847Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:4a5530bfe8c317fd120ea0710efd0bfc6788f3ae56c5226f9a77e0515985b32f","observation_id":"8213d409-3c2a-4eb3-b7bb-863c849af378","resolution":{"observed_at":"2026-08-06T11:49:04.916129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.724869Z","title":"Mutual-modality adversarial attack with semantic perturbation,","venue":null,"work_id":"bbffbdd4-b32e-4b76-bb08-2ad1ec07e6cc","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.036047Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:7aa96cd10d0cbb957d2a5057ca33551d1122dbde8a69a4b7ec2e9404d48ade5d","observation_id":"2bc95700-2598-4af3-b982-db7496d87ff4","resolution":{"observed_at":"2026-08-06T11:49:04.797875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.519367Z","title":"Frequency-driven imperceptible adversarial attack on semantic similarity,","venue":null,"work_id":"752b2509-3eb7-4ae8-960a-efa6277eccd8","year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.102680Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:4f82cd8cd52f0e969339b2466bbd9cdacdf796831f44ee216a5314c7a9259721","observation_id":"4d040643-f66b-40e6-8299-4abb08bc0f2a","resolution":{"observed_at":"2026-08-06T11:49:04.606945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.261268Z","title":"Facl-attack: Frequency-aware contrastive learning for transferable adversarial attacks,","venue":null,"work_id":"5f9da6dd-2405-4313-8de6-5223c0e16e2f","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.169362Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:d68869541c93487052faecfe0b40df1a4b2c8b3681a03a8df678e1352a35f454","observation_id":"d23d115c-d627-4fd2-9dd9-0b062b20e408","resolution":{"observed_at":"2026-08-06T11:49:04.398946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:04.042614Z","title":"AdvDiff: Generating unrestricted adversarial examples using diffusion models,","venue":null,"work_id":"458e479a-d9d0-4ebf-bec0-22c8dd609764","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.238624Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:f5a17182112a67b3785b69c6144b39078fc5b6eaee0fc2e18ad5ed8bfbf41dcb","observation_id":"6fd93d75-641a-4037-86a5-ef45924d9ebb","resolution":{"observed_at":"2026-08-06T11:49:04.134539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:03.803315Z","title":"Sita: Structurally imperceptible and transferable adversarial attacks for stylized image generation,","venue":null,"work_id":"0f7fa4e4-6061-4c40-801d-7ed382aa0432","year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.288345Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:0e98efd3cc75887afbce8d2ac293333907eda1c09cc169e35784a1d87b28afd8","observation_id":"48bef1b1-7e8e-4194-a705-2caf1677909d","resolution":{"observed_at":"2026-08-06T11:49:03.905311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:03.558863Z","title":"Toward transferable attack via adver- sarial diffusion in face recognition,","venue":null,"work_id":"5d9df402-5e55-4f1c-8da9-fd0277e95adb","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.357291Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:c501d449eddeed764a2c9daa5ddefe5a2978dd1768f61ed57d975331e0e9589f","observation_id":"8da632b0-7948-4b03-abd1-5ddc62ed65c0","resolution":{"observed_at":"2026-08-06T11:49:03.699649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:03.334376Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"3d6d9a6d-4e91-4376-865b-829b48a4761c","year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.427787Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:0b27ec6eead83c7077ba6745c5ea96b70249b51ddc9716659b8cb00f5afcc85b","observation_id":"4e2e9ca7-a281-4788-a8fa-6d7acdd0246c","resolution":{"observed_at":"2026-08-06T11:49:03.458002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:03.093188Z","title":"Imagenet-trained cnns are biased towards texture; in- creasing shape bias improves accuracy and robustness,","venue":null,"work_id":"0788c067-0a4e-43c5-a6e4-3ff3cdc79fb8","year":2019},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.499875Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:ffef30590bdff0158bd1a599697f725f46583cf3fa6c78037a1e47b63302f4b4","observation_id":"78db761b-45a7-4d8c-93c3-bea51dac1d77","resolution":{"observed_at":"2026-08-06T11:49:03.211391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.897881Z","title":"Spatial frequency analysis in the visual system,","venue":null,"work_id":"492512bc-32ac-427c-8731-4a902648f281","year":1985},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.569224Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:92d7e25c9964f3fbcbdea31d0424adccabd9fb1f77c76e296de3040c0a454f51","observation_id":"fb8349c0-5713-4d9d-b5d4-d6c9137209f0","resolution":{"observed_at":"2026-08-06T11:49:02.986444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.711764Z","title":"Distinct spatial frequency sensitivities for processing faces and emotional expressions,","venue":null,"work_id":"0d73b51e-acd9-41e2-84b4-4d61276f72b3","year":2003},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.646587Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:3403e0c38fc0807f5b160b7132f5b46284828660a548be79fee160850e8cb567","observation_id":"bb4613a0-1ba0-428d-b6af-978c1f3901b9","resolution":{"observed_at":"2026-08-06T11:49:02.799194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.480599Z","title":"Introducing stable diffusion 3.5,","venue":null,"work_id":"759462a9-9e03-4c42-abce-8ad4ec35e71b","year":2024},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.709172Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:3c00d115d0a757a4b474480520b18ddf84f1593c6a3dd03af06055fde1f5d256","observation_id":"2f1bcce0-e886-4524-b53e-dce94988428c","resolution":{"observed_at":"2026-08-06T11:49:02.589285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.247621Z","title":"Stable imagenet-1k dataset,","venue":null,"work_id":"0038314a-9cef-40a3-9411-7141ee872980","year":2022},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:59.888849Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:2646a5a3987355750ad9190c0e76fec4a4fc2dec8003832c741ad2ba14bd6c80","observation_id":"6861587b-27af-4e91-bb7c-596506ac0055","resolution":{"observed_at":"2026-08-06T11:49:02.354294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14126","last_updated":"2023-03-24T16:33:06Z","snapshot_observed_at":"2026-07-06T15:07:41.634914Z","submitted_at":"2023-03-24T16:33:06Z","title":"CIFAKE: Image Classification and Explainable Identification of AI-Generated Synthetic Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14126","snapshot_observed_at":"2026-08-06T11:49:00.019238Z","title":"Cifake: Image classification and explain- able identification of ai-generated synthetic images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.019238Z"},"links":{"cited_paper":"/paper/2303.14126","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:d348f9549264c08ad09b4582df9b71d56c74e883114d7d44e154f51f4947bd6c","observation_id":"e309ae7e-7ceb-4281-b87f-e04b1c33dabc","resolution":{"observed_at":"2026-08-06T11:49:00.019238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:02.048860Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":"f68c6992-d0c2-44b3-89db-f8f16f8acc00","year":2009},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.111949Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:5e763009bc8b465517408352801dc2542ee71091b87b060d689ad66fae191c70","observation_id":"0917d9f0-2a56-4e18-9b27-bcd0cb0ccb0a","resolution":{"observed_at":"2026-08-06T11:49:02.136374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:01.838037Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":"612fec88-f079-4343-a880-86c8ed78098d","year":2018},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.204015Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:c8fed4bdf9771c219b7b72aefde2c6e7fa7e46fb9933ced862562e457b4bd433","observation_id":"c6b4b5cc-7335-47a3-977e-f1d3d80ce43d","resolution":{"observed_at":"2026-08-06T11:49:01.934927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:01.637590Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"40617d0f-bdc4-4ad1-b987-7668e9ee1054","year":2014},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.382782Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:457e0ec9181f5a32376b67596bd51b2acdd72348d1e6aca6e189e7ead8dadbf5","observation_id":"3739c272-1042-49df-bc10-9049d4ae9d35","resolution":{"observed_at":"2026-08-06T11:49:01.717093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:01.336473Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,","venue":null,"work_id":"60f12388-bc99-4807-a0ce-ee26b7a36982","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.493287Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:c2cabd3504daa2b2d8adf3cac0fea4c90f1661bbcb83edcd2b0402e0a91ee4f8","observation_id":"cfdbfdc5-2132-4c87-bcc9-7c87b37b8eff","resolution":{"observed_at":"2026-08-06T11:49:01.491036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:01.107649Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":"bea0f00f-01d4-4d14-b05f-d80283ee6278","year":2015},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.597773Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:2cf0a26dc423aac0cb075a4329f1dc1350a05c2514f16d4916947b10f5c61ab4","observation_id":"b4d1bede-e084-412d-ac24-69779f4bf2e0","resolution":{"observed_at":"2026-08-06T11:49:01.226733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:49:00.730675Z","title":"Qwen2.5-vl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T11:49:00.730675Z"},"links":{"citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:f0d7c5cdfa2da089da34df8f50ded16e99c08ec8151eca5648da7629bc05a300","observation_id":"0dfd9bf2-eb4c-478b-a725-fba423b2746c","resolution":{"observed_at":"2026-08-06T11:49:00.730675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10474","last_updated":"2025-06-12T08:27:24Z","snapshot_observed_at":"2026-08-07T20:35:28.359427Z","submitted_at":"2025-06-12T08:27:24Z","title":"LLMs Are Not Yet Ready for Deepfake Image Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10474","snapshot_observed_at":"2026-08-06T11:48:58.556863Z","title":"Available: https://arxiv.org/abs/2506.10474","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T11:48:58.556863Z"},"links":{"cited_paper":"/paper/2506.10474","citing_paper":"/paper/2507.22398"},"observation_digest":"sha256:4a28aff6a745079a9c3fcf54b6d0ac2b01e47b2ebaad91fa8160e86603e70671","observation_id":"fe2e8c30-7841-40ba-802c-261fa120293d","resolution":{"observed_at":"2026-08-06T11:48:58.556863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22398","last_updated":"2025-08-13T01:15:41Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:36:08.894734Z","submitted_at":"2025-07-30T05:41:29Z","title":"On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":56},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2507.22398."}