{"as_of":"2026-08-21T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5508f1b8776fc34ec433db4b3e60f0d7728262a5f0ca9bf9e36f32411131b855","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:48:52.582823Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02124/citation-record","integrity":"/paper/2608.02124/integrity","json":"/paper/2608.02124/citation-record.json","paper":"/paper/2608.02124"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T14:48:43.969188Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:43.969188Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:7aad2ec84f64635dc58584722c0557f3256c6f645b0226f8d1905060613dc165","observation_id":"de399724-4fb0-46d1-901b-4420b6d1144c","resolution":{"observed_at":"2026-08-04T14:48:43.969188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11829","last_updated":"2024-10-15T17:55:22Z","snapshot_observed_at":"2026-08-20T08:20:12.062762Z","submitted_at":"2024-10-15T17:55:22Z","title":"MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11829","snapshot_observed_at":"2026-08-04T14:48:44.056463Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.056463Z"},"links":{"cited_paper":"/paper/2410.11829","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:ebd96c99820b58c5f8f49e562f0f0e5f5631a3ee34a61e40812bb6a970b2769d","observation_id":"c2fffe71-b3a8-4c11-b98d-61e614c74e39","resolution":{"observed_at":"2026-08-04T14:48:44.056463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:44.121747Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.121747Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:c3f3a5339fd3fde970c5120f158a25759e3e9c917400272328361a0b90af0c2c","observation_id":"1cd0337c-4d37-42e4-bcd2-db36d0373ae7","resolution":{"observed_at":"2026-08-04T14:48:44.121747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:44.176581Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.176581Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:e02a1b9ab36784a68445539dc15b4fa6b9ca7456c8fb23b38d9042333ce0c274","observation_id":"43dc680c-20ab-44c6-887d-fb2d0b854e31","resolution":{"observed_at":"2026-08-04T14:48:44.176581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:44.340224Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.340224Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:4b088d9cb3d77a813d3666b119e55e30be28c0e18bda1164b204e9c075fe8618","observation_id":"30ddce2d-6734-4dbf-89ea-85302e73e84b","resolution":{"observed_at":"2026-08-04T14:48:44.340224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:44.416820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.416820Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:a6e7cb207c78000f7d6bc0c2e73ba90bd62c4ded3e3c6677243c97b9d77de221","observation_id":"0e03fd56-f0cf-4ff6-8577-a67fc5c65f95","resolution":{"observed_at":"2026-08-04T14:48:44.416820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:44.530745Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.530745Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:ba8a187f2c58033a2125bb8d1822002335246991d1d7cb49fa7e86041775ccc0","observation_id":"be064b5b-3603-48b5-b189-174fe253841c","resolution":{"observed_at":"2026-08-04T14:48:44.530745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-04T14:48:44.720562Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.720562Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:5f4ff750c8df32661985a5532e7c601c74b5dbf0c164f1de163a4edd94107cba","observation_id":"44400a52-b8cf-4792-98e7-05d0ca7b99e1","resolution":{"observed_at":"2026-08-04T14:48:44.720562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:44.897497Z","title":"N.; Namboodiri, V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.897497Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:74cb3b154138873f93a77f77183832f73c220e0581e704cb00443bf71f7e9126","observation_id":"96041f91-5693-4bd5-ab1c-7f57ebbdfbed","resolution":{"observed_at":"2026-08-04T14:48:44.897497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:44.935970Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:44.935970Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:1db3c5c717cae406833eaddacdda78fddce9551eef5f0980450c3a65248053ef","observation_id":"cf0ab714-8404-4ead-a900-052efd992e73","resolution":{"observed_at":"2026-08-04T14:48:44.935970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13043","last_updated":"2024-07-18T02:54:35Z","snapshot_observed_at":"2026-08-20T08:46:10.002353Z","submitted_at":"2024-03-19T17:58:39Z","title":"When Do We Not Need Larger Vision Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13043","snapshot_observed_at":"2026-08-04T14:48:45.165044Z","title":"E.; and Darrell, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:45.165044Z"},"links":{"cited_paper":"/paper/2403.13043","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:96bc2c145a2abc104cfb9cc14223e6b35cbd0b576368262f11b91a9f0e3b221b","observation_id":"144f1609-5b75-41cc-9cd7-a031ea417612","resolution":{"observed_at":"2026-08-04T14:48:45.165044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:45.220878Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:45.220878Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:368a80f898a2eb7a1c36bef45986d8c47c5f98013e11616e1e18ef64e2bf4e71","observation_id":"e64e58b4-67ce-4c86-8776-e012710d4491","resolution":{"observed_at":"2026-08-04T14:48:45.220878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06912","last_updated":"2026-04-08T10:12:30Z","snapshot_observed_at":"2026-08-16T09:35:47.926898Z","submitted_at":"2026-04-08T10:12:30Z","title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06912","snapshot_observed_at":"2026-08-04T14:48:45.351380Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:45.351380Z"},"links":{"cited_paper":"/paper/2604.06912","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:b72f730afc5d1b50eafd876b984c7c82f0b0079ca27cc842eac2ea8d6abd21c1","observation_id":"4e2ec3c5-2608-4d9c-bb26-89b5c15c6c3d","resolution":{"observed_at":"2026-08-04T14:48:45.351380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06038","last_updated":"2026-05-18T14:51:17Z","snapshot_observed_at":"2026-08-02T14:57:47.919020Z","submitted_at":"2025-08-08T05:49:42Z","title":"Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06038","snapshot_observed_at":"2026-08-04T14:48:45.480334Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:45.480334Z"},"links":{"cited_paper":"/paper/2508.06038","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:cad1fef2754867f7b4ea638dfdf5da730025b591a374287f0c28c6069513c4c5","observation_id":"5b78899a-2155-4ef4-b679-741d3b183aad","resolution":{"observed_at":"2026-08-04T14:48:45.480334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-19T03:39:30.749912Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-08-04T14:48:45.590719Z","title":"J.; Lai, X.; Yu, B.; Zhao, H.; and Jia, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:45.590719Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:52fe5e7241005277d2b0c7b1dc2419d9e48133c9614a6db6c368ee1327fd4bf0","observation_id":"acfb3eed-9d37-47d4-9f02-b0800db2683c","resolution":{"observed_at":"2026-08-04T14:48:45.590719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13800","last_updated":"2024-11-14T23:53:05Z","snapshot_observed_at":"2026-08-20T06:24:16.112659Z","submitted_at":"2024-05-22T16:25:03Z","title":"Dense Connector for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13800","snapshot_observed_at":"2026-08-04T14:48:45.715995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:45.715995Z"},"links":{"cited_paper":"/paper/2405.13800","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:b4c65959f767d7f52d0c148056f1b8f13cb2a89b5573ff857274a4aa2f7e6ba2","observation_id":"c417a8f9-0141-47b0-8dd7-9ed585864b46","resolution":{"observed_at":"2026-08-04T14:48:45.715995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-08-18T15:38:18.649112Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-08-04T14:48:45.814594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:45.814594Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:866111f22f44268f4810d5dc7b551d2435a91becc962cbeef90846ade6d11873","observation_id":"f8687fac-5066-44d6-8b58-586f7b84c939","resolution":{"observed_at":"2026-08-04T14:48:45.814594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.021249Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.021249Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:8220a5d221e5537f654688d9390507d094afc80c178bee2dfc6d534fbd3fbbd9","observation_id":"64a95b8f-fe89-47d2-8cfb-91fdd338076d","resolution":{"observed_at":"2026-08-04T14:48:46.021249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.137922Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.137922Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:291c6c2a01545328bec66b3f0fa9d9eb2231d16e7c530adf8f1b17bac96fb184","observation_id":"8e2b24a0-4b4b-4ad0-8315-920f7adb0b91","resolution":{"observed_at":"2026-08-04T14:48:46.137922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.226407Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.226407Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:befe111be8a90b1c53831eaef3064fa68bc409f35a467f68df5febf75947226a","observation_id":"af7dcd06-032e-4797-a26c-9ce8bfb560c1","resolution":{"observed_at":"2026-08-04T14:48:46.226407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.340222Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.340222Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:6b894ebce33c6e1e4979b317d604eaef056a76d07bc865b2d3cb797f8c0c5357","observation_id":"3b916927-64cb-4c4b-846e-c9809962057d","resolution":{"observed_at":"2026-08-04T14:48:46.340222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.418040Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.418040Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:0e7cb4086e96bd7a71cd72d47d35a0186ea25e76dfa012073f7f9cb5de72ae10","observation_id":"b3ecfb50-22c4-4d95-8385-514e132fe3a4","resolution":{"observed_at":"2026-08-04T14:48:46.418040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.558148Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.558148Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:5fa0116ef8bf0a0e1ab1c0f98e2fa70d891f6371a27df5f40d0492a73c532fc8","observation_id":"03fe792c-d016-4a7b-a7ad-daac79b11906","resolution":{"observed_at":"2026-08-04T14:48:46.558148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.712925Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.712925Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:a9765a613c46e1599fd2a402678350ba035d7a29ee7996e94b967308ccd09f42","observation_id":"090765f9-7abf-486b-b552-e810b9493cad","resolution":{"observed_at":"2026-08-04T14:48:46.712925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.856323Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.856323Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:6afa490805fa8af1b671813f8e2862576bc0f6dcbc9d42dda5e17678b050980d","observation_id":"2d6ddde0-7aec-4829-9871-a1647dbdd637","resolution":{"observed_at":"2026-08-04T14:48:46.856323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:46.923981Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:46.923981Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:8c158730140e0e590b6fed28285fcd1353215f3385b90f2923d88433f4541779","observation_id":"1600d731-86c3-47f7-a4a2-730f3ca565ef","resolution":{"observed_at":"2026-08-04T14:48:46.923981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:47.028993Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:47.028993Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:eb654252b9e749acbd9ca006bdf7357f94788393b1a51173ebf768a4a8db6836","observation_id":"9421e6aa-14fb-4b7e-bb8a-d768a88c9ecc","resolution":{"observed_at":"2026-08-04T14:48:47.028993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:47.184516Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:47.184516Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:9fdf226847794187d4159b27ba0b54a5c6290b9f26a93eda0747ebe8ecbeda00","observation_id":"dbcf287c-62fb-4bb3-a6e8-4cf9e83de084","resolution":{"observed_at":"2026-08-04T14:48:47.184516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:47.307867Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:47.307867Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:12a0785945abbcab9628289c1c55c836eb90b0b93f37094339d879824165597f","observation_id":"da17d591-215a-41d0-b868-81f5fa81b7f4","resolution":{"observed_at":"2026-08-04T14:48:47.307867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:47.435964Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:47.435964Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:2369091150ecc9ab9afcef5139614d365b0c1a8373c5c210975ff737b8c1b320","observation_id":"b5c28d71-5321-4e33-b5ae-01eeb6143dbf","resolution":{"observed_at":"2026-08-04T14:48:47.435964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:47.531919Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:47.531919Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:e45c3ae8cf80152cc079a840784a495fcd30276930e4d670ef495804a11ae2a8","observation_id":"31eb79f8-777e-4253-95cf-653c72ff48da","resolution":{"observed_at":"2026-08-04T14:48:47.531919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:47.681408Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:47.681408Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:c7673236fd0622662d07799a64c40eedcf03b4d0aef1ce94ca0387d07ab0c901","observation_id":"fdb65b42-4085-4b4a-be57-2300483acc34","resolution":{"observed_at":"2026-08-04T14:48:47.681408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:47.789563Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:47.789563Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:61a20c443e67eded817553fba4fb093fd2614c9f0506734d22f964bbc469b7eb","observation_id":"66bf706b-31c4-4b61-a7ae-a51e31dd9735","resolution":{"observed_at":"2026-08-04T14:48:47.789563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:47.881297Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:47.881297Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:6feb91e3fac610a8027885ccee288e15d0937654c13ed9d17084364de267f4fe","observation_id":"eba592ce-c111-4f79-bec2-efd110b588f0","resolution":{"observed_at":"2026-08-04T14:48:47.881297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.004725Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.004725Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:45de3a4d31f425acd5f17165bfd71429d575ea53503f77d47fde26737754bafe","observation_id":"c15c28a3-7a6c-4f7a-8729-1d0ff6f34e59","resolution":{"observed_at":"2026-08-04T14:48:48.004725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.127093Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.127093Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:8017995034371d9a6ea508c583655c99d6868ebcadedc81ceb9e3aa5dae5eb52","observation_id":"291d24a3-be13-4e50-a728-a118ec387745","resolution":{"observed_at":"2026-08-04T14:48:48.127093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.267226Z","title":"CoRR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.267226Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:cbaadd79c4b24c7828a6436f6a8b32e55274702d5e9874a681e8dddbec2c8e7e","observation_id":"21291e92-5ca7-4f46-a5ed-fc6e6aa11ebb","resolution":{"observed_at":"2026-08-04T14:48:48.267226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.414808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.414808Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:d10d8bd4af174cb1a92cbc8d4535e50ae6fca56fb497e4c41919401010fee083","observation_id":"d1a71bae-ad9c-41f0-b813-64243f7f994f","resolution":{"observed_at":"2026-08-04T14:48:48.414808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.551649Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.551649Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:50d1446dac84c3a2056302604d09c8672979ad31dbeb221763e6a4248049d5b5","observation_id":"2d88e5da-b754-47c9-bda0-7ceaa8574d44","resolution":{"observed_at":"2026-08-04T14:48:48.551649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.689715Z","title":"2023 IEEE/CVF International Conference on Computer Vision (ICCV) , year=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.689715Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:7ae44b6a047ba8860b6126b64b8c016f44ef4fe8cb87200c12bba79488dc93cd","observation_id":"4ddfd35f-675b-41e0-a156-5d6fb0074965","resolution":{"observed_at":"2026-08-04T14:48:48.689715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.815245Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.815245Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:26de1ca570d6f0c6dbbb0e213bf22cea52ca4274e9eb5ab39732f9fe5c0f28ce","observation_id":"047396e1-0a73-4b4b-87c7-206c9dc750d9","resolution":{"observed_at":"2026-08-04T14:48:48.815245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.910257Z","title":"2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.910257Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:8a5013b3f8340d14466e1fc9beea0ff619f6cc8870762b9530084d8084a10784","observation_id":"0d7f6593-6c9c-4bd5-91dd-35a4d064a70b","resolution":{"observed_at":"2026-08-04T14:48:48.910257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:48.971482Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:48.971482Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:92b384bd44e1afca0acff801fcdcef3033e80143b094e3ec86ed4a0a4e230e59","observation_id":"f9c67a96-c046-43f5-8e65-e71b9b107583","resolution":{"observed_at":"2026-08-04T14:48:48.971482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.081321Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.081321Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:191b3677d45d7b4d24f367975e3298a2c81cb7bf8bc06ffff25b16a94d1aa2c6","observation_id":"aa0d6f9b-b58e-47ce-a41a-87516f7b01b3","resolution":{"observed_at":"2026-08-04T14:48:49.081321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.192567Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.192567Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:4ad34e929ced42444959d9c2a5a7570b9c6f4484a78c7b48626049ea00419049","observation_id":"a75bc033-64bb-4799-be39-9d607bc5534e","resolution":{"observed_at":"2026-08-04T14:48:49.192567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.318289Z","title":"International Journal of Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.318289Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:654c0b8ff8f63069639599da5b600fa7cae277d5b47ba1ea081cbadab0c56d75","observation_id":"a0c5a36e-fd3d-4b65-b4c7-5d5341e9d66d","resolution":{"observed_at":"2026-08-04T14:48:49.318289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.454743Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.454743Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:4409a717a9871f8e40977be5abcbc42b2db4fdfe6eabec41b0c16204be4aa4cf","observation_id":"241c5ab9-4886-4e5c-9cd6-e3e2c5c4eae5","resolution":{"observed_at":"2026-08-04T14:48:49.454743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.539404Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.539404Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:15870c0a0768cac212a4e19d0ba854e5c53181e228da71a1834557b579526f8d","observation_id":"602c55c8-6ac6-45ce-a95e-bc3a2d9d18b3","resolution":{"observed_at":"2026-08-04T14:48:49.539404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.585135Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.585135Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:f40269f64dc89fa327c229bd2cb0a2693f7d2b1eca16fcb7af16804ac83e81c7","observation_id":"acb7afe4-09e1-45fb-8c56-3dddb62a0200","resolution":{"observed_at":"2026-08-04T14:48:49.585135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.712390Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.712390Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:bb5cafaa0859ed9b508b10d7f831fdacfdf120297229a4499f9230d08032a51d","observation_id":"aaf6184b-7c7b-4e2e-b467-a01eb367fe15","resolution":{"observed_at":"2026-08-04T14:48:49.712390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.819870Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.819870Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:0896c1a27768ad5880670e4cddd6b9a8cf33dfd9c644d0fef34d54da4551261a","observation_id":"8bec512c-a4c6-47f3-98ab-ed8caecb90df","resolution":{"observed_at":"2026-08-04T14:48:49.819870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:49.971513Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:49.971513Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:377d1428947b448f78cb2c7f9785083e75d7650317632750b7048f73cc0d3238","observation_id":"942656b2-fb43-43f2-af0e-d72d3e7614be","resolution":{"observed_at":"2026-08-04T14:48:49.971513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:50.056558Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.056558Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:763fade633d12a78111702da4dc5cdb60d2e417b5a4f856ca535377722ddeb60","observation_id":"a15d9a1e-9783-4e95-b048-bcdbe813516a","resolution":{"observed_at":"2026-08-04T14:48:50.056558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:50.126928Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.126928Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:0a3fc1ad7f750ca07fd1735a601e887b613091c009776c7006facdd6523e6bc1","observation_id":"40dcbf8f-8f1d-49e0-bb83-6e572be0f168","resolution":{"observed_at":"2026-08-04T14:48:50.126928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:50.231894Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.231894Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:aad9299d1b647917373d16f51bdff956e4aa462c08e456c57723d236b249277b","observation_id":"11108345-f18c-4398-82ab-b873d92f15a0","resolution":{"observed_at":"2026-08-04T14:48:50.231894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:50.334839Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.334839Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:fbb262ddbd34b9262df70b62e898390eb8c92860db9d2104bdac144f6840b206","observation_id":"4a026308-ff39-47e5-bd5e-89d1b93db05c","resolution":{"observed_at":"2026-08-04T14:48:50.334839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:50.440638Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.440638Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:6c90416a7c090926b9ff3d50bae170d3943e2297c3ea2c60196a0dd09d9a7456","observation_id":"2cdd7a55-1e91-492e-ad90-79ef76a57a8a","resolution":{"observed_at":"2026-08-04T14:48:50.440638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:50.552949Z","title":"and Namboodiri, Vinay P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.552949Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:a466f0ce36c225ccab3f74ca01742dd8838d56e36aa1cbe0514972ea0269f8de","observation_id":"93dbe3ed-41a0-48e3-972f-20e22203d96d","resolution":{"observed_at":"2026-08-04T14:48:50.552949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:50.666879Z","title":"Science China Information Sciences , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.666879Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:12eb8dd67273d2e0e40d30309eb8ac50091eca06838974168997acedf1b67b6e","observation_id":"53eb6ad7-adca-44a0-8a33-fca4d5bd1e36","resolution":{"observed_at":"2026-08-04T14:48:50.666879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06038","last_updated":"2026-05-18T14:51:17Z","snapshot_observed_at":"2026-08-02T14:57:47.919020Z","submitted_at":"2025-08-08T05:49:42Z","title":"Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06038","snapshot_observed_at":"2026-08-04T14:48:50.773160Z","title":"arXiv preprint arXiv:2508.06038 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.773160Z"},"links":{"cited_paper":"/paper/2508.06038","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:92df55756b9989f59f98131d8934c2839af1733141d6128d90f502f0216bc790","observation_id":"a1299f09-257b-440a-9af8-095664394631","resolution":{"observed_at":"2026-08-04T14:48:50.773160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:50.880398Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.880398Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:7085616f90d47e1da29ebc895ac99db4ed59fff5876768d4fdc54841f4a95e28","observation_id":"6b0360f1-95f5-4033-ace3-cffda4546dd9","resolution":{"observed_at":"2026-08-04T14:48:50.880398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02327","last_updated":"2026-06-29T08:02:49Z","snapshot_observed_at":"2026-08-14T17:17:11.947846Z","submitted_at":"2026-04-02T17:59:49Z","title":"Steerable Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02327","snapshot_observed_at":"2026-08-04T14:48:50.999848Z","title":", title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:50.999848Z"},"links":{"cited_paper":"/paper/2604.02327","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:1aae1ae46baac43b2fbbe4f6327e5e2e932a7f2b68ad8cb6614b522923e79df5","observation_id":"1322f124-be03-4ba3-af3d-c48d16d75b3d","resolution":{"observed_at":"2026-08-04T14:48:50.999848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-09T11:39:14.249967Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19584","snapshot_observed_at":"2026-08-04T14:48:51.126553Z","title":"arXiv preprint arXiv:2606.19584 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.126553Z"},"links":{"cited_paper":"/paper/2606.19584","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:295970d386598c5b76cc9ce4067013e79b2a8a7bf6e9520b6822fdcd0f0e7f98","observation_id":"bfdd4eff-2c2d-400e-bbbe-6f7e1f2e63ef","resolution":{"observed_at":"2026-08-04T14:48:51.126553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00655","last_updated":"2026-04-14T16:56:45Z","snapshot_observed_at":"2026-08-11T06:06:49.310844Z","submitted_at":"2026-02-28T13:57:19Z","title":"Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00655","snapshot_observed_at":"2026-08-04T14:48:51.255520Z","title":"arXiv preprint arXiv:2603.00655 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.255520Z"},"links":{"cited_paper":"/paper/2603.00655","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:338cb1655391b36823625b85e367afad4c25c16e26949389c9a69cc74a8ceede","observation_id":"3d3fcb34-938d-4d67-a31f-3d227bc49011","resolution":{"observed_at":"2026-08-04T14:48:51.255520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03795","last_updated":"2026-06-02T15:42:54Z","snapshot_observed_at":"2026-08-18T11:05:12.418221Z","submitted_at":"2026-06-02T15:42:54Z","title":"Beyond Compression: Quantifying Spectral Accessibility in Vision Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03795","snapshot_observed_at":"2026-08-04T14:48:51.416685Z","title":"and Zhao, Yijun , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.416685Z"},"links":{"cited_paper":"/paper/2606.03795","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:b3a397fbba9b7ae6effc77d882271fda0fbfd6a6083a57649691b163abede02c","observation_id":"5792d494-0667-4ee3-bb48-f1acbfb98d1b","resolution":{"observed_at":"2026-08-04T14:48:51.416685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27875","last_updated":"2026-04-30T13:54:50Z","snapshot_observed_at":"2026-08-15T06:38:56.081576Z","submitted_at":"2026-04-30T13:54:50Z","title":"Frequency-Aware Semantic Fusion with Gated Injection for AI-generated Image Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27875","snapshot_observed_at":"2026-08-04T14:48:51.510269Z","title":"arXiv preprint arXiv:2604.27875 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.510269Z"},"links":{"cited_paper":"/paper/2604.27875","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:8845ebf6429e3435c4714a8be632876a99d403928ab824bb33f18523d5feddd8","observation_id":"ecad2929-9575-4e1a-962b-ef00230b8e95","resolution":{"observed_at":"2026-08-04T14:48:51.510269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:51.626024Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.626024Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:5297081c147cfa252c2551c3e5bd5709adfccd9c0fc9ef60d84e9975ad5e3c61","observation_id":"9dd3309e-0592-4e21-b029-45d3a1483166","resolution":{"observed_at":"2026-08-04T14:48:51.626024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:51.764106Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.764106Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:9d842eff35b5c8a3f1048e46f3b5fe5ff082645807845fa1e97f20a01cc90c1b","observation_id":"a66da503-d8df-407b-84bf-dbd60afb2a86","resolution":{"observed_at":"2026-08-04T14:48:51.764106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:51.909805Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.909805Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:66c223a00f3a4d1325b88e5cd2992740fa66d9a6da7b8bd2f20d001936bbd519","observation_id":"53ef75c1-0cb2-4013-89d0-7daee29346bc","resolution":{"observed_at":"2026-08-04T14:48:51.909805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:52.007440Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:52.007440Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:05420595a7d969d23519820a2b0fda7b790767169aeb094f928039b8fd08fe31","observation_id":"3fddfbcf-c317-4a0c-bc88-946f8148ced6","resolution":{"observed_at":"2026-08-04T14:48:52.007440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:52.173595Z","title":"Proceedings of the National Academy of Sciences of the United States of America , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:52.173595Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:d5c7873956b9be2e01cf7a645cb69e944e71637458f360c798e403ae35139587","observation_id":"94b82b6a-306e-4b39-b7da-b8c6cf622630","resolution":{"observed_at":"2026-08-04T14:48:52.173595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:52.282036Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:52.282036Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:2ce30471cdc93a7cb61a86282ecd586c502c71fd7b2a5d5c9139c1be4d27f34c","observation_id":"544eadbd-c563-413e-a9be-78f73d2962c6","resolution":{"observed_at":"2026-08-04T14:48:52.282036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:52.426337Z","title":"2000 , url=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:52.426337Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:e8fbd6469967f99d7a158d25dbc3ac703eff2ddd05b06a4dbf11ef2556edf130","observation_id":"439a63f6-b818-470b-8a33-260b1398e90a","resolution":{"observed_at":"2026-08-04T14:48:52.426337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:48:52.582823Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:52.582823Z"},"links":{"citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:4f84d2c7fbb78bef5b152f5c7e332098952c756dd5d1195d32e8c587ea388ada","observation_id":"31a74270-6905-4cb8-bc2d-38cce55501cd","resolution":{"observed_at":"2026-08-04T14:48:52.582823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:12:21.823387Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2608.02124."}