{"as_of":"2026-08-06T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5631ba0e2acbfbca17e8994cd6b65ad1a0e6ef4d0287d39856140a08d008297","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T20:26:42.128350Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.04473/citation-record","integrity":"/paper/2604.04473/integrity","json":"/paper/2604.04473/citation-record.json","paper":"/paper/2604.04473"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.09837","last_updated":"2025-03-14T01:44:17Z","snapshot_observed_at":"2026-07-06T20:51:36.789173Z","submitted_at":"2025-03-12T20:58:16Z","title":"On the Limitations of Vision-Language Models in Understanding Image Transforms","version":2},"cited_work":{"arxiv_id":"2503.09837","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.09837","snapshot_observed_at":"2026-07-03T05:07:39.099869Z","title":"arXiv preprint arXiv:2503.09837 (2025)","venue":null,"work_id":"23b085bd-ca1e-4736-9743-b799d26e410d","year":2025},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2503.09837","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:16f3bddd4423e560e2e3436d0bfd937deb6e5b83b4ac9270cf569bafdfd492ee","observation_id":"efe8bd61-f1df-471a-aadd-d80cb4365493","resolution":{"observed_at":"2026-05-10T21:55:52.631238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T21:21:26.318938Z","title":"In: Proceedings of the IEEE international confer- ence on computer vision","venue":null,"work_id":"31686120-1e3a-4e24-aad2-d2a238c991e9","year":2015},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:0475d3c7b0ced919b9593803ab9125447dbe7933240c61eff76bbd9c92728a33","observation_id":"c4ebc740-3b9f-49bc-8f6c-e7b9b8cfb57d","resolution":{"observed_at":"2026-05-16T01:30:30.492782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:e9fa7760f173c3fd2dc13ee375cace35517634b11beb909c35d636b001befc9c","observation_id":"5313a0bf-3628-4dae-acad-ab1c33c61f9b","resolution":{"observed_at":"2026-05-14T01:52:01.553388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"a422244a-b62e-4cfa-afac-d154088bde78","year":2023},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:12e83aa4f837539d771017b783c80a50d2b57c211cc77736dd7691619cc63a83","observation_id":"cd72d4ef-a157-491e-a9a1-32b1341351e6","resolution":{"observed_at":"2026-05-16T01:30:30.502432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems 32(2019)","venue":null,"work_id":"4b1856c4-c3d1-4dae-ac39-f38345fd3dbe","year":2019},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:e72c8956da0c36b25234e331a1956d8d04d480236a035a5103a114581bd7d51c","observation_id":"ba501ef0-15d0-43f7-8db5-9e977e01934d","resolution":{"observed_at":"2026-05-16T01:30:30.489639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:7186d9b82d06e3914ccf85b61363ed9aa360129ee6bb2494e8d2f3d300a60f2c","observation_id":"e914de77-f439-4790-90f7-f5d68b1d84f0","resolution":{"observed_at":"2026-05-10T21:55:52.598548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"1ba06916-93cd-4354-8c65-93607c97b638","year":2021},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:ca2450c92f4ceef90ea21ee6a87796a9297f88260940589b55c1532400d34061","observation_id":"04da5921-1a57-41fd-bd90-4e9615452ef6","resolution":{"observed_at":"2026-05-16T01:30:30.495644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"See https://vicuna","venue":null,"work_id":"c25aa0aa-f8ff-47e3-865c-c80cafa19769","year":2023},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:01ffbfd0c246151ee5084547264415461fbe25f7f42300ad8dbb0275d5125247","observation_id":"6de5cf50-b901-4cf3-9175-7c11c97e76a0","resolution":{"observed_at":"2026-05-16T01:30:30.498715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11751","last_updated":"2023-10-14T12:56:13Z","snapshot_observed_at":"2026-08-02T21:47:41.540245Z","submitted_at":"2023-09-21T03:24:30Z","title":"How Robust is Google's Bard to Adversarial Image Attacks?","version":2},"cited_work":{"arxiv_id":"2309.11751","doi":"10.48550/arxiv.2309.11751","metadata_source":"pith","pith_arxiv_id":"2309.11751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How robust is Google’s Bard to adversarial image attacks?","venue":"cs.CV","work_id":"0808b24c-a08e-44cf-8998-346530bebb32","year":2023},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2309.11751","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:ff55cd6089801290de0ea617b0799ffc9696c15f82fd0907f4690386149560b0","observation_id":"53d0f926-60b8-4177-85f5-47de7a482584","resolution":{"observed_at":"2026-05-10T21:55:52.672143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:50:49.487989Z","title":"Distill6(3), e30 (2021)","venue":null,"work_id":"34962dc1-f69e-4046-8871-4bc240b0b564","year":2021},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:95a0098701d4869fa01e12ef956a97891156960742716644c7de27a1bb5ca3fa","observation_id":"1a1d45f1-436e-4a42-a493-87455cc34cbc","resolution":{"observed_at":"2026-05-16T01:30:30.556902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:58.653982Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"2b42ac4b-8b63-4295-aa9e-72012235e428","year":2021},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:1711c1949da317d29cb488dff555201b5026fe2f66da36a2e0fc78c8fc58f543","observation_id":"7f02b71f-7fef-4ddc-8cbf-dcec57cf09c4","resolution":{"observed_at":"2026-05-16T01:30:30.532863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: International Conference on Learning Represen- tations (2019)","venue":null,"work_id":"a28e9723-a475-4249-b06e-226dce18ab20","year":2019},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:d8e612480f316c6c67a7864d5bc424087fb1d8eace92f092f02305dad8daa0eb","observation_id":"b3dfd729-56bc-4fc7-ab2b-e5660deaf825","resolution":{"observed_at":"2026-05-16T01:30:30.568663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:42.307021Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"7dbfc623-78dd-4e93-8e49-8372a6646720","year":2021},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:b30b7bab76335e8c9fddb74462de9d3d0eafc3010be503fa7b87f2a0eec21e0c","observation_id":"bea6562a-0c9a-4e8e-a1cf-af89ae5a73be","resolution":{"observed_at":"2026-05-16T01:30:30.572763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:50:49.474454Z","title":"Advances in Neural Information Processing Systems35, 29262–29277 (2022)","venue":null,"work_id":"c0bf0b3b-0526-4255-bb1e-5e07d10dca42","year":2022},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:ea054268e863e7f34f4cdb42498505ef6536e427f00e409b23fa5a2be181ab43","observation_id":"b89058a5-bd4b-4cc6-a554-a0ebf5f6718b","resolution":{"observed_at":"2026-05-16T01:30:30.543885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:07:58.712618Z","title":"In: International conference on machine learning","venue":null,"work_id":"e6164d9f-1b2e-4f60-b2c5-0e54d11af273","year":2021},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:4ab7720b1c367c7c162e49f74c7a065ef3b1a0601433cc67d2bda54420808a9a","observation_id":"a9819fe1-d73c-4943-ba76-c671f442ffd7","resolution":{"observed_at":"2026-05-16T01:30:30.589215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:06:35.483671Z","title":"In: International conference on machine learning","venue":null,"work_id":"22ffc0fc-0e30-4787-a2dc-413b36c1ba9d","year":2023},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:d2010c3fea9d03da0b53e939d30b0af8f075f4826ab8da16a16670fd1c17ba65","observation_id":"a0569cad-285a-49ff-959f-ead1bd7c7e6f","resolution":{"observed_at":"2026-05-16T01:30:30.536422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The Thirteenth International Conference on Learning Representations","venue":null,"work_id":"e9947df5-56a4-4ed6-8d29-9ac63c8f9c18","year":null},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:6854044355525d969a4bb8a7acacdee5b2de28178ca3e383a7679441fac0b7dd","observation_id":"35b188a2-bf67-435d-affa-8e8a94f5dff6","resolution":{"observed_at":"2026-05-16T01:30:30.584527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/075280-1516","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advances in neural information processing systems36, 34892–34916 (2023)","venue":"Advances in Neural Information Processing Systems 36","work_id":"06321a03-5a54-43d4-940e-cc7a186031d5","year":2023},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:8ec6c40976daa64f90f6f7e0c5eedf75af8e3b60aa68bfc0bd8cc6f71fc4f369","observation_id":"4f660090-338a-4c39-81aa-031f03dce1b9","resolution":{"observed_at":"2026-05-16T01:30:30.549112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-16T18:50:36.714002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T18:50:36.714002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition","venue":null,"work_id":"bb0c8bba-dc82-4bf1-9e93-64836e305c3a","year":2022},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:48b634e1417aef5da7025392f4b371a8d88fed5fe78931e7991969d98dab95a3","observation_id":"e2f4c631-6b09-4e5e-ae72-a3cd94fa1cab","resolution":{"observed_at":"2026-05-16T01:30:30.560617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:31:41.555121Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"2101d117-5c27-46ae-8f7c-667235a252b0","year":2022},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:a8317f1956db310424069346b917c7d5549c74f12ee74c29b15045a631e89090","observation_id":"bd86b4b7-d13a-44a7-b81a-782c15b19235","resolution":{"observed_at":"2026-05-16T01:30:30.593403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:096abc4d27a83e9f9e1ed223d3ee466ea57855f7fed09c8c7fcc1a496b50f8af","observation_id":"9df69bec-bde3-4b33-8a69-849040417ee2","resolution":{"observed_at":"2026-05-10T21:55:52.655740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:44.272383Z","title":"In: International conference on machine learning","venue":null,"work_id":"69077c18-2906-43b3-9114-9a7539e22548","year":2021},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:5fbebd8ad47cc50648078694d3ac0934cd713d4cb8f344bde915b3020c69b1de","observation_id":"1095e8a4-d54c-40f0-8eb9-268e53c4c98a","resolution":{"observed_at":"2026-05-16T01:30:30.553607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T21:31:29.846475Z","title":null,"venue":null,"work_id":"1e2ceac2-78de-453a-ab5c-d451d5fbaf56","year":2019},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:615e7ac12fb9186dd51999d942381870941021527ab66a5a866f4ad70900f65b","observation_id":"7eb436a9-ad9c-4f9e-b406-8e9b47d19979","resolution":{"observed_at":"2026-05-16T01:30:30.564265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Forty-first International Conference on Machine Learning Vision-Language Model Evaluation 15","venue":null,"work_id":"626e09ee-ff2f-4eb2-b2de-1cc7a003fa6c","year":null},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:bfd624726d972899d6b7958958600be16685c376c4aef11df5f0f51b329985a9","observation_id":"2134f50f-b3fc-47f8-8db4-353e814f6dd9","resolution":{"observed_at":"2026-05-16T01:30:30.528746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"d1e38ef6-1caa-47a6-aba3-c1d1f937566b","year":2024},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:2f45178e8d5312ded24276a91895158d6978743fec7bfa0d1f4f5e54d4cd9baa","observation_id":"01a34e15-6858-4c41-b62a-07f7f86942ec","resolution":{"observed_at":"2026-05-16T01:30:30.511519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3cec537e-05e3-438a-a3cc-a391359da838","year":2022},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:0c8765ad7deda9b4618b01fac1183898c7563587fb733b1c757f6a08a4e634cb","observation_id":"3225f32c-dba2-4cbb-8567-f257e1cee257","resolution":{"observed_at":"2026-05-16T01:30:30.525087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DataBricks (May, 2023) www","venue":null,"work_id":"30bdba72-533e-4f3e-a487-9088d45c2f7c","year":2023},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:eeaa7e941e3021de61122af344c0ae390aa691c2d8f9fb3b484d5d6e19cfe6f7","observation_id":"e8fd1413-eafd-47a0-b6c3-8e5b9efdab7c","resolution":{"observed_at":"2026-05-16T01:30:30.515435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:cdf3c3b1042e55a1fa72e6423293942ca781332ffa12785d2eaaea373040248e","observation_id":"1a7e33da-a28a-4c72-b3fe-9c75e168f906","resolution":{"observed_at":"2026-05-11T14:08:37.771343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04247","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:29:44.993191Z","title":"arXiv preprint arXiv:2511.04247 (2025)","venue":null,"work_id":"2abdc6ad-0ddf-4e9d-a92c-bef0f4ddbb41","year":2025},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:d662cb50e957e7d5ade51b19810a2f0e451efdbe21e44ae294c7a645532d83a1","observation_id":"d04ec15a-d122-4c18-ac53-4c4fe6dc591e","resolution":{"observed_at":"2026-05-10T21:55:52.604722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:27d2a9a56f4c85aa8cb74e17fd002ae9a4a75f979f55ed7dbc249be0af7d7058","observation_id":"edba0192-fe75-44b3-a647-ab7fc01bf47f","resolution":{"observed_at":"2026-05-10T21:55:52.619079Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)","venue":null,"work_id":"f828c241-d8d7-4db4-8132-43a2a9eefc3c","year":2025},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:2719857aca117090da25b48028e0c1006da9dfc7a904c6f92aa4ac8ae09f9b53","observation_id":"6d67bf92-5cb4-4edb-9948-6cc3c6d49de4","resolution":{"observed_at":"2026-05-16T01:30:30.505539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems32(2019)","venue":null,"work_id":"5128ba79-2c79-4586-80b4-840ef4344ca7","year":2019},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:a524870951f4391000e461674efd8fd0723b45b5366bb99ee910f9ee8dbd92ac","observation_id":"0be954b5-e5ad-4f72-8f49-40004a2e6579","resolution":{"observed_at":"2026-05-16T01:30:30.521674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.4414861","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Target: X5","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"ad7d7d73-57dc-478c-a117-965c95beeed7","year":2019},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:014801d7387064bfb150e4fa82ad25549d3885542cefc342b59305a0fc59b3b9","observation_id":"59f7f079-cfb4-45f8-be54-5e4805318be0","resolution":{"observed_at":"2026-05-10T20:30:47.397486Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-17T00:21:30.331143+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T00:21:30.331143+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"d2b4ffa2-ae75-4f72-b975-bb6dbbf25ec5","year":2020},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:3145a107fdddbc0dd9b390d32fef2808477b8b6baef2fe695abe39775bfc1a8c","observation_id":"5d37bf9d-255e-444f-823f-e80981eab542","resolution":{"observed_at":"2026-05-16T01:30:30.508558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"9cf50736-4691-4a34-be94-d69ff2abbd50","year":2019},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:4c67cf2bf94cd70f898a4e7f18294a32da35a60dbf846c0ab242e9ab423e71eb","observation_id":"8ec7da37-a6f4-416c-b4eb-2f22882a10aa","resolution":{"observed_at":"2026-05-16T01:30:30.539684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:34:31.824528Z","title":"Advances in Neural Information Processing Systems36, 54111–54138 (2023)","venue":null,"work_id":"a6d5e1c2-34c5-4786-a0d6-1c4f9fdc287f","year":2023},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:cd586a5b80d79cf9b1cd622968bb76d190c0d7af2afe563495070fc068a776f5","observation_id":"0c018309-7c15-43a4-ae02-f8cb71a1da04","resolution":{"observed_at":"2026-05-16T01:30:30.597098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02029","last_updated":"2025-01-03T07:01:15Z","snapshot_observed_at":"2026-07-06T20:16:22.788626Z","submitted_at":"2025-01-03T07:01:15Z","title":"Spot Risks Before Speaking! Unraveling Safety Attention Heads in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2501.02029","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02029","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.02029 (2025)","venue":null,"work_id":"5429c1db-5afa-4093-bab4-398b3a5b4249","year":2025},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2501.02029","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:e51f4b0ca385e76d96c991fb2fce89f931c78480d60f2ebad312046f3dd738b3","observation_id":"2c4a8ed0-1635-4b35-ad3a-3e8feb02ff16","resolution":{"observed_at":"2026-05-10T21:55:52.623591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"ab7e112c-911c-46d9-a648-4c1801eb7b28","year":2022},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:f118ed076213ff0246f12a51b970565bb59db70bd53eefa1ed5c9041a1076fac","observation_id":"5838d69c-556f-4f98-a5fc-74bcbb337158","resolution":{"observed_at":"2026-05-16T01:30:30.576498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia","venue":null,"work_id":"826d93e6-62b8-42fd-a3be-f18a998ab776","year":2024},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:aae1ee7b1c444f8e4e9a6667292c2f5f590fe2abaadfd68dc84e1c306e428ff4","observation_id":"180a22e5-eb2a-4744-b590-7156935c53de","resolution":{"observed_at":"2026-05-16T01:30:30.580420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":6,"verified_fuzzy":27},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2604.04473."}