{"as_of":"2026-08-16T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afba0593a332f5b9a6f4f48b1783abb1fa2a78c268a5cc899b6974d7ac2fe351","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:52:56.483685Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11804/citation-record","integrity":"/paper/2505.11804/integrity","json":"/paper/2505.11804/citation-record.json","paper":"/paper/2505.11804"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.229719Z","title":"Deep ensembles work, but are they necessary? Advances in Neural Information Processing Systems, 35: 0 33646--33660, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.229719Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:b94cb6eaa3c758f977bde3ffb2bdb7eb2b93faa960da68f0ae049e085186f671","observation_id":"18507cf6-fa64-42c8-a597-7579c6eb2054","resolution":{"observed_at":"2026-08-15T20:52:56.229719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:52:56.234433Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.234433Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:2e07d2211ce6b8f91a575cce08fcf6fce1e46312879c88183762bcfa12ade438","observation_id":"cedbbd0d-2ac8-4b79-84b4-cfd16e41c138","resolution":{"observed_at":"2026-08-15T20:52:56.234433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.234688Z","title":"Bayesian filtering unifies adaptive and non-adaptive neural network optimization methods","venue":null,"work_id":"9e7f9372-adf6-44a9-a480-966acd813eab","year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.239078Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:9b0b2ed837dc88644bd81012e28f25a41f77a454b6394a837655dc3be3a1703c","observation_id":"32883431-9e4a-4109-8670-305fe033f781","resolution":{"observed_at":"2026-08-15T20:52:57.238707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05912","last_updated":"2021-04-27T14:33:30Z","snapshot_observed_at":"2026-08-13T21:52:14.374757Z","submitted_at":"2020-08-13T13:46:58Z","title":"A statistical theory of cold posteriors in deep neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05912","snapshot_observed_at":"2026-08-15T20:52:56.242887Z","title":"A statistical theory of cold posteriors in deep neural networks","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.242887Z"},"links":{"cited_paper":"/paper/2008.05912","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:6fd88ed62cfe4bedcdeb41c42afbe1639823bc2eb00f90d519d50b88a5aecc6d","observation_id":"98763080-81ab-4a34-9f7e-ed17ac2864b2","resolution":{"observed_at":"2026-08-15T20:52:56.242887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:52:56.247081Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.247081Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:4cf19ee8f5e5fd7b7d6cb0e13bf2311c6471ba6e6412fa19f3bb840818b407f8","observation_id":"3665f6b7-1bdd-461a-aa8e-a208f0dd2ce1","resolution":{"observed_at":"2026-08-15T20:52:56.247081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.251212Z","title":"Weight uncertainty in neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.251212Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:c9e736dfa24744b7cde193a5b0c3a3e879e45431e14edce6d71cd3bad66a027d","observation_id":"4e551cba-c77d-4954-a260-a34f4b1a7644","resolution":{"observed_at":"2026-08-15T20:52:56.251212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07316","last_updated":"2016-04-25T16:03:56Z","snapshot_observed_at":"2026-07-06T04:53:59.754200Z","submitted_at":"2016-04-25T16:03:56Z","title":"End to End Learning for Self-Driving Cars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07316","snapshot_observed_at":"2026-08-15T20:52:56.255381Z","title":"End to end learning for self-driving cars","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.255381Z"},"links":{"cited_paper":"/paper/1604.07316","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:c6e77bd2e31a892fe93549f9df54f1ed99698a18ee1ec21afe002e4958c60a75","observation_id":"8409f062-12a1-4cc5-8278-7773e2b6b34d","resolution":{"observed_at":"2026-08-15T20:52:56.255381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.259545Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.259545Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:362d7fd0935d5f22687e93ee40742ed10fae43f756e1cc3eaf98f178772a39a8","observation_id":"8feb991c-09b1-48d0-b355-4af6de7efb2a","resolution":{"observed_at":"2026-08-15T20:52:56.259545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17767","last_updated":"2024-11-26T07:14:30Z","snapshot_observed_at":"2026-08-13T12:54:03.808817Z","submitted_at":"2024-11-26T07:14:30Z","title":"Exploring Aleatoric Uncertainty in Object Detection via Vision Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17767","snapshot_observed_at":"2026-08-15T20:52:56.262993Z","title":"Exploring aleatoric uncertainty in object detection via vision foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.262993Z"},"links":{"cited_paper":"/paper/2411.17767","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:dcb2b9a574a91a7b2276dad12e3198d5b060f4d94c9780b1fb73ab5c54c99b3c","observation_id":"78f2582b-d383-4c68-959b-63e97d64830b","resolution":{"observed_at":"2026-08-15T20:52:56.262993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.208600Z","title":"Repulsive deep ensembles are bayesian","venue":null,"work_id":"018427d2-0410-4f51-92f2-f9872ba5bf3d","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.266743Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:95af8bc32a60bbd59c6b038ca8cb43e32fdd4b9d3dc4e050aa64a59633242170","observation_id":"e01ef100-8d25-426e-ae77-e926fad91b7c","resolution":{"observed_at":"2026-08-15T20:52:57.212823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.196969Z","title":"Laplace redux-effortless bayesian deep learning","venue":null,"work_id":"b170bd6e-3b02-4060-a50d-841c2ebfb9c1","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.269986Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:6e42ef81066aabf2b5e97aa07454c8b53f31a76b970a0724c435275493c0b5f0","observation_id":"45319218-ed43-48cb-96f7-c68c341533fc","resolution":{"observed_at":"2026-08-15T20:52:57.201140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.185199Z","title":"Bayesian deep learning via subnetwork inference","venue":null,"work_id":"664b3660-24df-4bf2-90e6-55797824f04b","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.273286Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:352acc4caae47d8c17ce53c398b62458f8482e8200cc77629276cafa8e1de3f4","observation_id":"411fca6d-3fe0-4435-ab31-eca4fc948e88","resolution":{"observed_at":"2026-08-15T20:52:57.189262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.276687Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.276687Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:816b1738a80f865625d8ea242569e3c88d387bfc1b58cde9ca2596af06dd8910","observation_id":"fccc8526-d3e9-481a-beb7-2668b5773282","resolution":{"observed_at":"2026-08-15T20:52:56.276687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:52:56.279994Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.279994Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:0a1fe95592208d4e961f1a31a99f26c408ed5a19ccaa8e241a4e57cee296dd12","observation_id":"629dfc1f-76f0-48e6-9b42-db05de895cda","resolution":{"observed_at":"2026-08-15T20:52:56.279994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.283511Z","title":"Dermatologist-level classification of skin cancer with deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.283511Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:0c28f05fb305c6cc488167586f2d3fd960c16cc6630fd67eeb4791ea4e532d2f","observation_id":"3f709518-3900-4897-b9ed-7eca76a2634a","resolution":{"observed_at":"2026-08-15T20:52:56.283511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.286925Z","title":"Are foundation models for computer vision good conformal predictors? arXiv preprint arXiv:2412.06082, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.286925Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:717ab41bfb7feeec3811cfc18b44ce45eb96dfb7083836b31c676507bdb3654a","observation_id":"c1927d40-b4e1-422e-98f9-9b129b8f645c","resolution":{"observed_at":"2026-08-15T20:52:56.286925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.160492Z","title":"Exploring the limits of out-of-distribution detection","venue":null,"work_id":"1b7bca2e-1776-429c-8951-2512e4905f3f","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.290336Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:fe6f692009ba39cd6bbcc282e0f7324395cd1ecebefcdf063b50262a403d80a7","observation_id":"557ddf94-84ee-4f41-bfe9-806916e29bf8","resolution":{"observed_at":"2026-08-15T20:52:57.164607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.294819Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.294819Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:bf18ea6e34e1d0a7911ba6b7a3d26093ae5b21a42b46365227783bf57305fa27","observation_id":"30f8e77d-a566-4c11-b11a-079543059270","resolution":{"observed_at":"2026-08-15T20:52:56.294819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-15T20:52:56.298080Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.298080Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:98bcb2382e2f4abebd78fc0cd45893b2bbfa8cff1d2d8663b3eba04f7c61666d","observation_id":"28045dd5-60ff-452b-acb1-53e65f699353","resolution":{"observed_at":"2026-08-15T20:52:56.298080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.301730Z","title":"Recent advances in open set recognition: A survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.301730Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:a665b3c33a9148c3111ac26d1068e03fa33e2b18e3baa16755e05927bc5c7d92","observation_id":"06e425f4-f97c-49b2-be17-3320dc783e0f","resolution":{"observed_at":"2026-08-15T20:52:56.301730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.305156Z","title":"Practical variational inference for neural networks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.305156Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:bbb716ab5d7c185f985eebe2ca4e33e8a9d4d6a33f4a155bd62768fadca04033","observation_id":"77463db9-9529-4332-87e1-6327208cc06f","resolution":{"observed_at":"2026-08-15T20:52:56.305156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02917","last_updated":"2024-05-05T12:51:38Z","snapshot_observed_at":"2026-08-16T13:55:18.261813Z","submitted_at":"2024-05-05T12:51:38Z","title":"Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02917","snapshot_observed_at":"2026-08-15T20:52:56.308626Z","title":"Overconfidence is key: Verbalized uncertainty evaluation in large language and vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.308626Z"},"links":{"cited_paper":"/paper/2405.02917","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:944177a1b2c233f9393e521ce7e8c2bd576fd3664c2dc08631e5638ae5a102f7","observation_id":"ecebaa37-a3f8-4971-bca7-bd7d50311e38","resolution":{"observed_at":"2026-08-15T20:52:56.308626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.312300Z","title":"On calibration of modern neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.312300Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:b6720a2cbf7c5d26be43a71bb704c3ecfb9cf4d6ce4b03ca2a1bc6127bcbf68c","observation_id":"8c260fc0-5ba0-4c6b-b2cb-722b80e325ff","resolution":{"observed_at":"2026-08-15T20:52:56.312300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-15T10:34:34.836991Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-15T20:52:56.315627Z","title":"Benchmarking neural network robustness to common corruptions and perturbations","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.315627Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:3b5427bcf7c88468e400cac6865988cc7d9d2bde73c159b1508ca1e4764a7c82","observation_id":"827259ee-4198-4a68-a763-cf95f3ac30a3","resolution":{"observed_at":"2026-08-15T20:52:56.315627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04606","last_updated":"2019-01-28T20:34:44Z","snapshot_observed_at":"2026-08-14T17:45:07.132382Z","submitted_at":"2018-12-11T18:49:50Z","title":"Deep Anomaly Detection with Outlier Exposure","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04606","snapshot_observed_at":"2026-08-15T20:52:56.319261Z","title":"Deep anomaly detection with outlier exposure","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.319261Z"},"links":{"cited_paper":"/paper/1812.04606","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:db607113778aab1c55555a78583397f68c9266718e888ca05d327e53dc0be669","observation_id":"64b2fd75-84f9-47b9-92a8-4e014ec93b1b","resolution":{"observed_at":"2026-08-15T20:52:56.319261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.122455Z","title":"Pixmix: Dreamlike pictures comprehensively improve safety measures","venue":null,"work_id":"fbf4ada2-386e-42db-844a-128ff5d28eaf","year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.323015Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:08e74469114387f4e996e58034fa5abea76e36dd1d27b4871d587c10d37ac8ea","observation_id":"4541490e-54f2-4f67-8179-68b7b8483ade","resolution":{"observed_at":"2026-08-15T20:52:57.126248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.111093Z","title":"Meta-learning in neural networks: A survey","venue":null,"work_id":"578ac6b6-7b44-4cec-b198-74274527564a","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.326160Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:19ebd24e32e8314456ddfdb7423a4313ec06166fd4d6f672b3a3c57aa9a0f4f1","observation_id":"43d52c2e-947e-40d5-9223-314aa240c5a1","resolution":{"observed_at":"2026-08-15T20:52:57.115187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.329122Z","title":"Improving predictions of bayesian neural nets via local linearization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.329122Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:6e5241e4f4d38a3dbb89835c46666e9dccb3d271c195b94a7174f30cf56db20f","observation_id":"4bf11f3f-0d07-4702-a06a-c4ad82f518fa","resolution":{"observed_at":"2026-08-15T20:52:56.329122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.093307Z","title":"What are bayesian neural network posteriors really like? In International Conference on Machine Learning, pp.\\ 4629--4640","venue":null,"work_id":"dc8f368b-1647-4a6f-985a-ae4afb489b14","year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.331972Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:b221a709b48ba38d606de20f3987631c5ba0803a5d57a8060369d417a2842108","observation_id":"8a5e09ed-3158-4d02-a245-f9c6f88aea79","resolution":{"observed_at":"2026-08-15T20:52:57.097682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-15T20:52:56.334837Z","title":"Language models (mostly) know what they know","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.334837Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:0fcc6bbbbe23c7bc68b861c48b43608956d7c0df37777500e4d767552dd597a4","observation_id":"fa6ed01a-38c0-4f5d-ac60-22e4ae6cdb59","resolution":{"observed_at":"2026-08-15T20:52:56.334837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.338012Z","title":"What uncertainties do we need in bayesian deep learning for computer vision? Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.338012Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:1e9dd91222c31a458fcbae69d976aff85556c68e9d7809f62d784f0c76fe181a","observation_id":"bb66e643-7335-42c1-858d-508216ba2e2a","resolution":{"observed_at":"2026-08-15T20:52:56.338012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14418","last_updated":"2024-02-24T12:30:40Z","snapshot_observed_at":"2026-08-16T14:16:18.299665Z","submitted_at":"2024-02-22T10:04:17Z","title":"Uncertainty-Aware Evaluation for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14418","snapshot_observed_at":"2026-08-15T20:52:56.340889Z","title":"Uncertainty-aware evaluation for vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.340889Z"},"links":{"cited_paper":"/paper/2402.14418","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:a79d4541ee8e83816006b474c3eb4accd2dd08a026b5b09cea084d53628dc37f","observation_id":"27ccbf3d-b64b-45e7-8e09-36b109e3f375","resolution":{"observed_at":"2026-08-15T20:52:56.340889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-15T20:52:56.344271Z","title":"Semantic uncertainty: Linguistic invariances for uncertainty estimation in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.344271Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:adcc4da7e2471da4042180461e67a50149e6c892b9b3e9d6454901179757bf0c","observation_id":"bb82df96-3222-459a-ae41-c04f3efc172d","resolution":{"observed_at":"2026-08-15T20:52:56.344271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.348245Z","title":"Simple and scalable predictive uncertainty estimation using deep ensembles","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.348245Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:9f14dab30a07c32fef780433c735c2018506b4fdbce1ca5df7baf0c4c3349971","observation_id":"f9def78b-8058-4a24-be03-6944b1341ae0","resolution":{"observed_at":"2026-08-15T20:52:56.348245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.351808Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.351808Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:edb132c465c6f37c70fe379af45ed6279a77afef20a6f8ee2240f8a45c17fcf8","observation_id":"212c24e0-c073-47df-b911-5f2d0b704a02","resolution":{"observed_at":"2026-08-15T20:52:56.351808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.355263Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.355263Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:3332516510998cd73f0feb950e312682965920e6f31fc7443a78802f223fa973","observation_id":"bdb8dda3-812d-4f94-bfab-37669e51ff9a","resolution":{"observed_at":"2026-08-15T20:52:56.355263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.359327Z","title":"Simple and principled uncertainty estimation with deterministic deep learning via distance awareness","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.359327Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:130ee2a56fb6e0539b322d1a9429d260fe422303dafca7371b44662aedd0c7bf","observation_id":"bde9a2b3-1512-4ca5-82ea-414dd6f9a83e","resolution":{"observed_at":"2026-08-15T20:52:56.359327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.362797Z","title":"A practical bayesian framework for backpropagation networks","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.362797Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:78fa35f3d40499017ac3567cd61e48ee973ce03bcbbd49454b729dcc959cccd5","observation_id":"2f348dbc-0965-4061-99a0-78d0c8f19c65","resolution":{"observed_at":"2026-08-15T20:52:56.362797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.042366Z","title":"A simple baseline for bayesian uncertainty in deep learning","venue":null,"work_id":"efdd2b8a-7761-4d2e-8951-83f20f8586bb","year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.366297Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:43654b67b8a044ce8bef6917d039f212e6e64dd196d58855c94416592c4eb80b","observation_id":"ec79956c-317c-4a5b-af4f-6de4a4be039d","resolution":{"observed_at":"2026-08-15T20:52:57.046294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.031186Z","title":"Bayesian exploration of pre-trained models for low-shot image classification","venue":null,"work_id":"6b6967ae-a663-493f-bd3b-53e6b22658e9","year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.369691Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:be6569077ede8406874439e18b9629d3821de9162d5a3974bafcad9578b906ba","observation_id":"1df92c4e-f9fb-4b68-a7e8-92ae2bde67d8","resolution":{"observed_at":"2026-08-15T20:52:57.035027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.373167Z","title":"Revisiting the calibration of modern neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.373167Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:483b88599f214b7f328e607ecf78da7077c7bbc47d7efa3ea52d154288264ccb","observation_id":"9786d05d-77e2-4617-b395-eb999933a265","resolution":{"observed_at":"2026-08-15T20:52:56.373167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21794","last_updated":"2025-06-18T17:03:35Z","snapshot_observed_at":"2026-08-16T13:29:26.889475Z","submitted_at":"2024-07-31T17:59:58Z","title":"Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21794","snapshot_observed_at":"2026-08-15T20:52:56.377150Z","title":"Generalized out-of-distribution detection and beyond in vision language model era: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.377150Z"},"links":{"cited_paper":"/paper/2407.21794","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:690c710b4b5961245b038f7b3b05d0d455b34588495bb9ed20b4a4d495bc8882","observation_id":"3fbeaae9-1b81-4403-89ab-ef0754462a7c","resolution":{"observed_at":"2026-08-15T20:52:56.377150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20331","last_updated":"2025-06-09T11:51:00Z","snapshot_observed_at":"2026-08-16T14:05:08.187327Z","submitted_at":"2024-03-29T17:59:53Z","title":"Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20331","snapshot_observed_at":"2026-08-15T20:52:56.380700Z","title":"Unsolvable problem detection: Evaluating trustworthiness of vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.380700Z"},"links":{"cited_paper":"/paper/2403.20331","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:ecba9b1d0ec3d6329d4572c7bbba20278a61c1c35ca8b2fc8c5dd17edd7838cb","observation_id":"a759f1de-357d-4a06-9a52-dc7320867727","resolution":{"observed_at":"2026-08-15T20:52:56.380700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10963","last_updated":"2021-01-14T21:11:06Z","snapshot_observed_at":"2026-08-06T05:58:45.817385Z","submitted_at":"2020-06-19T05:08:43Z","title":"Evaluating Prediction-Time Batch Normalization for Robustness under Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10963","snapshot_observed_at":"2026-08-15T20:52:56.384279Z","title":"Evaluating prediction-time batch normalization for robustness under covariate shift","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.384279Z"},"links":{"cited_paper":"/paper/2006.10963","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:9aced2254444c256e6e430a54f4c3a1754771a28abc8c953a74947b586e93213","observation_id":"314fb2a4-52ea-41eb-8316-fe777bd7bbc2","resolution":{"observed_at":"2026-08-15T20:52:56.384279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09136","last_updated":"2019-02-24T11:57:32Z","snapshot_observed_at":"2026-08-15T00:45:03.614274Z","submitted_at":"2018-10-22T08:32:02Z","title":"Do Deep Generative Models Know What They Don't Know?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.09136","snapshot_observed_at":"2026-08-15T20:52:56.388125Z","title":"Do deep generative models know what they don't know? arXiv preprint arXiv:1810.09136, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.388125Z"},"links":{"cited_paper":"/paper/1810.09136","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:051913ab01b8da7d26bb0cee585a19f0856ffe8b7ef4dcc57e09697acee0905c","observation_id":"01d92e8a-6e00-4b10-8277-bfa395f44dd2","resolution":{"observed_at":"2026-08-15T20:52:56.388125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:57.015075Z","title":"Dropout as a structured shrinkage prior","venue":null,"work_id":"b615945a-a42d-42c2-a60f-6d7efbc1b70c","year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.391807Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:ce5300981e93ecc300e9b916950f5e91c6c30fccfeba41dbcd233a6abdca5b7c","observation_id":"97eb6c3d-b7df-4ff2-9e0e-3493f0283521","resolution":{"observed_at":"2026-08-15T20:52:57.018288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02994","last_updated":"2019-10-16T13:43:36Z","snapshot_observed_at":"2026-08-16T06:05:16.511181Z","submitted_at":"2019-06-07T10:03:16Z","title":"Detecting Out-of-Distribution Inputs to Deep Generative Models Using Typicality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02994","snapshot_observed_at":"2026-08-15T20:52:56.395152Z","title":"Detecting out-of-distribution inputs to deep generative models using typicality","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.395152Z"},"links":{"cited_paper":"/paper/1906.02994","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:176059b970a127655ad6529567d90dfe170838b85c712ee29781c3c1cda8899e","observation_id":"23661cca-18a7-4897-bd4e-4802c7fb251b","resolution":{"observed_at":"2026-08-15T20:52:56.395152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.399665Z","title":"Bayesian learning for neural networks, volume 118","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.399665Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:0e3adfa1cdbf874a4e38e0cca816b983074b85b940000a4c693927fccf351e2d","observation_id":"081cc503-bcec-4137-bf8d-95c2e4f061a2","resolution":{"observed_at":"2026-08-15T20:52:56.399665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.402972Z","title":"Kernel language entropy: Fine-grained uncertainty quantification for llms from semantic similarities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.402972Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:b9e88ffe3ee1489d83f7f2c084a1b35a07b9519a2de53c72f96bfe30a717960d","observation_id":"e659dbbd-8eec-4a80-87c0-6a6881a294ce","resolution":{"observed_at":"2026-08-15T20:52:56.402972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.992007Z","title":"Measuring calibration in deep learning","venue":null,"work_id":"438e7d7d-0d48-4e9c-84bf-0c416b6e096e","year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.406558Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:e3f2c92e99e1719a9022146c4a4d0e46b2ae71b19a679dc84f88326ea7e9c722","observation_id":"4affa65a-5400-4e84-882c-9b1003e73c00","resolution":{"observed_at":"2026-08-15T20:52:56.995360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.410158Z","title":"Can you trust your model's uncertainty? evaluating predictive uncertainty under dataset shift","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.410158Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:5f2031e4485f1aac15086021f28622b650fdb7eb3e5c32289c1f1dd6edf666b2","observation_id":"ca16067b-61ef-45b8-a696-0e60bc86b389","resolution":{"observed_at":"2026-08-15T20:52:56.410158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.974593Z","title":"Astroclip: a cross-modal foundation model for galaxies","venue":null,"work_id":"1f4a9d98-5e6c-40b9-b96b-7a7bf5ccde2e","year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.413943Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:03274828d729534fb70f2df284e0b15d8145cb73168f7420608fbd1dc7b13f1c","observation_id":"5b9ade2a-1121-44ed-9b37-7dd7cfb528ac","resolution":{"observed_at":"2026-08-15T20:52:56.978470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.417338Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.417338Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:3abc62705d2a8364f9c690a5cb51c6044ee4d003b73e983b2d96a997cf68582f","observation_id":"d5be2ac6-e76c-4631-b302-8022f659b847","resolution":{"observed_at":"2026-08-15T20:52:56.417338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.420703Z","title":"Do imagenet classifiers generalize to imagenet? In International Conference on Machine Learning, pp.\\ 5389--5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.420703Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:4a520b3b4c48d63d1eb76021e4e3de0bc0853a7df1d5a8ce01923dc16f5b731f","observation_id":"aa6886f8-0ad9-44c3-b141-8b923ab0ae03","resolution":{"observed_at":"2026-08-15T20:52:56.420703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-15T20:52:56.423706Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.423706Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:cb1c2fc930bc845f609436db4ec7cb5f5f723d08d359a9dc875a5c5b6197cdd5","observation_id":"13542eb1-a85b-4ccb-a6e5-f3caf72752d5","resolution":{"observed_at":"2026-08-15T20:52:56.423706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.950440Z","title":"Test-time adaptation with state-space models","venue":null,"work_id":"c57d91df-fdda-47db-a016-790fb46f2d51","year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.426760Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:7ea5f45f0e3c52508a6f1e4137d3f8541e6b6bf4662f0ecae55cf214b13e1687","observation_id":"07cefc81-b209-4592-b42e-868a25a6f874","resolution":{"observed_at":"2026-08-15T20:52:56.954202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.938832Z","title":"Improving robustness against common corruptions by covariate shift adaptation","venue":null,"work_id":"ef183622-fb32-4f38-ba5a-0c84417c1e64","year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.430245Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:b527f6e0b976c435c0fd5ac15fd67b4c4a10ae14be05cf8d6fe2ea0e8035f83e","observation_id":"5659a4ec-665d-483c-b1f5-f1b5b6e784a7","resolution":{"observed_at":"2026-08-15T20:52:56.942893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13548","last_updated":"2025-05-10T07:10:46Z","snapshot_observed_at":"2026-08-14T16:46:25.561386Z","submitted_at":"2023-10-20T14:46:48Z","title":"Towards Understanding Sycophancy in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13548","snapshot_observed_at":"2026-08-15T20:52:56.433794Z","title":"Towards understanding sycophancy in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.433794Z"},"links":{"cited_paper":"/paper/2310.13548","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:65e39cd45a829704961fe308caf4816c75f652939e35cf10120d62879ef13e41","observation_id":"95781dc6-27ca-4e6a-a241-61f45e149c6e","resolution":{"observed_at":"2026-08-15T20:52:56.433794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.437598Z","title":"Ptb-xl, a large publicly available electrocardiography dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.437598Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:f65827a2654a503a3613ae8aaf88721794cc3525723455df8c96601bea9769f8","observation_id":"c41e84b3-2a9b-4c08-aed7-92108060877c","resolution":{"observed_at":"2026-08-15T20:52:56.437598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.920208Z","title":"Galaxymnist: Galaxy images labelled by morphology (shape)","venue":null,"work_id":"f3aa9eee-e5b0-4040-8adc-94673dc3ce90","year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.441010Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:f1516a5714bf04f098d0d0b8b6056fbcfc5e46621da1c5dac18d421bec85722a","observation_id":"0cc9b714-e464-45af-b52e-762c66bfb404","resolution":{"observed_at":"2026-08-15T20:52:56.924197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.908505Z","title":"Galaxy zoo decals: Detailed visual morphology measurements from volunteers and deep learning for 314 000 galaxies","venue":null,"work_id":"7d01801b-ee28-4e65-9bb4-3d15433a4918","year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.445056Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:344b5f55362d4f1daf42bec0f94d69bbe5b4c539cf6161d308ad9a82bf894711","observation_id":"59e6728a-bac4-4de4-8a66-6466038538dd","resolution":{"observed_at":"2026-08-15T20:52:56.912789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11927","last_updated":"2022-06-23T18:07:27Z","snapshot_observed_at":"2026-08-16T16:50:47.517264Z","submitted_at":"2022-06-23T18:07:27Z","title":"Towards Galaxy Foundation Models with Hybrid Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11927","snapshot_observed_at":"2026-08-15T20:52:56.449341Z","title":"Towards galaxy foundation models with hybrid contrastive learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.449341Z"},"links":{"cited_paper":"/paper/2206.11927","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:166c88e3c9a08188326be07839066fb94cc8ea7083e5cd244ad61cfd36983418","observation_id":"2d8889da-12f8-4d8f-936e-dd389fceef4c","resolution":{"observed_at":"2026-08-15T20:52:56.449341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.453498Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.453498Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:b2f6b09353eac0800af65051e3415c36aff615593b90480ecca4e96ec61dee50","observation_id":"36d6ab4a-e280-4dbb-b23b-a238ae332875","resolution":{"observed_at":"2026-08-15T20:52:56.453498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T20:52:56.457241Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.457241Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:588e0e15c10f12d3f5f2df4e095994dfd9046d578ab046d67a0263db37af85ee","observation_id":"1cb1d169-314a-471b-8823-5b9e48ab69c2","resolution":{"observed_at":"2026-08-15T20:52:56.457241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19475","last_updated":"2025-09-03T09:19:05Z","snapshot_observed_at":"2026-08-14T19:09:04.015462Z","submitted_at":"2024-11-29T05:10:47Z","title":"GalaxAlign: Mimicking Citizen Scientists' Multimodal Guidance for Galaxy Morphology Analysis","version":2},"cited_work":{"arxiv_id":"2411.19475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19475","snapshot_observed_at":"2026-08-15T20:52:56.560101Z","title":"GalaxAlign: Mimicking Citizen Scientists' Multimodal Guidance for Galaxy Morphology Analysis","venue":"cs.CV","work_id":"f9d4ab6c-b279-449e-a8ad-cf76ffa2aad5","year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.461066Z"},"links":{"cited_paper":"/paper/2411.19475","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:34e1fa98a7796ff33b0105221ee8c2a7984a4d76693e24ecdba5c5059ea97cdd","observation_id":"b77bd107-3e42-46b4-85ee-2b089ce05bee","resolution":{"observed_at":"2026-08-15T20:52:56.564140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.891255Z","title":"Robustness to corruption in pre-trained bayesian neural networks","venue":null,"work_id":"707bd255-3d2d-45bd-ad67-8584798d5402","year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.465094Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:645e6adba827eca78e865012924ceca8e69b84e0517a72e3b88fbf702cf031da","observation_id":"234bd614-b79b-4101-b440-a80ba3c63a72","resolution":{"observed_at":"2026-08-15T20:52:56.894486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.468707Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.468707Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:b8a56c8c34f5fe14bfee6ee9806f4ffd966c33a3c2f958f86d57dba6ec79e3be","observation_id":"82781fd4-39de-4f64-80d9-efe7f6d85d33","resolution":{"observed_at":"2026-08-15T20:52:56.468707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.02405","last_updated":"2020-07-02T22:18:12Z","snapshot_observed_at":"2026-08-13T20:13:40.043420Z","submitted_at":"2020-02-06T17:38:48Z","title":"How Good is the Bayes Posterior in Deep Neural Networks Really?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.02405","snapshot_observed_at":"2026-08-15T20:52:56.472328Z","title":"How good is the bayes posterior in deep neural networks really? arXiv preprint arXiv:2002.02405, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.472328Z"},"links":{"cited_paper":"/paper/2002.02405","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:7d6fb7e44fcb093c0e4d683872358f388bfa43cefc2c8bd4bc5b018479caa836","observation_id":"2a3995fa-a60b-49ea-9616-c3709ae2ab92","resolution":{"observed_at":"2026-08-15T20:52:56.472328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01755","last_updated":"2024-03-18T21:31:29Z","snapshot_observed_at":"2026-08-16T14:55:37.897385Z","submitted_at":"2023-10-03T02:37:57Z","title":"ImageNet-OOD: Deciphering Modern Out-of-Distribution Detection Algorithms","version":2},"cited_work":{"arxiv_id":"2310.01755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01755","snapshot_observed_at":"2026-08-15T20:52:56.530716Z","title":"ImageNet-OOD: Deciphering Modern Out-of-Distribution Detection Algorithms","venue":"cs.CV","work_id":"51eb6ea1-19a2-4b23-bfa4-887fac331b94","year":2023},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.475848Z"},"links":{"cited_paper":"/paper/2310.01755","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:8ee7e63ee8bc4424f1e17ef549d5687b09b02af4bae235e4fa015c4d278573ed","observation_id":"9d86e994-b039-438f-8674-11e93204d740","resolution":{"observed_at":"2026-08-15T20:52:56.536581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11919","last_updated":"2024-11-28T13:35:56Z","snapshot_observed_at":"2026-08-16T19:08:16.706246Z","submitted_at":"2024-11-18T04:06:04Z","title":"VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11919","snapshot_observed_at":"2026-08-15T20:52:56.479782Z","title":"Vl-uncertainty: Detecting hallucination in large vision-language model via uncertainty estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.479782Z"},"links":{"cited_paper":"/paper/2411.11919","citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:2ce47f2ff2f86ca0a07a92d4d8f5664172bfb6ec5473cea6df7566d78bd077fd","observation_id":"c37699cb-f054-4069-b4f9-0acb61fa0027","resolution":{"observed_at":"2026-08-15T20:52:56.479782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:56.483685Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T20:52:56.483685Z"},"links":{"citing_paper":"/paper/2505.11804"},"observation_digest":"sha256:10085c2c564f5737b35f27d2959202628ba471bab079aca152a62bd7dbd80efa","observation_id":"0c8755d8-47b2-43bf-a95e-f425bc9a2c25","resolution":{"observed_at":"2026-08-15T20:52:56.483685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11804","last_updated":"2025-05-17T03:16:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:37:59.724370Z","submitted_at":"2025-05-17T03:16:49Z","title":"Are vision language models robust to uncertain inputs?"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2505.11804."}