{"as_of":"2026-08-21T06:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88a41c5b5230816b915a9a7ba5da13e55a3a3ce173aeb90a75af020b076ff07a","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:22:04.590968Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07742/citation-record","integrity":"/paper/2608.07742/integrity","json":"/paper/2608.07742/citation-record.json","paper":"/paper/2608.07742"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19794","last_updated":"2025-06-11T16:24:02Z","snapshot_observed_at":"2026-08-14T00:22:50.649312Z","submitted_at":"2024-12-27T18:47:05Z","title":"MVTamperBench: Evaluating Robustness of Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19794","snapshot_observed_at":"2026-08-11T00:22:04.429523Z","title":"Mvtamperbench: Evaluating robustness of vision-language models.arXiv preprint arXiv:2412.19794, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.429523Z"},"links":{"cited_paper":"/paper/2412.19794","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:6883c4c3d8a3b9f970ff62d86e04de4b67055673247cac0444c621ce8b24a196","observation_id":"d2c2178e-d379-4a56-897d-87886bdf3e79","resolution":{"observed_at":"2026-08-11T00:22:04.429523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.373791Z","title":"Introducing claude opus 4.7.https://www.anthropic.com/ news/claude-opus-4-7, 2025","venue":null,"work_id":"b314ef6d-9259-443f-ad81-9b64dbdd6e42","year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.435574Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:6f47706c262f3e7305baea0c86af6b4f215246baef7cc57cd97db9df3784a8ac","observation_id":"95930af6-152d-4847-b574-9db3ec94d04c","resolution":{"observed_at":"2026-08-11T00:22:05.378432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T00:22:04.440754Z","title":"Qwen-vl: A frontier large vision-language model with versatile abili- ties.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.440754Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:2a69f1310ae3442e94a693d6d3ba4c20d6d510235a0b94861f6148c54db1f727","observation_id":"4c94f25a-33c2-4698-959f-ee90b9dc19d3","resolution":{"observed_at":"2026-08-11T00:22:04.440754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15906","last_updated":"2026-05-15T12:44:02Z","snapshot_observed_at":"2026-08-17T02:44:17.349384Z","submitted_at":"2026-05-15T12:44:02Z","title":"A Causally Grounded Taxonomy for Image Degradation Robustness Evaluation","version":1},"cited_work":{"arxiv_id":"2605.15906","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15906","snapshot_observed_at":"2026-08-11T00:22:05.176705Z","title":"A Causally Grounded Taxonomy for Image Degradation Robustness Evaluation","venue":"cs.CV","work_id":"5edc4fa5-c433-4c75-bd23-e6d36b841fc8","year":2026},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.446081Z"},"links":{"cited_paper":"/paper/2605.15906","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:5218006f5e973b46319d8d914af619182df06918af76ade01c6132814cb482b1","observation_id":"b932f388-47a0-4804-ac2d-41960520aa31","resolution":{"observed_at":"2026-08-11T00:22:05.182052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T00:22:04.452206Z","title":"Mmstar: Are we on the right way for evalu- ating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.452206Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:c58e06560fc27de603dc70c8d687a9bdcea2ff2fb0c42a21093a0fa70444b2c3","observation_id":"53cb5de0-1ae7-4706-acb0-8c3b05b38293","resolution":{"observed_at":"2026-08-11T00:22:04.452206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.20377","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.133446Z","title":"Internvl 2.0: Scaling up vi- sion foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2403.20377, 2024","venue":null,"work_id":"6e8c2ba5-5d91-4ec3-8092-116088592dd3","year":2024},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.457825Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:736c8c436c99d5d15bc89ac4307eb37f92471f54843d80b8c501e02469c29131","observation_id":"ad1aca39-c351-47cf-b3b5-d0434f2eff2f","resolution":{"observed_at":"2026-08-11T00:22:05.141286Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.358819Z","title":"Evaluating large language models on multimodal chemistry olympiad exams.Communications Chemistry, 8(1):402, 2025","venue":null,"work_id":"2daab644-f73d-4524-b30a-51b9e52bf403","year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.463203Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:91540df4cb2c8ebd8fb0e1548c133bc267627b97b7dc67fa98f09dba1b75bf33","observation_id":"a97dc704-e90e-44dc-8ce7-65813d6950c3","resolution":{"observed_at":"2026-08-11T00:22:05.363918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T00:22:04.467478Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning.arXiv preprint arXiv:2305.06500, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.467478Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:26148987ad9c180909223a3f11ce282e0d6352831af5d53e2cb1b7b61a68701d","observation_id":"2b2ce3a9-5fb5-4169-a1ef-6bf59d01f2c0","resolution":{"observed_at":"2026-08-11T00:22:04.467478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.344114Z","title":"Interpretable explanations of black boxes by meaning- ful perturbation","venue":null,"work_id":"a8ab2685-76e1-4670-a5e5-e2936d711126","year":2017},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.471999Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:b4182316e5ac6e4a27d3f1e00ed1bbbda81de9c568913a7d5ac8f05f16ff4185","observation_id":"5d6e35fd-5613-486b-a416-a173a01a4d8e","resolution":{"observed_at":"2026-08-11T00:22:05.348717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.329245Z","title":"Can llms solve molecule puzzles? a multi- modal benchmark for molecular structure elucidation","venue":null,"work_id":"6eb54225-b1af-44d2-93a4-e4838d8a5b5b","year":2024},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.476478Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:875ee26bc6b7030f447d95d2699fa83da2a3b8b54e73833bd762b6b05102b654","observation_id":"e652fded-c6a9-4ec3-b0b0-86b3dadf5bcc","resolution":{"observed_at":"2026-08-11T00:22:05.333869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:04.481013Z","title":"Benchmarking neural network robustness to common corruptions and perturbations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.481013Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:3d1316911afb23263a7385cc35525d61468616da6a6a3c9f6668a09c5e605e4a","observation_id":"26d8f4cb-3c24-40e4-89a5-93569dda0e23","resolution":{"observed_at":"2026-08-11T00:22:04.481013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.302889Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"c286d362-158e-4bf7-a7cf-bc23491c41a2","year":2021},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.485666Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:3dec16cf8ccf5100be5d97ad6be48987b1b03f3f843256eb44974b9c6320cb83","observation_id":"ef188135-90db-4fc3-a947-f7e27123e080","resolution":{"observed_at":"2026-08-11T00:22:05.308149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.287588Z","title":"Azam Hossain","venue":null,"work_id":"6847293e-d91d-4e7b-85cb-ca7549177bfc","year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.489854Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:66b8bdfebadf32c65669e709569405ad82cd1b754c440c4a26e369c6a5a7f5e3","observation_id":"f5854e3c-71a6-4a23-a0e6-f5033ddecc6d","resolution":{"observed_at":"2026-08-11T00:22:05.292014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05474","last_updated":"2024-10-07T20:12:08Z","snapshot_observed_at":"2026-08-16T13:11:45.865913Z","submitted_at":"2024-10-07T20:12:08Z","title":"R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05474","snapshot_observed_at":"2026-08-11T00:22:04.495381Z","title":"R-bench: Are your large multimodal models robust to real-world corruptions?arXiv preprint arXiv:2410.05474, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.495381Z"},"links":{"cited_paper":"/paper/2410.05474","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:9e1d17ad1de36f6ef1b9d7eb24f5e2dd4144dcbb21d7fe6e176fd79195b5d985","observation_id":"d0af0bd5-dea9-481a-9b50-1c8f3c83cac4","resolution":{"observed_at":"2026-08-11T00:22:04.495381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v39i1.32020","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:04.636696Z","title":"Chemvlm: Exploring the power of multi- modal large language models in chemistry area.Proceedings of the AAAI Conference on Artificial Intelligence, 39(1):415–423, 2025","venue":null,"work_id":"c37eb247-a70b-4deb-b68c-559513e518de","year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.501511Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:3dd357b765bbed21d8ade937e860fcfa4cd3946f68fada4c3bbfb9ace89f5f6e","observation_id":"0098da10-e48e-43a8-9de7-599864049e0d","resolution":{"observed_at":"2026-08-11T00:22:04.644027Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-11T01:08:07.252201+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-11T01:08:07.252201+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T00:22:04.506537Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.506537Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:c04a5b354ffe438b8ce7caaff5a6058275c2d6c86dbc46ea4dd07477f38fb09b","observation_id":"85f248a5-858a-48f9-bcc3-d370819b4ea8","resolution":{"observed_at":"2026-08-11T00:22:04.506537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T00:22:04.511776Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.511776Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:822c4a6f60bf981fa501e789c94d0c2705062a9de87335f15bca8be7ac15c8b0","observation_id":"5584204e-c1bd-4dcd-a092-3d9174aecb7c","resolution":{"observed_at":"2026-08-11T00:22:04.511776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-19T12:38:24.427894Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-11T00:22:04.517161Z","title":"Learn to explain: Multimodal rea- soning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.517161Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:d715e01ece814970ea8f8aeaa278cd20fb63c17789e87d2d2a2e031148c7748a","observation_id":"47588bda-591d-4116-98bc-d4175c502554","resolution":{"observed_at":"2026-08-11T00:22:04.517161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T00:22:04.522159Z","title":"Mathvista: Evaluat- ing mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.522159Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:7eb2effe1a991c7adb1038c6fa73fa82bf8109873831a32d04b79254f0702d68","observation_id":"9dfdbbf5-8fc0-4b72-990c-e7b194955a24","resolution":{"observed_at":"2026-08-11T00:22:04.522159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09339","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:04.951797Z","title":"mmjee-eval: A bilingual multimodal bench- mark for evaluating scientific reasoning in vision-language models","venue":null,"work_id":"c6997954-53e1-4e92-8814-55559b5a68e4","year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.527602Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:d6b77fe71b5c345386d8e9183a6482fe3e0eda42538cda19258a3f07c312107c","observation_id":"ad7d8a6d-3b48-421f-a532-f1f232fc1739","resolution":{"observed_at":"2026-08-11T00:22:04.958916Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.271813Z","title":"Introducing gpt-4.1 in the api.https://openai.com/index/ gpt-4-1/, 2025","venue":null,"work_id":"5a5dd906-e63e-408f-9755-b3e9ce2fe45e","year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.532193Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:205e5589881c4b27f4c337348e5591b7c3fcb97eecbf3fcec21ae67497b4d9cc","observation_id":"ae810fe8-ed84-4f30-9a5c-15c081bdcd9a","resolution":{"observed_at":"2026-08-11T00:22:05.276614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00451","last_updated":"2018-06-01T17:16:56Z","snapshot_observed_at":"2026-08-16T06:32:06.888652Z","submitted_at":"2018-06-01T17:16:56Z","title":"Do CIFAR-10 Classifiers Generalize to CIFAR-10?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.00451","snapshot_observed_at":"2026-08-11T00:22:04.537137Z","title":"Do cifar- 10 classifiers generalize to cifar-10?arXiv preprint arXiv:1806.00451, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.537137Z"},"links":{"cited_paper":"/paper/1806.00451","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:8a39655d01f11d22aeddf1f48dcdb9a1d90bd99abd8a28622196b18046e74b58","observation_id":"a043a968-b2b9-4adb-9371-169fae5d25ce","resolution":{"observed_at":"2026-08-11T00:22:04.537137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.256252Z","title":"Do im- agenet classifiers generalize to imagenet? InProceedings of the 36th International Conference on Machine Learning (ICML), pages 5389–5400, 2019","venue":null,"work_id":"a1cf8086-af52-4fd9-bf87-faa55e502234","year":2019},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.541685Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:b07a65bc94b4e55d3caffb5ada3ebdca94720b82769f3ea5b014e920d2196ba6","observation_id":"19206fae-4e83-4bcb-90c0-714749c364bd","resolution":{"observed_at":"2026-08-11T00:22:05.261447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:04.545977Z","title":"Hughes, and Finale Doshi-Velez","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.545977Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:07d0e8c9136e82794dfba19c3b4cac74d741d507a9c4c82b9c2289068fcdf231","observation_id":"54f65b16-072d-4f54-97cd-1be53ffdd9ca","resolution":{"observed_at":"2026-08-11T00:22:04.545977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07735","last_updated":"2025-07-10T19:25:11Z","snapshot_observed_at":"2026-08-20T11:24:59.975786Z","submitted_at":"2025-05-12T16:44:38Z","title":"Assessing the Chemical Intelligence of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07735","snapshot_observed_at":"2026-08-11T00:22:04.550184Z","title":"Runcie et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.550184Z"},"links":{"cited_paper":"/paper/2505.07735","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:59534c05976ba733991bbd9c5cbd96035aa3663ed63866e02ac0609672c6950f","observation_id":"f78ca4bf-ed1a-44c6-8375-123c8477604f","resolution":{"observed_at":"2026-08-11T00:22:04.550184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19032","last_updated":"2026-07-09T04:07:40Z","snapshot_observed_at":"2026-08-16T06:03:41.986353Z","submitted_at":"2025-11-24T12:07:56Z","title":"Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2511.19032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.19032","snapshot_observed_at":"2026-08-11T00:22:04.822302Z","title":"Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models","venue":"cs.CV","work_id":"ca5f0a91-4b92-4b6a-b5d8-7da8b37b3dc0","year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.554549Z"},"links":{"cited_paper":"/paper/2511.19032","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:e7f432f7e2307ebe8754520b6e7b39196fb1851485ad74d7f3ca7dde7717a995","observation_id":"07456421-f0e8-44e1-9d45-071a8e7143ef","resolution":{"observed_at":"2026-08-11T00:22:04.827239Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T00:22:04.559189Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.559189Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:d5687aa687212d12c7ff568b647e79567f3a1512975dec40de40b45efa7e62f3","observation_id":"40a5ba18-a700-41ea-bf30-4ae401245be8","resolution":{"observed_at":"2026-08-11T00:22:04.559189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13690","last_updated":"2025-04-21T17:07:18Z","snapshot_observed_at":"2026-08-16T12:00:01.212105Z","submitted_at":"2025-04-18T13:46:32Z","title":"Analysing the Robustness of Vision-Language-Models to Common Corruptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13690","snapshot_observed_at":"2026-08-11T00:22:04.563578Z","title":"Analysing the robustness of vision-language-models to common corruptions.CoRR, abs/2504.13690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.563578Z"},"links":{"cited_paper":"/paper/2504.13690","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:4c8d413e7671fc41cb97bf55d712e561d8bad88139c064faae634a569938d6c5","observation_id":"0a276d57-6442-4410-84f5-be29e78194bc","resolution":{"observed_at":"2026-08-11T00:22:04.563578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T00:22:04.567756Z","title":"Cogvlm: Visual expert for pretrained language models.arXiv preprint arXiv:2311.03079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.567756Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:f60700f65624100b4e81197d72fe29df715d81990925973f8423ba87908f9b2e","observation_id":"a96f37fe-5b51-49f6-87a8-ea937988ae74","resolution":{"observed_at":"2026-08-11T00:22:04.567756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15645","last_updated":"2025-06-18T17:14:07Z","snapshot_observed_at":"2026-08-13T22:37:09.420596Z","submitted_at":"2025-06-18T17:14:07Z","title":"Demystifying the Visual Quality Paradox in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15645","snapshot_observed_at":"2026-08-11T00:22:04.572242Z","title":"Demystifying the visual quality para- dox in multimodal large language models.CoRR, abs/2506.15645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.572242Z"},"links":{"cited_paper":"/paper/2506.15645","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:424d2419572178795f9f12a2008cccc04167b565e0cb33dc27f639a346aaedf7","observation_id":"07d465fc-27e1-4480-811c-90c38daa5dfe","resolution":{"observed_at":"2026-08-11T00:22:04.572242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.240870Z","title":"Mmt-bench: A comprehensive multi- modal benchmark for evaluating large vision-language models towards multitask agi","venue":null,"work_id":"afdb2873-e61c-4121-a772-95c0805a8c81","year":2024},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.576512Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:d253823613fa74decc9349e5f1820b674f229d86e4bedb694e94c2230c345ae3","observation_id":"cb975c57-f16a-4c30-a27b-72585bf68f82","resolution":{"observed_at":"2026-08-11T00:22:05.245806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-17T13:10:52.611064Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T00:22:04.581233Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.arXiv preprint arXiv:2311.16502, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.581233Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:55a51f89ed0781f6e0be548ad46d87abd527f216ca9878f90edfbb6ea8d63b7b","observation_id":"0753f46d-0fcb-4275-927e-8405c2c125d0","resolution":{"observed_at":"2026-08-11T00:22:04.581233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:05.225448Z","title":"Zeiler and Rob Fergus","venue":null,"work_id":"0dddd9da-63a9-4495-83a4-dcd8528f4ea0","year":2014},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.586309Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:06adeccce86902421a131175a6273f0327f52c464a6002da04c09b538aeb9680","observation_id":"8f6dd67a-5f3c-498f-bc8d-a8930749ca5f","resolution":{"observed_at":"2026-08-11T00:22:05.230308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:04.590968Z","title":"Benchmarking multi- modal llms on recognition and understanding over chemical tables.arXiv preprint arXiv:2506.11375, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:04.590968Z"},"links":{"citing_paper":"/paper/2608.07742"},"observation_digest":"sha256:1003ece42937ca4de2a86d183710e078f26fdee6dc55ca4da2c4adfba218b5ea","observation_id":"4df0552e-db5d-46e8-a391-d91bea186125","resolution":{"observed_at":"2026-08-11T00:22:04.590968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07742","last_updated":"2026-08-07T20:19:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T02:07:37.994780Z","submitted_at":"2026-08-07T20:19:11Z","title":"BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":4,"verified_fuzzy":10},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.07742."}