{"as_of":"2026-08-09T08:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de855e5d42e95e9ad613dac3f04c0a16ab11024b2f11c2cc20a66ad9ee538850","coverage":[{"denominator":116,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:15:53.706327Z","state":"measured"},{"denominator":107,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":107,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:34:48.043962Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:56:59.022805Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07601","snapshot_observed_at":"2026-08-06T18:34:48.043962Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07939","last_updated":"2025-07-22T03:11:41Z","snapshot_observed_at":"2026-08-06T18:26:29.044622Z","submitted_at":"2025-07-10T17:23:42Z","title":"SAGE: A Visual Language Model for Anomaly Detection via Fact Enhancement and Entropy-aware Alignment","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:34:48.043962Z"},"links":{"cited_paper":"/paper/2502.07601","citing_paper":"/paper/2507.07939"},"observation_digest":"sha256:4f8b49e19d1d0ed5beffa4bb5c33021b1e3768eff5901cff97961e7bf424858f","observation_id":"cccf2b32-a767-4ef5-8514-908e8a252a70","resolution":{"observed_at":"2026-08-06T18:34:48.043962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07601","snapshot_observed_at":"2026-08-06T17:21:55.132815Z","title":"Xu, S.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13378","last_updated":"2025-07-15T08:03:56Z","snapshot_observed_at":"2026-08-06T17:14:44.031776Z","submitted_at":"2025-07-15T08:03:56Z","title":"A Comprehensive Survey for Real-World Industrial Defect Detection: Challenges, Approaches, and Prospects","version":1},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:55.132815Z"},"links":{"cited_paper":"/paper/2502.07601","citing_paper":"/paper/2507.13378"},"observation_digest":"sha256:884e0344808af64c13ec7e9482813e9a415d75180d58d264bed2aea042009da6","observation_id":"57484b60-46ea-4e24-ade4-665a9a6e1b26","resolution":{"observed_at":"2026-08-06T17:21:55.132815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07601","snapshot_observed_at":"2026-08-05T20:20:12.587523Z","title":"M.; and Dwivedi, I","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10681","last_updated":"2025-08-14T14:24:47Z","snapshot_observed_at":"2026-08-06T15:57:51.802224Z","submitted_at":"2025-08-14T14:24:47Z","title":"IADGPT: Unified LVLM for Few-Shot Industrial Anomaly Detection, Localization, and Reasoning via In-Context Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:12.587523Z"},"links":{"cited_paper":"/paper/2502.07601","citing_paper":"/paper/2508.10681"},"observation_digest":"sha256:70836d27dbbfba7974dc5ab6405a04bc0f8bf24cd15541a71098d5c5fda83a3a","observation_id":"a9fae0f0-539d-42d2-add4-8d2e6ea6b02a","resolution":{"observed_at":"2026-08-05T20:20:12.587523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07601","snapshot_observed_at":"2026-08-02T17:19:39.274578Z","title":"Patel, and Isht Dwivedi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27176","last_updated":"2026-07-28T06:00:54Z","snapshot_observed_at":"2026-08-06T10:30:41.635476Z","submitted_at":"2026-03-28T07:26:40Z","title":"MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T17:19:39.274578Z"},"links":{"cited_paper":"/paper/2502.07601","citing_paper":"/paper/2603.27176"},"observation_digest":"sha256:7a30bf07223b30320780941b5db961f9a564a51a0a103f0d0845492d7cb32de2","observation_id":"1859c60c-b1b4-41f4-a8a5-60221e6b99ea","resolution":{"observed_at":"2026-08-02T17:19:39.274578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07601","snapshot_observed_at":"2026-07-02T13:56:59.022805Z","title":"Patel, and Isht Dwivedi","venue":null,"work_id":"a092c9ca-019e-40a4-a15b-527839f593d0","year":2025},"citing_paper":{"arxiv_id":"2605.03437","last_updated":"2026-05-06T11:25:15Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:16:47Z","title":"Learning Discriminative Signed Distance Functions from Multi-scale Level-of-detail Features for 3D Anomaly Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T17:57:53.482855Z"},"links":{"cited_paper":"/paper/2502.07601","citing_paper":"/paper/2605.03437"},"observation_digest":"sha256:8180205bdb69164002cdb6466c1ad184f395fa2df45061e37bc5d5073d7be1da","observation_id":"f8f625d4-994b-4482-9c02-b613ef14cff3","resolution":{"observed_at":"2026-05-12T11:01:30.656310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07601","snapshot_observed_at":"2026-07-02T13:56:59.022805Z","title":"Patel, and Isht Dwivedi","venue":null,"work_id":"a092c9ca-019e-40a4-a15b-527839f593d0","year":2025},"citing_paper":{"arxiv_id":"2605.03437","last_updated":"2026-05-06T11:25:15Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:16:47Z","title":"Learning Discriminative Signed Distance Functions from Multi-scale Level-of-detail Features for 3D Anomaly Detection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T19:20:50.624344Z"},"links":{"cited_paper":"/paper/2502.07601","citing_paper":"/paper/2605.03437"},"observation_digest":"sha256:07194a2bfa63a46c33cac065a7bd4e1d405fb184992cd259c805257505bc16b3","observation_id":"7857fc62-e618-4346-9506-152167131094","resolution":{"observed_at":"2026-05-09T05:55:31.287658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07601","snapshot_observed_at":"2026-07-02T13:56:59.022805Z","title":"Patel, and Isht Dwivedi","venue":null,"work_id":"a092c9ca-019e-40a4-a15b-527839f593d0","year":2025},"citing_paper":{"arxiv_id":"2607.01049","last_updated":"2026-07-01T15:11:29Z","snapshot_observed_at":"2026-08-04T06:06:18.855599Z","submitted_at":"2026-07-01T15:11:29Z","title":"GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-02T13:55:24.194420Z"},"links":{"cited_paper":"/paper/2502.07601","citing_paper":"/paper/2607.01049"},"observation_digest":"sha256:a128e12496f85e747d8673936a257cf0a92aca0810ef8e6973bdf6c83e7679db","observation_id":"c0565497-94c2-44cd-9cbe-8c702588b80b","resolution":{"observed_at":"2026-07-02T13:56:59.024632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07601/citation-record","integrity":"/paper/2502.07601/integrity","json":"/paper/2502.07601/citation-record.json","paper":"/paper/2502.07601"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.271328Z","title":"Bmad: Benchmarks for medical anomaly detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.271328Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:406b2ee99bd8b3f892649edf7e91a4a9fb96d9a784aeb10b4df4d4ba0f4746fa","observation_id":"5251cacb-ee9a-4756-853d-c82bf6765c83","resolution":{"observed_at":"2026-08-08T12:15:53.271328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.276837Z","title":"Mvtec ad–a comprehensive real-world dataset for unsupervised anomaly detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.276837Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:a652489f6ecc803b3c93554b9c32c1a7eb7918e4774d1c886d2ef75734db8e6c","observation_id":"16beb027-d33d-4682-951f-59092485be62","resolution":{"observed_at":"2026-08-08T12:15:53.276837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.282288Z","title":"Uninformed students: Student-teacher anomaly detection with discriminative latent embeddings","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.282288Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:d6ea047cfb8dc7dd0c3372980ab09e472044a52f66710f74831d3dc53e75efb5","observation_id":"c1a49393-7017-4dc0-963c-6b9494fe3363","resolution":{"observed_at":"2026-08-08T12:15:53.282288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.287304Z","title":"The mvtec 3d-ad dataset for unsupervised 3d anomaly detection and localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.287304Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:5acd7e373c86ef915fce6fc5cd84397584b8aeaf54e76038e43b154f0a743a1d","observation_id":"7f7a930a-6146-42b6-a6ca-ddca2a95386b","resolution":{"observed_at":"2026-08-08T12:15:53.287304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.292561Z","title":"Anomaly de- tection under distribution shift","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.292561Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:ed799d243ad580348f15e2b62743132a5e74957eeadbc8c353ba0ee93232cbee","observation_id":"91020dee-bd40-412d-af52-30c0eebcda37","resolution":{"observed_at":"2026-08-08T12:15:53.292561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.297780Z","title":"Adaclip: Adapting clip with hybrid learnable prompts for zero-shot anomaly detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.297780Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:eed9143195a40d6031dac02a24404274230fec7da8139b318a5d69c163f4e0c3","observation_id":"1576dde6-3e62-4de8-ae51-823a3c7c714a","resolution":{"observed_at":"2026-08-08T12:15:53.297780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.304161Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.304161Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:ac462151412a0ea723d7c617199b144bd11b9eb64b086c138def589113f605be","observation_id":"6659cced-29fc-4962-b4f2-5f4288776798","resolution":{"observed_at":"2026-08-08T12:15:53.304161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.309093Z","title":"Sharegpt4v: Improving large multi-modal models with better captions,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.309093Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:b2f10afd8d3038e05086cbb93573a1ef4897948d0ec60409cbd8ebfa26c1ce58","observation_id":"5ee7da13-bf68-4278-ade0-20ba06ddddde","resolution":{"observed_at":"2026-08-08T12:15:53.309093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09359","last_updated":"2024-07-12T15:33:37Z","snapshot_observed_at":"2026-08-07T21:23:11.083832Z","submitted_at":"2024-07-12T15:33:37Z","title":"A Unified Anomaly Synthesis Strategy with Gradient Ascent for Industrial Anomaly Detection and Localization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09359","snapshot_observed_at":"2026-08-08T12:15:53.314105Z","title":"A unified anomaly synthesis strategy with gradi- ent ascent for industrial anomaly detection and localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.314105Z"},"links":{"cited_paper":"/paper/2407.09359","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:2423378356e2740119578195f0422d0dc6b5af8db0a50e0206ac15b7f7e1d657","observation_id":"774a8392-0f72-4a1b-b4ee-fe28d193c77e","resolution":{"observed_at":"2026-08-08T12:15:53.314105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.319222Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.319222Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:9ef2f4051a22c459e961e10af548e5c125f35469d47893daf8198cdccdbefb7c","observation_id":"82f71480-ee12-48f3-9288-a12c1525d2e1","resolution":{"observed_at":"2026-08-08T12:15:53.319222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.324056Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.324056Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:0049826b705523c8542dc552c7cc3f50d38fb652f170b6d1494bfca5eb3ea109","observation_id":"3f2e2f85-d716-4f48-b534-c87687e2aed7","resolution":{"observed_at":"2026-08-08T12:15:53.324056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.328729Z","title":"Deep one-class classification via interpolated gaussian descriptor","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.328729Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:b38e0729ca0f966e307ff8c3f4d3f6680c5a248ee5c49943a48ec540415fa5dc","observation_id":"809943ab-af17-41a4-9551-032d96cdee07","resolution":{"observed_at":"2026-08-08T12:15:53.328729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.333203Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open- source suites, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.333203Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:605f3caa06f21b6e532567400da538baf357730b944a0ce133962144ef7bb8e3","observation_id":"f3bfa126-e4a9-4c60-9e3e-917abc90eea8","resolution":{"observed_at":"2026-08-08T12:15:53.333203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.337928Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.337928Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:9bbc3dabcef9174f29711acbc08697ac8fd6629b7058d1af7def3a326062a6b7","observation_id":"9dcd80d6-142a-4ab8-871a-cd33b2af471e","resolution":{"observed_at":"2026-08-08T12:15:53.337928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.342684Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.342684Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:d1d3c67ca0f71722195541e748dfd5ee1a72f8d0c5be7f49bce4eba65c6a3865","observation_id":"ded92600-a5be-465f-be47-772e41d8a0a9","resolution":{"observed_at":"2026-08-08T12:15:53.342684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.347147Z","title":"Automatic classification of defective photovoltaic module cells in electroluminescence images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.347147Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:c9fb7a2d36e4bb380326f8dc9f871c85c236b3fafa5efd3cbf2c6b356061cad4","observation_id":"8d42ff7c-43f2-4eda-85a9-1b5b89ed2f6c","resolution":{"observed_at":"2026-08-08T12:15:53.347147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.350933Z","title":"Simclip: Refining image-text alignment with simple prompts for zero-/few- shot anomaly detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.350933Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:72ff19f1883a840c2d2d06153a12a48d2828cb50ee0e676a9d1e966953644b25","observation_id":"242de92f-4dbc-4158-af72-40db640d3c2c","resolution":{"observed_at":"2026-08-08T12:15:53.350933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.354743Z","title":"Anomaly detection via reverse distillation from one-class embedding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.354743Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:04263b8a239d3b9e1e835266a2b1eb34de5e50a01ccc11a158cd2f74be65e03b","observation_id":"983219c8-4ab3-4466-98b3-1814c5c840d3","resolution":{"observed_at":"2026-08-08T12:15:53.354743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15939","last_updated":"2024-02-27T00:07:47Z","snapshot_observed_at":"2026-07-06T16:12:14.281695Z","submitted_at":"2023-08-30T10:35:36Z","title":"Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15939","snapshot_observed_at":"2026-08-08T12:15:53.358917Z","title":"Anovl: Adapting vision-language models for unified zero- shot anomaly localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.358917Z"},"links":{"cited_paper":"/paper/2308.15939","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:f1368ee8d5620fdca672547c42f78f272c4cc28efa15e2e5b681fc020a6087cb","observation_id":"b6dbf93b-5b9a-4dd4-ba18-1f95b58c4c1f","resolution":{"observed_at":"2026-08-08T12:15:53.358917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.363220Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.363220Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:561b64c1662b0e32255f9d7c65779231105992284e7d426b905b9039cd7ca9b9","observation_id":"7cf54599-4abc-407b-aeff-31378cdbfde3","resolution":{"observed_at":"2026-08-08T12:15:53.363220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.367178Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.367178Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:a6cd31d6c102baad4ecd1cfa422f81aafe669b97602d74714146b804750e5ee6","observation_id":"57b8a415-cba6-4fc6-80de-809e5e27625a","resolution":{"observed_at":"2026-08-08T12:15:53.367178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.370868Z","title":"Fastrecon: Few-shot industrial 9 anomaly detection via fast feature reconstruction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.370868Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:c1e56f62ca737e0ecceb5086c3c46bfe447b49840ee0520686dd70acc2585308","observation_id":"e582fd4b-8bcd-4ead-ae38-a4a915437ff6","resolution":{"observed_at":"2026-08-08T12:15:53.370868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.374785Z","title":"Chatpose: Chatting about 3d human pose","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.374785Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:980874202ddfd2cd659a0a996cf2273a3dc1407c865a93da9d6b6cdd2fe8c694","observation_id":"a20ce60e-5ee8-4528-ae21-edec39e84f62","resolution":{"observed_at":"2026-08-08T12:15:53.374785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.378603Z","title":"Deep learning for medical anomaly detection–a survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.378603Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:6c060ede895fe4b5a8449f959ad2f25f95e2838e7e293166d2bc3fb2c86c4be6","observation_id":"a2f3597d-c1ad-4444-945e-0637ae75d3c8","resolution":{"observed_at":"2026-08-08T12:15:53.378603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.382424Z","title":"Transfusion–a transparency-based diffusion model for anomaly detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.382424Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:8b7357f1e37465620c259c349391322c5efe40f8eafd3c0fc7d4a3332055e351","observation_id":"2b277262-4c36-4f5f-ae5d-d6301a0c1737","resolution":{"observed_at":"2026-08-08T12:15:53.382424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.386559Z","title":"Google-images-search 1.4.7, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.386559Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:0ef0ed6af7dcdecd4af3c43617811438b06c27efb54a5f4c4afaf9b09ba62082","observation_id":"0b8ecb4f-5ecf-49aa-a2cf-dde2ff843a4a","resolution":{"observed_at":"2026-08-08T12:15:53.386559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.391198Z","title":"Filo: Zero-shot anomaly detection by fine-grained description and high-quality lo- calization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.391198Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:a6c5bfa09acb5f8cd8d2a36c17997db36fdfccf54c8212f4915ae12cdacb19a1","observation_id":"82b99abe-e8e6-49cc-9530-e040ff4cd20e","resolution":{"observed_at":"2026-08-08T12:15:53.391198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.395484Z","title":"Anomalygpt: Detecting in- dustrial anomalies using large vision-language models","venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.395484Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:f5d9a4f9db0cf5e9b24b7c801399012cf3d79ff002dd6f62c42e226fe7bb73f1","observation_id":"960e4149-32aa-416d-af3f-146e640225fb","resolution":{"observed_at":"2026-08-08T12:15:53.395484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00304","last_updated":"2025-06-03T03:39:27Z","snapshot_observed_at":"2026-07-06T19:08:35.604487Z","submitted_at":"2024-08-31T00:00:50Z","title":"StimuVAR: Spatiotemporal Stimuli-aware Video Affective Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00304","snapshot_observed_at":"2026-08-08T12:15:53.400089Z","title":"Stimuvar: Spatiotemporal stimuli-aware video affective reasoning with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.400089Z"},"links":{"cited_paper":"/paper/2409.00304","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:64aa9876dec1e97797f2e4278d863ab159800271d9ca501a63b9f8f4b849a177","observation_id":"4670a506-937d-4d22-8edc-5245d6d52162","resolution":{"observed_at":"2026-08-08T12:15:53.400089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.404999Z","title":"Br35h: Brain tumor detection 2020, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.404999Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:00c16ef7db1be46f94eee20f8bd417f9681248f34c6a4d3eaf46706a6fc7ae7f","observation_id":"10c03b7b-996a-49ab-95a0-14a2957ac48e","resolution":{"observed_at":"2026-08-08T12:15:53.404999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.409690Z","title":"Madgan: Unsupervised medical anomaly detection gan us- ing multiple adjacent brain mri slice reconstruction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.409690Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:14dc28a0ca2bfd6f91e0946e39f271953ccfea216eca5f8ad81bfcf2022e6611","observation_id":"c0e4925d-f603-462f-9954-d69ba4337208","resolution":{"observed_at":"2026-08-08T12:15:53.409690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11561","last_updated":"2024-07-16T09:25:19Z","snapshot_observed_at":"2026-08-07T22:49:50.826325Z","submitted_at":"2024-03-18T08:29:47Z","title":"Learning Unified Reference Representation for Unsupervised Multi-class Anomaly Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11561","snapshot_observed_at":"2026-08-08T12:15:53.414221Z","title":"Learning unified reference rep- resentation for unsupervised multi-class anomaly detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.414221Z"},"links":{"cited_paper":"/paper/2403.11561","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:acc57f1e349afcec36b4ca37e7fd2cbadb22ab2922b0dae2eeb8ca016290f5b9","observation_id":"58ee2b46-a8e1-486a-aa04-e804e28352cc","resolution":{"observed_at":"2026-08-08T12:15:53.414221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.419152Z","title":"Long-tailed anomaly detection with learnable class names","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.419152Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:51afe83d6eeb1e9b185efe650e8a771565f7c549ec99df3d6e6fd953291a1103","observation_id":"4a157f83-2de0-49c7-b1ae-3b9a6b3e51a7","resolution":{"observed_at":"2026-08-08T12:15:53.419152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.423387Z","title":"Divide-and-assemble: Learning block-wise memory for unsupervised anomaly detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.423387Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:900b6581a009173339c861006dbc871dbde68e78a52a39102111b61042bda91c","observation_id":"e84b1db1-1717-4c23-9382-6bbafb1648bb","resolution":{"observed_at":"2026-08-08T12:15:53.423387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.428165Z","title":"Registration based few-shot anomaly detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.428165Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:acca9ee6a5e546dafd1ff0f83c4d690ca2e1d9e684a07b5d703ff07304ff4681","observation_id":"cb92f8e8-ca70-4fc6-968a-b7abc3ec38b8","resolution":{"observed_at":"2026-08-08T12:15:53.428165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.433177Z","title":"Adapting visual-language models for generalizable anomaly detection in medical im- ages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.433177Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:5724170ddf44be3a84576a5e8e95ed311d4f2283cbac300dca36a22919a5937f","observation_id":"546268aa-c623-4456-9e1b-38596f4885ce","resolution":{"observed_at":"2026-08-08T12:15:53.433177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.438063Z","title":"Towards open-world object- based anomaly detection via self-supervised outlier synthe- sis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.438063Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:97b11f0f90505d0192a05f05df3448be4c900dacabcb245b61be93748115a7c4","observation_id":"f5ce1b47-5985-4438-bfdc-8ae83c47ecae","resolution":{"observed_at":"2026-08-08T12:15:53.438063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.442369Z","title":"Winclip: Zero- /few-shot anomaly classification and segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.442369Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:77a4ac4927d16fee4156184a55496ffdfdf43ba2f47787d86e9ae88c00a53f0d","observation_id":"c7df16ef-fd03-4444-8584-930e0d006e03","resolution":{"observed_at":"2026-08-08T12:15:53.442369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.446169Z","title":"Deep learning-based defect detection of metal parts: evaluating current methods in complex condi- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.446169Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:ebd7f78cb86f7d291fdfc286575fa4d9953a8ed42252a88e9405b7637a78449c","observation_id":"671e3f7e-5650-4867-bfb1-b6f5802834c8","resolution":{"observed_at":"2026-08-08T12:15:53.446169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.450294Z","title":"Brain tumor detec- tion using mri images","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.450294Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:7e28b3b3152a3fd5cbd639c274e33cb7ce8fb21613f48ad4e181e42256a04c06","observation_id":"69353b87-5277-44f5-90a3-8c3785db9761","resolution":{"observed_at":"2026-08-08T12:15:53.450294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:55.056628Z","title":"Head ct - hemorrhage, 2018","venue":null,"work_id":"6b5d2657-a446-4763-8457-780b4d10fb7a","year":2018},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.454103Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:4a2d1eea9d15473f64c464773452b1fc2b53a80df3ff29e177c46286957a5f74","observation_id":"6fda25c5-8081-42f8-a8d8-a60ea8c9f22f","resolution":{"observed_at":"2026-08-08T12:15:55.061301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:55.040886Z","title":"Text-guided variational image generation for industrial anomaly detection and seg- mentation","venue":null,"work_id":"c8565eb3-1115-4e21-a643-1086ed6e9b17","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.458104Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:2f1413ffeefa8152a7de545b10b005488b29e4ad037ff23870c4ce2763d13c71","observation_id":"f40c2d93-f506-4cba-b585-3fff828e7136","resolution":{"observed_at":"2026-08-08T12:15:55.046697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:55.025982Z","title":"Zero-shot anomaly detection via batch normalization","venue":null,"work_id":"3b5be279-bbd8-401c-b61f-abfc7e680435","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.462223Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:336cadd2d267efd3eb7456ca83b09a98af184a803992528150ebed068225ba92","observation_id":"bd381509-6754-4376-86ac-88a8967d3601","resolution":{"observed_at":"2026-08-08T12:15:55.030782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:55.011394Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":"d81df8fc-4389-493c-848d-a02dc0455221","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.465889Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:660188a3772838bbdcae7fbd907103a15b08c1d1a27a944b2ac1a57cf06f0959","observation_id":"596f0d4c-f678-4541-8948-9e8604fce402","resolution":{"observed_at":"2026-08-08T12:15:55.016171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.996069Z","title":"LLaV A-med: Training a large language- and-vision assistant for biomedicine in one day","venue":null,"work_id":"592165b4-ce9f-4767-96f2-40b0f7da6647","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.469750Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:4317c7edae865387d1af653817b2ec5528c7c99a0ce1988dc26b2031841b67a6","observation_id":"7536d9d0-65a4-4ee2-b11c-2ba50b349078","resolution":{"observed_at":"2026-08-08T12:15:55.001076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.981115Z","title":"Cutpaste: Self-supervised learning for anomaly detection and localization","venue":null,"work_id":"03f32488-bc60-4e24-ae0c-1ed73cfa18da","year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.473426Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:635edfd2e36df9aba4fd1dac823df56ae137d242bc9622c3727fd9bb66d2786a","observation_id":"2ed6b532-bbac-4f91-b030-31f8590a2d1e","resolution":{"observed_at":"2026-08-08T12:15:54.985949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-08T12:15:53.477089Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.477089Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:c7acd585c42946d7e14a43519fa30affc1780f3fb9a7c9880bf668e17701d279","observation_id":"4d4bd1b1-48f3-42f9-a787-d0fba4c35e45","resolution":{"observed_at":"2026-08-08T12:15:53.477089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.964741Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"aeaa8c78-d265-480d-b55d-0ae6301d240c","year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.481291Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:fb5e27e7e2f8f6a1633af0726dbbeb9f8698cd1235ef289b4410fef013807f43","observation_id":"673abf65-e6db-4b09-93de-6c2296aeceb4","resolution":{"observed_at":"2026-08-08T12:15:54.970320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.949487Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"78cd2a9a-8e38-4c74-8c8c-67ec55b3e237","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.485212Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:ffb7c322ee5a274e8506f1e26868fcb534c1af304820e90672f155d4a2b3ac93","observation_id":"68d9a879-ce00-4a8e-8f1f-79233de8aa34","resolution":{"observed_at":"2026-08-08T12:15:54.954048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.934987Z","title":"Towards scalable 3d anomaly detection and localization: A benchmark via 3d anomaly synthesis and a self-supervised learning network","venue":null,"work_id":"d0fd7f43-63c7-4a7a-a2cc-dc52da70572b","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.489206Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:133fa164274272dca8aa58a701fa36e68a28ceb97065d5e652c5d577fb3c1280","observation_id":"15ce009d-b8c1-4e2d-893b-21054169db4e","resolution":{"observed_at":"2026-08-08T12:15:54.939374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.920956Z","title":"Promptad: Learn- ing prompts with only normal samples for few-shot anomaly detection","venue":null,"work_id":"216a5e03-0d5e-42cc-a034-bef29a077f27","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.493831Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:7e5d4505f89c11087756047a329dc9471a416c3eb40eae45ba845e0178d03af5","observation_id":"6804423d-60b8-4702-b29e-0751a465da41","resolution":{"observed_at":"2026-08-08T12:15:54.925805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.905482Z","title":"Promptad: Zero-shot anomaly detection using text prompts","venue":null,"work_id":"aabb64ae-edb0-439c-adf6-6c6662055ad6","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.497734Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:da402008e293a53e1e74ca11ce3e48b1499256427cdeec60330409c52af7601b","observation_id":"1b81c0c3-9df4-4ec6-b3a3-4254a154f780","resolution":{"observed_at":"2026-08-08T12:15:54.911041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.501819Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.501819Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:95a196ed943e5e6b46e4de8c2ebb1ba05625ff055f5bb5f068824ea7ee29b2cf","observation_id":"a25c4e51-315b-48fe-881b-f330a5a620c7","resolution":{"observed_at":"2026-08-08T12:15:53.501819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.879796Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"dc8173ae-e072-49f5-b14c-2fd58f0077ef","year":2004},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.505655Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:bf0c6df695084fa40ac52d59c53ead8dbdc573aa35b6ad23b3b77a7b0b311fe1","observation_id":"33ceb8d1-8d6d-4145-8f1e-514f328a44fe","resolution":{"observed_at":"2026-08-08T12:15:54.884619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.509372Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.509372Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:dae4835f7b70cf1a0dfc877a099775b38905781383349632f77cd5fb038c4afc","observation_id":"3205bdc8-7ad3-4727-9807-a0b0bda6eb1e","resolution":{"observed_at":"2026-08-08T12:15:53.509372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.853783Z","title":"Clip is also an efficient segmenter: A text-driven approach for weakly supervised semantic segmentation","venue":null,"work_id":"f97a34c7-bcd4-4446-b53c-4e2d6609228e","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.513279Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:96a4b76577666f2db7e17af985330c0c070b100c9e7373b3753f14cf65771fa0","observation_id":"5730d8d2-2075-415e-80be-3b5b30078270","resolution":{"observed_at":"2026-08-08T12:15:54.858892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.836656Z","title":"Visual instruction tuning","venue":null,"work_id":"1e51b6b9-e078-40a7-9f4b-a0fcc15dab3b","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.517843Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:e1c370073f4a4b6f55ebebb0d4ba9c9868b405a902452c7a04ca8be0b17a5c2a","observation_id":"3ac0a8b6-7581-4471-884c-2e17d20d7a3f","resolution":{"observed_at":"2026-08-08T12:15:54.842820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.522667Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.522667Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:7617f73acd7b3ca8e74296d4b7ba4da80a8498f605e335c4bda68cc4f2d24ae5","observation_id":"254e98cf-f3a9-4e66-b194-9256c1d26756","resolution":{"observed_at":"2026-08-08T12:15:53.522667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.527419Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.527419Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:7599e73a277caaae9662328f3b9329b7f3043b348e61a4bd8961de568b2928c6","observation_id":"a4b3793c-1954-4fcb-8e85-3a9f30896c12","resolution":{"observed_at":"2026-08-08T12:15:53.527419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.803528Z","title":"Real3d- AD: A dataset of point cloud anomaly detection","venue":null,"work_id":"e9378490-0862-44bb-955b-4d1267be398b","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.531861Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:6ce1a4455e3b52274cc4deada05e512005aa6f2035161dba7da508edd5a3e4e0","observation_id":"c08a054d-8521-4520-b5d9-894562724bdd","resolution":{"observed_at":"2026-08-08T12:15:54.807824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.789792Z","title":"Clip-driven universal model for organ segmentation and tumor detection","venue":null,"work_id":"6b1d34da-828d-4c06-8285-355d7191d730","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.536229Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:a5b8518e41508960d647c8a9804c1e5484c3305282d05921d793aaafb29906e7","observation_id":"ddc1331c-7822-48b2-9daf-e29f5cd67349","resolution":{"observed_at":"2026-08-08T12:15:54.794048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.540697Z","title":"Roberta: A robustly optimized bert pretraining approach, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.540697Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:459cb49fbb9bc4c52ecf16cd4d8e4e23ac68bb3eef688fb4728aaee3929438af","observation_id":"137878c9-ce2e-48e5-ad20-117311f14c5f","resolution":{"observed_at":"2026-08-08T12:15:53.540697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.763918Z","title":"Adversar- ially robust one-class novelty detection","venue":null,"work_id":"9749aa54-f709-42fc-ab52-1a18814910f7","year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.545382Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:527558d1054fc5b130ce20ed2ed68591b7814e00e27a078e15c0f2f8e9d7ac83","observation_id":"8c7ada39-edfc-428c-ad97-e74e36cbb410","resolution":{"observed_at":"2026-08-08T12:15:54.769489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.749042Z","title":"SGDR: Stochastic gradi- ent descent with warm restarts","venue":null,"work_id":"f4f8d663-cb1c-4543-9240-fb7180fae37c","year":2017},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.549912Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:70637072d0f26cc245b591458957a25d2afca76fa3f6fefbb0dd04edac3ac0af","observation_id":"d29669ab-e0bc-4217-af8a-99fe45c80531","resolution":{"observed_at":"2026-08-08T12:15:54.754016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.733522Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"6bdd9488-9360-47fe-b383-73a9da5daea2","year":2019},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.554357Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:4c6fecec756dfd6dfc4b2a5fe507484404af5ce543589d2d6d1ecdc672c98ce0","observation_id":"dbf8f5b0-4363-458d-9c7e-de7c64ed50f6","resolution":{"observed_at":"2026-08-08T12:15:54.738401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.718812Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"56f82be3-8203-4784-8390-1702d9da777e","year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.558678Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:1ca45a9fde25fdd7f5d0a013304d22d3ee183121b3c0c7c1f5f8024a78aec271","observation_id":"2b3b22e5-9e5b-4d15-92e1-c5a0ae1c2295","resolution":{"observed_at":"2026-08-08T12:15:54.723784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05702","last_updated":"2024-01-11T07:09:44Z","snapshot_observed_at":"2026-07-06T17:14:07.183954Z","submitted_at":"2024-01-11T07:09:44Z","title":"Video Anomaly Detection and Explanation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05702","snapshot_observed_at":"2026-08-08T12:15:53.563367Z","title":"Video anomaly detection and explanation via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.563367Z"},"links":{"cited_paper":"/paper/2401.05702","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:aa1eed52f3fa6e75d0dfd5c56b1afec2e6869f713df55889e2c003f1d723339d","observation_id":"aa3a4a84-13f6-452c-a0d8-2ecb525039ce","resolution":{"observed_at":"2026-08-08T12:15:53.563367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.703915Z","title":"Vt-adl: A vision trans- former network for image anomaly detection and localiza- tion","venue":null,"work_id":"0086d565-e8f5-4999-9de8-3f6133ce9d15","year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.567560Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:92a3eb907fa2f105ab4004d27932a602a1f3fa495eacaea8f2384259bd8ee171","observation_id":"9d9fed68-e7ef-4f5a-88d8-6a738a7911dd","resolution":{"observed_at":"2026-08-08T12:15:54.709007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.689237Z","title":"RGI: robust GAN- inversion for mask-free image inpainting and unsupervised pixel-wise anomaly detection","venue":null,"work_id":"41eff223-6efe-49d7-93fb-2834e09b34ff","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.571258Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:00a854e44e1a8688a336aac3f33def833c1562dffaf0405aa1705fd4c79f5d25","observation_id":"ccb3bf7d-bd10-4a5c-9274-b0de42d79aa7","resolution":{"observed_at":"2026-08-08T12:15:54.693739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.675818Z","title":"Reason2drive: Towards interpretable and chain-based reasoning for autonomous driving","venue":null,"work_id":"77974c97-131a-422c-a692-504fe4c2b350","year":2025},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.575232Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:8ac6261ca77c7925ee7daa0b4f179a639fd4775359fd22710f295443ca637843","observation_id":"956e313d-f563-49a5-b6e5-b4b1219f3d4e","resolution":{"observed_at":"2026-08-08T12:15:54.680087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.663322Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":"46b5d5ea-e02c-423c-92c1-1069a453e946","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.578923Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:49e2d0d7321f54e4dde4a6b9efabddcfc87fc032c7b8e1fa6eae3bf36ee7d510","observation_id":"938b045e-6084-415b-a8c0-d12b2133d011","resolution":{"observed_at":"2026-08-08T12:15:54.667030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.649221Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"9100b906-d626-4955-a905-14aac7e04150","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.582723Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:54b12783c34e9454dc8f10c2f86bda562fffed2f6299be3b9f3b5f6682d4ec3e","observation_id":"4801efe5-ffde-4f87-9fe4-de0b41e1d8a9","resolution":{"observed_at":"2026-08-08T12:15:54.653781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.634860Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"7252bb0f-ecb1-4c3d-8ebb-2fa978cee0a4","year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.586726Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:1d803b3e525f64097d7055222dace41fffce88ebcc80a2c136cd7a1e71bdfa4a","observation_id":"50d40237-7878-4827-b995-0a3c44209d35","resolution":{"observed_at":"2026-08-08T12:15:54.639592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.620402Z","title":null,"venue":null,"work_id":"77f5f908-b0d4-476f-aa8e-67d7ce4734d5","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.590675Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:d9b85e7b45d7e5b9fafbe840b03069824b349f5f3bf06ae22abfa843bb8166aa","observation_id":"c40b9611-e583-45c3-baa4-3cc2221055a5","resolution":{"observed_at":"2026-08-08T12:15:54.625410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.606020Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks, 2019","venue":null,"work_id":"6751236e-872c-49e6-b492-ef2140b8d5ec","year":2019},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.594739Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:e4b659a890b32ff43ae891374a0b3132d4a726261f2a7bd7810488876c4da7b8","observation_id":"b09b3d67-fb72-4205-b1b9-7bc902f5e0a5","resolution":{"observed_at":"2026-08-08T12:15:54.610652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.591253Z","title":"Mean-shifted contrastive loss for anomaly detection","venue":null,"work_id":"9ce2c689-520f-49bf-bf27-28a1002f91b3","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.598479Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:2060387307ad1840a35e4e412f1628bf310bdb8adc32d903de3ab3b472749d1f","observation_id":"1aeaa6d6-dc9f-4a24-bda3-75ccbde72296","resolution":{"observed_at":"2026-08-08T12:15:54.596389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.575626Z","title":"Towards total recall in industrial anomaly detection","venue":null,"work_id":"e819aebc-ae7c-4f2c-8e18-8670f38414e9","year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.602396Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:c1934a39d866677db9aa7093ab96c3fb23ca17fc223d07423de208b1f5800c59","observation_id":"74f29015-56b3-4b7e-821f-e2e7b0ec9af8","resolution":{"observed_at":"2026-08-08T12:15:54.580448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.560893Z","title":"Prompt- guided zero-shot anomaly action recognition using pre- trained deep skeleton features","venue":null,"work_id":"77e22f1c-d35a-42ca-9909-90181a78b231","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.606365Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:9b4a9130f6929e99b9b544b6f6eebd9275c0a5546c1f4b2321f64d07535e9111","observation_id":"7fe32284-5df2-4ce3-a0e7-c86e59ec6996","resolution":{"observed_at":"2026-08-08T12:15:54.565755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.546272Z","title":"Mae- day: Mae for few-and zero-shot anomaly-detection","venue":null,"work_id":"c685f403-dacf-49e0-b4c0-c705a0af7f90","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.610465Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:2854033c60bc0abee6dd9364a36c6bcf5159eda204c84e553b835590a77fa13a","observation_id":"01b391f1-fd84-4407-859f-037da6ac93d9","resolution":{"observed_at":"2026-08-08T12:15:54.550703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.530452Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":"23a4e118-c83e-4d11-89ed-943e0b862ca1","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.614583Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:e065694e83f67d97ca9ade6131bcb0bac8e476db44b725c09e55a0801e492651","observation_id":"9f084ef1-2fac-459e-9472-c841ff3168c5","resolution":{"observed_at":"2026-08-08T12:15:54.534899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.517252Z","title":"A public fabric database for defect detection methods and results","venue":null,"work_id":"4d6f2311-35fa-4c63-b814-a5d7d63bf4fa","year":2019},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.618684Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:1dabd7a1d3611ffb9ef6ba797acdcb19d06a0242c503af05dd50c7d14285ba1e","observation_id":"86f7c917-4e03-4b11-a86f-fbcaa0895909","resolution":{"observed_at":"2026-08-08T12:15:54.521260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12427","last_updated":"2024-07-17T09:27:41Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:27:41Z","title":"GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features","version":1},"cited_work":{"arxiv_id":"2407.12427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12427","snapshot_observed_at":"2026-08-08T12:15:53.870953Z","title":"GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features","venue":"cs.CV","work_id":"9119a945-6e6f-40ff-885e-1d097e16929b","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.622832Z"},"links":{"cited_paper":"/paper/2407.12427","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:5a4398e02f1475707f2dda3f5e82ade2f22587ff4db4c84be7348452cbe48b1b","observation_id":"9794d84a-1b2b-4f5c-b8d9-43c04435bc33","resolution":{"observed_at":"2026-08-08T12:15:53.875324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.502437Z","title":"Face-mllm: A large face perception model,","venue":null,"work_id":"934a63dd-2cf5-4cf5-b4a1-d33d3a62c646","year":null},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.627906Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:abcd448e5d3301017bbdb807fe615695e1dac7e84281d03be887d6ef10e37062","observation_id":"fa01b72f-e64f-444c-a631-84e50525e4bb","resolution":{"observed_at":"2026-08-08T12:15:54.507618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.487774Z","title":"An incremental unified framework for small defect inspection","venue":null,"work_id":"f5b37ff8-6329-474e-a8d2-ca358e6cb4d1","year":2025},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.632894Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:18f0704945bdbbd7e9b3e3e92fd0e81fcd41b3cfccc18c4ffbc0a5da62f56925","observation_id":"3d8076a1-cac8-4460-8c67-c07881fe4a36","resolution":{"observed_at":"2026-08-08T12:15:54.492515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.473088Z","title":"Revisiting reverse distillation for anomaly detection","venue":null,"work_id":"834ff1aa-86a7-4e5c-a6d0-c7b7ca00da9b","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.637405Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:1c564783af3852de81e0ffb32509778d8c280408805cc07ba7386954778c3a93","observation_id":"35743585-c2be-4c16-ba27-f08648224357","resolution":{"observed_at":"2026-08-08T12:15:54.477938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.642115Z","title":"Clipn for zero-shot ood detection: Teaching clip to say no","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.642115Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:8e15d05d253399c632ec718620c13ec9703587dea41d7a8ed823742950ddb2b7","observation_id":"bbc8b73f-d170-488c-a05a-feaf2c6acbbf","resolution":{"observed_at":"2026-08-08T12:15:53.642115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.646597Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.646597Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:ced02a695ba156cf8140e923628c66aff9360c424f1bbc918fc29235ed285970","observation_id":"203ab711-cbab-4986-ad1e-d911fa72137d","resolution":{"observed_at":"2026-08-08T12:15:53.646597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.436648Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":"cba1981d-a436-4205-8637-28c421625d10","year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.651558Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:1b107255c5848b56fab5f62a2ff735032eb702bbf68c8eece3e4643efa862db8","observation_id":"4633c331-b818-487c-a731-06bf2b0c5d05","resolution":{"observed_at":"2026-08-08T12:15:54.442134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.421271Z","title":"Anomaly detection for medical images based on a one-class classification","venue":null,"work_id":"4ef72f46-1c77-4b60-a344-00aa2d1fe3df","year":2018},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.655999Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:491f13d824da25d809ad9dfa4da4531e0edb85fca893cfc6c794797bb480212b","observation_id":"b4bb723b-17d8-482d-8fe9-6797034aa9a9","resolution":{"observed_at":"2026-08-08T12:15:54.426462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.405992Z","title":"Diffusion models for medical anomaly detection","venue":null,"work_id":"1e1daaab-c4a9-4e6d-ae31-68217562abd8","year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.660509Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:c26e6c21d833b505ae73a403b8949a74949fe5da941fd94263fae25364c684f0","observation_id":"bbb2da57-1507-4f3b-9ef3-9c33d387ee28","resolution":{"observed_at":"2026-08-08T12:15:54.411277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.388927Z","title":"Funqa: Towards surprising video comprehension","venue":null,"work_id":"93ff57dd-6e52-495c-b691-7c639bbebd36","year":2025},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.665555Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:617b33fd2f85d8ea97af8ca60c8dc3d3aa6aefb71b7f0bac2f3b148c5702ecd7","observation_id":"d74f576e-4fdc-4952-83b3-d664ca3996f2","resolution":{"observed_at":"2026-08-08T12:15:54.394750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.373696Z","title":"Pushing the limits of fewshot anomaly detection in industry vision: Graphcore","venue":null,"work_id":"46699c7e-5481-4bea-b9c7-e6894e750130","year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.670316Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:e93ea88169268d457b6a8f57bf21b72ada72439697a9c1113feb4a2010b57301","observation_id":"af221e77-25f3-4af2-a96d-e924441d1471","resolution":{"observed_at":"2026-08-08T12:15:54.378097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.359615Z","title":"Emovit: Revolutionizing emotion insights with vi- sual instruction tuning","venue":null,"work_id":"93029836-5603-4b7c-9251-ae950ab55a86","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.674798Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:925a104629e8548f55e9d90cbc933089c035d34b35b158ad87b17c41a4ebd48a","observation_id":"8e53082f-5813-4cf1-81dd-d40c4833efba","resolution":{"observed_at":"2026-08-08T12:15:54.363919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10299","last_updated":"2024-07-20T07:56:47Z","snapshot_observed_at":"2026-07-06T18:46:09.997234Z","submitted_at":"2024-07-14T19:23:12Z","title":"Follow the Rules: Reasoning for Video Anomaly Detection with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10299","snapshot_observed_at":"2026-08-08T12:15:53.679847Z","title":"Follow the rules: reasoning for video anomaly detection with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.679847Z"},"links":{"cited_paper":"/paper/2407.10299","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:2e0bf01cc32f6ce243c7d0cd352eef774d4053772d0dd40181f41fda59decc99","observation_id":"4732ee9f-da8c-47d1-aef7-aea0f1e8ada4","resolution":{"observed_at":"2026-08-08T12:15:53.679847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07487","last_updated":"2024-09-09T07:23:36Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:27:23Z","title":"GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly Detection","version":3},"cited_work":{"arxiv_id":"2406.07487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07487","snapshot_observed_at":"2026-08-08T12:15:53.826945Z","title":"GLAD: Towards Better Reconstruction with Global and Local Adaptive Diffusion Models for Unsupervised Anomaly Detection","venue":"cs.CV","work_id":"ae4d1ab4-8a11-446d-9e42-ea9eee6626ca","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.684888Z"},"links":{"cited_paper":"/paper/2406.07487","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:6bbffc0bbbe47f353d2d42d883b3d7d2a237068267f96c33182d9a4eeb9fe900","observation_id":"17db7374-8110-459b-94bb-6272ca7da8bc","resolution":{"observed_at":"2026-08-08T12:15:53.834354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.345565Z","title":"Dense connector for mllms, 2024","venue":null,"work_id":"c568b272-f28f-43e3-bf24-8534301c5d74","year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.689732Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:efd5644117ace8f3eea4f7a1f7171f2818d3fbc2013f26608d933481380edf3f","observation_id":"dc014634-f280-4bbb-bdd1-a985697b0b90","resolution":{"observed_at":"2026-08-08T12:15:54.349535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13349","last_updated":"2024-07-04T14:07:12Z","snapshot_observed_at":"2026-07-06T17:47:30.518562Z","submitted_at":"2024-03-20T07:21:37Z","title":"Hierarchical Gaussian Mixture Normalizing Flow Modeling for Unified Anomaly Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13349","snapshot_observed_at":"2026-08-08T12:15:53.694335Z","title":"Hierarchical gaussian mixture normal- izing flow modeling for unified anomaly detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.694335Z"},"links":{"cited_paper":"/paper/2403.13349","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:2e747d79a9d0e2c7d2397b06328876396cab10518af81f05d80ced99e1bb4a54","observation_id":"18049448-ec09-4522-aa53-45d3900a3d5c","resolution":{"observed_at":"2026-08-08T12:15:53.694335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.331676Z","title":"A unified model for multi-class anomaly detection","venue":null,"work_id":"74ba23b2-bbfe-401d-a4a5-d45b7ee0f91b","year":2022},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.698429Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:3b45c2d90eac0f4cb60e38926ccf9d31d7cb8adf50f613e12c5b7b544b11e90f","observation_id":"2fe0294f-70a3-41f3-bbd9-aa6fd332b78f","resolution":{"observed_at":"2026-08-08T12:15:54.335814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:54.317938Z","title":"Draem- a discriminatively trained reconstruction embedding for sur- face anomaly detection","venue":null,"work_id":"b26e9759-9140-4f20-a723-041e3777921c","year":2021},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.702619Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:d6d62383c02c180bf5201cdebbe114db6af40144f2fbb65a932bb47b46c6ec49","observation_id":"dba8505e-b04c-447b-8f5c-5009b16993dd","resolution":{"observed_at":"2026-08-08T12:15:54.322137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:15:53.706327Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.706327Z"},"links":{"citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:c28ad032af1adc3cd60b9cda7b640713e0f21ef7b1b6351e40a755021e4efdfd","observation_id":"279928e5-3150-4429-9e90-b1edfde5646b","resolution":{"observed_at":"2026-08-08T12:15:53.706327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:08:25.181707Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":2,"verified_fuzzy":45},"total_outbound_references":116},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 116 outbound references and 7 inbound Pith citation observations for arXiv:2502.07601."}