{"as_of":"2026-08-12T03:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6044d10fc584dfa315ebf05b2af19dd893d2f4edfac16b8d6dc52c05a853cd25","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:00:13.103101Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10353/citation-record","integrity":"/paper/2412.10353/integrity","json":"/paper/2412.10353/citation-record.json","paper":"/paper/2412.10353"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.586083Z","title":"Deep neural rejection against adver- sarial examples,","venue":null,"work_id":"67fcc973-27af-44c3-a3fe-650b0b101fa2","year":2020},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.013540Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:45b43515a36246a2964025d9b50522ac103dfbb4e913240c552b39d3fca18951","observation_id":"7c8f0814-7449-4a9f-af37-ed9a0d5a9160","resolution":{"observed_at":"2026-08-11T16:00:13.594571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14713","last_updated":"2022-11-18T10:12:11Z","snapshot_observed_at":"2026-08-11T13:50:02.370614Z","submitted_at":"2022-03-28T13:00:01Z","title":"Image-text Retrieval: A Survey on Recent Research and Development","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14713","snapshot_observed_at":"2026-08-11T16:00:13.040800Z","title":"Image-text retrieval: A survey on recent research and development,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.040800Z"},"links":{"cited_paper":"/paper/2203.14713","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:d6da3232f2a7a6b558199d843972596ee360a0a1e70a070b0eff5d94c157287c","observation_id":"84bb4307-1660-44c8-8125-eb2f712e35f7","resolution":{"observed_at":"2026-08-11T16:00:13.040800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00522","last_updated":"2024-07-08T02:48:27Z","snapshot_observed_at":"2026-08-11T22:02:20.960260Z","submitted_at":"2024-03-01T13:30:51Z","title":"VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00522","snapshot_observed_at":"2026-08-11T16:00:13.052533Z","title":"Visionllama: A unified llama interface for vision tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.052533Z"},"links":{"cited_paper":"/paper/2403.00522","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:61769bf433bdab85b7e8046ceaafa304de0aea5ea184cd0417a366f242d0ea22","observation_id":"60c69d0f-88ce-4201-a803-ab13abd4585b","resolution":{"observed_at":"2026-08-11T16:00:13.052533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06705","last_updated":"2019-02-20T17:38:32Z","snapshot_observed_at":"2026-08-02T02:05:14.321072Z","submitted_at":"2019-02-18T18:18:27Z","title":"On Evaluating Adversarial Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06705","snapshot_observed_at":"2026-08-11T16:00:13.059287Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.059287Z"},"links":{"cited_paper":"/paper/1902.06705","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:26f3310d2d7c02a4ce64fb607df337f9c9b2e35854ea3a6b59eb998cc64b53fc","observation_id":"f0282e34-d82e-4341-a3d1-f10c78907782","resolution":{"observed_at":"2026-08-11T16:00:13.059287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.506542Z","title":"An analysis of single-layer networks in unsupervised feature learning,","venue":null,"work_id":"53e5df37-9c34-43c0-9aaf-55fd42612b77","year":2011},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.070621Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:45e34d9f6d9785e112671a226c8a63238858f81c71a12b4f8a00b70afb261f71","observation_id":"e3767c66-8306-4766-8642-51167b2a8c16","resolution":{"observed_at":"2026-08-11T16:00:13.515652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.480709Z","title":"Improving robustness using generated data,","venue":null,"work_id":"9db0d28e-61d5-423d-871d-fdb80e2ae926","year":2021},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.075645Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:e969b4f8122ec641682d6ff5d86b2c6569ce3edb935f4d156946ec718aeac949","observation_id":"86033ae1-2dec-4428-966e-2f14dc0b4370","resolution":{"observed_at":"2026-08-11T16:00:13.487170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.456375Z","title":"Adversarial robustness: From self-supervised pre-training to fine-tuning,","venue":null,"work_id":"ed540446-68f9-4158-875a-0152dc709e5e","year":2020},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.082583Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:920600845056589376e1c36d9bafd9968abefd1fe9e4cb76f69ec7fda4cf652f","observation_id":"a80416b1-e043-4b94-a4d2-fdf6bd256249","resolution":{"observed_at":"2026-08-11T16:00:13.465157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.088859Z","title":"Fusionbench: A comprehensive benchmark of deep model fusion,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.088859Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:511278e257a0ca84e1050c2031b995cf8805afd330bc6df96306b6c10d10207b","observation_id":"dc5aa641-55d7-47b6-9234-ac34f1b736b7","resolution":{"observed_at":"2026-08-11T16:00:13.088859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15658","last_updated":"2023-06-27T17:51:06Z","snapshot_observed_at":"2026-08-03T00:57:50.686707Z","submitted_at":"2023-06-27T17:51:06Z","title":"CLIPA-v2: Scaling CLIP Training with 81.1% Zero-shot ImageNet Accuracy within a \\$10,000 Budget; An Extra \\$4,000 Unlocks 81.8% Accuracy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15658","snapshot_observed_at":"2026-08-11T16:00:13.094737Z","title":"Clipa-v2: Scaling CLIP training with 81.1% zero-shot imagenet accuracy within a $10, 000 budget; an extra $4, 000 unlocks 81.8% accuracy,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.094737Z"},"links":{"cited_paper":"/paper/2306.15658","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:04a130525fc22cca82eb6ad65a8f1ca87e43351e6311abeb3c34b7355be20b4b","observation_id":"2a39b60f-6d87-4c68-baa6-66f024898cab","resolution":{"observed_at":"2026-08-11T16:00:13.094737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-11T16:00:13.103101Z","title":"Huggingface’s transformers: State-of-the-art natu- ral language processing,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.103101Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:6e7980abb9fb40ea0ba5629c82b163ae35109c2938db4ded3707eba1a3eabb65","observation_id":"dac85a6e-423f-41a1-9f33-3bb62ac9547f","resolution":{"observed_at":"2026-08-11T16:00:13.103101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.537265Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":"e3ff850d-46f8-4dd6-8ead-c6b897516f56","year":2004},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.065711Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:86c74efd6ef47672bd15a95bd5aa4ed5cc6fa57760a1e741cb4870054b9df858","observation_id":"28b0a0ed-11a8-435c-964a-785d74169182","resolution":{"observed_at":"2026-08-11T16:00:13.544798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.668442Z","title":"Towards evaluating the robustness of neural networks,","venue":null,"work_id":"a092b6ed-a26b-40f5-b659-d101dba6c10d","year":2017},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:12.984402Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:c78d603530ba047f9400c0600aa3d264a2c787d2cc948ee590b4cb1f76035004","observation_id":"460ee490-2aec-4398-95b3-c508bebe017f","resolution":{"observed_at":"2026-08-11T16:00:13.675015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-11T16:00:13.002316Z","title":"Towards deep learning models resistant to adver- sarial attacks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.002316Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:15c83d336cd9af4ccb435e228da9d067d03b26b6b50a2e23283af545c376fa45","observation_id":"775bfcc7-9d62-4945-ab92-753b48169323","resolution":{"observed_at":"2026-08-11T16:00:13.002316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.607561Z","title":"Safetynet: Detecting and rejecting adversarial examples robustly,","venue":null,"work_id":"832eb879-af52-4a3b-8446-67584ec3a8c0","year":2017},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.008087Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:b60df42b2b4dfd414ab91dd3e4f1822dc2b881fdbf08e20f8d9db186d26024a7","observation_id":"aacb442f-a626-47a5-8a97-f93dd6079843","resolution":{"observed_at":"2026-08-11T16:00:13.613574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-11T16:00:13.029837Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.029837Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:ca9657e59f54c8dac9418cbb247338788ae0daf6203322a59211bc507dcee905","observation_id":"970b03d7-ed8a-40c4-9025-18827242f426","resolution":{"observed_at":"2026-08-11T16:00:13.029837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.560159Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"43a34d5b-0a84-4c87-9fe8-5849c592d891","year":2021},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.019822Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:544ca4970b8e7e219fe2322f36e5b13d284ce6ffcb85b8fe9de26273e47609b0","observation_id":"8f44f540-b9c8-4e4d-968c-17fa362054f7","resolution":{"observed_at":"2026-08-11T16:00:13.566416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.839524Z","title":"Evasion attacks against 8 machine learning at test time,","venue":null,"work_id":"f7a334b0-d6ff-4454-bd6e-2c9f268a202f","year":2013},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:12.977010Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:f1eceb6bf964ae2fca550a6ba60cc521ed4764283b6fdfa71b4a61ed72c7f566","observation_id":"9ae533e3-f133-4521-a039-162509643c0a","resolution":{"observed_at":"2026-08-11T16:00:13.845651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.626214Z","title":"Wild patterns: Ten years after the rise of adversarial machine learning,","venue":null,"work_id":"7fef975e-7ff7-45f6-b98b-ac4a4dbb4da1","year":2018},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:12.997383Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:f0f953b171e2570ae1e98d7e557242b53d604ac399968bfd0996f8cd79e769a9","observation_id":"6e033151-2dd2-4d03-ae19-fb02cfd3de9e","resolution":{"observed_at":"2026-08-11T16:00:13.633314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-11T16:00:13.046276Z","title":"Visualbert: A simple and performant baseline for vision and language,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.046276Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:cecc8a01a467332fa8d371529195fbb09ff86aae60a864df7cfc79935dafe7ff","observation_id":"4f7405e4-7fd0-4d69-acee-cdab0767910a","resolution":{"observed_at":"2026-08-11T16:00:13.046276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-07-06T12:40:27.042790Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-11T16:00:13.035351Z","title":"A survey of vision- language pre-trained models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.035351Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:2e739a1416ec161f7948f01d3fd076a760fd159ad4f6947ebb0398cfa511b12b","observation_id":"1edc973a-b1b2-42cc-89e4-663c6096cc65","resolution":{"observed_at":"2026-08-11T16:00:13.035351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.04765","last_updated":"2018-03-13T13:02:13Z","snapshot_observed_at":"2026-07-06T06:28:00.254252Z","submitted_at":"2018-03-13T13:02:13Z","title":"Deep k-Nearest Neighbors: Towards Confident, Interpretable and Robust Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.04765","snapshot_observed_at":"2026-08-11T16:00:13.024471Z","title":"Towards open set deep networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:13.024471Z"},"links":{"cited_paper":"/paper/1803.04765","citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:0b0b87e59d254e4157975fe3cd0381190f0dc64ca511ef3d6fe78b43a09de8ef","observation_id":"93b7f950-d061-4b8f-a711-164aab124dc5","resolution":{"observed_at":"2026-08-11T16:00:13.024471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:00:13.648473Z","title":"Attackbench: Evaluating gradient-based attacks for adversarial examples,","venue":null,"work_id":"9e903238-e4c9-437e-8b94-6552eda09307","year":2025},"citing_paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T16:00:12.992098Z"},"links":{"citing_paper":"/paper/2412.10353"},"observation_digest":"sha256:9f8ea8c717056d99367c8a4271d7a2153e4f752d9d7ba1cab1a1af38ef1dd5af","observation_id":"10eed4f2-559b-4a97-a16a-7e7067022bdc","resolution":{"observed_at":"2026-08-11T16:00:13.654844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10353","last_updated":"2025-04-18T13:02:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:53:43.018590Z","submitted_at":"2024-12-13T18:49:25Z","title":"Robust image classification with multi-modal large language models"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2412.10353."}