{"as_of":"2026-08-12T05:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a54a2758a281c83e767ccdc0c9a1aaa86b83591b22352122bd4e96f82e33c7c","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:41:37.913674Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T05:53:26.066674Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T05:53:26.308450Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"cited_work":{"arxiv_id":"2412.16418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting mllms: An in-depth analysis of image classification abilities","venue":null,"work_id":"cd5bb838-ef93-450a-803d-4b741b86e4bc","year":2024},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2412.16418","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:f8e7bb2c9009da2063ec4ddace79f8d94cb5f1db65129db35950b5c552409c7b","observation_id":"c79c90a0-9f56-44e8-9ae0-b82a1af23dd6","resolution":{"observed_at":"2026-05-17T05:53:26.314287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"cited_work":{"arxiv_id":"2412.16418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting mllms: An in-depth analysis of image classification abilities","venue":null,"work_id":"cd5bb838-ef93-450a-803d-4b741b86e4bc","year":2024},"citing_paper":{"arxiv_id":"2602.07605","last_updated":"2026-04-27T13:49:08Z","snapshot_observed_at":"2026-08-11T04:07:17.058050Z","submitted_at":"2026-02-07T16:16:51Z","title":"Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T06:13:33.315525Z"},"links":{"cited_paper":"/paper/2412.16418","citing_paper":"/paper/2602.07605"},"observation_digest":"sha256:a1a1ec2aa4c44a7bb6cde9eabc6cd4bd1a7d2c23652c80b0655974dcfc138750","observation_id":"cd99320d-16e6-4664-8f5c-b047690979af","resolution":{"observed_at":"2026-05-16T06:17:26.785959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"cited_work":{"arxiv_id":"2412.16418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting mllms: An in-depth analysis of image classification abilities","venue":null,"work_id":"cd5bb838-ef93-450a-803d-4b741b86e4bc","year":2024},"citing_paper":{"arxiv_id":"2603.03197","last_updated":"2026-04-12T16:48:44Z","snapshot_observed_at":"2026-08-03T05:43:55.769983Z","submitted_at":"2026-03-03T17:52:39Z","title":"Specificity-aware reinforcement learning for fine-grained open-world classification","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T16:44:47.866126Z"},"links":{"cited_paper":"/paper/2412.16418","citing_paper":"/paper/2603.03197"},"observation_digest":"sha256:ec2af1a7f96fefdc1c4bd9d32889d38477170d4fb17340382c507df76cd2fd75","observation_id":"6ed6e79d-0ae8-403b-81a3-9aeafa49eb0f","resolution":{"observed_at":"2026-05-15T16:46:17.940206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"cited_work":{"arxiv_id":"2412.16418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting mllms: An in-depth analysis of image classification abilities","venue":null,"work_id":"cd5bb838-ef93-450a-803d-4b741b86e4bc","year":2024},"citing_paper":{"arxiv_id":"2604.16785","last_updated":"2026-04-18T02:16:34Z","snapshot_observed_at":"2026-08-06T13:20:04.480997Z","submitted_at":"2026-04-18T02:16:34Z","title":"Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T07:46:39.249226Z"},"links":{"cited_paper":"/paper/2412.16418","citing_paper":"/paper/2604.16785"},"observation_digest":"sha256:cf43cdb03b3e710c5b6330d5e561261d19c5e913318b6ad929517b58cb2e10e4","observation_id":"a966abb4-9133-462e-b8d5-fa9c4869ed82","resolution":{"observed_at":"2026-05-10T07:47:12.229585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16418/citation-record","integrity":"/paper/2412.16418/integrity","json":"/paper/2412.16418/citation-record.json","paper":"/paper/2412.16418"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.800677Z","title":"Phi-3 technical report: A highly capable language model locally on your phone, 2024","venue":null,"work_id":"87fa9ace-166a-48c1-b4f4-7bb10458527a","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.645085Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:249a5f2e7965f3114ece53f823473052d70c9c8f0858920c53c0574c9f223b24","observation_id":"26d9fdff-b43a-4026-ad45-64adff441f29","resolution":{"observed_at":"2026-08-11T10:41:38.804660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T10:41:37.649338Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.649338Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:10f245db81876a7927a0de6ea11cbea7e97e607ef00a22ada9aeae435bcba508","observation_id":"ee6d380d-4759-4055-88ad-3cf8158c5df3","resolution":{"observed_at":"2026-08-11T10:41:37.649338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T10:41:37.654130Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.654130Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:e4d5f6643be625804bf9e355682df5a0c0826d35a968c9bb1452a6f02c1c448f","observation_id":"dd44ae15-887c-4550-ba9d-b1f3d11e1f76","resolution":{"observed_at":"2026-08-11T10:41:37.654130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.785292Z","title":"Objectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models.NeurIPS, 32, 2019","venue":null,"work_id":"c99512ea-84ee-4705-a369-1a572288e7ff","year":2019},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.659252Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:5ae39357238c72899c993c51fd9b8951e0b5e87742cdbb93ae4c4014697346d8","observation_id":"b147c20f-2529-43f9-a83b-fe3e3809a35d","resolution":{"observed_at":"2026-08-11T10:41:38.791334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.767747Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":"25b2d4fd-fc86-42af-b209-8b028bdf52db","year":2014},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.663576Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:c0914d679ce46b655694129cf43281bd7984204dad6518b65250a8751fcf86c6","observation_id":"5f25b32c-41a3-4ab6-8391-260bd1192543","resolution":{"observed_at":"2026-08-11T10:41:38.773812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.751876Z","title":"Are we on the right way for evaluating large vision-language models? In NeurIPS, 2024","venue":null,"work_id":"1e54822d-7ae7-4f44-a4b5-57301c019132","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.667758Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:c5fa217d3130300690b0b594caa267f6ea0c2f888c8806e5cf09b7e19c8076f7","observation_id":"f25dc983-710a-40ce-b637-d287d267c968","resolution":{"observed_at":"2026-08-11T10:41:38.757562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T10:41:37.671719Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.671719Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:4364d6fdfec5c62bb90f3fbe31df3e68d29597b1815fbc3de00419df43f6be49","observation_id":"f2bc42e5-e1e0-44fa-b969-89a1d01cacd5","resolution":{"observed_at":"2026-08-11T10:41:37.671719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T10:41:37.676904Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.676904Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:484405878edd3798fcdff52c0d144953dba515332fec10c7c8656c33fb78e825","observation_id":"512549b8-9fb6-46fb-9c55-0f9f7350d085","resolution":{"observed_at":"2026-08-11T10:41:37.676904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.738694Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"ef29896c-0f90-4129-a500-c39a4f590a11","year":2023},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.680980Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:f61541fdbe13d128253f39f19a4f2e4b6f476d63376eb3cd5aa1814c084694de","observation_id":"7e37559a-9fd4-46f4-93f4-b1a016a384ff","resolution":{"observed_at":"2026-08-11T10:41:38.742658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.723770Z","title":"Coatnet: Marrying convolution and attention for all data sizes","venue":null,"work_id":"2b7b4690-09ba-41c0-835a-037d6c953f8c","year":2021},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.685448Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:171b63d241de6d096b4d7201445561f62256fed56e8570ba254757c33dddabdb","observation_id":"649b899d-acfc-4e74-ac00-ec9a4666e795","resolution":{"observed_at":"2026-08-11T10:41:38.728961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.707106Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"66179262-e7ce-44d4-91be-765047fc9026","year":2009},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.691943Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:131e701be23e1671121b80280a07b3b91df5ba0ecb5bde0f9da819ca43f83096","observation_id":"1fae459d-ba51-44ce-bd4f-142eac21a8d3","resolution":{"observed_at":"2026-08-11T10:41:38.712308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.691778Z","title":"BERT: pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"17c390f1-ca60-4c06-b751-4be6239b07a9","year":2019},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.696993Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:d1e8ce5ccf2260ebdc47c58f7f8f676e5d7b6255a6abf0e089e34e01679c38c7","observation_id":"2f3049f3-2cba-46e3-b277-3daad7465ce5","resolution":{"observed_at":"2026-08-11T10:41:38.697360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:37.703159Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.703159Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:a9eb9d3528c789f80de4951605c3af5111e0d3928e69e148cab3518b275e3a17","observation_id":"5f8f7f39-9aa5-4eda-9b92-0d01a523c50f","resolution":{"observed_at":"2026-08-11T10:41:37.703159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.667264Z","title":"Data filtering networks","venue":null,"work_id":"1a9e7146-ea9d-4c1b-be95-e4795baa525b","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.707016Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:45381ec9d5f46706ac9207b3d82cedb38de9aa265380fde2c72aa6639314c25d","observation_id":"6565e1be-5820-43a8-965c-4c62d5f88e7a","resolution":{"observed_at":"2026-08-11T10:41:38.671134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.652610Z","title":"Eva-02: A visual representa- tion for neon genesis","venue":null,"work_id":"b612326a-ac56-4fe6-9b44-42c6a34b3876","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.710856Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:a0d1ffb5e443e293d2b8d3f0a03d90d3ab176ee0189ae57b403987e1b7ab09d0","observation_id":"f5617f5b-cba8-40ea-bf28-bd89e01680a8","resolution":{"observed_at":"2026-08-11T10:41:38.657904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.636860Z","title":"Learning gener- ative visual models from few training examples: An incre- mental bayesian approach tested on 101 object categories","venue":null,"work_id":"b8f7c783-07b3-4c71-a700-68340b8e434d","year":2004},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.715175Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:0cb2e224cecf8d6ee0757b532ceba9db988e58b332168f55727e8e48f6662df5","observation_id":"64e592e5-588d-48fc-86b7-210724a4ffa9","resolution":{"observed_at":"2026-08-11T10:41:38.642239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T10:41:37.719841Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.719841Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:1bc84158062f47e0b723d042e6ef6525505eb4dd09dc11de3fe86387633b2b52","observation_id":"135ad5c1-ab1f-4405-9072-85df1f456097","resolution":{"observed_at":"2026-08-11T10:41:37.719841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15125","last_updated":"2024-09-23T15:31:25Z","snapshot_observed_at":"2026-08-12T03:10:22.584797Z","submitted_at":"2024-09-23T15:31:25Z","title":"Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation","version":1},"cited_work":{"arxiv_id":"2409.15125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15125","snapshot_observed_at":"2026-08-11T10:41:38.032671Z","title":"Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation","venue":"cs.CV","work_id":"e9593565-4cae-4b96-9b5b-9aa13c0b4b14","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.724041Z"},"links":{"cited_paper":"/paper/2409.15125","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:90594aa584aa3839eb278c8c562f85ce26138e844439a9838b292b572825a8e3","observation_id":"bb13bc77-0bc9-42b1-a4ae-ccf7ddd93ff3","resolution":{"observed_at":"2026-08-11T10:41:38.039197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:37.728454Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.728454Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:eb688cbaad2a415b161db935627d2d256e3eef19a7585a092469855bb814102c","observation_id":"a3306c69-e067-41c6-ab6a-20f523e98067","resolution":{"observed_at":"2026-08-11T10:41:37.728454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.614238Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"28309785-c60d-465d-a354-ed8be3becc27","year":2019},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.732817Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:98698d313eac96c3bdba56200d5fd76eef513dc70d88a96a88b55d35f6827031","observation_id":"5a58e4a6-c8f9-4894-b8f4-02cd67bcf147","resolution":{"observed_at":"2026-08-11T10:41:38.618633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.601189Z","title":"Rwku: Benchmarking real-world knowledge unlearning for large language models","venue":null,"work_id":"1c8b9404-a1b1-4156-8601-9d19601dffc6","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.736467Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:dfc54ee000898a0dfa32723adeeb2874dbd4acfbbf78ef806ff537f20e81629b","observation_id":"d705921b-d5a6-452f-942b-105c522a0042","resolution":{"observed_at":"2026-08-11T10:41:38.605236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.586992Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"3d9d5c82-b441-4166-a4e1-7b041161f04e","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.739962Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:091caea88dc179e167ec5f2b36f09b99f8da4e4d69f51df455a5e7d60d3e42fd","observation_id":"6bdb4fae-00c0-4d45-9dce-5c5d20c3a406","resolution":{"observed_at":"2026-08-11T10:41:38.591704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.572907Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"99faa844-4f7d-43d2-95f2-61474d98905c","year":2013},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.743871Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:83cdd62b75654d896c5f57b10b7e6108e59ebb1c92a4049dcfbc35ba0383d511","observation_id":"147fb193-4c30-42cd-b226-900d5f05ed03","resolution":{"observed_at":"2026-08-11T10:41:38.576988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:37.747756Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.747756Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:f96dcb7e85640c268e4cc02cce0e4dc65aeb93e968af0f1c0ea7d80a2abe65df","observation_id":"423d313b-a984-48b6-8315-49018b59265f","resolution":{"observed_at":"2026-08-11T10:41:37.747756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:37.751786Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.751786Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:50b028e1a46f341724cba40da137e259b8858a0b50e7c392a804d8d5e466b3b9","observation_id":"2880705b-cf22-48c6-955e-78b6ed7c7f28","resolution":{"observed_at":"2026-08-11T10:41:37.751786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.540924Z","title":"Gradient-based learning applied to document recog- nition","venue":null,"work_id":"f613f06c-81f0-4488-aa49-08b9ffa8af6d","year":1998},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.756024Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:2a7d6c4a1319cc9edaff1fd3900543c3664b6a5905aa396d06baff73627e85e9","observation_id":"fb3ff337-0db6-4da1-8332-27cf3950accf","resolution":{"observed_at":"2026-08-11T10:41:38.544978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.527573Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":"921cf9e2-a9dd-4da4-a9be-591b98918016","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.760545Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:ad0ffcc9ef6096c7dc551bbc5c2de7de42175c13fde25a52f4a902e7ec7c37ac","observation_id":"4763ab78-4416-492a-baa7-2c9d8e3126f4","resolution":{"observed_at":"2026-08-11T10:41:38.532234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T10:41:37.764851Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.764851Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:bf9b9d2af8fa9c36d9a96bad8132fae76f3c2c2187cf9f50cd5c6289b5c83769","observation_id":"d7f22d14-e1ba-485c-a2d6-23804eac654f","resolution":{"observed_at":"2026-08-11T10:41:37.764851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.513233Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"f215ef7b-8c58-4b5a-9dfa-de18d02eedea","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.769002Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:04bf99c03120e8e1a46bdbfe096d82581de5b77d6f2a36129e7135beeb963a0f","observation_id":"eb5755bc-79ee-4029-99a4-ccd84213866c","resolution":{"observed_at":"2026-08-11T10:41:38.517939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.499811Z","title":"Visual instruction tuning","venue":null,"work_id":"26004fce-baec-4a46-a810-3dbfec73249e","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.772807Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:41282c6e31429f35df7689cac394007574b0cea5574ccb00d3aeef9dc92485e2","observation_id":"1eefded5-450b-469d-8753-2b4f87f91387","resolution":{"observed_at":"2026-08-11T10:41:38.504194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.485442Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, pages 216–233","venue":null,"work_id":"bc27405a-ff08-4344-9618-bfe3f4e6158b","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.777788Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:18d762f8ca4f26134c1f345533ad28ddffc5605e58f7e18c7d0fca88af63f04f","observation_id":"f05a396c-3dcf-43b6-8376-e2cc2e03942c","resolution":{"observed_at":"2026-08-11T10:41:38.490407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:37.781644Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.781644Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:8f8ebb089c9707258b477097bbe1a2bad229880f7471bccff743a5bd1f9408ba","observation_id":"b125040d-82e0-47d1-8623-32f40ce15112","resolution":{"observed_at":"2026-08-11T10:41:37.781644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.462169Z","title":"Swin transformer v2: Scaling up capacity and resolution","venue":null,"work_id":"8cd20875-08dc-455d-bd93-596c7c2b7c27","year":2022},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.785576Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:955d2e00484ce817856a23f3e8d6cc3c03531e62615d046899dfee30ef019ff4","observation_id":"7a9eb696-d3e2-4342-b53f-63f7a724c2b7","resolution":{"observed_at":"2026-08-11T10:41:38.466547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.447762Z","title":"Deepseek-vl: Towards real-world vision- language understanding, 2024","venue":null,"work_id":"31f93f4e-18d5-49f0-8717-35193d726b30","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.789525Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:6407f1bb1f7de151daeb15f468006564c9ec9fc958d6af0985af95329423343f","observation_id":"680c1ba2-1e15-40d8-b18e-392a34f8462c","resolution":{"observed_at":"2026-08-11T10:41:38.452406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:37.793312Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.793312Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:18fec4fb67371d2737e1147752c908a0c2f1fdb07b5fa70ce4b3ba935770883b","observation_id":"6c907534-b710-4e45-a52d-deb2507b3eb7","resolution":{"observed_at":"2026-08-11T10:41:37.793312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.423821Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"ca9ba25c-ac1f-4b49-b060-a0daad94bbbd","year":2022},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.797816Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:d60883d04d7ecd4a567218b945b3c2ed859c169c049b3f2b202d5429a0e38426","observation_id":"ce63c050-1879-4730-b950-31b8bdf8d301","resolution":{"observed_at":"2026-08-11T10:41:38.428526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.409546Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"fec18247-8e97-4be9-a2ea-41e7271399b5","year":2021},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.801625Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:ed73702e970f81dab315dd6780efd6e2a50864881fdf55e3d562478e40d028bf","observation_id":"fc28fc7b-fd75-4e1b-9d14-938ab88e8b51","resolution":{"observed_at":"2026-08-11T10:41:38.414259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.395485Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"dc6b45fc-e10a-42dc-adb9-c98fd9fdd643","year":2008},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.805381Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:4c3f7f5043a207c39dae7bc024d5bfb2e0f0d1f153acb6d0dc8518185571d24c","observation_id":"97fc78a3-17c7-4c73-a309-f0126aae063f","resolution":{"observed_at":"2026-08-11T10:41:38.399973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.380619Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"b4dacae6-7cb6-4dbd-bee5-3414c384d014","year":2021},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.809342Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:ec9259792548f1e2c0477c4522641505d66c5635d88d4d3f15ec0ce70b15582b","observation_id":"d84a2c1d-a71c-48d1-bc91-ec675586df64","resolution":{"observed_at":"2026-08-11T10:41:38.385355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.367056Z","title":"Do imagenet classifiers generalize to im- agenet? In ICML, pages 5389–5400","venue":null,"work_id":"df684ea0-c3fa-4fdc-9405-e4ad5f395cad","year":2019},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.813258Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:45b74588abae70f9615a49a8e507f45ba88642cd5e54f219224780dc63e7cb8a","observation_id":"b0dda3b1-c61c-44bd-b8c3-145b132615cd","resolution":{"observed_at":"2026-08-11T10:41:38.371153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-10T22:24:05.831832Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-11T10:41:37.817566Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.817566Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:0c4639cfdd0f19c36578a51a44503006b6b21999df88b34f358b909c626c1d97","observation_id":"6583b487-47db-4cab-b85e-780423ad6ef8","resolution":{"observed_at":"2026-08-11T10:41:37.817566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.355000Z","title":"Going deeper with convolutions","venue":null,"work_id":"06ef99e1-645c-4794-8b2c-4477cfce6fae","year":2015},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.821586Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:e9741d48b2396b77322e9ea2e2c05a436884b68f500bbd5961e765585daf99c0","observation_id":"c5aa90d2-8c50-4c8a-88ae-cf42f07c6516","resolution":{"observed_at":"2026-08-11T10:41:38.358893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.342141Z","title":"Jn-logo: A logo database for aesthetic visual analysis","venue":null,"work_id":"d82396cb-0f3f-4652-a334-70acf96981ea","year":2022},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.825220Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:42d5763d62d9a75609858b9f4ea68655eb0b81ca0453ad71b6e4130005e234a8","observation_id":"c39ea7b9-18ea-49d6-916b-5f101a0d3628","resolution":{"observed_at":"2026-08-11T10:41:38.346202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T10:41:37.829252Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.829252Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:8fc76dec752b9d4e80a0a540b251d3a71a7982c41a63ed852a94f8c80a12f4df","observation_id":"77b04fab-f437-4f57-ab40-25f814b7bbf1","resolution":{"observed_at":"2026-08-11T10:41:37.829252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.329310Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":"e60da67b-8d57-40ad-91d2-bddf7f1ead81","year":2011},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.833118Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:bb06074f021570772cd97a2eb53728583d1e086c0043b56b95a32186a1e08614","observation_id":"a11be65f-a96a-478e-851d-dc087973079e","resolution":{"observed_at":"2026-08-11T10:41:38.333684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T10:41:37.836593Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.836593Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:ea92db4698feb05023b285ed9ac5cd7ed66f2968913934d8877270dd890e154b","observation_id":"79c68e05-d7ef-4e85-a426-dde92e24ba70","resolution":{"observed_at":"2026-08-11T10:41:37.836593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.315351Z","title":"Google landmarks dataset v2-a large-scale benchmark for instance-level recognition and retrieval","venue":null,"work_id":"917174a3-e45f-4cc5-8fb3-c7e4a1ef7614","year":2020},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.840235Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:d2bac9ddd369e9a3def28d48a8deb5479f111111cfe573ecc59526f71d41c23f","observation_id":"c9a3af94-9db8-4a0f-b0e8-afcb4f4ae00b","resolution":{"observed_at":"2026-08-11T10:41:38.320216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09265","last_updated":"2023-06-15T16:39:24Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T16:39:24Z","title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09265","snapshot_observed_at":"2026-08-11T10:41:37.843756Z","title":"Lvlm-ehub: A comprehensive evaluation benchmark for large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.843756Z"},"links":{"cited_paper":"/paper/2306.09265","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:c32a3a58dbaa81864e79c3f61e011fe3f5347982e4e058f962bd5247b7a30849","observation_id":"6dfdb39c-d2fd-4d8b-a273-3684ffda1862","resolution":{"observed_at":"2026-08-11T10:41:37.843756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T10:41:37.848153Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.848153Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:8ff6dae6bab80f0a9de8baeca52291efacc4d9e99829562e3f147e1171c93bbf","observation_id":"54f2a3cb-6db3-47cf-9fa2-0eafe9ae4a9b","resolution":{"observed_at":"2026-08-11T10:41:37.848153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T10:41:37.851906Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.851906Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:b8199e1325db4c24fa0781c4b79cfb6d6a61e30697ef2d3f95968a73f1b3d598","observation_id":"7ea62737-c138-4423-bb54-245ca0e19438","resolution":{"observed_at":"2026-08-11T10:41:37.851906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.299610Z","title":"Lamm: Language-assisted multi- modal instruction-tuning dataset, framework, and bench- mark","venue":null,"work_id":"cacf6f17-5417-478a-afed-a3cfddd40c86","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.855634Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:ee46f7306b095f3ec81252b02db28c944758525c892905205fdfd151229982c2","observation_id":"9376f618-2abc-453d-ae52-23869843af28","resolution":{"observed_at":"2026-08-11T10:41:38.305265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.286810Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":"df6cb8c1-ae9c-4b46-92c7-74a7774a1aed","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.859312Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:666ed6600550237af23555976a899cf203a473b6a31f347ab0a4a99ede684e5e","observation_id":"e22b5e0b-38f6-45c2-afc9-6075f861c1f8","resolution":{"observed_at":"2026-08-11T10:41:38.291495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.275045Z","title":"Scaling vision transformers","venue":null,"work_id":"7158e944-6ee3-45c4-a757-7923714017a2","year":2022},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.862680Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:429eca0979202f266a0a9911ae0a9b7acfe5e98bb0dbb4033dc4bd19283792c2","observation_id":"d5484383-abc7-42e2-a928-f59e8bdeebca","resolution":{"observed_at":"2026-08-11T10:41:38.279108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.262217Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"d09f14f9-9b1e-4b76-89a3-6a5ab0d7a68b","year":2023},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.866304Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:ca67347d9f124af4e4a533524a26ef3c9dfa429130779ba41ec71511e42262c0","observation_id":"7a8448cb-a3e6-4239-aeaa-ca7bb0f2b90a","resolution":{"observed_at":"2026-08-11T10:41:38.266554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.250318Z","title":"Why are visually-grounded language models bad at image classi- fication? In NeurIPS, 2024","venue":null,"work_id":"1185d50e-dae2-4381-b14c-ecddb4c6c87d","year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.869890Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:aa05951fa95f2426a8cbb021596ebafe374985c24921d0e90fe5225f97b2a095","observation_id":"31162702-5e58-482f-b745-20a7f7a518b7","resolution":{"observed_at":"2026-08-11T10:41:38.254538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.236714Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"54812018-0e90-4793-8bd3-bc27ca5112fe","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.872988Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:5ec24cb0b2743dd0177979941675657eb7114a3cd40189578d84d412c425e17d","observation_id":"546b4cde-2671-4a32-9206-c001ced541ec","resolution":{"observed_at":"2026-08-11T10:41:38.241459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.210210Z","title":null,"venue":null,"work_id":"d0a329a1-4a17-48b1-b5c0-4f682945bfa2","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.881848Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:1687e42b1488f8c6c5855c4c829a9defd31a4db3758177c7207ae9ea186b8a13","observation_id":"31a23f9b-ec1f-4a5c-bec6-052b72921c54","resolution":{"observed_at":"2026-08-11T10:41:38.214146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.197617Z","title":null,"venue":null,"work_id":"7582156a-920f-41a5-a483-8177cf4c4e38","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.887053Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:08cce7ec3571d0d8d07131dbc0df9c04abe25c198c56f2470c89ee35ec6a8ac2","observation_id":"7636536f-80a8-4b01-8360-a7b6d0483495","resolution":{"observed_at":"2026-08-11T10:41:38.201467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.184197Z","title":null,"venue":null,"work_id":"6c7e30a1-7ba9-4572-a0be-d111757696b1","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.891584Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:42d8002e3b66e39dfa6073593d1a5a5497a3c91f06e94c561e418ec954f83ec6","observation_id":"79d88115-2d8d-4c8e-8b7a-2f93aea6b1e4","resolution":{"observed_at":"2026-08-11T10:41:38.188362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.170739Z","title":null,"venue":null,"work_id":"ba8c2820-0ad8-4724-adc9-02ca49e17f53","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.895924Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:f9eb7d3fd7cc80005163c51a29aae2106cccde1a891fe8b506b4202162573fc2","observation_id":"7cc51c5e-d78d-4889-a52a-4d0b5105ccad","resolution":{"observed_at":"2026-08-11T10:41:38.175138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.156959Z","title":null,"venue":null,"work_id":"77603dd5-976e-4111-8560-0e8f3a6245da","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.899858Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:6a60ae6d295eeaf8512d5b3ee4a1b999d707d37044278ac263a5e95de3284db7","observation_id":"7b16d058-1a34-4f6c-a60f-d65e9a096e6b","resolution":{"observed_at":"2026-08-11T10:41:38.160953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.144671Z","title":null,"venue":null,"work_id":"ea434e21-d65e-4d15-a998-a13beabfe7f9","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.904364Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:cd23e79d90ec73e7b548672dc0cabb1c365804da278b38a070f591b36efded9b","observation_id":"4d9a79a2-fb2e-492d-af42-4d324ab77001","resolution":{"observed_at":"2026-08-11T10:41:38.148659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.130439Z","title":null,"venue":null,"work_id":"30a8f9a8-830c-4ba8-b342-f6495c94c493","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.908611Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:cb7b81c5849b3d5a133b12f3f13756126418ad952f3e326e8ca45845acfc5a1c","observation_id":"b383dafe-c24e-4f2e-8852-d03ff902e144","resolution":{"observed_at":"2026-08-11T10:41:38.135247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.115804Z","title":null,"venue":null,"work_id":"5a1da936-adf8-4f36-8845-76b44cda89e4","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.913674Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:49ece47aee81531374bea55d62e08b4b455e2b4be05697fa0410c9e709816473","observation_id":"7de3ba91-6a0f-4777-b72a-95f5049e0ed0","resolution":{"observed_at":"2026-08-11T10:41:38.120651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:41:38.223591Z","title":"Then, we perform an in-depth exploration of MLLM classification evaluation (delineated in Section B), including the formulation, influence of option numbers, etc","venue":null,"work_id":"7c1699f0-435b-4a81-b204-7afac33917ee","year":null},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.877198Z"},"links":{"citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:0f407ed88511be9bfccbf208a1645075666252a27e2a7fea8e20bcda28dbdd52","observation_id":"fc92c4ea-6741-4ebb-9dc6-2d69d2c97d3c","resolution":{"observed_at":"2026-08-11T10:41:38.227596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":38},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 4 inbound Pith citation observations for arXiv:2412.16418."}