{"as_of":"2026-08-08T21:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5d9d5d1f587d60b75f8968a50c457344d6c7cc86c8aa12b708062d00d97a722","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:20:57.934252Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.15748/citation-record","integrity":"/paper/2512.15748/integrity","json":"/paper/2512.15748/citation-record.json","paper":"/paper/2512.15748"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T17:20:47.815738Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:47.815738Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:f2c9f5b03798f4c0523ee516dce09c0cc7455caebb6be33fb118dda851661e68","observation_id":"ca819ec2-ca05-49aa-995b-36ada97ca8bd","resolution":{"observed_at":"2026-08-03T17:20:47.815738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:47.981109Z","title":"Deep learning approaches to the phylogenetic placement of extinct pollen morphotypes.PNAS nexus, 3(1):pgad419,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:47.981109Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:a09f2659db2866bf02468fbd8fe8c1f841beeca2879bd96be8e3a2383de5fb9d","observation_id":"0cceec24-9583-43d9-9faf-ef4c50e2808c","resolution":{"observed_at":"2026-08-03T17:20:47.981109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:48.160553Z","title":"Pollen morphology, deep learning, phylogenetics, and the evolution of environ- mental adaptations in podocarpus.New Phytologist, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:48.160553Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:be4294891a60e78f61c2444e1bd96f61b5041f75690427d22ce9f10e1276d5ec","observation_id":"8cc81f53-a87e-4e57-8bd1-b880e83d3036","resolution":{"observed_at":"2026-08-03T17:20:48.160553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:48.372338Z","title":"Many-shot in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:48.372338Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:a1965d06d39f36fae4ec9faf102445ce4cfeb4e3db0e173ff0de64be548c23c3","observation_id":"02ada333-6979-4eed-bc70-b3eeaded44a3","resolution":{"observed_at":"2026-08-03T17:20:48.372338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:48.596614Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:48.596614Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:b7ef535d99f359c7780f9121e38baf9efb61e6de7cf6ff01c673633e8980840d","observation_id":"c386f622-a4d9-4daf-995c-51d22b97e1ac","resolution":{"observed_at":"2026-08-03T17:20:48.596614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:48.803358Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:48.803358Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:d6d5fe5ebd46ae827b1e06ebafc8100cb829581f88838e5bae98c13ae407d524","observation_id":"c12e10cc-0ed5-4b4a-ae91-e4d7e69f2c6a","resolution":{"observed_at":"2026-08-03T17:20:48.803358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:48.937306Z","title":"Bach, Jesse E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:48.937306Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:9ed17f9a70e290958136960b800d3af6e25c0591c4558b788b530d5ca035f16f","observation_id":"363bb8f4-a260-4013-a072-eec0276d84d8","resolution":{"observed_at":"2026-08-03T17:20:48.937306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-03T17:20:49.099404Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:49.099404Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:61c0426dc582a4c7b27f6b69b8d380d0dd11cfc7ced6289d87de0ee2ea156eda","observation_id":"2ea80824-b1d8-4e38-b37b-e51bdd3a45f2","resolution":{"observed_at":"2026-08-03T17:20:49.099404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:49.288569Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:49.288569Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:e52b0d8ccb941f88649ad48aeb8cd1c03cd30f9ea5b824b9a49764d5e79af70b","observation_id":"30b64f71-738a-4132-bee3-7d61ab58ebf0","resolution":{"observed_at":"2026-08-03T17:20:49.288569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:49.452368Z","title":"Scaling Biodiversity Monitoring for the Data Age.XRDS: Crossroads, The ACM Magazine for Students, 27(4):14–18, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:49.452368Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:2a0ee115c72c4f37a60ff9a0123affef6d9d0024794609849412d6b24df81d97","observation_id":"063dd15d-e57a-46cc-8888-a1a6b38d0088","resolution":{"observed_at":"2026-08-03T17:20:49.452368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10340","last_updated":"2020-04-21T23:25:13Z","snapshot_observed_at":"2026-08-07T18:30:26.178863Z","submitted_at":"2020-04-21T23:25:13Z","title":"The iWildCam 2020 Competition Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10340","snapshot_observed_at":"2026-08-03T17:20:49.597250Z","title":"The iWildCam 2020 competition dataset.arXiv preprint arXiv:2004.10340,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:49.597250Z"},"links":{"cited_paper":"/paper/2004.10340","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:ec10bfe6ddb241c13ada1bb30fe353ba9e1e7dd6b51ced1e7659aefe21f37934","observation_id":"9a00a591-e640-4113-a692-43bd9043338b","resolution":{"observed_at":"2026-08-03T17:20:49.597250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03494","last_updated":"2021-05-07T20:27:22Z","snapshot_observed_at":"2026-08-05T21:12:51.646985Z","submitted_at":"2021-05-07T20:27:22Z","title":"The iWildCam 2021 Competition Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03494","snapshot_observed_at":"2026-08-03T17:20:49.688619Z","title":"The iWildCam 2021 competition dataset.arXiv preprint arXiv:2105.03494, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:49.688619Z"},"links":{"cited_paper":"/paper/2105.03494","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:706ac838d38188c3a30dcc36c960b6e699750922157de42de5f4f5099e463137","observation_id":"025e4585-f6e4-4c8d-bd80-87b9b17680f1","resolution":{"observed_at":"2026-08-03T17:20:49.688619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:49.850555Z","title":"Deep learning as a tool for ecology and evolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:49.850555Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:2995a334d4b406a502171c7e3f3f0a626d4a0171ad15899be3bbf54e1de259ba","observation_id":"1d36f394-b33f-4f4b-b147-4b150541a009","resolution":{"observed_at":"2026-08-03T17:20:49.850555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:50.021573Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:50.021573Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:fc9c1805ab98171280ca4450b6d1bf0dda88d7af88154733b7c72209bd4746d0","observation_id":"d0442136-8455-493c-b23f-d16add554bf3","resolution":{"observed_at":"2026-08-03T17:20:50.021573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:50.224620Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:50.224620Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:8b7c0252d31d5ea677b4d45ff45aa09a69343cd8e7e3fbb9b1e0d79dde133efe","observation_id":"9fbfc295-7d42-4d8b-9a13-6276ce852f40","resolution":{"observed_at":"2026-08-03T17:20:50.224620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:50.364650Z","title":"Big self-supervised models are strong semi-supervised learners.Advances in Neural Information Processing Systems (NeurIPS), 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:50.364650Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:a08c732954c0c413469683426f0e3af4a48356414adc70b0ee9ec57d6eaa1017","observation_id":"eee0d3a6-fae4-4fa3-b6ee-a02a1d9e5faa","resolution":{"observed_at":"2026-08-03T17:20:50.364650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:50.519880Z","title":"Christian Schmidt, Aditya Jain, Yves Basset, Sara Beery, Maxim Larrivée, and David Rol- nick","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:50.519880Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:d32980f48f4d0478cc4ae0a5a986fb876e0ee0dc2ecbbc722d7d43c0be41de89","observation_id":"dd82752a-acc8-444d-9fe2-cbe859cb7ccf","resolution":{"observed_at":"2026-08-03T17:20:50.519880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:50.685635Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:50.685635Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:35f695a4a6c214a96cee43b5a1a770582110c1fdc571bee5f5f03bb560d56d9b","observation_id":"d67c3314-a228-4eb5-9e46-6535c52f1e57","resolution":{"observed_at":"2026-08-03T17:20:50.685635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:50.852895Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:50.852895Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:0011b9f5f549de461969d9a5b2f32c2ec77a968bb24add06c322c82fdfd53d52","observation_id":"9b8cd4f0-47fc-4785-9957-ba9813d0fc6e","resolution":{"observed_at":"2026-08-03T17:20:50.852895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:50.937326Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:50.937326Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:3088d132a7164c6ec3019a39947c1d204b12611cdd88f7fa8a411cdc50c6d434","observation_id":"0f1d8706-0ff6-4437-bc38-03fa5a6ab073","resolution":{"observed_at":"2026-08-03T17:20:50.937326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.008866Z","title":"Discovering localized attributes for fine-grained recog- nition","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.008866Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:f765cf4bce396ef0b372337e6c67050aa7a0aca0a9d15b623e800575db9144ab","observation_id":"3ae8f157-6c47-41ab-aef3-2707ea304b2c","resolution":{"observed_at":"2026-08-03T17:20:51.008866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.126777Z","title":"Ezray, Drew C","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.126777Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:d3ccb9923409d5f357935cd238651312a03311eddcdd74bc313231fd8669412e","observation_id":"d116ea48-52a4-4ba3-9a24-c7b1c6d67ba8","resolution":{"observed_at":"2026-08-03T17:20:51.126777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.218543Z","title":"open world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.218543Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:303cc8060e733cffd6079959631356675ee297e02438505eb78a1d4b356d859b","observation_id":"259325bf-355d-4a3a-8f66-c57b05ec608a","resolution":{"observed_at":"2026-08-03T17:20:51.218543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.259009Z","title":"Clip-adapter: Better vision-language models with feature adapters.International Journal of Computer Vision, 132(2): 581–595, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.259009Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:08cac88574f4440e36f8c363f39c0b52e0cef2dd8e9b6e7e7992ded4c57db46f","observation_id":"467401c1-866d-456c-aa12-ed0fe1c3b1b7","resolution":{"observed_at":"2026-08-03T17:20:51.259009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.337217Z","title":"White, James Balhoff, Wasila M Dahdul, Daniel Rubenstein, Hilmar Lapp, Tanya Berger-Wolf, Wei-Lun Chao, and Yu Su","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.337217Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:57e1aeaeb59e1f01caa878db94da3848c9443b318108a92c4597989aba23c151","observation_id":"3f261f1d-74c0-4fc5-aed2-c68c88087b92","resolution":{"observed_at":"2026-08-03T17:20:51.337217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.488300Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.488300Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:3543bd4bd09bd4e507368b020dbe6ea9b6c538850f17811ef0738c1594d8f364","observation_id":"7a3f2a6b-8f9d-4f99-b55b-167d0a3ca7b6","resolution":{"observed_at":"2026-08-03T17:20:51.488300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.587844Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.587844Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:8a3bef7e7f4932418a5c5c1e4260370e6937a1967a5c775bb79a853c84ee127f","observation_id":"67285c77-58bf-42e2-8f51-fc3fcdacb613","resolution":{"observed_at":"2026-08-03T17:20:51.587844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.737138Z","title":"Momentum contrast for unsupervised visual repre- sentation learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.737138Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:2ff835122fc816ef4c1f264f56cdb9c7029cea5ada27261cb3b2254176fa42f4","observation_id":"e1fdae11-b9df-499c-a7ef-050aad999a91","resolution":{"observed_at":"2026-08-03T17:20:51.737138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:51.877137Z","title":"Species196: A one-million semi-supervised dataset for fine-grained species recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.877137Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:f6e082ebd5ff42e7d8f0da1a731d1a8b63223d9919f7b5b583eeed451590343e","observation_id":"4bf98107-27c1-4319-99f9-df24137659e3","resolution":{"observed_at":"2026-08-03T17:20:51.877137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-03T17:20:51.987413Z","title":"Distill- ing the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:51.987413Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:5c09e36973cbf56cf9cd38944287042501890d3bb72918ea5202ca2a208329e4","observation_id":"020d5389-9d81-4b8b-bdf7-878cfbced8f2","resolution":{"observed_at":"2026-08-03T17:20:51.987413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.064616Z","title":"Deep learning on butterfly phenotypes tests evolution’s oldest mathematical model.Science advances, 5(8):eaaw4967, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.064616Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:ff8aadd07f5e9edf3f1ac23dc4ced8b95d26d3133e2b945454fc342645cfcfd4","observation_id":"897461c0-a785-410d-8605-65d2e79c455a","resolution":{"observed_at":"2026-08-03T17:20:52.064616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.147501Z","title":"Deep learning and computer vision will transform entomology","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.147501Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:1375c2925c5588debcb4e8832f1ba8772e302254b7b472f9c1d133b7dd891d4c","observation_id":"a414d1e4-71ac-4481-98e1-1a226ebf001e","resolution":{"observed_at":"2026-08-03T17:20:52.147501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.230950Z","title":"Multimodal learning and reasoning for visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.230950Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:fdd7d2e2ecc7a20ddc4ef980a869e16a7771a16b897d4e6dd5d82be344b898f4","observation_id":"7b2d6fde-a97a-474a-b259-b550e2ad4ea8","resolution":{"observed_at":"2026-08-03T17:20:52.230950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.313777Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.313777Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:f3fa0af70614488280319851d971efc426e5fbc5edfc0b4edba95c125b805a1f","observation_id":"d3dd95a5-12aa-4ada-a4ce-a737a769ab0d","resolution":{"observed_at":"2026-08-03T17:20:52.313777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.395188Z","title":"Vi- sual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.395188Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:02b4b5a7cfaa5a1e6b307c57e77371a75bd30c7c6851f71d0f244799d1e5ee3b","observation_id":"b1ee9801-cc5d-4f22-89dc-bddb9f53920a","resolution":{"observed_at":"2026-08-03T17:20:52.395188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-08-03T17:20:52.476377Z","title":"Many-shot in-context learning in multimodal founda- tion models.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.476377Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:6cb0593e60e3504c35b6bac3f18069400c7f5db7fefa5c462ab77232bf612f81","observation_id":"a01c224e-b043-443d-9d2f-17963259643c","resolution":{"observed_at":"2026-08-03T17:20:52.476377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.559446Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.559446Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:b95daadea88263bf8575c6bd28712d46ff3beb95b3333391236b436adcded073","observation_id":"8d96eb85-8150-483c-b595-27d487048f83","resolution":{"observed_at":"2026-08-03T17:20:52.559446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.637961Z","title":"Large language models are zero-shot reasoners.Advances in neural information pro- cessing systems (NeurIPS), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.637961Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:4452027e29f8dca54b507b7dfaa66052d4f5c7169d72d5f818e4edcef319986c","observation_id":"a446798e-7c50-48b5-b0be-f1a1334d152f","resolution":{"observed_at":"2026-08-03T17:20:52.637961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.724049Z","title":"Low-rank bilinear pool- ing for fine-grained classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.724049Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:9dc1d390a7ca5d05f4b2600ecd76b93220570c4636b376727ee1e688632a82a5","observation_id":"aca7c54a-22b4-4356-9992-69afead9ad97","resolution":{"observed_at":"2026-08-03T17:20:52.724049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.808500Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.808500Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:34cc16a01f059b4c1770b25930ff1108fe0b51fa7ca808b7d037477828ebbac2","observation_id":"7e573183-e331-4f18-9627-4aa772e0c3d5","resolution":{"observed_at":"2026-08-03T17:20:52.808500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.860548Z","title":"Bilinear cnn models for fine-grained visual recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.860548Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:b52e73648ca113045fd45fad0204fffbb932d461ac1cb3c30b6533aef75cb8c7","observation_id":"58c88dec-83de-4bb1-b497-97c9cfb8ca6a","resolution":{"observed_at":"2026-08-03T17:20:52.860548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.910093Z","title":"Multimodality helps unimodality: Cross- modal few-shot learning with multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.910093Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:d6298d4da08c7cab5dcb966e34e3a69d4d90703244fc916529d5103549e54dbe","observation_id":"52922b1b-2bc7-443d-8f78-09216399cd2a","resolution":{"observed_at":"2026-08-03T17:20:52.910093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:52.991903Z","title":"Visual instruction tuning.Advances in neural information processing systems (NeurIPS), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:52.991903Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:135b316c3d0dc951281bb88b1b41a17c619314eda8d8551e7cae7f9498de3ab7","observation_id":"ddb5ed0b-43c3-4cef-bfd1-9140ba496a88","resolution":{"observed_at":"2026-08-03T17:20:52.991903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.066383Z","title":"Democratizing fine-grained visual recognition with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.066383Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:df15c856fca93d57bfc5fd2ef04b1e1ee2e96d2bbf7ee4f5f8ada4e6130fa144","observation_id":"652f6c9a-56b5-4660-91db-07814f49d229","resolution":{"observed_at":"2026-08-03T17:20:53.066383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.115245Z","title":"Few-shot recognition via stage-wise retrieval-augmented finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.115245Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:86f9a2391b7276122449dc704c20cf1a7e78f6ff0b18b304a64cffb037437fa1","observation_id":"e68e4722-1374-44f8-963e-cab9829a0a45","resolution":{"observed_at":"2026-08-03T17:20:53.115245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13805","last_updated":"2026-05-15T05:14:37Z","snapshot_observed_at":"2026-07-06T17:47:51.284226Z","submitted_at":"2024-03-20T17:59:55Z","title":"RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13805","snapshot_observed_at":"2026-08-03T17:20:53.190844Z","title":"Rar: Retrieving and ranking augmented mllms for visual recognition.arXiv preprint arXiv:2403.13805, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.190844Z"},"links":{"cited_paper":"/paper/2403.13805","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:fefc8366c1ecadcbad49fc5dac1475308a1daea56754aae6c1d2c40ffa1a3b9a","observation_id":"ca1c1d35-3cf7-4eed-bd4e-656b785dc892","resolution":{"observed_at":"2026-08-03T17:20:53.190844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.230828Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.230828Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:a7cbdc155e8b5a06f963ce02023d9936e722b22d73b7532de6d0ed33ab4290c8","observation_id":"46b1c36b-9f84-4b53-8671-6ac5494d53ef","resolution":{"observed_at":"2026-08-03T17:20:53.230828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.265819Z","title":"Computer vision, machine learning, and the promise of phenomics in ecology and evo- lutionary biology.Frontiers in Ecology and Evolution, 9: 642774, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.265819Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:0954d5beb6f714d2e1f8c5d00ab125a726973f23cf0c8540540de5786f977427","observation_id":"e6632fcd-e3b2-49fb-97f4-6ffaaa328211","resolution":{"observed_at":"2026-08-03T17:20:53.265819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.300062Z","title":"Lessons learned from a unifying empirical study of parameter-efficient transfer learning (petl) in visual recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.300062Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:ad49e1162693550efc46597bb53a95808e6cd060cc53ce5b6259b5ac94493996","observation_id":"9e1609d5-c897-4beb-ad92-6ebd3999b60f","resolution":{"observed_at":"2026-08-03T17:20:53.300062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.338422Z","title":"En- hancing clip with gpt-4: Harnessing visual descriptions as prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.338422Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:6308a9b7c78f784842a4613690dcbb050cdba2d30a809ac3e5d7df94f9c89c08","observation_id":"80e96a85-5696-4721-a578-379f078ed6fc","resolution":{"observed_at":"2026-08-03T17:20:53.338422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.379292Z","title":"Visual classification via description from large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.379292Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:b69c9be29cdace8d4a7f046bda796f8ffdb18b765a3e6f664adf1f0de574eb78","observation_id":"17d797ad-892d-48c6-9c03-f8511d9a446a","resolution":{"observed_at":"2026-08-03T17:20:53.379292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.416678Z","title":"Re- thinking the role of demonstrations: What makes in-context learning work? InEMNLP, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.416678Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:47924f2e8de6299e0d5724e1e85a49bd31fbb5bf19264bd1fde5b8ed7f42b9ed","observation_id":"292cad3c-99ac-4139-8646-e5a53418d950","resolution":{"observed_at":"2026-08-03T17:20:53.416678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.451792Z","title":"Compositional chain of thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.451792Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:22c1911ab2589fc304c92fa10c58008115309bf7d24745b9a3a9a414f009bcae","observation_id":"07b303fa-c589-4b18-bff5-51ed6f698aa1","resolution":{"observed_at":"2026-08-03T17:20:53.451792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.486008Z","title":"Norman, Jason A","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.486008Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:60b0a40aa8a699e73a7633e516b6b035590998b0c7681226d58b1f0aeecc91ad","observation_id":"a47d12da-8b70-48f3-a83f-6f6cba1497d5","resolution":{"observed_at":"2026-08-03T17:20:53.486008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.510416Z","title":"Inaturalist.Science Scope, 41(7):12–13, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.510416Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:59e73a6a6bfb43dfa215a142159cde5a536482227ab1812c6b7deb6bd31bf1f1","observation_id":"1aa9f8fb-5af5-45c0-9826-10b2f40e2406","resolution":{"observed_at":"2026-08-03T17:20:53.510416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.545495Z","title":"Gpt-5 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.545495Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:b7a503016448555e7582d6d4d78e7b00c9d060d8dc418c9277866d5a9b3831ed","observation_id":"3df99a23-1401-453a-a0a7-a2477cc2c872","resolution":{"observed_at":"2026-08-03T17:20:53.545495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T17:20:53.601756Z","title":"DINOv2: learning robust visual features without supervision.arXiv preprint 2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.601756Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:457f2bad2fd835f19b5e7d55dda93fd3b8af2c71288b2dede5207e33e8b98db7","observation_id":"032ed4b0-959e-4f2b-8180-092b0b1d897d","resolution":{"observed_at":"2026-08-03T17:20:53.601756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.638353Z","title":"Prompting scientific names for zero-shot species recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.638353Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:0275145a3da82f1bc2b5b81b307d0dd2725f6c8c2fe48397ae09a1edf6c34690","observation_id":"c3d98390-11bd-4c08-bd51-0c4dcef2eafd","resolution":{"observed_at":"2026-08-03T17:20:53.638353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.664309Z","title":"The neglected tails of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.664309Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:524538322267b5007d72f4f72770b93d77064a3328169826824f2f6e21fc0fd0","observation_id":"4ede0685-97ab-40db-9331-57987c6dc25e","resolution":{"observed_at":"2026-08-03T17:20:53.664309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.801502Z","title":"Fungitastic: A multi-modal dataset and benchmark for image categorization","venue":null,"work_id":null,"year":2037},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.801502Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:7ec31eaea41e761466d2fc1be4c215e4ff82a3a15659b8791e4e3bd1a3a19caa","observation_id":"c2834b8f-c987-42f4-be40-f3fa7cf257f9","resolution":{"observed_at":"2026-08-03T17:20:53.801502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:53.955334Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:53.955334Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:bb17485ead7ff567df4ead2f006bd529ad556a01284af33dff88d69047fad111","observation_id":"ebfb9336-b53e-4819-a03c-6d57f0006e60","resolution":{"observed_at":"2026-08-03T17:20:53.955334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:54.081400Z","title":"What does a platypus look like? generating customized prompts 11 for zero-shot image classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:54.081400Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:6825ce536326f4255cfde831e035deac28cefa39bd86cd1d8cee74c255e4b4c1","observation_id":"6cc7c3ac-2a96-491e-96ac-8355fb545645","resolution":{"observed_at":"2026-08-03T17:20:54.081400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:54.191504Z","title":"Automated identifi- cation of diverse neotropical pollen samples using convolu- tional neural networks.Methods in Ecology and Evolution, 13(9):2049–2064, 2022","venue":null,"work_id":null,"year":2049},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:54.191504Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:dc6d3a9df1eeec13cc2820421a3f4afa770aee9154f98b0c703935078407b777","observation_id":"6482fc50-3850-4760-943d-e9d36497e825","resolution":{"observed_at":"2026-08-03T17:20:54.191504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:54.357240Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:54.357240Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:b9e79ae10f5192fa724782cba719f20348be4f2c65de07deaa8756203990a3cb","observation_id":"23b6cc76-c598-477a-a133-7dda7da88c8c","resolution":{"observed_at":"2026-08-03T17:20:54.357240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:54.468242Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:54.468242Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:821ea3fa4395fe49f1db778bb104b8ce101af6e5607743b11b01353ad00f1fb3","observation_id":"4cd5ebc1-8bf7-4367-9fc2-3809b13a232b","resolution":{"observed_at":"2026-08-03T17:20:54.468242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:54.628501Z","title":"Im- proved zero-shot classification by adapting vlms with text descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:54.628501Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:c285f5f17dd534693a1331233d774d4ff2df9fe25e20809f9194cec6d87600ee","observation_id":"40fb7c41-b96a-403f-b9ff-229b638f1f9c","resolution":{"observed_at":"2026-08-03T17:20:54.628501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-03T17:20:54.770955Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:54.770955Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:9f79f56eac3520c63b79a21dd27df88c23214805c023cf5597b60ad676c43598","observation_id":"0e869490-7ea9-4451-b34c-925125b40814","resolution":{"observed_at":"2026-08-03T17:20:54.770955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:54.841060Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:54.841060Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:75ee141d40c0f96f40e377a53f7e65d4b4e079d92a489de72e62b1c6b3750b01","observation_id":"93a130d3-e95e-41a4-805c-332ba9e1d43b","resolution":{"observed_at":"2026-08-03T17:20:54.841060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:54.955759Z","title":"A closer look at the few-shot adaptation of large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:54.955759Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:eba3110bf7a6fd45e7b69dc186ff66a24c5aa75ca162237d27876d185119436a","observation_id":"5640011c-d0d7-4fa3-9300-be652e66b479","resolution":{"observed_at":"2026-08-03T17:20:54.955759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:55.037052Z","title":"Scaling-up camera traps: monitoring the planet’s biodi- versity with networks of remote sensors.Frontiers in Ecology and the Environment, 15(1):26–34, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.037052Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:da2c8d248a02169cbb2e05efdfb31cfab0593f4de126c0cb838996daea630e6f","observation_id":"992727dd-2af2-48c3-9909-b3532eb1a458","resolution":{"observed_at":"2026-08-03T17:20:55.037052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:55.190028Z","title":"BioCLIP: A vision foundation model for the tree of life","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.190028Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:d0ada68913f55b47af032a5b79873125e5913777f2a6d8e41eec2cc66b63f1a9","observation_id":"c2d8cc07-21b2-4e44-a6f1-e65e05b370da","resolution":{"observed_at":"2026-08-03T17:20:55.190028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06937","last_updated":"2021-03-11T20:21:16Z","snapshot_observed_at":"2026-07-06T10:49:09.382403Z","submitted_at":"2021-03-11T20:21:16Z","title":"The Semi-Supervised iNaturalist-Aves Challenge at FGVC7 Workshop","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06937","snapshot_observed_at":"2026-08-03T17:20:55.270657Z","title":"The semi- supervised inaturalist-aves challenge at fgvc7 workshop","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.270657Z"},"links":{"cited_paper":"/paper/2103.06937","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:d33d63385c8b9d64fb58dc88e37869fcfb38152b6dd7527bbd8151d68e12fc66","observation_id":"8f0ef4bb-d848-45cc-b7ea-5576c8404f04","resolution":{"observed_at":"2026-08-03T17:20:55.270657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:55.356710Z","title":"A real- istic evaluation of semi-supervised learning for fine-grained classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.356710Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:a77d975701371e1f120735f2f979acf2a899f887b6c24c08602c06dfbdd0fbdd","observation_id":"096c0bdc-7cf9-4eb4-b4e5-d925e71f8a94","resolution":{"observed_at":"2026-08-03T17:20:55.356710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:55.457981Z","title":"Gemini 2.5: Pushing the frontier with ad- vanced reasoning, multimodality, long context, and next generation agentic capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.457981Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:ee760082f9fe0f2f6d3740739729f66dccefc6da277f7bc05e756058ca7806b7","observation_id":"e0e4b60b-d278-4515-84c5-d03fe65b44c1","resolution":{"observed_at":"2026-08-03T17:20:55.457981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T17:20:55.546044Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.546044Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:e65aa9f3c1e1b24ddd817e068e77ef623d0c693f3d6fbfc8331a72245d1a4641","observation_id":"1857c0fd-1ea7-4930-96fb-e21aff3b501d","resolution":{"observed_at":"2026-08-03T17:20:55.546044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:55.637210Z","title":"Glm-4.5v and glm-4.1v-thinking: Towards ver- satile multimodal reasoning with scalable reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.637210Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:074d8becbecdbb459794482ba65c7475e4e9577218be1353c971f839aced2a39","observation_id":"4419eb91-a866-412b-8b97-a68289c75fe9","resolution":{"observed_at":"2026-08-03T17:20:55.637210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01079","last_updated":"2023-05-01T20:27:11Z","snapshot_observed_at":"2026-07-06T15:22:05.246650Z","submitted_at":"2023-05-01T20:27:11Z","title":"Bird Distribution Modelling using Remote Sensing and Citizen Science data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01079","snapshot_observed_at":"2026-08-03T17:20:55.741333Z","title":"Bird distribution modelling using remote sensing and citizen science data.arXiv preprint arXiv:2305.01079, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.741333Z"},"links":{"cited_paper":"/paper/2305.01079","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:884edf2d7cbacc5fd73785e8e4005dbbbb2eb51093750f504ee634b681694f6c","observation_id":"257e3c93-b3c0-4497-a4ff-13f90440c814","resolution":{"observed_at":"2026-08-03T17:20:55.741333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:55.851986Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.851986Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:52f667985a7ba08c92fbc604c7526bafd06af58640cc970030ae0b126d0db0c5","observation_id":"6e23718d-a86a-47fa-939c-e065e1fedae3","resolution":{"observed_at":"2026-08-03T17:20:55.851986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T17:20:55.989907Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:55.989907Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:36a4515020849a49dd46d5ac771cbea1c40da2d13c3a5b61fd01661688870e44","observation_id":"15a1affe-c2e1-468f-aa33-61f9de66ac35","resolution":{"observed_at":"2026-08-03T17:20:55.989907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:56.058377Z","title":"Perspectives in machine learning for wildlife conservation.Nature communications, 13(1):792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.058377Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:8e20ae49db733f95fa7811ca10a4747db150bcd9d6f4d6734a52a55bc695904e","observation_id":"1889cb53-ad26-4be2-b948-9b53c541ec54","resolution":{"observed_at":"2026-08-03T17:20:56.058377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:56.114390Z","title":"iNat Challenge 2021 - FGVC8, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.114390Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:693a2eb9495cfb2128bbfb051d1641b53b1449a2b9c615cfea70a7b2a01f511d","observation_id":"08c51221-cede-4954-b399-006042e4eb5d","resolution":{"observed_at":"2026-08-03T17:20:56.114390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:56.214406Z","title":"The inaturalist species classification and detection dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.214406Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:9245b3e9fb3e40d99ae246a85419eb7988d52b1a61ef92d3c6489da144245580","observation_id":"aa69fb4a-97d2-4424-bd3c-faccaccb598b","resolution":{"observed_at":"2026-08-03T17:20:56.214406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:56.378174Z","title":"Enabling val- idation for robust few-shot recognition.arXiv preprint arXiv:2506.04713, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.378174Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:e12ad4b0562fcdd50736ed17f03adc7d14866d097d2c6d5ad0e71dd600dce7dd","observation_id":"7914cdd8-0a0c-4741-84b2-4c340dc22840","resolution":{"observed_at":"2026-08-03T17:20:56.378174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T17:20:56.556327Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.556327Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:c2dab3e5bd73da647894da40df2bb1b9790b1856226990ae8f21685630e1cd42","observation_id":"041b29a9-730a-44e9-ab79-9a52f2c14551","resolution":{"observed_at":"2026-08-03T17:20:56.556327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:56.655136Z","title":"Self-consistency improves chain of thought reason- ing in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.655136Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:7b8619dcdd0a81e3fa2bdcdcc3342fb2470735951cf21cbed95ac0a0a1ab45e1","observation_id":"f6ce78e3-5d81-45a2-b963-88a3f6c0d20a","resolution":{"observed_at":"2026-08-03T17:20:56.655136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:56.759429Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.759429Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:a000e177a8b20d264cdf6850ec432ba53c9d0a72f9faa04e6cb1fb46396c53ef","observation_id":"c47bf2cf-ea3f-4133-a9c1-a069f958b3ee","resolution":{"observed_at":"2026-08-03T17:20:56.759429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:56.856946Z","title":"Large language models are better reasoners with self-verification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.856946Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:9ad27affbfab6a7059c1595e9ac8b723484253c90a838a8ee99ddaf5150f6519","observation_id":"265a5255-3ef1-429a-b037-58327ee3c24f","resolution":{"observed_at":"2026-08-03T17:20:56.856946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:56.969004Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:56.969004Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:fecb4181f63cda5e4cc8aee486df52704de436090ffef4ac7731ef34be6952eb","observation_id":"282b710f-f4be-4c31-82be-6f31cd5732b6","resolution":{"observed_at":"2026-08-03T17:20:56.969004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.120474Z","title":"Pro- tect: Prompt tuning for taxonomic open set classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.120474Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:7297ff4bdca762c9f85a34351ddb30dd3a7d6a06022973c112b5890ece2a47d8","observation_id":"1f2a6376-5c7b-403a-8929-9a67c87e1be2","resolution":{"observed_at":"2026-08-03T17:20:57.120474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.268383Z","title":"Demysti- fying CLIP data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.268383Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:ddd4d660985b700830cab7d58b592a15b0d07624183544118df01de28689fd56","observation_id":"bc1791b6-64c2-4fac-9142-e43464e0add9","resolution":{"observed_at":"2026-08-03T17:20:57.268383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.355940Z","title":"Learning concise and descriptive attributes for visual recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.355940Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:d17bb6cabaf654478739dab5d3107c07ffda28ad4feacc3def38716528461a18","observation_id":"73cc0f6e-18ac-4011-9d2e-9183a1b43033","resolution":{"observed_at":"2026-08-03T17:20:57.355940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T17:20:57.416538Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.416538Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:8b3c5286269c278d98f61175f2b97e9713d59e86ea835926ec7864a3207af34a","observation_id":"0ece8779-db63-4ed4-98c1-a8ef7a6fdcbf","resolution":{"observed_at":"2026-08-03T17:20:57.416538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.488624Z","title":"An empirical study of gpt-3 for few-shot knowledge-based vqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.488624Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:09d86fb01985e7d5031c14593758e7a58c042dd8fc3b16329b7837d22844329f","observation_id":"0123dc96-752f-486c-872d-5a09f020e4d2","resolution":{"observed_at":"2026-08-03T17:20:57.488624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.564993Z","title":"Visual- language prompt tuning with knowledge-guided context op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.564993Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:119944285e119b43aa2b514149744630ee7f0b0aeaa955c09e05385ee2d5cdeb","observation_id":"778cb526-d5d3-404f-89f4-6db2ac3b2869","resolution":{"observed_at":"2026-08-03T17:20:57.564993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.636392Z","title":"Image captioning with semantic attention","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.636392Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:ee7e16133e48b21d1f86a05bd665f37c4efbf9c5854ac70f40d64870c28cbc32","observation_id":"a58b1ec4-2516-4354-8b08-cc310e32ee7d","resolution":{"observed_at":"2026-08-03T17:20:57.636392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.681087Z","title":"Task residual for tuning vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.681087Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:55a6fec2c64aeaa4dcf542c1193d2748e916fc7c6c5ddd67361a778460771fc8","observation_id":"58e0763b-799b-4e00-833d-f07ea5e612ac","resolution":{"observed_at":"2026-08-03T17:20:57.681087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.728666Z","title":"Part-based r-cnns for fine-grained category detection","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.728666Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:9578c669648853670ba78e191f5d8435ce21846739c6aa8edd8bc08927a0e7e0","observation_id":"50994f92-3f34-47c9-a1ce-3709b1264338","resolution":{"observed_at":"2026-08-03T17:20:57.728666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.770948Z","title":"Revisiting semi-supervised learning in the era of foundation models.Advances in Neural Information Processing Systems (NeurIPS), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.770948Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:59d8cf062afd89f49b40a75c8f5242e3d065cfc46c758cea2d7c7980b4827759","observation_id":"a1ba8331-1068-4aa8-91cd-20e1cb7247c1","resolution":{"observed_at":"2026-08-03T17:20:57.770948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.837437Z","title":"Tip- adapter: Training-free adaption of clip for few-shot clas- sification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.837437Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:9380b307d45ec940e9950c8b108dd5a45c0401dcb4ab4fd39413fe9d6262622a","observation_id":"34a446c3-8bff-4cce-9c39-637a136a0c69","resolution":{"observed_at":"2026-08-03T17:20:57.837437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T17:20:57.934252Z","title":"What makes good examples for visual in-context learning?Advances in Neural Information Processing Systems (NeurIPS), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T17:20:57.934252Z"},"links":{"citing_paper":"/paper/2512.15748"},"observation_digest":"sha256:532dcb0060ec5245d9725a1f5b0323b0d54f9aec859176deef0e0ef62c605c0a","observation_id":"5ab9d9f4-4262-4ddf-8d97-80c541c28212","resolution":{"observed_at":"2026-08-03T17:20:57.934252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.15748","last_updated":"2026-07-14T05:21:16Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:50:56.707712Z","submitted_at":"2025-12-10T21:30:48Z","title":"Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 0 inbound Pith citation observations for arXiv:2512.15748."}