{"as_of":"2026-08-08T18:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c21709501e156649d7c87cd6becfe3903bd2157f91000e591df9b0a780b19322","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:11.740399Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22664/citation-record","integrity":"/paper/2505.22664/integrity","json":"/paper/2505.22664/citation-record.json","paper":"/paper/2505.22664"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:24.092305Z","title":"Understanding Inter- mediate Layers Using Linear Classifier Probes","venue":null,"work_id":"08105ed7-f08f-4c7f-be43-09d752371fee","year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:03.570614Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:d77d8b9226a0877f6b5c3e805fdba9a9be023cfc29a91da0e318572fff4acd24","observation_id":"260503fb-70c9-419e-9346-d45496269371","resolution":{"observed_at":"2026-08-07T13:10:24.280642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.673363Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":"899143d1-1f19-4a44-a1ab-72db7856af6f","year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:03.714649Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:3cc6b19d77df218e49a4267f0c82bfd3ca245f3de00dee2612c74082d4aef018","observation_id":"a5d9bd1d-3cfd-476b-8415-2836dd75b673","resolution":{"observed_at":"2026-08-07T13:10:23.894969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08112","snapshot_observed_at":"2026-08-07T13:10:03.928054Z","title":"Eliciting Latent Predictions From Transform- ers With the Tuned Lens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:03.928054Z"},"links":{"cited_paper":"/paper/2303.08112","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:8f5b23424291c862eeed0c5b51c849a9abe85f580c559bc82d7bd16305eaf6ed","observation_id":"9544eb4d-59cd-40dc-a31a-a6342a5cd088","resolution":{"observed_at":"2026-08-07T13:10:03.928054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:23.262208Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","venue":null,"work_id":"33ce4994-55bf-4d34-a49c-edb96da69386","year":2020},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:04.074749Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:23a4b6587423b6984984fd702f3aae98f81c3ed88ebc42e804f5624e9e5afb54","observation_id":"362a970d-0fc7-457c-9579-d940edc8e5a0","resolution":{"observed_at":"2026-08-07T13:10:23.407238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10323","last_updated":"2024-06-14T17:44:08Z","snapshot_observed_at":"2026-07-06T18:31:13.039726Z","submitted_at":"2024-06-14T17:44:08Z","title":"GenQA: Generating Millions of Instructions from a Handful of Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10323","snapshot_observed_at":"2026-08-07T13:10:04.258432Z","title":"GenQA: Generating Millions of Instructions from a Handful of Prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:04.258432Z"},"links":{"cited_paper":"/paper/2406.10323","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:712b1e14be8e112df6c28e6249f0be59caa4efb4ede26737b3ff4a0a16442201","observation_id":"0038ccda-7977-4d22-928b-75fbc3ad31fe","resolution":{"observed_at":"2026-08-07T13:10:04.258432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.948732Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":null,"work_id":"0daf5c26-61ee-459b-8e7f-cbcaf3c3d89d","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:04.453895Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:b121424c14e77f417084351bc4c507ef84a1c8f17865465c1eb17f1203280261","observation_id":"23ecf2b9-8082-4abd-9ce3-97b81ab43e7a","resolution":{"observed_at":"2026-08-07T13:10:23.087790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.699419Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":"ed398103-521b-42d1-8d49-1325f8afc1f1","year":2019},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:04.575468Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:8e6b91d35ca7ef4adf22d182b23fc232d6e7f2f7df3758f523da3bfa4cab7ac4","observation_id":"15b07d9f-64ed-41f7-9924-daad416ba5bc","resolution":{"observed_at":"2026-08-07T13:10:22.825369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T13:10:04.718039Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:04.718039Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:88fa47f968e8988161b8633308bd5dd28f9b4f63608d4db611e753555f37a3ac","observation_id":"d5b5b0a8-89d3-4666-8664-009a8d53eee2","resolution":{"observed_at":"2026-08-07T13:10:04.718039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:10:04.898522Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:04.898522Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:9fa52b05e6a1dc3bea04ee0d520e75f4114536f27a2344893eac06c01338e135","observation_id":"01fa7e38-1e5d-4ef9-93a5-901f89510876","resolution":{"observed_at":"2026-08-07T13:10:04.898522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T13:10:04.974166Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:04.974166Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:55eac41af4f9761251ff374323dac34c80b10b0065f6df13ed8c2c85ce325982","observation_id":"5b4a33fc-eb7a-4283-b220-365723fedb31","resolution":{"observed_at":"2026-08-07T13:10:04.974166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.545637Z","title":"A Framework for Few-Shot Language Model Evaluation, 2024","venue":null,"work_id":"d52ff859-9145-4cc8-a94f-dff4400fc4a6","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:05.094039Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:b39bfdaab85d4cde2bc4ebc0c176df2ac67050fc512eac5637f8ddc9dbac2852","observation_id":"551b002b-ce61-45cd-b6e5-ac28a7b6aded","resolution":{"observed_at":"2026-08-07T13:10:22.629018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:22.298896Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","venue":null,"work_id":"9de64490-f42c-418c-9ac5-6378e5edcd06","year":2025},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:05.218644Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:849e85cffc6b285d2e2597736f12b58c0513417b109ae41f96a41f491ae773f2","observation_id":"d1a63bc4-cf48-4255-bdb5-778f03175f2e","resolution":{"observed_at":"2026-08-07T13:10:22.422088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.941820Z","title":"VizWiz Grand Challenge: Answering Visual Questions from Blind People","venue":null,"work_id":"cba80e1e-3bee-4948-a051-00b329125fee","year":2018},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:05.387611Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:724c325ebe668b71e0d6dba40f83a9a66541aad0ec6b45c07af3b38aea122ac1","observation_id":"b946c6a1-1a01-4cf3-a6f8-e9132388e955","resolution":{"observed_at":"2026-08-07T13:10:22.118148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.681930Z","title":"Word Embed- dings Are Steers for Language Models","venue":null,"work_id":"f1c306ff-3ade-482e-bea0-7a069d8c209d","year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:05.521073Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:8fb814fc78200aa99d6427bb00ade0a819829bf856f568bc8829ba861c8d9e2d","observation_id":"b82948d8-89bc-4133-8fea-961338574cef","resolution":{"observed_at":"2026-08-07T13:10:21.805678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.321932Z","title":"Measur- ing Massive Multitask Language Understanding","venue":null,"work_id":"61b900d2-61df-46cb-820b-7d96b6054718","year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:05.648401Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:d1b31f288fb5d9762d48bc2d018bd8bb668b47a5f29986ad9db10e7f093218ab","observation_id":"59cedae0-882b-4c12-8981-88ae6f07fd93","resolution":{"observed_at":"2026-08-07T13:10:21.475285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.022638Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":"8f9c5fd3-9aac-430c-8b92-88e5ded8a736","year":2022},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:05.846778Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:c8fdb09ff555ecb656045f9bc0324b9d6b179a14c423cc88cf41a049939546c7","observation_id":"23bde0c7-c291-4500-a284-599a88ae5017","resolution":{"observed_at":"2026-08-07T13:10:21.140630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.676687Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","venue":null,"work_id":"f8c3d322-823b-4d73-b27c-7b973d90acab","year":2019},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.057813Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:e13c2c1445c972ced1d52c157cef0eef2f1f0276828810f0cae064f904e06e16","observation_id":"649794ba-112a-4f81-bc14-897e75708ce8","resolution":{"observed_at":"2026-08-07T13:10:20.845832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.408365Z","title":"InternVL2: Better than the Best—Expanding Performance Boundaries of Open-Source Multimodal Mod- els with the Progressive Scaling Strategy","venue":null,"work_id":"2734d3b2-7b48-4877-9a38-dd7d06562277","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.173724Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:40d7a8a336cf5a5955ae9803eb7a1404351c99f440c32688261bba31f425ada7","observation_id":"eb6c8812-05c5-41e1-95f8-1d5eee1132ef","resolution":{"observed_at":"2026-08-07T13:10:20.536709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:20.088579Z","title":"A Diagram Is Worth a Dozen Images","venue":null,"work_id":"efe56751-bd13-4ec5-99fa-b507abec74da","year":2016},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.293534Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:3aef6681b371587bef96c259326c83969d202e5f267408c49f9e93537d4cc9a5","observation_id":"c7be7e24-b793-42cf-a693-fd05281938c6","resolution":{"observed_at":"2026-08-07T13:10:20.238302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.739250Z","title":"Propulsion: Steering LLM with Tiny Fine-Tuning","venue":null,"work_id":"38b46fe2-3758-4309-bcf5-aa85b8fd13b1","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.462436Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:c178d16cb427153640f2bf16f09eadcb06aff09cf413b06b18b20bd2ac8effe3","observation_id":"51e4d9b8-f8e7-47e3-85ef-fb41ceeaaa29","resolution":{"observed_at":"2026-08-07T13:10:19.880653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.493130Z","title":"SEED-Bench: Benchmarking Multi- modal LLMs with Generative Comprehension","venue":null,"work_id":"4649fad7-ecc3-4f0f-8b9d-a10006a82c97","year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.605423Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:1bd4e88763b36e09d644372e87245512cd548a5e122a4a461838a3c35ee82c0d","observation_id":"dc51ade7-865f-494a-813a-e740ae092e60","resolution":{"observed_at":"2026-08-07T13:10:19.640428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.168222Z","title":"LLaV A-Next: Stronger Llms Supercharge Multimodal Capabilities in the Wild","venue":null,"work_id":"e59ddbf2-ef6f-4110-81ce-e50f43857244","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.744498Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:e45f8f1d973e33d6f5c495456f744503a4840def1fce4156b3c648920a4a8f0b","observation_id":"ef148f84-4a47-4d82-8ed6-8b250a7c0ea5","resolution":{"observed_at":"2026-08-07T13:10:19.339366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:18.866748Z","title":"LMMs-Eval: Accelerating the Development of Large Multimodal Models","venue":null,"work_id":"bff47092-bf41-4489-9427-ba17d99787f3","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:06.928443Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:57913e9ee69be6dbd02a76a0d09514cb4fb35b8ff5c7286a1433b7cee259b7f0","observation_id":"7832c4fa-c5e8-4888-b070-8974240f4229","resolution":{"observed_at":"2026-08-07T13:10:19.028093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:10:07.072452Z","title":"LLaV A-OneVision: Easy Visual Task Trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.072452Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:1c8b0b1290361298303ed46cb1cb74c9ea628c2bcf93394acc1808bdd6f4513f","observation_id":"c0410ddb-23dc-45dd-848c-d1419c58cf19","resolution":{"observed_at":"2026-08-07T13:10:07.072452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:18.549094Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"36da4056-0a95-4aff-a637-c7e230e68d9a","year":2023},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.202405Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:d5bd988e29af9a51307185e17d4f1ad0b5496e323e948e0f69ab6f5e40c0b0ed","observation_id":"0755a51f-eaac-4b00-9b4c-3239e119c8f5","resolution":{"observed_at":"2026-08-07T13:10:18.689949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:18.196080Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":null,"work_id":"35114fcd-41c2-4b37-ac5a-f6435ca00a06","year":2023},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.335320Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:8bfb053af7f704cc053e94170e896d2989b0cfb57756f98237c28fdd1e7ed75b","observation_id":"3e3532c1-4f67-4bb3-a78f-3d463911b73a","resolution":{"observed_at":"2026-08-07T13:10:18.346769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:17.858214Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":"b959585a-e8aa-4b51-b4f0-1a18f1f3c8d6","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.486743Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:e9537f1804701ad7c0871083b7600c9223a7ea7597475886beedcae6155a8527","observation_id":"c9b6ce0f-78ed-4883-bbb3-dec8e561454a","resolution":{"observed_at":"2026-08-07T13:10:18.009253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:17.591195Z","title":"LLaV A-Next: Im- proved Reasoning, Ocr, and World Knowledge","venue":null,"work_id":"9da1515e-335f-468d-b351-fcb6677c58c6","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.663602Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:fb637ad121ef79bbe5e780d2b0443441abc457fdd5f968c3cee2de311f691e26","observation_id":"9dd22051-41b2-4fad-9ab1-324a36a2e708","resolution":{"observed_at":"2026-08-07T13:10:17.719998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:17.226057Z","title":"Visual Instruction Tuning","venue":null,"work_id":"f76466f9-a8ff-42e3-b48b-127323a13ad1","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.830359Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:2abf37c961a0ceacbf5ff5117114bdbf30b7eb576424c722993cb85cc9c7ab5b","observation_id":"b193148e-e3df-4f21-a0fd-15b2cdf9772e","resolution":{"observed_at":"2026-08-07T13:10:17.431218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:16.858344Z","title":"MMBench: Is Your Multi-modal Model an All-around Player? In ECCV, 2025","venue":null,"work_id":"d4553202-3bbc-4c84-b76b-fcf359469d34","year":2025},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:07.935523Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:c647824dab423ff206a5328809d555e35e9421260c0eb954520e7a735bdb2872","observation_id":"c245efa1-3580-47e7-ba77-2bcc3340a6bd","resolution":{"observed_at":"2026-08-07T13:10:17.038114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:16.532295Z","title":"Chartqa: A Benchmark for Question Answering About Charts With Visual and Logical Reason- ing","venue":null,"work_id":"0a3cd7cf-ebe3-4d3e-a86f-878f87b3bf71","year":2022},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.060825Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:d0710afdda5c229b505950fc678d5e21ac2cc4382e935337a47ca686d35982d8","observation_id":"54401c49-46c3-4af6-b992-1fdc4d582771","resolution":{"observed_at":"2026-08-07T13:10:16.743903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:16.254520Z","title":"Docvqa: A Dataset for VQA on Document Images","venue":null,"work_id":"7008ed5a-0df8-4557-9e74-24d345bc06e8","year":2021},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.282593Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:e0e139458e841887028cc988cf0e36eccbef8802195b40b0ac8c75267490152b","observation_id":"4c64e431-059d-4041-88f4-0bf1cb177edd","resolution":{"observed_at":"2026-08-07T13:10:16.373407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.888985Z","title":"Infograph- icVQA","venue":null,"work_id":"c8b2e329-c6df-49b2-8075-9b6d6e94c0ad","year":2022},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.400143Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:05fade42fb58fee96e996d8bd12e9d506b627dfac2382061f12b6e13a7912e7a","observation_id":"a9d22fad-abc7-49d9-810f-a284bbfe4824","resolution":{"observed_at":"2026-08-07T13:10:16.063658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-03T01:48:18.654934Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-07T13:10:08.563542Z","title":"ShortGPT: Layers in Large Language Models are More Re- dundant Than You Expect.arXiv preprint arXiv:2403.03853,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.563542Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:3fc9c37724825058c4848cc2d0c6ccd52645cbca0f7a45c749e14b0b520e9406","observation_id":"b2bdd531-cbc6-4173-bb5f-290a138497d0","resolution":{"observed_at":"2026-08-07T13:10:08.563542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.617442Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":null,"work_id":"74655ab6-2c06-4a1d-9741-063d33a0b0e4","year":2018},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.737225Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:60b208db62773c93f859be7dd5c551dabf9af7807dcee1cc5139c94d66196bf1","observation_id":"6cdc855b-7bfd-4691-801c-425a5f9c46f5","resolution":{"observed_at":"2026-08-07T13:10:15.729807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.208198Z","title":"interpreting GPT: the logit lens","venue":null,"work_id":"eda7bf58-18f4-4e08-97a9-3d3bc591d2df","year":2020},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:08.896020Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:1399fd09b2852b33d50268a49d8da41b3dea0954635c7cd96f4522832998b0f0","observation_id":"232146ff-0a88-4f50-855c-fb474f1916d3","resolution":{"observed_at":"2026-08-07T13:10:15.404758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.890883Z","title":"Learning Transferable Visual Models From Natural Language Super- vision","venue":null,"work_id":"35db2ab5-d01a-436f-bbc1-80563dea648c","year":2021},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.084874Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:b6c77cfe1e2f525909aa4f834a0ad20649c1ce2b1e20cbd097191f47fa64ebf4","observation_id":"70fe4b8e-5a8c-4c2e-ac06-9159051c07fa","resolution":{"observed_at":"2026-08-07T13:10:15.037846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.543756Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":null,"work_id":"89502c19-10aa-43d4-affe-a601e29a8bce","year":2021},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.261308Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:3324f62ddf1d2c8516dc52180d46d5eb6ffa5f2027f3e593ae3a459ff0fc0a26","observation_id":"a54574e4-0195-4a87-b106-2c4102115b3f","resolution":{"observed_at":"2026-08-07T13:10:14.688023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T13:10:09.455799Z","title":"Open Problems in Mechanistic Interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.455799Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:ee77f24348e726711bb5d75a24f5c9eb2aa6fad52bb6bb15a090460a0bcd5e81","observation_id":"919f7776-77bc-4d98-9e36-159147c403cf","resolution":{"observed_at":"2026-08-07T13:10:09.455799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.247599Z","title":"Towards VQA Models That Can Read","venue":null,"work_id":"f773feaa-f3d0-4b23-9a37-78b500e1fe4d","year":2019},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.639043Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:68125ee033112388feb714114ab871028400873a041e30aa24462efb00e55c85","observation_id":"78f61f07-327e-420c-a7aa-9e2c43699f45","resolution":{"observed_at":"2026-08-07T13:10:14.377820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09298","last_updated":"2025-02-12T21:57:06Z","snapshot_observed_at":"2026-07-06T18:45:27.130369Z","submitted_at":"2024-07-12T14:31:05Z","title":"Transformer Layers as Painters","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09298","snapshot_observed_at":"2026-08-07T13:10:09.868806Z","title":"Transformer Layers as Painters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:09.868806Z"},"links":{"cited_paper":"/paper/2407.09298","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:1862c3bcb43b4450983829f513ab45da6f47361f28ee5dca79375d1ba9bb5f6b","observation_id":"ae21e43a-ad87-459a-96a4-d61fe2ab610b","resolution":{"observed_at":"2026-08-07T13:10:09.868806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.936356Z","title":null,"venue":null,"work_id":"d3aaa5f8-a8b8-4133-b580-cbcacb1661d2","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.023098Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:be052fc22d541cf2833ff3214e74c23c8842016d24c69cef30a5887533b51a62","observation_id":"c2eeae5e-c64c-4045-9a0d-fe116ec56739","resolution":{"observed_at":"2026-08-07T13:10:14.074467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.626577Z","title":null,"venue":null,"work_id":"5404c892-3d2a-4f32-a0ab-8eb3fe22a572","year":2025},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.154755Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:0ea661155a6c3c42ef0550d2057e4949cf0f8962b1db150022e47ba61e866050","observation_id":"8b80db9e-b15a-49f8-9293-6e6b9916aaad","resolution":{"observed_at":"2026-08-07T13:10:13.774364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:10:10.316669Z","title":"Qwen2.5 Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.316669Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:2d460b2e7f80da8fa42a438f9c748d4fc5ea9244104856bbf60a5e178fdc35be","observation_id":"a5233e1d-bf72-455f-9bde-cbcffb59e415","resolution":{"observed_at":"2026-08-07T13:10:10.316669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T13:10:10.411364Z","title":"Qwen3 Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.411364Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:08173e71e416a9d933ce60034fa0c45e3129424888f5df39d6fde9a8399b4e9a","observation_id":"8cac2992-8ccd-4fe4-b59d-3433f20693fb","resolution":{"observed_at":"2026-08-07T13:10:10.411364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.377158Z","title":"Cambrian- 1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","venue":null,"work_id":"80b35a5a-5b09-4dd4-aeaa-787fb1fdda00","year":2025},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.548879Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:78517554d086f2780031cd384b6d98844df896a404019e58b7d7510d1c4f5187","observation_id":"9a9ab4b5-bf59-4450-99bf-fbc4ddfbb156","resolution":{"observed_at":"2026-08-07T13:10:13.491774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T13:10:10.711035Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localiza- tion, and Dense Features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.711035Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:31f1a5d9a217ef51c5aa4c3b372160a26e559b20076588ff728ca02bb7836c2d","observation_id":"bbd238ab-8814-446f-beb0-b6b14efeb168","resolution":{"observed_at":"2026-08-07T13:10:10.711035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:10:10.917149Z","title":"Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:10.917149Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:6c99d89d0bf887fb1ecce5007aa5e6ae9435ba72754296e1fe39cffef2c92ed5","observation_id":"02bcb860-639e-41f6-b365-d8f131348935","resolution":{"observed_at":"2026-08-07T13:10:10.917149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.021780Z","title":"CogVLM: Visual Expert for Pretrained Lan- guage Models","venue":null,"work_id":"251d74cb-e3d8-41ea-a783-0fee65578118","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.082351Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:1fe7f379ced102598446dca35f2c7330dacc6c533c2838ee807babb6cade7f34","observation_id":"90da24bf-cbc8-4556-ad96-05125bcc443d","resolution":{"observed_at":"2026-08-07T13:10:13.221500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.623212Z","title":"MM-Vet: Evaluating Large Multimodal Models for Inte- grated Capabilities","venue":null,"work_id":"24e251c4-056d-4463-be4f-b67e9716703f","year":2024},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.239273Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:808f085f890e3adceba952abc3e4df324e44419258cccfa0d45b05d93bb45373","observation_id":"5a1b519c-ef56-4100-9df7-56f6a70460de","resolution":{"observed_at":"2026-08-07T13:10:12.806130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.333317Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence? In ACL Anthology, 2019","venue":null,"work_id":"1fa8bd96-af38-4e44-9cb3-997ecc0f4599","year":2019},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.437478Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:8b30de692a5642e250409d206c280ae346a01e90d8596de2d92f213606e0fd2b","observation_id":"9f4c83da-0827-4fb2-b03c-2602aeeaa9b4","resolution":{"observed_at":"2026-08-07T13:10:12.491448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.039328Z","title":"Sigmoid Loss for Language Image Pre- Training","venue":null,"work_id":"782b614d-cc7c-4a7a-b521-9bba1d173b0e","year":2023},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.570195Z"},"links":{"citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:97baf9926715761cd6f81cbcd3857441bd594d75d2d93bd12932aac982900fb7","observation_id":"652f85e5-fdfb-400c-be5a-0ee75c053fec","resolution":{"observed_at":"2026-08-07T13:10:12.138345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T13:10:11.740399Z","title":"PyTorch FSDP: Experi- ences on Scaling Fully Sharded Data Parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:11.740399Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2505.22664"},"observation_digest":"sha256:ab2e6a06293ca50487c913a816979c57749654f018f8f2b761119ff09396b444","observation_id":"f1dca64a-039e-41c8-b879-848cd520fce3","resolution":{"observed_at":"2026-08-07T13:10:11.740399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22664","last_updated":"2025-08-02T22:03:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T08:57:24.731047Z","submitted_at":"2025-05-28T17:59:59Z","title":"Zero-Shot Vision Encoder Grafting via LLM Surrogates"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.22664."}